Audio/vidéo → texte et sous-titres gratuits : transcription
Vous pouvez désormais retranscrire gratuitement de l'audio ou de la vidéo en texte directement dans votre navigateur : dans la rubrique "Vidéo" un outil est apparu « Audio/vidéo → texte + sous-titres (gratuit) ». Il reconnaît la parole, l'affiche sous forme de texte avec un horodatage et fournit des sous-titres prêts à l'emploi - et n'efface pas les jetons.

Pourquoi est-ce gratuit
Habituellement, le décryptage se fait sur le serveur d'un service payant : le fichier est téléchargé, les minutes sont comptées et ils paient pour chaque minute. Ici, le modèle de reconnaissance vocale est chargé dans le navigateur et s'exécute sur votre ordinateur. Le serveur ne donne que le code de l'outil et le poids du modèle : il n'a rien à compter, donc les tokens ne sont pas radiés, et le nombre de décryptages n'est pas limité.
D'où la confidentialité : l'enregistrement ne quitte pas votre ordinateur. Ceci est important si vous transcrivez des entretiens, des appels professionnels, des conférences ou des notes personnelles.
Comment transcrire de l'audio ou de la vidéo : étape par étape
- Ouvrir Rubrique "Vidéo" et sélectionnez dans la liste des modèles « Audio/vidéo → texte + sous-titres (gratuit) » — l'outil est situé en bas, à côté d'autres outils gratuits.
- Téléchargez un fichier : cliquez sur le champ de sélection ou faites glisser et déposez l'audio ou la vidéo directement dedans.
- Sélectionnez votre langue vocale - ou laissez-la sur « Détecter automatiquement ». Par défaut, la langue de l'interface du site est définie, mais vous pouvez toujours la modifier manuellement.
- Cliquez sur « Reconnaître la parole » et attendez qu'il soit prêt. Le premier lancement prend plus de temps : le navigateur télécharge une fois le modèle et l'enregistre dans le cache.
- Vérifiez le texte, désactivez les horodatages si nécessaire et copiez le résultat.
- Téléchargez les sous-titres au format souhaité - TXT, SRT, VTT ou JSON. Pour une vidéo, vous pouvez immédiatement assembler une vidéo avec des sous-titres gravés.
Quels fichiers conviennent ?
Audio : MP3, WAV, M4A, AAC, OGG, OPUS, FLAC et autres formats courants. Vidéos : MP4, MOV, M4V, MKV, AVI, OGV, WebM. Le son de la vidéo est extrait directement dans le navigateur ; il n'est pas nécessaire de convertir le fichier séparément.
Qu'obtiendrez-vous
- Texte du discours — transcription avec horodatage, qui peut être désactivée et obtenir un texte clair.
- Copie — tout le texte reconnu avec un seul bouton dans le presse-papiers.
- TXT — texte simple pour les notes et les documents.
- SRT — des sous-titres pour la plupart des lecteurs et éditeurs vidéo.
- VTT — sous-titres pour lecteurs web et HTML.
- JSON - des pièces marquées avec des timings pour leurs scripts.
Vidéo avec sous-titres gravés
Si vous téléchargez une vidéo, l'outil peut graver des sous-titres directement dans les images : une telle vidéo est lue n'importe où, même là où les sous-titres ne sont pas pris en charge. Le son de la source est conservé. La gravure a lieu sur votre appareil, le fichier n'est envoyé nulle part.
Tout compte sur votre appareil
Speech reconnaît les modèles Whisper à Transformers.js : il essaie d'abord WebGPU (carte vidéo), et s'il n'y a pas d'adaptateur, il passe honnêtement à WASM et compte sur le processeur. Il n'y a pas de API payant ici, les jetons ne sont pas radiés et l'enregistrement ne va pas au serveur. Le traitement des enregistrements longs prend plus de temps - tout est calculé sur votre ordinateur.
Ce que l'outil ne fait pas
Honnêtement à propos des limites : il s’agit de reconnaissance vocale, pas de traduction. L'outil ne traduit pas le texte dans une autre langue et n'effectue pas de doublage. La qualité dépend de l'enregistrement : avec une parole claire sans trop de bruit ni de musique, le résultat est sensiblement meilleur. Les vidéos avec des sous-titres gravés nécessitent un navigateur moderne – cette étape nécessite Chrome ou Edge.
À qui cela sera-t-il utile ?
L'outil est utile à tous ceux qui travaillent avec des enregistrements : journalistes et podcasteurs - transcriptions d'entretiens, étudiants - notes de cours, éditeurs - sous-titres de vidéos, ainsi que ceux qui tiennent des procès-verbaux de réunions. Si vous avez besoin d'autre chose sur rendez-vous, dans la rubrique "Vidéo" Il y a suppression de l'arrière-plan, haut de gamme Et carte de profondeur — ils calculent également directement dans le navigateur.
Questions fréquemment posées
Est-ce vraiment gratuit ? Oui. Les jetons pour cet outil ne sont pas débités, il n'a pas de API payant - votre ordinateur le calcule.
Le fichier va-t-il sur le serveur ? Non. L’enregistrement et le résultat restent sur votre appareil ; Seuls le code outil et les poids du modèle proviennent du serveur.
Combien de langues sont prises en charge ? Whisper reconnaît 99 langues. Vous pouvez sélectionner la langue manuellement ou faire confiance à la détection automatique.
Est-il possible d'obtenir les sous-titres sous forme de fichier ? Oui. TXT, SRT, VTT et JSON sont téléchargés à l'aide de boutons séparés.
L'outil traduit-il la parole ? Non. Il reconnaît la parole dans la langue sélectionnée, mais ne la traduit pas dans une autre.
Pourquoi le premier lancement prend-il plus de temps ? Le navigateur télécharge une fois le modèle de reconnaissance et l'enregistre dans le cache : les prochains lancements démarrent immédiatement.