オーディオ/ビデオ → テキストと字幕を無料で: ブラウザーで文字起こし
オーディオまたはビデオをブラウザで直接無料でテキストに書き写せるようになりました: セクション "ビデオ" ツールが現れた 「音声・動画 → テキスト+字幕(無料)」。音声を認識し、タイムスタンプ付きのテキストで表示し、既製の字幕を提供します。また、トークンを消去しません。

なぜ無料なのか
通常、復号化は有料サービスのサーバー上で行われます。ファイルがダウンロードされ、時間がカウントされ、分ごとに料金が支払われます。ここでは、音声認識モデルがブラウザにロードされ、コンピュータ上で実行されます。サーバーはツールのコードとモデルの重みのみを提供します。サーバーにはカウントするものがないため、トークンは消去されず、復号化の回数も制限されません。
したがって、プライバシーが保護されます。記録はコンピュータから流出しません。これは、インタビュー、仕事の電話、講義、または個人的なメモを文字に起こす場合に重要です。
音声またはビデオを文字に起こす方法: ステップバイステップ
- 開ける 「ビデオ」セクション モデルのリストから選択します 「音声・動画 → テキスト+字幕(無料)」 — このツールは、他の無料ツールの隣の一番下にあります。
- ファイルをアップロードする: 選択フィールドをクリックするか、オーディオまたはビデオを選択フィールドに直接ドラッグ アンド ドロップします。
- 音声言語を選択するか、「自動的に検出」のままにします。デフォルトでは、サイト インターフェイスの言語が設定されていますが、いつでも手動で変更できます。
- 「音声認識」をクリックし、準備が完了するまで待ちます。最初の起動には時間がかかります。ブラウザはモデルを 1 回ダウンロードし、キャッシュに保存します。
- テキストを確認し、必要に応じてタイムスタンプを無効にし、結果をコピーします。
- 希望の形式 - TXT、SRT、VTT または JSON で字幕をダウンロードします。ビデオの場合は、焼き付けられた字幕を含むビデオをすぐに組み立てることができます。
どのようなファイルが適しているのでしょうか?
オーディオ: MP3、WAV、M4A、AAC、OGG、OPUS、FLAC、およびその他の一般的な形式。動画: MP4、MOV、M4V、MKV、AVI、OGV、WebM。ビデオからのサウンドはブラウザで直接抽出されます。ファイルを個別に変換する必要はありません。
何が得られますか
- スピーチテキスト — タイムスタンプ付きのトランスクリプト。無効にして平文を取得できます。
- コピー — 認識されたすべてのテキストを 1 つのボタンでクリップボードに保存します。
- TXT — メモや文書用のシンプルなテキスト。
- SRT — ほとんどのプレーヤーとビデオエディターの字幕。
- VTT — Web および HTML プレーヤーの字幕。
- JSON — 脚本のタイミングを作品にマークしました。
焼き付けられた字幕付きのビデオ
ビデオをアップロードすると、このツールは字幕をフレームに直接書き込むことができます。そのようなビデオは、字幕がサポートされていない場所であっても、どこでも再生されます。ソースの音はそのまま残ります。書き込みはデバイス上で行われ、ファイルはどこにも送信されません。
すべてはデバイスに依存します
音声認識はモデル Whisper から Transformers.js までを認識します。最初に WebGPU (ビデオ カード) を試行し、アダプターがない場合は素直に WASM に切り替えてプロセッサーを頼りにします。ここには有料の API はなく、トークンは消失せず、録音はサーバーに送信されません。長いレコードの処理には時間がかかります。すべてがコンピューター上で計算されます。
ツールでできないこと
正直に言うと、境界については、これは音声認識であり、翻訳ではありません。このツールはテキストを別の言語に翻訳したり、吹き替えたりしません。品質は録音によって異なります。ノイズや音楽が少なく、音声がクリアであれば、結果は著しく向上します。焼き付けられた字幕のあるビデオには最新のブラウザが必要です - この手順には Chrome または Edge が必要です。
誰が役に立つと思うでしょうか?
このツールは、ジャーナリストやポッドキャスター - インタビューのトランスクリプト、学生 - 講義ノート、編集者 - ビデオの字幕、さらには会議の議事録を作成する人など、録音に携わるすべての人にとって便利です。他に何か必要な場合は予約制です。 "ビデオ" がある 背景の除去, 高級な そして 深度マップ — ブラウザ内で直接計算も行います。
よくある質問
本当に無料ですか? はい。このツールのトークンは引き落とされません。有料の API はありません。コンピューターが計算します。
ファイルはサーバーに送られますか? いいえ。記録と結果はデバイスに残ります。ツール コードとモデルの重みのみがサーバーから取得されます。
いくつの言語がサポートされていますか? Whisper は 99 の言語を認識します。言語を手動で選択することも、自動検出を信頼することもできます。
字幕をファイルとして取得することはできますか? はい。 TXT、SRT、VTT、JSON は別のボタンを使用してダウンロードされます。
このツールは音声を翻訳しますか? いいえ。選択した言語での音声は認識されますが、別の言語に翻訳されません。
最初の起動に時間がかかるのはなぜですか? ブラウザは認識モデルを一度ダウンロードしてキャッシュに保存します。次の起動はすぐに開始されます。