← 所有文章

音频/视频 → 免费文本和字幕:在浏览器中转录

明亮的工作室:带有打开转录窗口的笔记本电脑,旁边是音频波和整齐的字幕线,柔和的明亮亮点

您现在可以直接在浏览器中免费将音频或视频转录为文本:在 部分 “视频” 出现了一个工具 “音频/视频→文字+字幕(免费)”。它识别语音,以带有时间戳的文本形式显示语音,并提供现成的字幕 - 并且不会注销标记。

视频部分:音频/视频到文本 + 字幕(免费)工具,包含已加载的视频、已识别的带有时间戳的文本和字幕下载按钮

为什么是免费的

通常解密是在付费服务的服务器上完成的:下载文件,计算分钟数,然后按每分钟付费。这里,语音识别模型被加载到浏览器中并在您的计算机上运行。服务器只给出工具的代码和模型的权重:它没有什么可计算的,因此令牌不会被注销,并且解密次数不受限制。

因此,隐私:录音不会离开您的计算机。如果您要转录采访、工作电话、讲座或个人笔记,这一点很重要。

如何转录音频或视频:一步一步

  1. 打开 “视频”部分 并从型号列表中选择 “音频/视频→文字+字幕(免费)” — 该工具位于底部,旁边是其他免费工具。
  2. 上传文件:单击选择字段或将音频或视频直接拖放到其中。
  3. 选择您的语音语言 - 或将其保留为“自动检测”。默认情况下,站点界面语言已设置,但您始终可以手动更改它。
  4. 单击“识别语音”并等待其准备就绪。第一次启动需要更长的时间:浏览器下载模型一次并将其保存在缓存中。
  5. 检查文本,必要时禁用时间戳,然后复制结果。
  6. 下载所需格式的字幕 - TXT、SRT、VTT 或 JSON。对于视频,您可以立即组装带有内置字幕的视频。

哪些文件适合?

音频:MP3、WAV、M4A、AAC、OGG、OPUS、FLAC等常见格式。视频:MP4、MOV、M4V、MKV、AVI、OGV、WebM。视频中的声音直接在浏览器中提取;无需单独转换文件。

你会得到什么

  • 语音文字 — 带有时间戳的文字记录,可以禁用它并获取清晰的文本。
  • 复制 — 所有识别的文本一键保存到剪贴板。
  • TXT — 用于笔记和文档的简单文本。
  • SRT — 适用于大多数玩家和视频编辑器的字幕。
  • VTT — 网络和 HTML 播放器的字幕。
  • JSON - 标记片段的脚本时间。

带有烧焦字幕的视频

如果您上传视频,该工具可以将字幕直接刻录到帧中:这样的视频可以在任何地方播放,即使在不支持字幕的地方也是如此。保留了音源的声音。刻录发生在您的设备上,文件不会发送到任何地方。

一切都取决于您的设备

语音识别型号 Whisper 到 Transformers.js:首先它会尝试 WebGPU(显卡),如果没有适配器,它会诚实地切换到 WASM 并依赖处理器。这里没有付费的API,代币不会被注销,录音也不会发送到服务器。长记录需要更长的时间来处理 - 一切都在您的计算机上计算。

该工具不做什么

诚实地讲一下边界:这是语音识别,而不是翻译。该工具不会将文本翻译成另一种语言或进行配音。质量取决于录音:语音清晰,没有太多噪音和音乐,结果明显更好。带有烧焦字幕的视频需要现代浏览器 - 此步骤需要 Chrome 或 Edge。

谁会觉得它有用?

该工具对所有使用录音的人都很有用:记者和播客 - 采访记录,学生 - 讲义,编辑 - 视频字幕,以及记录会议记录的人。如果您需要预约其他任何服务,请在 部分 “视频” 有 背景去除, 高档 和 深度图 - 他们还直接在浏览器中计算。

常见问题

真的免费吗? 是的。该工具的代币不会被记入借方,它没有付费的 API - 您的计算机会计算它。

文件是否发送到服务器? 不会。录音和结果保留在您的设备上;只有工具代码和模型权重来自服务器。

支持多少种语言? Whisper 可识别 99 种语言。您可以手动选择语言或信任自动检测。

是否可以将字幕作为文件获取? 是的。 TXT、SRT、VTT 和 JSON 使用单独的按钮下载。

该工具可以翻译语音吗? 不会。它可以识别所选语言的语音,但不会将其翻译成另一种语言。

为什么第一次启动需要更长的时间? 浏览器下载识别模型一次并将其保存在缓存中 - 下一次启动将立即开始。