核心要点 (BLUF): 该工具完全在浏览器中把音频和视频转成文字:文件不会发送到我们的服务器,不扣代币,识别出的文字可以编辑。
Whisper 模型(约 40 MB)只需下载一次并由浏览器缓存。语言可以自动识别或手动选择。结果带时间戳显示,可编辑、复制,并以 TXT、SRT、VTT 或 JSON 下载。
如果上传的是视频,还可以生成带硬字幕的视频文件(Chrome 和 Edge)并下载。
识别在你的设备上完成:文件和识别出的文字都不会到达我们的服务器。没有付费接口,也不扣代币。
质量取决于录音:清晰语音下模型很准确,嘈杂录音可能出错。识别文字可在保存字幕前修改。
免费,不扣代币:模型在浏览器中本地运行。
不会,音频、视频和识别出的文字都不会离开你的设备。
可以,文字可在页面上直接编辑,修改会进入字幕。