音频转文字
快速将音频文件转换为文本,支持多种语言,适合会议记录和课堂笔记,准确率高,操作简单。
你的文件会怎么处理
文件会发送到我们的服务器,在那里完成转写,并在结果生成后立即删除。它不会被归档、不会进入备份,也不会有人去听。我们不要求账号,也不索取邮箱,因此没有任何东西把一段录音和你联系起来。转写结果只呈现在返回给你的那个页面上,关掉页面,它在我们这边也就不存在了。
- 上传的文件在转写结果生成的那一刻被删除。
- 不需要账号、不需要邮箱,也不记录你转写了什么。
- 转写在我们自己的机器上运行,你的音频不会交给任何第三方服务。
如何把音频转成文字
- 选择你的音频或视频文件。
- 如果知道语音的语言就选上,不知道就保持自动。
- 点击开始转写并稍候。短音频几秒返回,整整 15 分钟大约需要一分钟。
- 复制文本,或下载为 TXT、SRT、VTT 字幕。
支持的格式
音频和视频文件都可以。以下是常见的几种。
| 类型 | 格式 |
|---|---|
| 音频 | MP3、WAV、M4A、AAC、OGG、OPUS、FLAC、WMA、WEBM |
| 视频 | MP4、MOV、WEBM、MKV、AVI、3GP(使用其中的音轨) |
| 导出 | TXT 纯文本、SRT 字幕、VTT 网页字幕 |
简要回答
要免费把音频转成文字,在上方选择你的 MP3、WAV、M4A 或 MP4 文件,指定语音语言,然后点击开始转写。短音频几秒就能拿到结果,可下载为 TXT、SRT 或 VTT。无需账号,文件在结果生成后立即删除。
什么是音频转文字工具
音频转文字工具会听取一段录音,并把说出的内容写下来。这与人工听打是同一件事,只不过语音识别模型能在极短时间内完成。人们用它来处理访谈、讲课、播客、语音备忘、会议录音和视频字幕。
限制与速度
文件最大 20 MB、最长 15 分钟。15 分钟的录音大约一分钟返回,简短的语音留言几秒钟就好。如果是很长的访谈,按自然停顿分段处理,比硬塞一个大文件更顺畅。
准确度如何
背景噪音少、口齿清楚的语音,转写效果很好。当出现多人同时说话、口音较重、人声下面压着音乐,或是电话音质的录音时,准确度会下降。数字、人名地名和专业术语通常需要人工核对。请把结果当作一份不错的初稿,而不是定稿文件。
如何得到更好的转写结果
- 指明语音的语言,不要停留在自动识别。
- 尽量靠近说话人录音。麦克风距离比文件格式更重要。
- 如果人声下面有音乐或杂音,先做降噪再转写。
- 把长录音在自然停顿处分段,避免把句子从中间切断。
- 安静的房间胜过昂贵的麦克风。先解决房间的问题。
常见问题
是的,不需要账号,没有试用期,结果也不带水印。我们把语音模型跑在自己的服务器上,而不是按分钟付费给第三方,这正是它能免费提供、又不设注册门槛的原因。
文件会上传、完成转写,然后立即删除。不归档、不备份,也没有人去听。因为没有账号,从一开始就没有东西把录音和你关联起来。转写结果只出现在返回给你的页面上,关掉页面就结束了。
每个文件 20 兆字节、15 分钟。如果连续提交多个文件,还会有一小段等待时间,好让工具对所有人都保持顺畅。录音较长时,请分成几段依次处理。
大约 90 种,包括中文、英语、西班牙语、葡萄牙语、法语、德语、意大利语、荷兰语、波兰语、俄语、土耳其语、日语、韩语、泰语、越南语、印尼语和加泰罗尼亚语。自己选定语言比自动识别效果更好,短音频尤其如此。
可以。上传 MP4、MOV、WEBM 等文件,工具会从中读取音轨。画面本身会被忽略,所以不必事先提取音频。
下载 SRT 或 VTT 文件。两者内容相同,都是按时间切分成行的转写结果,正是视频编辑软件和播放器所需要的。SRT 适用于绝大多数剪辑软件,VTT 则是网页视频的格式。
一分钟的语音留言几秒钟返回,整整十五分钟大约需要一分钟。等待时间主要花在转写本身,所以网速快有助于上传,但不会加快处理。
语音识别在多人同时说话、口音很重、有背景音乐以及低质量电话录音的情况下表现较差。通常最有帮助的做法,是自己设定语音语言,而不是让它自动识别。无论音质如何,人名地名和数字都值得手工核对一遍。
简要回答
要免费把音频转成文字,在上方选择你的 MP3、WAV、M4A 或 MP4 文件,指定语音语言,然后点击开始转写。短音频几秒就能拿到结果,可下载为 TXT、SRT 或 VTT。无需账号,文件在结果生成后立即删除。