音频转文字

快速将音频文件转换为文本,支持多种语言,适合会议记录和课堂笔记,准确率高,操作简单。


选择你的音频或视频文件

MP3、WAV、M4A、OGG、FLAC、WEBM、MP4、MOV 等

每个文件最大 20 MB、最长 15 分钟。

100% 免费 无需注册 处理完立即删除文件
指明语言比交给自动识别更可靠,短音频或有噪音时差别尤其明显。

你的文件会怎么处理

文件会发送到我们的服务器,在那里完成转写,并在结果生成后立即删除。它不会被归档、不会进入备份,也不会有人去听。我们不要求账号,也不索取邮箱,因此没有任何东西把一段录音和你联系起来。转写结果只呈现在返回给你的那个页面上,关掉页面,它在我们这边也就不存在了。

  • 上传的文件在转写结果生成的那一刻被删除。
  • 不需要账号、不需要邮箱,也不记录你转写了什么。
  • 转写在我们自己的机器上运行,你的音频不会交给任何第三方服务。

如何把音频转成文字

  1. 选择你的音频或视频文件。
  2. 如果知道语音的语言就选上,不知道就保持自动。
  3. 点击开始转写并稍候。短音频几秒返回,整整 15 分钟大约需要一分钟。
  4. 复制文本,或下载为 TXT、SRT、VTT 字幕。

支持的格式

音频和视频文件都可以。以下是常见的几种。

类型 格式
音频 MP3、WAV、M4A、AAC、OGG、OPUS、FLAC、WMA、WEBM
视频 MP4、MOV、WEBM、MKV、AVI、3GP(使用其中的音轨)
导出 TXT 纯文本、SRT 字幕、VTT 网页字幕

简要回答

要免费把音频转成文字,在上方选择你的 MP3、WAV、M4A 或 MP4 文件,指定语音语言,然后点击开始转写。短音频几秒就能拿到结果,可下载为 TXT、SRT 或 VTT。无需账号,文件在结果生成后立即删除。

什么是音频转文字工具

音频转文字工具会听取一段录音,并把说出的内容写下来。这与人工听打是同一件事,只不过语音识别模型能在极短时间内完成。人们用它来处理访谈、讲课、播客、语音备忘、会议录音和视频字幕。

限制与速度

文件最大 20 MB、最长 15 分钟。15 分钟的录音大约一分钟返回,简短的语音留言几秒钟就好。如果是很长的访谈,按自然停顿分段处理,比硬塞一个大文件更顺畅。

准确度如何

背景噪音少、口齿清楚的语音,转写效果很好。当出现多人同时说话、口音较重、人声下面压着音乐,或是电话音质的录音时,准确度会下降。数字、人名地名和专业术语通常需要人工核对。请把结果当作一份不错的初稿,而不是定稿文件。

如何得到更好的转写结果

  • 指明语音的语言,不要停留在自动识别。
  • 尽量靠近说话人录音。麦克风距离比文件格式更重要。
  • 如果人声下面有音乐或杂音,先做降噪再转写。
  • 把长录音在自然停顿处分段,避免把句子从中间切断。
  • 安静的房间胜过昂贵的麦克风。先解决房间的问题。

常见问题

是的,不需要账号,没有试用期,结果也不带水印。我们把语音模型跑在自己的服务器上,而不是按分钟付费给第三方,这正是它能免费提供、又不设注册门槛的原因。

文件会上传、完成转写,然后立即删除。不归档、不备份,也没有人去听。因为没有账号,从一开始就没有东西把录音和你关联起来。转写结果只出现在返回给你的页面上,关掉页面就结束了。

每个文件 20 兆字节、15 分钟。如果连续提交多个文件,还会有一小段等待时间,好让工具对所有人都保持顺畅。录音较长时,请分成几段依次处理。

大约 90 种,包括中文、英语、西班牙语、葡萄牙语、法语、德语、意大利语、荷兰语、波兰语、俄语、土耳其语、日语、韩语、泰语、越南语、印尼语和加泰罗尼亚语。自己选定语言比自动识别效果更好,短音频尤其如此。

可以。上传 MP4、MOV、WEBM 等文件,工具会从中读取音轨。画面本身会被忽略,所以不必事先提取音频。

下载 SRT 或 VTT 文件。两者内容相同,都是按时间切分成行的转写结果,正是视频编辑软件和播放器所需要的。SRT 适用于绝大多数剪辑软件,VTT 则是网页视频的格式。

一分钟的语音留言几秒钟返回,整整十五分钟大约需要一分钟。等待时间主要花在转写本身,所以网速快有助于上传,但不会加快处理。

语音识别在多人同时说话、口音很重、有背景音乐以及低质量电话录音的情况下表现较差。通常最有帮助的做法,是自己设定语音语言,而不是让它自动识别。无论音质如何,人名地名和数字都值得手工核对一遍。

简要回答

要免费把音频转成文字,在上方选择你的 MP3、WAV、M4A 或 MP4 文件,指定语音语言,然后点击开始转写。短音频几秒就能拿到结果,可下载为 TXT、SRT 或 VTT。无需账号,文件在结果生成后立即删除。