把音频、播客、录音变成字幕:Mac 本地出 SRT
手上是一段录音、一期播客、一场采访,或者一份语音备忘录,你想要带时间码的字幕,或者一份能复制、能搜索的文字,又不想把音频传到别人的服务器。双语幕不只处理视频:mp3、m4a、wav 这类音频文件拖进来,同样在文件旁边得到 .srt。外语的一期听不懂,也可以同时出翻译,边听边读。
能处理哪些文件
- 音频:mp3、m4a、wav、aac、aiff、flac、caf。
- 视频的声音:mp4、mov 等视频文件同样能拖进来,识别的是它的声音。
- 一次多个:整批拖进窗口,排成队列依次处理。

三步
- 拖进来把音频文件拖到窗口里。
- 等一会儿源语言自动识别,也可以手动指定;目标语言自己选。想只要原文字幕,目标选成同一种语言就行。第一次使用要联网下载一次语音模型(不到 1 GB)。
- 在音频旁取字幕同一个文件夹里多出 .srt:只含目标语言的,比如
Podcast.zh-Hans.srt;外语音频还有双语的,比如Podcast.zh-Hans-en.srt(目标在前,源在后)。
拿到 SRT 之后能做什么
- 当字幕用:做视频播客或带画面的音频节目时,把 SRT 导入剪辑软件,步骤见导入 SRT。
- 转成纯文字稿:SRT 是纯文本,去掉序号和时间码就是逐字稿,办法见检查和修改 SRT里的「转纯文本」一节。
- 外语播客边听边读:目标语言在上、原文在下,听不懂的句子立刻看到意思,原文也留着对照。
- 按关键词找位置:在 SRT 里搜到一句话,旁边的时间码就是它在音频里的位置。
双语幕的文件模式输出的是 SRT,不直接导出 txt 或带说话人的逐字稿。要纯文字,按上面的办法转。
适合哪些音频
- 播客和访谈:自己做的节目,或者外语的一期。
- 课程录音、讲座录音:整理成字幕或笔记,见网课和讲座字幕。
- 语音备忘录、采访素材:不想上传的内容,在本机处理。
- 外语听力材料:上下两行对照着看。
录音里有别人的声音时,使用前先确认你有权处理它,需要时先告知对方。
说在前面的限制
- 不区分说话人:多人对话得到的是连续的字幕,不标注是谁说的。
- 准确度:背景音乐大、多人抢话、口音重、专业名词多时更容易出错,数字和人名请对着音频校对。
- 不是实时的:这里处理的是已有的音频文件。要边播边译,见视频和直播实时翻译。
- 不做歌词对齐:它识别的是说话的声音。
- 额度:免费版每个文件只处理前 10 分钟,买断 ¥128 不限时长。
- 系统:需要 macOS 26 及以上,Apple 芯片的 Mac。
隐私:音频留在你的 Mac 上
识别和翻译都在你的 Mac 上完成,没有后端,音频不经过任何服务器。只有第一次使用要联网下载一次语音模型,翻译语言包由 macOS 下载,之后断网也能用。详见隐私政策。
常见问题
支持哪些音频格式?
mp3、m4a、wav、aac、aiff、flac、caf。视频文件也行,识别的是它的声音。
能直接导出文字稿吗?
文件模式输出 SRT。SRT 是纯文本,去掉序号和时间码就是文字稿,办法见检查和修改 SRT 那一篇。
能区分谁在说话吗?
不能。多人对话得到的是连续的字幕,不标注说话人。
外语播客能同时翻译吗?
能。目标语言选你要的,会多出一份双语字幕,目标语言在上、源语言在下;想只要原文,目标选成同一种语言。
音频很长怎么办?
免费版每个文件只处理前 10 分钟;买断后处理完整时长。处理速度和视频相近,进度一直看得到。
要联网吗?
识别和翻译都在你的 Mac 上完成,音频不上传。第一次使用要联网下载一次语音模型,之后识别在本机完成。
播客正在播,能边听边出字幕吗?
那是实时翻译的用法,处理的是此刻正在播的声音,见视频和直播实时翻译那一页。文件模式处理的是已有文件。
即将上架 Mac App StoremacOS 26 及以上,Apple 芯片。想抢先试用,写信到 twinsub@gatheon.com。
更新于 2026-10-12。回到双语幕首页