录音的时候觉得方便,整理的时候才发现费时间。
一段访谈、一节课程,或者自己随手录下的口述内容,想变成能搜索、能修改的文字,就得不断暂停、回放、打字。尤其是只想找其中一句话,拖着进度条来回听,很容易把时间耗在定位内容上。
Buzz 提供了一种本地录音转文字的办法:把音频或视频交给电脑上的语音识别模型处理,再对生成的文字进行校对。**本文介绍的是 GitHub 上免费开源的 Buzz 项目,它支持 Whisper 等识别方式,可以导出文稿和字幕文件。项目说明和各系统的安装入口见 Buzz 官方开源页面。
对经常整理录音的人来说,先得到一份可以编辑的文字初稿,就能减少从头听写的工作。做视频也一样:先生成带时间信息的字幕,再检查识别内容,比逐句手打更有操作空间。
不过,“本地转写”有一个前提需要说清楚:软件和需要的模型必须先准备好。第一次使用某个模型时,通常需要联网下载;模型保存在电脑上以后,选择本地识别方式,就可以离线处理录音。Buzz 也提供云端 API 选项,如果选择那类方式,处理位置和费用规则就不同了。具体区别可以参考 Buzz 官方常见问题。
第一次使用,不建议直接丢进去一段两小时的录音。先找一段两三分钟、说话比较清楚的素材,跑通导入、识别和导出的过程,更容易判断当前设置是否合适。
基本操作可以这样做:
- 打开 Buzz,点击工具栏的“+”,或者通过 File 菜单中的 Import Media File 导入音频或视频。
- 在任务设置中选择转写;如果录音主要是中文,就明确选择中文。
- 选择本地模型和合适的模型大小,按提示完成首次下载。
- 点击 Run 开始处理,等待任务显示 Completed。
- 双击完成的任务查看结果,校对后导出需要的文件。
界面名称可能随版本和语言设置略有不同,完整流程可以对照官方文件导入说明。
任务类型尤其要看清楚。如果只是想把中文语音变成中文文字,应选择 Transcribe。Whisper 的“Translate to English”任务会把识别内容翻译成英文,和保留原语言的转写用途不同。这个区别在官方任务设置说明中有介绍。
导出时,可以按用途选择格式:
- **TXT:**适合整理访谈文字、课程笔记和口述草稿,后续放进文档里修改。
- **SRT:**带字幕时间信息,适合导入支持该格式的视频播放器或剪辑软件。
- **VTT:**适合需要 WebVTT 格式的网页视频和相关发布流程。
要注意,导出 SRT 得到的是一份字幕文件。如果想让字幕直接显示在最终视频画面里,还需要在剪辑或转码软件中完成后续处理。
Buzz 也支持修改已经生成的转写内容,并提供调整字幕分段的功能。比如一句话被拆得太碎,或者一条字幕太长,可以再整理分段后导出,相关操作见官方编辑说明。
至于识别速度和效果,不适合简单用“几分钟搞定”来概括。它们会受到电脑配置、模型大小和录音质量影响。较小的模型适合先试跑,较大的模型通常需要更多资源;处理中文时,还要避开名称中带有“.en”的英语专用模型。第一次先比较一小段素材,比盲目选择最大的模型更容易找到合适的设置。
校对时,可以优先检查人名、数字、产品名称和专业词汇。这些地方即使错了,整句话也可能读得很顺,很容易漏过去。多人同时说话、背景音乐明显或收音不清楚的片段,也值得重新听一遍。
我更建议把 Buzz 用在“先拿到初稿”这一步:采访录音先转成文字,再整理成文章;教程视频先生成字幕,再调整断句和时间。对于已经录好的内容,有了一份能搜索、能修改的文本,后续整理会更有条理。
软件下载与相关链接:

