语音转文字离线工具 Buzz 上手:把会议录音变成可编辑字幕,全程不花钱不上传
语音转文字离线工具 Buzz 上手:把会议录音变成可编辑字幕,全程不花钱不上传
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
凌晨一点,我瘫在椅子上,对着一段两小时的会议录音发呆。想整理成文字纪要,手动听写显然不现实,用在线工具又要把机密内容传上别人的服务器,心里总不踏实。直到我遇到 Buzz——一款基于 OpenAI Whisper 的免费离线语音转文字工具,它在您的个人电脑上完成音频和视频的转录、翻译与字幕导出,不联网、不付费、不上传,转完就是本地文件。
一、深夜录音与一台"会听话"的电脑
痛点先摆出来。会议纪要、访谈逐字稿、网课字幕、播客脚本……这些需求背后都是同一件事:把语音变成文字。传统做法要么花钱请人,要么自己对着录音器逐句敲。两者的共同缺点是慢、贵、容易出错。
Buzz 给出的答案很直接。它把 OpenAI 开源的 Whisper 模型打包成一个桌面软件,转录全部在本地计算完成。您导入一个 MP3 或 MP4,几分钟后就能拿到带时间戳的文字稿。模型越小越快,模型越大越准,丰俭由人。
技术并不神秘。Whisper 是一套已经训练好的神经网络,Buzz 只是把它包装成顺手的产品。您可以把它理解成"自带翻译、字幕、降噪的语音工坊",而这些能力都不需要一条外部网络请求。
二、装好它,总共分几步
Buzz 提供三种安装路径,按您的身份对号入座。
普通用户:下载安装包。Windows 和 macOS 用户从 SourceForge 获取安装程序,双击按提示走完即可。Linux 用户可走 Flatpak 或 Snap:
flatpak install flathub io.github.chidiwilliams.BuzzPython 开发者:一行命令。
pip install buzz-captions python -m buzz想读源码或二次开发。克隆仓库后即可在本地运行:
git clone https://gitcode.com/GitHub_Trending/buz/buzz cd buzz python -m buzz安装完成后启动,您会看到一个带任务列表的主窗口。不要急着点任何按钮,先把下一节的流程走一遍。
三、第一次转录:从拖入文件到拿到字幕
下面是一次完整的实操,约十分钟,请跟着做。
第 1 步:导入文件。点击工具栏的加号图标,或直接把音频、视频文件拖进窗口。Buzz 支持 MP3、WAV、MP4、AVI 等常见格式,也可以批量拖入多个文件。从 1.2.0 版本起,还支持直接粘贴 YouTube 链接。
第 2 步:选择任务与语言。双击新建的任务行,弹出转录设置。任务类型选"转录"(保留原语言)或"翻译"(统一转成英文)。语言建议手动指定,比如中文选zh,比自动检测更稳。
第 3 步:挑一个模型。新手建议先选 Tiny 或 Base 跑通流程,等熟悉了再按第四节的对照表升级。这一步先保证"能出结果"。
第 4 步:点击运行。任务进入队列后开始转录,状态栏实时显示进度。长音频建议挂着等,中途可以暂停、取消或新增任务。
第 5 步:双击任务行查看结果。每个片段带开始/结束时间,底部播放器可同步回听原文,哪里有错直接改。
到这里,您的第一份带时间戳的文字稿已经躺在屏幕上了。
四、选对模型,快慢与准确之间有个平衡
Whisper 提供从 Tiny 到 Large 的多个尺寸,选择直接决定转录的时延和准确率。参数越多的模型"听"得越细,代价是更慢、更吃资源。
| 模型 | 参数量 | 速度 | 准确率 | 适合场景 |
|---|---|---|---|---|
| Tiny | 39M | 极快 | 中等 | 实时录音、短视频、验证流程 |
| Base | 74M | 快 | 良好 | 日常会议记录 |
| Small | 244M | 中等 | 优秀 | 播客、普通访谈 |
| Medium | 769M | 较慢 | 极佳 | 专业内容、出版级字幕 |
| Large | 1.5B | 慢 | 顶级 | 学术研究、方言与术语密集材料 |
日常建议这样取舍:会议纪要选 Base,能听清重点且不拖沓;字幕制作选 Small 或 Medium;访谈研究这类"错一个字都难受"的场景,直接上 Large。不必一上来就追求最大,够用就好。
模型在"首选项 → Models"标签页管理:查看已下载列表、下载新版本、删除不用的模型释放磁盘空间。
硬件加速值得提一句。有 NVIDIA 显卡可在设置里启用 CUDA,Apple Silicon 的 M 系列芯片同样有原生优化,转录速度能快出几倍。纯 CPU 也能跑,只是慢一些。
五、拿到文字稿之后:导出与二次加工
转录只是开始,文字稿的"可用度"往往取决于后续处理。
导出格式按用途挑。点开导出菜单,Buzz 提供 TXT、SRT、VTT 三种格式:TXT 适合分享和归档,SRT 兼容绝大多数剪辑软件,VTT 面向网页播放器。选择对应的格式与语言即可落地文件。
字幕长短可以精细控制。遇到长句被切得七零八落时,用"调整字幕"功能把片段重新组装。参数包括目标字幕长度(默认 42 字符)、按静默间隙合并、按标点分割等,调完立即预览效果。
识别不准有补救手段。在转录设置里填写"初始提示"是最实用的技巧——把本次内容的人名、专业术语写进去,Whisper 会明显偏向这些词。比如医学访谈就写上"心室、搭桥、阿托伐他汀"。
通用设置里还能放上 OpenAI API 密钥,为翻译和 AI 摘要功能做准备。
六、进阶玩法:命令行、文件夹监控与插件
界面操作熟练后,这几件效率工具能让转录真正自动化。
命令行批量转录。不想开图形界面?add子命令支持完整参数:
# 中文转录,导出 SRT 字幕 buzz add --task transcribe --language zh --model-size medium --srt lecture.mp3 # 后台批量处理整个目录 buzz add --task transcribe --hide-gui --model-type whispercpp *.mp3文件夹监控。在"首选项 → Folder Watch"里指定一个目录,之后扔进任何音频文件都会自动转录并导出,做完还能移动或删除源文件。适合固定收录音的场景。
插件系统把流程串起来。Buzz 内置了多个插件,都是"转录前后自动跑一段逻辑"的思路:
- AI 摘要:转录完成后调用 OpenAI 兼容接口,生成要点和行动项,存进备注或单独文件;
- DeepFilterNet 降噪:转录前先剔除背景噪音,适合嘈杂录音;
- 导出 DOCX:一键把转录结果输出为 Word 文档,无需额外依赖;
- 跳过已转录文件:重扫文件夹时自动识别已处理的文件,避免重复劳动。
插件在"帮助 → 插件"菜单里统一管理,可以开关、排序、配参数,也能通过 URL 安装社区插件。想自己写也不难,内置插件的源码就是最好的范例,代码都躺在仓库的buzz/plugins/目录下。
七、读完立刻能做的五件事
把这篇的内容落地成行动,接下来您可以:
- 下载安装 Buzz,拖入一段十分钟以内的录音跑通首次转录;
- 打开"首选项 → Models",按第四节的对照表选好默认模型;
- 给一段专业录音配上"初始提示",观察准确率变化;
- 导出一次 SRT,放进剪辑软件试试字幕效果;
- 设置一个文件夹监控目录,把转录交给它自动完成。
您的下一场会议录音、下一段访谈、下一个视频素材,都不必再成为熬夜的借口。装上 Buzz,剩下的交给本地这台"会听话"的电脑吧。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
