Buzz本地音频转录:三个系统装起来,全程离线把声音变成字幕
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一个基于 OpenAI Whisper 的开源本地音频转录工具:转写、翻译都在你自己的电脑上跑,离线可用、免费,支持 90 多种语言,还能对着麦克风实时录音转写。
它到底解决什么问题
在线转录服务需要你把音频上传到别人的服务器。会议录音、采访原声这类内容,隐私风险摆在那里。Buzz 的思路是把模型搬回本地:音频文件不出你的电脑,转录结果也存本地,断网照常工作。
另一个好处是零费用。项目开源,没有订阅制,装一次用一次。它同时覆盖了日常需求:批量导入音视频文件、导出 TXT/SRT/VTT 字幕、麦克风实时转录、文件夹自动监听,还有 CLI 命令行可供脚本调用。
下面是主界面,左侧任务列表管理批量转录,右侧是录音和导出入口。
装起来
Windows
从官方下载页(SourceForge 的 buzz-captions 项目)拿到安装程序,双击安装即可。
程序没有数字签名,安装时 Windows 会弹安全警告,点「更多信息」→「仍要运行」放行。
macOS
同样去官方下载页拿.dmg安装包,拖进「应用程序」文件夹完成安装,Intel 和 Apple 芯片都支持。
Linux
Flatpak 和 Snap 都有,任选其一:
flatpak install flathub io.github.chidiwilliams.BuzzSnap 方式则是sudo snap install buzz(需要先装 libportaudio2 等依赖,见 docs/docs/installation.md)。
首次启动时 Buzz 会自动下载你选的转录模型,建议先在联网状态下打开一次把它备好。
首次运行要做的三件事
- 选模型:帮助 → 偏好设置 → Models,下载要用的模型。没有 NVIDIA 显卡就选 Whisper.cpp(CPU、核显、Mac 都跑得动);显卡显存 6GB 以上可以选 Faster Whisper,速度快很多。
- 定导出文件名:偏好设置里可以给默认导出文件名设模板,支持源文件名、任务、语言、日期等变量,比如
{{ input_file_name }} ({{ task }}d on {{ date_time }})。 - 选界面语言:程序自带多语言界面,包含简体中文,在偏好设置里切到你的语言,后面看菜单不费劲。
功能逐个说
批量转录:一次导入一整批文件
菜单 File 里的「Import Media File」(或 Ctrl+O、工具栏「+」号)导入音频或视频,也可以直接粘 YouTube 链接。
- 文件进队列后自动排队处理,每行的状态会实时更新为「Completed」。
- 双击列表行即可打开转录结果查看。
- 进阶选项里可以开「Extract speech」先把人声从背景里分离出来,噪声大的素材准确率更稳。
- 偏好设置里可开文件夹监听,往指定目录丢新文件就自动开始转录。
模型怎么选:速度、内存和精度的平衡
模型分 tiny 到 large 多个档位,越大越准也越吃资源。没有标准答案,官方 FAQ 的建议就是「在你的语言上把几个档位都测一遍」。
| 档位 | 速度 | 内存占用 | 精度 | 适用场景 |
|---|---|---|---|---|
| Tiny | 极快 | 很低 | 基础 | 快速草稿、实时转录 |
| Base | 快 | 较低 | 良好 | 日常使用 |
| Small | 中等 | 中等 | 良好 | 常规内容 |
| Medium | 较慢 | 较高 | 优秀 | 重要内容 |
| Large | 慢 | 很高 | 最好 | 专业转录、精细校对 |
[
除了档位,还要挑后端类型:默认 Whisper 最稳但慢;Whisper.cpp 是 C++ 优化版,Mac 上首选;Faster Whisper 需要 6GB 以上显存的 N 卡。带.En后缀的模型只认英语。
实时录音:边说边出文字 🎙️
选好麦克风、语言和任务后点 Record,声音就会边录边转成文字。
- 任务可选「Transcribe」(转写)或「Translate to English」(翻译成英文)。
- 语言建议手动指定;自动检测靠前几秒音频判断,偶尔会认错。
- 实时转写比较吃资源,官方提示优先用 Whisper.cpp + 小模型。
- 开会、做报告时可调出 Presentation window,把实时文字放大展示,也方便现场无障碍使用。
字幕编辑:时间轴和文本都能改
双击转录结果打开查看器,能逐段校对、搜索(Ctrl+F)、按 0.5 倍到 2 倍速播放,还能循环播放某一段或让文本跟随音频滚动。
- 用 Ctrl+方向键微调某段的开始/结束时间,每次 0.5 秒。
- 点「Resize」做字幕整形:设每条字幕最大长度、按标点断句、延长每条字幕的显示时长。
- 想用上完整的合并与断句功能,转录时要先勾上「Word-Level Timings」。
- 成品可导出 SRT、VTT、TXT、JSON 等格式。
三个场景直接抄作业
场景一:会议记录
- 打开录音面板,选好麦克风和会议语言。
- 点 Record,把 Presentation window 调出来投到副屏。
- 散会后停止录音,检查实时生成的文本。
- 导出 TXT,顺手丢进文档归档。
场景二:视频字幕
- 导入视频文件,语言手动指定,模型选 Medium 起步。
- 高级设置里勾上 Word-Level Timings,专有名词多的话填进 Initial prompt。
- 转录完成后打开查看器,用 Resize 把字幕调成每条 40 字符左右。
- 导出 SRT,直接拖进剪辑软件。
场景三:访谈整理
- 把访谈录音批量导入,或放进监听文件夹自动开转。
- 人名、术语提前写进 Initial prompt,减少拼写错误。
- 在查看器里搜索关键词,逐段核对并修正。
- 导出 TXT 或 DOCX(启用内置的 Export to DOCX 插件),按说话人分段归档。
卡住了看这里
转录太慢怎么办?把模型降到 base 或 small;换成 Whisper.cpp 后端,它在 CPU 和核显上都能跑;有 6GB 以上显存的 N 卡就切 Faster Whisper。三条里挑一条,通常立刻见效。
识别准确率不高?换更大的模型(medium、large 系列);用 Initial prompt 提供背景词和人名;音频本身噪声明显的话,先跑一遍内置的 DeepFilterNet 降噪插件再转录。
模型下载失败、甚至启动崩溃?多半是模型文件不完整。到帮助 → 偏好设置 → Models 里删掉已下载的模型重新拉。如果目标机器完全断网,可以在有网的电脑上下载好,把模型缓存文件夹拷过去:Linux 是~/.cache/Buzz,macOS 是~/Library/Caches/Buzz,Windows 是%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache。
录音时报PaErrorCode-9999?检查系统是否允许应用访问麦克风(Windows 在 设置 → 隐私 → 麦克风),杀毒软件有时也会拦,先临时关掉试试。
Buzz 把本地语音转文字做成了不写代码就能用的样子,装完试一条自己的音频就知道合不合适。更多细节见 docs/docs/faq.md,想扩展功能可以翻翻 buzz/plugins/ 里现成的插件源码。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考