Buzz 离线语音转录指南:本地 Whisper 把录音转成文字与字幕
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
处理采访音频或会议录音时,把原始文件上传到云端转录 API,意味着它要先经过第三方服务器。Buzz 是一款在本地运行 OpenAI Whisper 的桌面转录工具,音频和模型都不离开你的电脑,离线即可产出文字稿与 SRT/VTT 字幕。配置一般的笔记本可以用小模型纯 CPU 跑通第一段转录,再根据硬件逐步调整。
它是什么:定位与运行环境
Buzz 是基于 PyQt6 的桌面应用,把多个本地 Whisper 后端统一放进同一个任务队列:OpenAI 原版 Whisper、针对 NVIDIA GPU 优化的 faster-whisper、C++ 实现的 whisper.cpp(任意 GPU 或纯 CPU 可用,对 Mac 和核显最友好),以及 HuggingFace Transformers 实现(可加载 MMS 等自定义多语言模型)。除文件转录用外,还支持麦克风实时转录、转录前的人声分离(处理嘈杂录音)、说话人识别与插件系统。
| 项目 | 说明 |
|---|---|
| 许可证 | MIT |
| 平台 | Windows、macOS(含 Apple Silicon)、Linux |
| 运行环境 | 预构建安装包,或 Python 3.12+ 源码安装 |
| 核心依赖 | Whisper / faster-whisper / whisper.cpp / transformers、PyQt6 |
| GPU 加速 | NVIDIA CUDA、Apple Silicon、Vulkan(whisper.cpp) |
安装 Buzz 离线转录工具
Windows 与 macOS
从官方发布页下载对应平台的安装程序或 .dmg。Windows 包未做代码签名,安装时 SmartScreen 会弹出警告,选择"更多信息"再点"仍要运行"即可;macOS 版本原生支持 Apple Silicon。
Linux
两种包管理器任选其一:
flatpak install flathub io.github.chidiwilliams.Buzz sudo snap install buzz源码安装
先装好 ffmpeg,然后执行:
pip install buzz-captions python -m buzz跑通第一段录音
主界面点击"+"导入音频或视频文件(MP3、WAV、MP4 等,视频会自动提取音轨),选择模型大小和语言后点"运行",进度条显示转录进度。完成后双击任务行打开转录查看器:可以全文检索、编辑文本、调整时间戳并控制播放,最终结果在同一界面导出为 TXT、SRT 或 VTT。脚本化场景可用命令行:buzz add --model-size small --srt --vtt meeting.mp4建任务并直接产出字幕文件。
🎬 三种典型用法
采访者:长录音变干净文字稿
痛点:90 分钟的访谈录音,人工听打不现实。操作:选 medium 模型,手动指定音频语言,把采访对象姓名、机构名等易错词写进 initial prompt。产出:可直接编辑的 TXT 草稿。可执行技巧:重要访谈手动指定语言而不是自动检测,并在初始提示中列出专有名词,能明显提高识别准确率。
视频编辑者:MP4 直接出字幕文件
痛点:给视频上字幕需要手动对时间轴。操作:导入 MP4,转录完成后导出 SRT 或 VTT,再用内置的转录长度调整按间隙合并、按标点分割,让每条字幕落在可读长度内。可执行技巧:先按间隙合并、再按标点分割,导入剪辑软件时字幕断句更自然。
会议管理员:录音丢进文件夹自动转
痛点:每天新的会议录音落在共享文件夹,总得有人手动导入。操作:在偏好设置里开启文件夹监视,指定输入目录和输出目录,新文件进入后自动加入任务队列。可执行技巧:给会议录音统一命名(日期_会议名),输出目录里方便按批次归档。
⚙️ 模型后端怎么选
不同硬件适合不同后端。NVIDIA 显卡显存 6GB 以上时选Faster Whisper,比原版 Whisper 快数倍且占用更少内存;Mac 或只有核显的机器选Whisper.cpp,支持 Vulkan 加速,纯 CPU 也能跑实时转录。需要针对特定语言优化的模型时,用 HuggingFace 后端加载 MMS(覆盖 1000+ 语言)或经 PEFT 微调的模型。模型文件缓存在本地(Linux 下为~/.cache/Buzz),下载过一次后完全离线可用;无网机器可以把另一台电脑的模型缓存目录整体拷过去,配合 scripts/download-models.py 可以提前备好整套模型。
实时转录方面,Buzz 支持麦克风录音转文字:选择录音设备、设置缓冲时长即可在发言时看到文字,还可以单独调出演示窗口把实时字幕投到大屏上,适合会议和发布会现场。
避坑:高频问题速查
| 问题 | 处理办法 |
|---|---|
| Windows 安装时提示安全警告? | 官方包未签名,点"更多信息→仍要运行",属正常现象 |
| 转录速度太慢? | 先换更小模型(base/small),再开 GPU 加速;NVIDIA 卡 6GB+ 显存用 Faster Whisper |
| 实时转录报麦克风错误(PaErrorCode-9999)? | 检查系统麦克风隐私权限,临时关闭杀毒软件测试 |
| 老电脑启动失败? | CPU 需支持 AVX2,过旧的机器不受支持 |
资源索引
- 官方文档与功能总览:docs/
- 使用教程(文件导入、实时录音、翻译、导出):docs/docs/usage/
- CLI 参数参考:docs/docs/cli.md
- 常见问题(模型缓存位置、GPU 加速、无网机器):docs/docs/faq.md
- 插件系统与内置插件(AI 摘要、字幕自动调整):buzz/plugins/
- 说话人识别组件:buzz/widgets/transcription_viewer/speaker_identification_widget.py
Buzz 的价值在于把整条转录链路放进你自己的机器:不上传、不过云端、不依赖网络,这是处理敏感音频时选择它的最主要原因。下一步很具体:挑一段三五分钟的录音,用小模型跑完第一次转录、导出一份 SRT,再换大模型对比一次准确率,你就能摸清自己硬件的合适档位。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考