Buzz 离线转录完全指南:本地推理跑 Whisper,3 分钟把录音变文字
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一个完全离线语音转录工具:在你自己的电脑上跑 Whisper 本地推理,转写并翻译音频,不向云端上传任何数据。会议录音、采访录音这类敏感内容留在自己设备里。
🧩 它是什么,解决了什么问题
Buzz 是一个把 OpenAI Whisper 模型放在本地跑的桌面应用:导入音频或视频文件,选模型和语言,得到带时间戳的转录结果。和云端语音识别服务比,它有三个不同:数据不出设备,音频不离开电脑,也没有按分钟计费的 API;推理后端可选,Whisper、Whisper.cpp(支持 Vulkan GPU 加速)、Faster Whisper 都内置,按你的硬件挑一个;图形界面与命令行两用,日常点鼠标,批量录音不打开窗口也能跑。
三分钟跑通第一次
macOS:从官方发布页下载 .dmg,拖进应用程序文件夹即可,Apple Silicon 原生支持,无需额外配置。
Windows:下载后运行安装包;安装程序未签名,看到安全提示选"更多信息",再点"仍要运行"。
Linux / Python:用包管理器或 pip 二选一:
flatpak install flathub io.github.chidiwilliams.Buzzpip install buzz-captions python -m buzzLinux 走 pip 的话可能还要装 ffmpeg、libportaudio2 等系统依赖,完整列表见安装文档。
最简验证:打开后点"+",选一个 MP3,默认设置直接点 Run。任务行的状态从 In Progress 走到 Completed,输出目录里出现 TXT 文件,就说明它跑起来了。
🎬 一条真实工作流
假设你是个当天要交稿的记者,跟着我走一遍:
- 点主界面左上角的"+",加入采访录音的 .flac 文件;
- 在任务行里选 Faster Whisper (Medium),速度和准确率的平衡点;
- 语言选中文,任务选 Transcribe,点运行;
- 队列里每个文件都有实时进度,别的文件可以继续排队,不用干等。
跑完后双击那一行,打开转录查看器:每句都有起止时间,点播放核对内容,直接在表格里改文字;句子太长就点 Resize,按标点或最大长度拆分,可以直接进字幕轨道。
用到第二周才会发现的进阶能力
说话人识别:两人采访转出来是一锅粥,分不清谁说的。在查看器里点"Identify speakers",它按声纹切分并给每句打标签;每个标签可试听 10 秒样本句,认出是谁就改成真实姓名,勾选"Merge speaker sentences"后同一人的连续句子会合并成段。
文件夹监视:文件攒多了不想一个个手动导入,在 Preferences 的 Folder Watch 页签指定输入文件夹和输出位置,丢进文件夹的录音会自动排队转录,适合录音机每天自动归档会议录音的场景。
导出文件名模板:导出多了,文件分不清是哪个会、哪个时间。Preferences 的"Default export file name"支持变量,例如{{ input_file_name }} ({{ task }}d on {{ date_time }}),生成的名字自带日期和任务类型,批量导出不乱。
🛠 踩坑与排障
- Windows 安装时弹 SmartScreen 警告。大概率是安装程序未签名,选"更多信息"→"仍要运行"继续即可,属正常现象。
- Linux 上
python -m buzz起不来或报音频相关错误。缺 ffmpeg、libportaudio2 等系统依赖,用 apt 装上,对照安装文档里的依赖列表。 - 第一次转录很慢,或提示找不到模型。首次使用要下载模型文件,打开 Preferences → Models 提前下载;低配机器选 tiny/base,medium 及以上吃内存。
- GPU 报错,或 GPU 比 CPU 还慢。启动前设环境变量
BUZZ_FORCE_CPU=true强制走 CPU;显存紧张再配BUZZ_REDUCE_GPU_MEMORY=true用 8bit 量化,详见进阶配置。
配置、扩展与生态
- 官方文档:实时录音、翻译、转录查看器等完整功能说明
- CLI 用法:批量转录参数,支持
--srt/--vtt/--txt输出与词级时间戳 - 插件系统:AI 摘要、DeepFilterNet 降噪、跳过已转录等扩展入口
- 说话人识别:标签重命名与句子合并的详细用法
- 偏好配置:导出模板、实时录音模式、全部环境变量清单
还在担心采访录音传上云会泄露,或者手动誊抄转录结果的话,现在就能做第一步:装好 Buzz,拖进本周最长的一段会议录音,选 tiny 模型跑一遍,几分钟后你手上就会有一份带时间戳的转录稿。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考