Buzz 离线语音转录完整指南:免费在本地把音频转成文字
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款离线语音转录工具,基于 OpenAI 的 Whisper 模型,把音频和视频转成文字,还能翻译成其他语言。整个流程跑在自己的电脑上,不需要账号,没有订阅费,断网照常使用。支持 Windows、macOS 和 Linux 三个平台,开源免费(MIT 许可)。
为什么用本地转录,而不是在线服务
先说结论:Buzz 完全跑在本地,音频文件从头到尾不出设备,网络断了照样转录。
补三个理由:
- 隐私:会议录音、采访、课堂内容不经过任何第三方服务器
- 成本:开源免费,装好永久用,不按时长计费
- 限制:没有文件大小、每月时长、免费额度这些天花板
在线服务一般要先上传音频,长录音还会碰到额度墙。走本地这条路,上传环节直接消失,剩下的只是本机算力的问题。
安装 Buzz 的两种路径
按使用习惯分两条路。
图形版:Windows 和 macOS 用户从官方发布渠道下载预编译安装包,macOS 是 .dmg 镜像。注意新版本的 macOS 版只支持 Apple Silicon 芯片,Intel Mac 停留在 1.4.5。Linux 一条命令装 Flatpak 版:
flatpak install flathub io.github.chidiwilliams.Buzz终端版:已有 Python 环境的用户,装好 ffmpeg 后执行:
pip install buzz-captions python -m buzz两个小坑提前说:Windows 安装包没有数字签名,首次运行会弹警告,选"更多信息"再"仍要运行"即可;PyPI 版依赖 ffmpeg 解析音频,没装会直接报错。
🎯 第一次转录:三步出结果
第一步,放文件。把音频或视频拖进主窗口,也可以直接粘贴一个链接,Buzz 会自动建好转录任务。
第二步,选设置。模型和语言是必选项,拿不准就选小一点的模型,语言选"自动检测"。
第三步,等结果。任务列表里有实时进度,首次运行会自动下载对应模型,之后再转同样的内容就走本地缓存,不用再等。
转完后结果落在查看器里,带音频,可以搜索、可以播放,逐段对照原文。
转完的字能干什么
导出支持三种格式:TXT 适合阅读和全文检索,SRT 和 VTT 是字幕格式,丢进剪辑软件就能用。
查看器不只是"看"。支持关键词搜索、播放速度调节,点任意一段文字就跳到对应音频位置。识别错了直接改文字,时间戳不准可以按段调整,改完重新导出。
两个进阶能力:
- 说话人识别:多人录音自动区分说话人,标注谁说了什么,访谈和会议记录用得上
- 文件夹监视:指定一个文件夹,新丢进去的音频自动开始转录,批量处理不用盯着
日常用法的详细说明在 官方文档,功能篇集中在 使用指南。
⚙️ 引擎和模型怎么选
Buzz 内置多个转录后端,各自适合不同机器:
| 选项 | 特点 |
|---|---|
| Whisper | OpenAI 官方实现,综合表现稳定 |
| Whisper.cpp | 轻量,可借 Vulkan 在大多数显卡上加速 |
| Faster Whisper | 速度快,内存占用低 |
除此之外,还能接 Hugging Face 上的 Whisper 兼容模型(包括 Parakeet、Qwen3-ASR 等社区模型),或者接 OpenAI API 做云端转录——最后这条是可选项,关掉它 Buzz 依然 100% 离线。
硬件加速有三档:CUDA(NVIDIA 显卡)、Apple Silicon(Mac)、Vulkan(通用方案,集显也能用)。
选型按这条规则走:
- 模型大小:tiny、base、small、medium、large 五档,越大越准但越慢。普通笔记本从 small 起步,桌面 GPU 可以上 medium
- 机器较弱:Whisper.cpp 配 tiny 或 base,速度优势明显
- 有独显:在偏好里确认启用了加速项
🔌 插件能做什么
Buzz 带插件系统,仓库里预置了 5 个官方插件,都在 plugins/ 目录下:
- AI 摘要:转录完成后调用 AI 接口(兼容 OpenAI 格式)自动生成摘要
- 转录分段:按字符数、时长或标点把长句拆成短行,字幕直接能用
- 跳过已转录:批量处理时自动略过已完成的文件,不重复烧算力
- DOCX 导出:把结果导出成 Word 文档
- 增强语言检测:提升自动识别语言的准确度
谁适合用,先做什么
三种典型用法:
- 字幕制作者:视频丢进监视文件夹自动转录,用分段插件拆好行,导出 SRT 进剪辑软件
- 研究人员:批量转访谈录音,区分说话人后按关键词定位特定讨论段落
- 学生:转录课堂录音,用 AI 摘要插件出要点,对照原录音复习
不太适合的两类:需要真正实时同传的场景(Buzz 的麦克风实时转录比较吃资源,官方标注不保证跟上语速);以及已有稳定云服务、完全不介意上传音频的用户。
快速上手清单:
- 按上一节装好 Buzz
- 按机器配置选模型,先从 small 开始
- 设一个监视文件夹,丢第一段音频跑通全流程
现在就做
打开终端,输入:
pip install buzz-captions python -m buzz窗口起来后,拖入第一段音频。模型下载完,第一次转录就开始跑了。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考