Buzz 完整指南:免费本地转录,三步把会议录音变成文字
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一个免费开源的离线转录工具,基于 OpenAI Whisper 在你的电脑上完成音频转录与翻译——录音不用上传到任何服务器,结果直接落在本地,支持 Windows、macOS、Linux 三大平台。本文从安装讲起,依次走完"文件转录、实时录音、字幕导出"三条最常用的路径,最后给你两个批量处理的自动化捷径。
🎯 第一次转录:把一段会议录音变成文字
三大平台各有一条安装路径
Windows 下载官方 .exe 安装包,安装时若提示"未知发布者",选"更多信息 → 仍要运行"即可;macOS 下载 .dmg 拖入 Applications;Linux 任选一条命令:
# Flatpak 方式 flatpak install flathub io.github.chidiwilliams.Buzz # 或 Snap 方式 sudo snap install buzz导入音频,做三个决定
点工具栏的"+"(或 Ctrl+O)选入 MP3、WAV、MP4 等音频或视频文件,也可以粘贴 YouTube 链接。导入时只需要决定三件事:任务是 Transcribe 还是翻译成英文;语言建议手动指定,自动检测只靠开头几秒判断,混杂音频容易跑偏;模型先用默认值,下一节细讲。点 Run,等状态变成 Completed,双击该行即可打开转录结果。
第一次运行的稳妥参数
30 分钟以内的文件选 base 或 small 模型,普通电脑几分钟能跑完;语言写中文就填 zh;导出格式默认 TXT 即可。
⚡ 挑一个和你的硬件匹配的 Whisper 模型
按大小定速:tiny 到 large 差 30 倍
模型体积与速度、准确率大致成正比:tiny 约 75MB 最快但错字多,base 约 142MB,small 约 466MB,medium 约 1.5GB,large 约 2.9GB 精度最高。日常会议和课程录音 small 通常够用,重要内容再上 medium 或 large。模型只下载一次并缓存到本机(Linux 在~/.cache/Buzz),之后断网也能继续转。
有 N 卡选 Faster Whisper,没有选 Whisper.cpp
官方 Whisper 实现准确但吃内存;Faster Whisper 在 6GB 以上显存的 N 卡上快一个数量级;Whisper.cpp 是 C++ 实现,没有独显的笔记本靠集显甚至纯 CPU 也能跑实时转录,Mac 上首选它。
完全离线的机器:把模型文件夹拷过去
在一台联网电脑上下载好所需模型,通过 Preferences → Models 的"Show file location"找到缓存目录,把模型文件夹拷到离线机器的相同位置就能用;仓库里的 scripts/download-models.py 就是专门用来预生成离线模型缓存的。
🎙️ 实时录音:开会、听讲座边说边出字
麦克风直出文字
在实时录音面板选好任务、语言和麦克风,点 Record,说出的话逐句变成文字。实时场景官方文档建议切到 Whisper.cpp 后端并选小模型,否则任务队列会越积越长。
第二屏投出实时字幕
录音进行中会多出一个 Presentation window 选项,打开后大字号字幕投到另一块屏幕,适合现场同传展示或让观众实时看到文稿。
多人对话:分清谁说了什么
转录完成后在查看器里点 Identify speakers,Buzz 会给每句话标上说话人标签,可试听任意一句的 10 秒片段确认身份,并把自动标签改成真名;保存时勾选"合并同一说话人的句子",整场对话就按人归好了。
✂️ 转录后处理:改错字、调字幕、导出三种格式
逐句校对文字与时间戳
查看器里每句话都带时间轴,点哪句音频就跳到哪个位置播放,还能调节播放速度;改错字、合并或拆分句子直接在行内表单里完成。
字幕太长?用 Resize 重新切分
导入时若勾选了 Word-Level Timings,Resize 就能按"最大字幕长度"把词句重新合并,并按标点断句,还能给每条字幕统一延长显示时长;原音频文件还在的话,它会分析静音区间让切分更准。
导出 TXT、SRT 或 VTT
改完点导出:TXT 进笔记软件,SRT 拖进剪辑软件当视频字幕,VTT 用于网页端字幕。
🤖 两个自动化捷径:命令行与文件夹监控
一条命令批处理
装好 PyPI 版(需 Python 3.12 与 ffmpeg,命令为pip install buzz-captions)后,终端里可以直接跑:
buzz add --task transcribe --language zh --model-type whisper --model-size small 会议录音.mp3加--srt --vtt可同步导出字幕文件,完整参数见 docs/docs/cli.md。
文件落进文件夹就自动转
在 偏好设置 的 Folder Watch 标签页指定一个目录,之后任何丢进去的音频都会自动排队转录——适合"每天把当天录音丢进同一个文件夹"的固定工作流。
📋 落地建议:三条起步路径与两个常见坑
新手第一天的顺序
- 用 base 模型转一段 5 分钟以内的短音频,跑通"导入 → 运行 → 打开结果"全流程;
- 换 small 模型重转同一段,对比错字率,建立对模型大小的体感;
- 试一次实时录音并导出 TXT,检查格式是否符合你的笔记习惯。
两个容易踩的坑
- 不指定语言:自动检测依赖开头几秒音频,中英混杂的内容经常猜错,手选语言准确率明显更高。
- 老电脑跑不起来:Buzz 需要 CPU 支持 AVX2,太老的机器无法运行;另外模型下载残缺会导致崩溃,到 Preferences → Models 删除重下一次即可。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考