Buzz 离线语音转文字完整指南:从一段会议录音到批量自动化
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款在个人电脑上离线转录和翻译音频的工具,核心由 OpenAI Whisper 驱动。你的录音不需要上传到任何云端,转出的文字直接落在本地。这份指南以"整理一段会议录音"为主线,带你从导入、首次转录、字幕导出,一直走到实时录音与批量自动化,每一步都对应一个具体动作。
导入音频并完成第一次转录
从工具栏起步打开 Buzz,你会看到一条任务列表。第一次转录按这个顺序:
- 点击File菜单的Import Media File,或工具栏的+图标,也可以用快捷键Ctrl+O(macOS 用Cmd+O)。
- 选中一个音频或视频文件,任务默认是Transcribe。
- 明确指定Language,别依赖自动检测,选错语言会拉低准确率。
- 选一个模型,点击Run。
状态变成Completed后,双击这一行就打开了转录结果。
减少错拼的提示词专业名词、人名容易转错。点任务里的Advanced...,在Initial prompt里写几个常被拼错的词,模型会照着写。这是官方文档明确推荐的做法。
逐字时间戳开关导入选项里还有Word-Level Timings和Extract speech两个开关。前者给每个词单独打时间戳,方便之后合并成字幕;后者先把人声分离出来再转录,嘈杂环境更准。
选对后端与模型,让本机跑得动
转录全靠算力,选错后端会明显变慢。Buzz 内置多种 Whisper 后端,差别不小。
| 后端 | 特点 | 适合你 |
|---|---|---|
| Whisper | OpenAI 原版,准但慢、吃内存 | 追求最高精度 |
| Faster Whisper | 优化版,比原版快数倍、省内存 | 有 6GB 以上显存的 Nvidia 卡 |
| Whisper.cpp | C++ 实现,能吃各种 GPU,纯 CPU 也能跑 | 无独显的机器、Mac 首选 |
| HuggingFace | Transformers 实现,支持上千种语言的 MMS 等自定义模型 | 想试语言专用模型 |
GPU 加速怎么选Nvidia 卡走CUDA,Mac 走Apple Silicon,没有独显就用Whisper.cpp的Vulkan甚至纯 CPU。想用 Faster Whisper,显存至少 6GB。
线程数能换来多少速度Whisper.cpp 默认用一半 CPU 核心。在 16 线程的笔记本上,把线程数设成 8,官方实测转录能快约 15%;再往上加线程反而更慢。
实时录音与演示窗口
不只是处理文件,Buzz 也能对着麦克风边说边出字。
开启实时转录选好录音任务、语言和麦克风,点Record。默认 Whisper 模型比较吃资源,实时场景建议用Whisper.cpp,并选小一点的模型。
三种拼接模式
- Append below / Append above:新句子依次往下或往上排。
- Append and correct:会回改上一句末尾的错误,最准但最费机器。
演示窗口开始录音后会出现Presentation window选项,适合开会、演讲时把实时字幕投到大屏。
编辑字幕、缩放与说话人识别
转录只是第一步,Buzz 的查看器能接着编辑。
搜索与播放双击转录打开查看器,Ctrl+F出搜索框,Ctrl+P播放/暂停,播放速度可在0.5x 到 2.0x之间调。勾选Follow Audio,文字会自动跟到当前播放位置。
缩放字幕点Resize,把逐字时间戳合并成一句句字幕。可以设最大长度、按标点断句;原始音频还在的话,它会分析静音来对齐,还能给每条字幕统一延长停留时间。
区分说话人点Identify speakers,Buzz 会给每句话打标,可以试听某位说话人 10 秒、把自动标签改成真实姓名,还能把同一人的连续句子合并成一段。注意Intel Mac不支持该功能。
批量、命令行与插件
监听文件夹在偏好里指定一个文件夹,Buzz 会自动转录新放进来的文件,适合持续归档录音。
命令行批量处理Buzz 提供完整的 CLI,适合写脚本:
buzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt /path/to/audio.mp4内置插件打开Help → Plugins管理(1.4.5 起提供):
- AI Summary:接 OpenAI 兼容接口,把长转录压成摘要。
- DeepFilterNet:转录前先降噪。
- Export to DOCX:一键导出 Word,可带时间戳。
- Skip Already Transcribed:重复导入时自动跳过已有结果。
离线部署与常见坑
真的能断网用吗能。先在联网机器上把模型下好,再把模型文件夹拷到离线机器。Linux 默认在~/.cache/Buzz,Mac 在~/Library/Caches/Buzz,Windows 在%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache。也可以看scripts/download-models.py提前准备模型缓存。
转得太慢先查什么换更小的模型,或改用Whisper.cpp;有 6GB 显存就上Faster Whisper。
别踩的硬件红线Buzz 要求 CPU 支持AVX2,太老的电脑带不动。Windows 安装包未签名,安装时选More info → Run anyway即可。模型下坏会导致崩溃,删掉重下一般就好。
你现在就可以从一段会议录音开始:导入、选 Whisper.cpp、导出 SRT。想批量跑就开监听文件夹加一条命令行,离线归档、实时字幕、说话人识别都能一站搞定。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考