Buzz 离线语音转文字实战指南:本地音频免费转成字幕只需三步
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
你的会议录音散落在手机、电脑和 U 盘里,想转成文字,又不放心把敏感内容交给在线服务?Buzz 基于 OpenAI Whisper,把整个语音转文字过程放在你自己的电脑上跑:导入音频、点运行,得到带时间戳的文本和字幕,全程不出本机。
为什么选 Buzz:五个值得留意的点
- 音频不出设备:模型和推理都在本地运行,涉密录音、客户访谈可以放心处理。
- 免费且开源:不订阅、不按分钟收费,支持 99 种以上语言的转写与翻译成英文。
- 离线可用:只需首次联网下载模型,之后断网照常工作。
- 界面与命令行双通道:日常用图形界面点两下就行,批量任务可以写进脚本。
- 覆盖录音到字幕的全流程:实时录音出字、说话人区分、字幕拆分导出都内置,不需要再拼一堆外部工具。
一条命令跑起来:安装与启动
最省心的路径是 Python 环境(建议 3.12,并先装好 ffmpeg):
pip install buzz-captions python -m buzz不想折腾环境的话:Windows 装官方安装包(首次运行遇到"未签名应用"提示,点"更多信息"→"仍要运行"即可);macOS 下载 DMG 拖进"应用程序";Linux 用flatpak install flathub io.github.chidiwilliams.Buzz或 snap 包。想跟进最新功能,克隆源码即可:git clone https://gitcode.com/GitHub_Trending/buz/buzz。
三步把一段音频变成文稿
适合:单人访谈、课程录音、手机备忘音等单声源材料。
- 点工具栏"+"图标(或"文件"菜单)导入音频,Buzz 对 MP4、MKV 等视频文件会自动抽取音轨。
- 任务选"转录",语言建议手动选——自动检测只看开头几秒,选错整段都会跑偏。
- 选好模型点"运行",状态变成"已完成"后双击这一行。
打开查看器后,播放器逐句对齐文字,你可以边听边改;需要修正易错的人名、产品名时,在"高级设置"的初始提示里列出来,再导出一份 TXT 就齐活了。
多人对话:自动区分并标注说话人
适合:多人访谈、播客、小组讨论——最终文稿要能看出"谁说了什么"。
- 先按普通流程完成转录,双击打开查看器。
- 点"识别说话人",Buzz 会把每句话打上说话人标签。
- 试听任意一句的 10 秒片段,确认无误后把自动标签改成真实姓名;若勾选"合并同一说话人的连续句子",同一段发言会合成一个段落,读起来更像人工整理的纪要。
注意:说话人识别依赖本地音频文件仍在原位置,且 macOS Intel 版本暂不支持。
从录音到成品字幕:词级时间戳 + 字幕拆分
适合:给视频配字幕,要直接进播放器或剪辑软件。
- 导入视频文件,在"高级设置"里打开"词级时间戳"。
- 转录完成后点"调整大小":可以按最大字幕行长度、是否在标点处断句来组合字幕;只要原音频还在,Buzz 还会分析静音间隔,让断行更贴合语流。
- 若嫌每条字幕停留太短,可给每段加几秒的延长量(不会侵入下一条的起点)。
- 导出 SRT 或 VTT,即可挂载到视频上。
不用手动点:文件夹监视与批量命令
适合:录音固定投进某个归档目录,或希望流程可脚本化。
- 文件夹监视:在偏好设置里指定一个目录,新文件一放进去就自动生成转录任务;再启用"跳过已转录文件"插件,同一批文件重复导入时直接复用旧结果,不重复跑模型。
- 命令行:一条命令完成转录并导出 SRT:
buzz add --task transcribe --model-size small --srt /path/to/audio.mp3参数较多时看buzz add -h,官方文档里也有完整列表。
让识别更快更准的几个开关
- 换后端:模型类型切到 Whisper.cpp 能吃到 GPU 加速——Nvidia 走 CUDA,AMD/Intel 走 Vulkan;显存紧张时选 q_5 这类量化模型,或在偏好设置里开 8 位量化压低显存占用。
- 按场景选模型:草稿和实时录音用 base / small 控制延迟;终稿校对再上 medium / large 换准确率。
- 手动定语言:已知语种就别交给自动检测,误识别率明显更低。
- 初始提示:把人名、术语、产品名写进提示,专名拼写会稳定很多。
- 噪声环境:勾选"语音提取"先分离人声,或用 DeepFilterNet 插件先降噪再转录。
- 环境变量:CPU 速度不理想可调
BUZZ_WHISPERCPP_N_THREADS改线程数;老显卡开加速反而更慢时设BUZZ_FORCE_CPU=true;国内下载模型慢,设HF_ENDPOINT指向 hf-mirror.com 镜像。
谁该用,谁可以不用
| 维度 | Buzz | 云端转录服务 | 纯命令行 Whisper 脚本 |
|---|---|---|---|
| 音频存放位置 | 本机,不上传 | 需传到服务器 | 本机 |
| 网络要求 | 仅首次下载模型 | 必须联网 | 离线 |
| 费用 | 免费 | 按量计费 | 免费 |
| 操作方式 | 图形界面 + 命令行 | 网页 | 仅命令行 |
| 实时录音出字 | 支持 | 支持 | 不支持 |
适合你,如果你处理的是不想外传的录音、需要字幕产出、又希望操作尽量傻瓜化;不必用它,如果你是"全云端"工作流用户,或者只需要一次性脚本化转录且能接受纯命令行。
延伸阅读
- CLI 参数全集:docs/docs/cli.md
- 偏好设置详解:docs/docs/preferences.md
- 转录引擎源码:buzz/transcriber/
- 插件系统源码:buzz/plugins/
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考