Buzz 离线语音转文字教程:4 步跑通本地转录与字幕生成
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
会议录音涉密不能传云端,或者想批量产出视频字幕却嫌外包按分钟计费?Buzz 就是为这类场景准备的。它是一款免费、开源的离线语音转文字工具,所有识别都在本机完成,音频文件不出电脑,覆盖 99 种以上语种。图形界面与命令行两种方式都有,几分钟即可上手。
Buzz 跨平台安装步骤
- Windows:从官方 SourceForge 渠道下载安装包并运行。程序未签名,出现安全提示时先点"更多信息",再选"仍要运行"。
- macOS:下载官方
.dmg镜像,把图标拖进"应用程序"文件夹即可。 - Linux:可选两条渠道:
flatpak install flathub io.github.chidiwilliams.Buzz或使用 Snap:
sudo snap install buzz- Python 环境:需要 Python 3.12,并预先装好
ffmpeg:
pip install buzz-captions python -m buzz也可以克隆源码体验最新功能:
git clone https://gitcode.com/GitHub_Trending/buz/buzz第一次转录:从导入到导出
- 导入音频:用"文件"菜单或工具栏"+"图标挑选本地音频文件。
- 配置任务:任务一栏选"转录";语言一栏手动指定具体语种——自动检测只看开头几秒,手选明显更准;模型一栏挑选规格。
- 点击"运行",等待状态变为"已完成"。
- 双击该行打开查看器:边播放边核对文本,再把文本存成 TXT,或生成 SRT、VTT 字幕。
三大实战场景
实时录音出字:会议与访谈
任务一栏选"录音",接好麦克风点击"录音",软件会边录边出字。新句显示有三种模式:"追加在下方"、"追加在上方"、"追加并校正"。最后一种会不断回头修正上一句的识别错误,最接近人工笔记。
多人访谈时,结果能区分并标注不同说话人。识别结果还能实时落盘到.txt文件,供 OBS 等直播软件读取;打开演示窗口,文字可投到大屏上给全场观众看。
视频自动生成字幕
导入 MP4、MKV 等视频文件,音轨会被自动抽取。在高级设置中打开"词级时间戳",每个词都会获得独立字幕行;接着用"调整大小"按静音间隔和标点把词组合成标准字幕长度的行,输出 SRT 或 VTT,直接喂给播放器或剪辑软件。
批量转录与归档
在偏好设置里填一个监视文件夹,新音频放进即被检测并自动创建转录任务,很适合把会议录音归档到固定目录的工作流。再装上"跳过已转录文件"插件,同一批文件二次导入时直接沿用旧结果,省掉重复推理。批量操作也能走命令行:
buzz add --task transcribe --model-size small --srt --vtt /path/to/audio.mp3提速与准确率调优
- GPU 加速:把模型后端切到
Whisper.cpp,Nvidia 卡默认走 CUDA,AMD、Intel 卡走 Vulkan;显存吃紧时换q_5这类量化模型,或在偏好设置中勾选"降低 GPU 内存占用",启用 8 位量化。 - 模型大小权衡:日常草稿用
base、small控时间;终稿校对换medium、large换准确率;实时录音务必挑小模型,才能跟得上说话节奏。 - 手动指定语言:已知音频语种时直接指定,可大幅减少误识别。
- 初始提示:在高级设置中填入人名、产品名等易错专有名词,纠正拼写。
- 噪声处理:嘈杂录音开启"语音提取",或先用 DeepFilterNet 插件降噪再转录。
卡点速查:识别慢,换更小的模型,或用环境变量BUZZ_WHISPERCPP_N_THREADS调 CPU 线程数;国内拉模型慢,把HF_ENDPOINT指到 hf-mirror.com;老显卡越跑越慢,设BUZZ_FORCE_CPU=true强制走 CPU。
离线方案选型对比
| 方案 | 数据隐私 | 联网要求 | 费用 | 实时录音 | 交互方式 |
|---|---|---|---|---|---|
| Buzz | 数据不出本机 | 无需联网 | 免费开源 | 支持 | 图形界面 + 命令行 |
| 云端转录服务 | 需上传服务器 | 必须在线 | 按量收费 | 支持 | 网页端 |
whisper等命令行工具 | 本地处理 | 可离线 | 免费 | 不支持 | 仅命令行 |
Buzz 让音频数据全程留在本机,又同时提供图形界面与命令行两种用法,是隐私敏感用户的高性价比选择。
延伸阅读:官方文档、转录核心模块、插件系统源码。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考