Buzz 离线语音转文字:免费本地 Whisper 转录完整上手指南
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款跑在你自己电脑上的音频转录工具,基于 OpenAI Whisper 离线完成语音转文字和多语言翻译,音频不出本机,全程免费,不上传任何数据。
它帮你解决什么问题
你有没有过这些时刻:会议录音攒了一堆,想转成文字却发现在线服务要么要注册、要么按量收费;视频要做字幕,但又不想把素材传到别人的服务器上;有些音频涉及敏感内容,根本不能离开本地。Buzz 就是为这些场景准备的。它在本地调用 Whisper 家族模型完成转录,后端可选 Whisper、Whisper.cpp、Faster Whisper、Hugging Face 模型等多个,桌面形态,MIT 许可证,你想怎么用都行。
装好跑通第一遍
用图形界面的你,直接去下载页拿对应平台的安装包。Windows 用户注意一点:安装包没有做代码签名,安装时系统会弹安全警告,点"更多信息"再选"仍要运行"就行,属于正常现象。macOS 用户现在需要 Apple Silicon 机型,Intel 的 Mac 只能用到 1.4.5 及更早版本。
Linux 用户最省事,一条 Flatpak 命令:
flatpak install flathub io.github.chidiwilliams.Buzz想从源码或 PyPI 装的开发者,前提是本机装好 ffmpeg。Python 环境下执行:
pip install buzz-captions python -m buzz装完打开应用,导入一个音频文件,选好语言和模型,点运行,第一次转录的完整流程就走通了。
习惯命令行的你,一条buzz add就能指定后端、模型和输出格式:
buzz add -m whispercpp -s medium -l zh --srt meeting.mp3不打开窗口也能跑,加上--hide-gui参数即可,后面讲自动化时会再用到。
三种用法按需选
姿势一:把文件丢进桌面界面。这是最顺手的用法,几个要点值得知道:
- 支持近百种语言,语言栏留空则自动检测,适合混杂或不确定语种的内容
- 转录结果可导出 TXT、SRT、VTT 三种格式,SRT/VTT 能直接进剪辑软件
- 转录查看器支持搜索、播放控制、倍速播放,点哪段播哪段
- 想区分谁说了什么,用说话人识别功能把发言人标注开
- 某个片段时间戳对不齐?用片段调整工具手动微调起止时间
- 批量处理可以把目录设为监视文件夹,新文件落进去自动建任务转录
姿势二:开麦克风实时转。主界面切到实时录音模式,选好麦克风就能边说边出字。出字不是瞬时的,系统默认有一段缓冲延迟来保证文字和语音对得上。现场演讲或活动演示时,还能单独弹出一个演示窗口把实时文字投出来。转录的同时也可以指定目标语言做翻译,说完直接得到译文。
姿势三:命令行加监视目录做自动化。buzz add的参数基本覆盖界面里的所有选项:-m选后端(whisper、whispercpp、fasterwhisper、huggingface、openaiapi),-s选模型大小,-l指定语言,-t translate切换到翻译任务,输出格式用--srt、--vtt、--txt控制。1.4.6 版本起支持一次传多个文件排队处理,也能用通配符把整个文件夹的录音丢进去,再用--output-directory把产物统一放到字幕目录:
buzz add --srt --output-directory ./subtitles recordings/*.mp4这样就能写进脚本或 CI 流程,夜里跑一批,早上收字幕。
两个场景走一遍
场景 A:给已有视频出字幕。导入视频文件,Buzz 会自动抽音轨,你不用自己转格式。任务选"转写",语言按内容指定(知道是中文就直接选 zh,别用自动检测,更准),模型按机器性能选 small 或 medium,运行。跑完后打开转录查看器核对时间戳,哪里不对就调整,最后导出 SRT 或 VTT。产出物是一个能直接拖进剪辑软件的字幕文件,安静环境下录的内容,基本不用人工精校。
场景 B:会议边录边转。切到实时录音模式,选好会议麦克风,开始录音,底部面板实时出字。结束后保存这条转录,如果人多,跑一遍说话人识别把发言者分开,再按需翻译成目标语言归档。产出物是一份带时间戳、区分了发言人、可翻译成任意语言的文字记录。
性能与避坑
如果转录速度慢得离谱,先想两件事:模型是不是选大了?小机器直接用 tiny 或 base。后端是不是没吃到 GPU?换 Whisper.cpp 后端并启用加速,N 卡走 CUDA,其他显卡走 Vulkan,速度差距非常明显。
如果专有名词、术语总被识别错,去高级设置里填初始提示(initial prompt),把术语和背景塞进去给模型上下文。另外,确定音频语言时手动指定,别交给自动检测,能省掉一部分误判。
如果 Windows 安装时报安全警告,不用慌,安装包本身没签名,"更多信息"→"仍要运行"就是标准解法。
如果 PyPI 装的版本 GPU 不生效,多半是因为默认装的是 CPU 版 torch。按 README 的说明改装带 CUDA 后缀的 torch 和对应运行库,N 卡才能跑起来。
二次开发入口
想接新转录后端,看 buzz/transcriber/ 目录,Whisper、Whisper.cpp、Faster Whisper、Hugging Face 各占一个文件,照着写一个实现接口即可。插件机制在 buzz/plugins/,内置的 AI 摘要、DOCX 导出、自动调整字幕时长都在这,想加自定义后处理就从这里入手。命令行完整参数一览在 docs/docs/cli.md。
更多使用细节看 docs/docs/ 里的文档;跑批任务遇到问题,或者有想要的功能,直接去项目 Issues 提,维护者更新很勤。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考