Buzz零门槛离线语音转文字完整指南:3步把会议录音变成纪要
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款基于 OpenAI Whisper 的全离线语音转文字工具。导入录音或视频,它在你的电脑上转成文本,可导出 TXT/SRT/VTT。全程不联网、数据不出本机、免费不订阅。如果你常处理会议纪要或视频字幕,这是最快的上手路径。
值不值得用:看这张表再决定
如果你还在纠结本地转录工具能不能替代在线服务,用这张表判断。
| 对比项 | 在线转录服务 | Buzz 本地转录 |
|---|---|---|
| 数据出不出你的电脑 | 上传第三方服务器 | 留本地,不联网 |
| 使用成本 | 订阅或按分钟计费 | 免费,装一次用一年 |
| 网络依赖 | 断网就用不了 | 完全离线环境照样转 |
| 支持格式 | 看服务商给什么 | MP3、MP4、WAV、M4A、FLAC,连 YouTube 链接都行 |
| 硬件加速 | 服务器端,你感知不到 | 用你自己的 GPU,CUDA/Vulkan/Apple Silicon 都支持 |
跑起来:从安装到第一次转写
本节带你从空电脑到出第一份文本,共 7 步。
- 先装 ffmpeg(Buzz 靠它解码音频)
- 选一种安装方式:
- macOS/Windows:下载安装包直接运行;Windows 若提示"未签名",点"更多信息 → 仍要运行"
- Linux:snap 一行装好
sudo snap install buzz- 喜欢源码方式:Python 3.12+ 下
pip install buzz-captions,再执行python -m buzz
- 首次启动,到"偏好设置 → 模型"里下载一个转录模型(新手选 Base,约 1GB)
- 把录音拖进主窗口,或用菜单导入
- 在任务上选好模型和语言(留空即自动识别),勾选需要的输出格式
- 点"转录"
- 双击转录结果打开编辑器
任务一:把 47MB 会议录音变成可编辑纪要
如果你有一段会议录音要变成文字底稿,按这 4 步走。
- 导入会议录音,MP3/WAV/MP4 都行
- 选模型:日常会议用 Base;口误多、环境吵就换 Medium
- 中文会议把语言设为 zh;英文会议留空让它自动检测,不用手动选
- 勾选"单词级时间戳",后面想拆字幕行时才用得上
转完双击结果进编辑器:播放进度和文本同步,逐句改错别字、修专有名词,最后导出 TXT 底稿。
任务二:给课程视频挂 SRT 字幕
如果你的目标是给视频挂字幕,关键在转写前勾对"单词级时间戳",再用"Resize"工具分句。
- 导入视频,选 Small 或 Medium 模型(课程视频长,Medium 更稳)
- 任务里勾上单词级时间戳 + SRT/VTT 输出
- 转完在查看器点"Resize":设好单条字幕最大长度、按标点断开,自动切行
- 想让字幕停留更久,加一个"延长结束时间",每段多留几百毫秒
任务三:批量文件不想一个个点
如果你有几十个音频要处理,别手动逐个导入,用文件夹监控或命令行。
配置文件夹监控
- 在"偏好设置 → 常规"里设好监控文件夹、默认模型和输出格式
- 以后新文件丢进这个文件夹就自动转录,人不用守着
顺带把导出文件名的默认模板也改了(比如自动带日期),归档时不用改名。
用命令行一句话
脚本化或挂在服务器上跑时:
buzz add --model-type whispercpp --model-size small --srt --vtt /path/to/meeting.mp3完整参数见 CLI 文档。
让它跑满:模型和硬件 30 秒决策
如果转录慢或内存吃紧,多半是模型选错了,先看这张表:
| 场景 | 选哪个模型 | 吃不吃内存 | 值不值得开 |
|---|---|---|---|
| 只查大致内容 | Tiny | <500MB | 最快,适合粗稿 |
| 日常会议 | Base | 约 1GB | 速度和准确率最均衡 |
| 要字幕级质量 | Medium | 约 3GB | 音频吵时值得 |
| 存档级要求 | Large | 约 8GB | 有 GPU 才开 |
两条榨速度的技巧:
- 🚀 GPU 用户:在"偏好设置 → 模型"里选 whispercpp 后端开 Vulkan/CUDA;显存紧张就换量化版(q_5),省一半显存
- CPU 跑嫌慢时,设环境变量
BUZZ_WHISPERCPP_N_THREADS为核数一半,往往比拉满线程更快,详见高级设置文档
卡住了:高频问题速查
某一步卡住时,先查这里,再翻安装文档。
| 现象 | 可能原因 | 一句话解法 |
|---|---|---|
| Linux 起不来、没声音 | 缺系统音频库 | sudo apt-get install libportaudio2后重启 |
| Windows 安装提示未签名 | 官方包没做签名 | "更多信息 → 仍要运行" |
| 模型下载失败 | 网络问题 | 手动把模型文件下到模型缓存目录 |
| 转录慢 | 模型太大或 CPU 弱 | 换 Base 或 Tiny |
| 准确率低 | 音频吵或模型小 | 勾"提取语音"先降噪,再升 Medium |
| GPU 没生效 | 驱动或后端不对 | 换 whispercpp 后端,确认 CUDA/Vulkan 装好 |
Buzz 只做一件事:把音频文件在你自己的电脑上免费转成文字,全程离线。如果你不想让会议录音和采访音频经过任何服务器,装好它、选个模型、丢进文件就行。想读源码或提改进,把仓库克隆到本地即可:
git clone https://gitcode.com/GitHub_Trending/buz/buzz【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考