会议录音不发云端:Buzz 三步离线转文字的完整走法
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款离线音频转录工具,基于 OpenAI 开源的 Whisper 模型,能在你个人电脑上把会议录音、采访、网课视频转成文字。音频全程不出本机,断网也能转写,零订阅费用——适合手里有敏感录音、又需要一套本地语音转文字方案的人。
先判断:它适合你吗
装之前先做个快速决策:
| 选 Buzz | 不选它 |
|---|---|
| 录音涉及隐私,不想上传任何云端 | 可以接受上传,且追求云端超大模型的极限精度 |
| 需要断网作业(出差、现场、内网环境) | 需要团队多人实时协作编辑同一份文稿 |
| 零订阅成本,用几次就是赚几次 | 对耗时不敏感,更想省事走云 API |
左列中你至少中了两条,下面这些内容就值得看下去。
能力清单:需求对得上吗
| 你的需求 | 对应能力 |
|---|---|
| 隐私隔离 | 全部音频与文本在本机处理,零数据上传 |
| 多语言识别 | 覆盖 99 种以上语言(中、英、日等),可自动检测语种 |
| 硬件加速 | NVIDIA 走 CUDA、Mac 走 Apple Silicon、核显走 Vulkan |
| 格式兼容 | MP3、MP4、WAV、M4A、FLAC 通吃,还能直接吃 YouTube 链接 |
| 实时记录 | 麦克风实时转录,配投屏窗口,适合讲座现场 |
另有两个容易被忽略的加分项:说话人分离(多人对话先分离再转写)和说话人识别。想验证处理逻辑的话,转录核心代码全部开源可查。
一条链路跑通:从文件到文稿
不管整理会议纪要还是做视频字幕,路径都是同样五步,跟着做就能成:
- 导入:把音视频文件拖进任务区,或点录音键开始实时转录;
- 选模型:在模型配置入口里定好模型大小,日常会议选 Medium 就够;
- 设输出:勾选需要的导出格式(TXT / SRT / VTT)并指定保存目录;
- 校对:任务跑完打开文稿,边播放边改错字、调时间戳;
- 导出:菜单一键生成成品,字幕制作直接拿 SRT 用。
主界面左侧的任务队列会展示每一条转录的进度,支持批量排队
跑到第四步时,本地语音转文字的结果长这样——按时间戳分行,点哪播哪,校对效率比对着纯文本改高得多:
效果调优:模型 × 硬件怎么配
模型越大越准,但吃内存也越狠。按场景选:
| 场景 | 推荐模型 | 内存占用 | 处理速度 |
|---|---|---|---|
| 快速初稿 | Tiny | <500MB | 最快 |
| 日常会议 | Base | ~1GB | 快 |
| 专业转录 | Medium | ~3GB | 中等 |
| 重要资料 | Large | ~8GB | 最慢 |
取舍逻辑其实就两条:
- 8GB 内存的机器:日常挂在 Base 和 Medium 之间,跑 Long 级别模型前先把浏览器大页面关掉;
- 16GB+ 内存带 GPU:直接开 CUDA / Vulkan 加速再上 Medium 或 Large,同一段音频比纯 CPU 能快数倍,这是提速最实在的一招。
模型默认缓存在~/.cache/Buzz/models,网络不稳时可以在别的机器下好拷过去。
卡住了:自查清单
| 现象 | 大概率原因 | 解法 |
|---|---|---|
| 装完打不开 | 缺 ffmpeg | 装好 ffmpeg 再启动 |
| 模型下不动 | 网络抽风 | 手动下载模型,放进~/.cache/Buzz/models |
| 转录特别慢 | 模型选大了 / 内存吃紧 | 降一档模型,或开 GPU 加速 |
| 错字多 | 录音噪声大 / 模型太小 | 先做降噪,或模型升一档 |
| GPU 没生效 | 驱动或环境不全 | 更新显卡驱动,确认 CUDA / Vulkan 装好 |
Linux 上跑 PyPI 版记得先补音频依赖:
sudo apt-get install libportaudio2 libcanberra-gtk-module libcanberra-gtk3-module玩法延伸
三个进阶方向,点到为止:
- 📦插件扩展:插件目录自带 AI 摘要、字幕自动调整、深度滤波降噪、DOCX 导出等现成插件,开开关就能用;
- ⌨️命令行批处理:CLI 支持脚本化,一条命令就能把文件丢进转录队列:
python -m buzz add -s medium -l zh --srt --hide-gui ./recordings/0909.mp3- 📂文件夹监控:指一个目录,新落进来的录音自动排队转录,批量归档很顺手,实现见 folder_watcher。
最后说一句:Buzz 最值得留的理由,是你的音频、中间产物和文稿全程只存在你自己的电脑上——拔了网线照样能出一份干净转写。想上手的,先git clone https://gitcode.com/GitHub_Trending/buz/buzz把源码拉下来,用 Tiny 模型跑一条 30 秒的录音试试手感。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考