Buzz 离线音频转文字实操指南:本地 Whisper 转录一次讲清
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款基于 OpenAI Whisper 的离线音频转文字工具,录音、播客、采访视频交给它,全部处理发生在你的电脑本地,全程不上传文件。它面向三类人:整理会议录音的打工人、处理采访素材的记者,以及给视频加字幕的创作者。下文按"装好、转出第一稿、把结果改到你满意"的顺序讲。
🎯 Buzz 是什么:三句话说清
- 本地离线音频转录:音频不离开你的电脑,没有网络也能跑,前提是把模型提前下好
- 多种 Whisper 实现可切换,NVIDIA 显卡、Apple Silicon、集显都能加速
- 支持批量导入多个音频/视频文件排队处理,结果可导出 TXT、SRT、VTT
💻 Buzz 安装与第一次离线音频转文字
Windows 和 macOS 从官方渠道下载安装包即可,Windows 版未签名,安装时看到警告选择"更多信息 → 仍要运行";Linux 用 Flatpak 或 Snap 安装,Python 用户也可以走 PyPI 装(需要 Python 3.12 和 ffmpeg)。Linux 下用 Flatpak 只需一行:
flatpak install flathub io.github.chidiwilliams.Buzz装好后打开主界面,工具栏的"+"按钮(或 Ctrl/Cmd + O)就是导入入口。选几个 MP3、WAV、FLAC、MP4 之类的文件加入队列,选择任务(原语言转写,或翻译成英文)、语言、模型类型和大小,点"Run"。队列按顺序执行,状态变成"Completed"后双击那一行,就打开了带时间戳的转录结果。如果人名、产品名总被识别错,点"Advanced..."在 Initial prompt 里写上这些词,错字会明显减少。
⚙️ Whisper 模型选择:按场景对号入座
模型大小直接决定速度和准确性,官方文档里的 FAQ 给了明确方向:
| 你的场景 | 建议 | 备注 |
|---|---|---|
| 求快 | tiny / base,配 Whisper.cpp 后端 | 错字多,适合先出一稿再人工修 |
| 求准 | Large-V3 | 偶尔会"幻觉"出音频里没有的词,交付前需核对 |
| 均衡 | Large-V2 或 Turbo | Large-V2 对不少语言更稳,Turbo 兼顾速度和准确性 |
后端选择也有讲究:Whisper.cpp 支持各类显卡甚至纯 CPU,是 Mac 上的首选;Faster Whisper 需要 N 卡且至少 6GB 显存;Whisper 原版准确但慢、吃内存。另外带.En的模型只支持英语,别拿来转中文。模型在"Help → Preferences → Models"里下载和管理,也可以填下载地址导入自定义.bin模型。
✂️ 转录之后:编辑、字幕调整、导出与实时转录
编辑文字:转录查看器里可以逐段改文字和时间戳,自带搜索(Ctrl+F)、播放控制、0.5 到 2 倍调速,还有"跟随音频"自动滚动,长音频校对不用手动找位置。
字幕调整:点"Resize"打开调整面板。如果转录时勾选了词级时间戳,可以按字幕最大长度、是否按标点拆分来重新合并字幕,并且会分析音频静音段以提高切分准确性;没勾词级时间戳的转录只能重新合并长度。还能给每条字幕统一延长显示时间,适合让字幕在屏幕上停留更久。
导出:工具栏的导出菜单选 TXT(纯文本)、SRT 或 VTT 字幕格式,默认导出文件名可在设置里用变量自定义,比如带上原文件名和日期。
麦克风实时转录:选一个录音任务,点工具栏麦克风按钮,说话就会被持续转成文字,适合现场记录、讲座和即时字幕。官方提醒:实时模式建议用 Whisper.cpp 后端加小模型,否则电脑会吃力。录音还能开"Presentation window",把实时字幕投到第二块屏幕。
📌 实用细节速览
- 明确选语言:自动检测靠开头几秒猜,官方建议已知语言就直接选,质量更稳。
- 批量与自动:多文件一次性导入即自动排队;开启监控文件夹后,新文件落盘就自动转录。
- 快捷键:Ctrl/Cmd + O 导入、Ctrl/Cmd + F 搜索、Ctrl/Cmd + G 跳到当前播放位置,都在"偏好设置 → 快捷键"里可改。
- 模型缓存:存在系统缓存目录(Linux 为
~/.cache/Buzz,macOS 为~/Library/Caches/Buzz),损坏就删掉重下;完全离线的环境可从别的电脑拷贝模型文件夹过去。 - 硬件前提:CPU 需要支持 AVX2,过老的机器跑不起来。
装好应用、选对模型、导入文件、点运行、导出结果——从一段原始音频到可交付的文本或字幕,就是这几步。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考