Buzz 语音转文字:离线转录快速上手指南
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款完全本地的离线语音转文字工具:导入音频或视频,它就在你自己电脑上用 OpenAI Whisper 把语音变成文字,还能顺手翻译成目标语言。全程不经过云端,产出带时间戳的字幕文件,这篇文章带你跑完第一遍转录。
先搞懂它凭什么
底座是 OpenAI 的 Whisper 语音识别模型,Buzz 在其上加了完整界面和多套推理后端:Whisper.cpp 和 Faster Whisper 都可选,CPU、核显、独立显卡都能跑。
和常见的在线转写服务相比,它的差别在三点:
- 数据不出本机,不注册账号、不联网、不按时长收费
- 支持词级时间戳,每个词一行、各自带时间,为后续切字幕留好接口
- 插件可扩展:内置降噪、语言检测、AI 摘要、导出 DOCX 等插件,拖拽即可调整执行顺序,见 plugins 文档
把它装好
最省事的路径是用 pip 安装,三个平台通用,装完启动一次:
pip install buzz-captions python -m buzz其他平台各一句话带过:macOS 可下载 .dmg 双击安装;Linux 走 Flatpak 或 Snap 官方渠道;Windows 有独立安装包,未签名,弹窗警告时手动确认"仍要运行"即可。
跑通第一次
- 点"文件 → 导入媒体文件"(快捷键 Ctrl+O),弹出文件选择框
- 选中音频或视频,在导入框里把任务设为"Transcribe"、指定源语言,模型保持默认
- 点"Run",任务出现在列表里,等状态变成"Completed"
- 双击该行打开转录查看器,看到按片段划分、带起止时间的全文
给视频做出字幕文件
你要的结果:一份能直接拖进剪辑软件的 SRT/VTT 字幕。
- 导入时勾上"Word-Level Timings",让每个词单独打时间戳
- 转录完成后点查看器里的"Resize",按最大字幕长度合并、按标点断句
- 原音频还在的话,它会分析静音间隙修正字幕边界,也能给每条字幕追加停留秒数
- 最后从"Export"菜单选 SRT 或 VTT 落地成文件
完整参数说明在 编辑与调整文档。
把外语音频翻成中文
你要的结果:整段音频的中文译文,可导出 TXT。
- 导入时把任务直接设为"Translate",指定原音频语言
- 转录完成后在查看器点"Translate",选目标语言开始
- 顶部切到翻译模式,页面只显示译文
边开会边出文字
你要的结果:讲话的同时,文字实时滚上屏幕。
- 切到"录音转录"标签页,选好麦克风和语言
- 按红色录制键开始,说话过程中文本逐步出现
- 结束后点停止,结果自动存进任务列表
⚠️ 实时转录对硬件要求高,建议 Whisper.cpp 后端配小模型,体感更流畅。
效率技巧与常见坑
- 模型怎么选:求快选 tiny/base,均衡选 small,求准选 large;Nvidia 显卡显存 6GB 以上可换 Faster Whisper,非 Nvidia 和 Mac 用 Whisper.cpp
- 校对快捷键:Ctrl+F 搜索、Ctrl+P 播放/暂停、Ctrl+Shift+P 重播当前片段、Ctrl+←/→ 调片段起点、Ctrl+Shift+←/→ 调终点,每次 0.5 秒
- 播放支持 0.5x~2x 变速,勾上"循环片段"和"跟随音频",校对不用反复拖进度条
- 自动语言检测容易误判,导入时手动指定语言更稳
- 模型下坏了会导致崩溃:在"帮助 → 偏好设置 → 模型"里删除后重新下载;完全离线的机器可以把别处的模型缓存目录整体拷过来
- CPU 需要支持 AVX2,过老的机器跑不了
下一步:进"帮助 → 偏好设置 → 模型"把模型下好,拿一段长音频完整跑一遍。更多问题查 官方 FAQ;想读源码就git clone https://gitcode.com/GitHub_Trending/buz/buzz,从 buzz/transcriber/ 的转录逻辑看起。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考