news 2026/9/20 10:37:21

Buzz 离线语音转文字:免费本地 Whisper 转录完整上手指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz 离线语音转文字:免费本地 Whisper 转录完整上手指南

Buzz 离线语音转文字:免费本地 Whisper 转录完整上手指南

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款跑在你自己电脑上的音频转录工具,基于 OpenAI Whisper 离线完成语音转文字和多语言翻译,音频不出本机,全程免费,不上传任何数据。

它帮你解决什么问题

你有没有过这些时刻:会议录音攒了一堆,想转成文字却发现在线服务要么要注册、要么按量收费;视频要做字幕,但又不想把素材传到别人的服务器上;有些音频涉及敏感内容,根本不能离开本地。Buzz 就是为这些场景准备的。它在本地调用 Whisper 家族模型完成转录,后端可选 Whisper、Whisper.cpp、Faster Whisper、Hugging Face 模型等多个,桌面形态,MIT 许可证,你想怎么用都行。

装好跑通第一遍

用图形界面的你,直接去下载页拿对应平台的安装包。Windows 用户注意一点:安装包没有做代码签名,安装时系统会弹安全警告,点"更多信息"再选"仍要运行"就行,属于正常现象。macOS 用户现在需要 Apple Silicon 机型,Intel 的 Mac 只能用到 1.4.5 及更早版本。

Linux 用户最省事,一条 Flatpak 命令:

flatpak install flathub io.github.chidiwilliams.Buzz

想从源码或 PyPI 装的开发者,前提是本机装好 ffmpeg。Python 环境下执行:

pip install buzz-captions python -m buzz

装完打开应用,导入一个音频文件,选好语言和模型,点运行,第一次转录的完整流程就走通了。

习惯命令行的你,一条buzz add就能指定后端、模型和输出格式:

buzz add -m whispercpp -s medium -l zh --srt meeting.mp3

不打开窗口也能跑,加上--hide-gui参数即可,后面讲自动化时会再用到。

三种用法按需选

姿势一:把文件丢进桌面界面。这是最顺手的用法,几个要点值得知道:

  • 支持近百种语言,语言栏留空则自动检测,适合混杂或不确定语种的内容
  • 转录结果可导出 TXT、SRT、VTT 三种格式,SRT/VTT 能直接进剪辑软件
  • 转录查看器支持搜索、播放控制、倍速播放,点哪段播哪段
  • 想区分谁说了什么,用说话人识别功能把发言人标注开
  • 某个片段时间戳对不齐?用片段调整工具手动微调起止时间
  • 批量处理可以把目录设为监视文件夹,新文件落进去自动建任务转录

姿势二:开麦克风实时转。主界面切到实时录音模式,选好麦克风就能边说边出字。出字不是瞬时的,系统默认有一段缓冲延迟来保证文字和语音对得上。现场演讲或活动演示时,还能单独弹出一个演示窗口把实时文字投出来。转录的同时也可以指定目标语言做翻译,说完直接得到译文。

姿势三:命令行加监视目录做自动化。buzz add的参数基本覆盖界面里的所有选项:-m选后端(whisper、whispercpp、fasterwhisper、huggingface、openaiapi),-s选模型大小,-l指定语言,-t translate切换到翻译任务,输出格式用--srt--vtt--txt控制。1.4.6 版本起支持一次传多个文件排队处理,也能用通配符把整个文件夹的录音丢进去,再用--output-directory把产物统一放到字幕目录:

buzz add --srt --output-directory ./subtitles recordings/*.mp4

这样就能写进脚本或 CI 流程,夜里跑一批,早上收字幕。

两个场景走一遍

场景 A:给已有视频出字幕。导入视频文件,Buzz 会自动抽音轨,你不用自己转格式。任务选"转写",语言按内容指定(知道是中文就直接选 zh,别用自动检测,更准),模型按机器性能选 small 或 medium,运行。跑完后打开转录查看器核对时间戳,哪里不对就调整,最后导出 SRT 或 VTT。产出物是一个能直接拖进剪辑软件的字幕文件,安静环境下录的内容,基本不用人工精校。

场景 B:会议边录边转。切到实时录音模式,选好会议麦克风,开始录音,底部面板实时出字。结束后保存这条转录,如果人多,跑一遍说话人识别把发言者分开,再按需翻译成目标语言归档。产出物是一份带时间戳、区分了发言人、可翻译成任意语言的文字记录。

性能与避坑

如果转录速度慢得离谱,先想两件事:模型是不是选大了?小机器直接用 tiny 或 base。后端是不是没吃到 GPU?换 Whisper.cpp 后端并启用加速,N 卡走 CUDA,其他显卡走 Vulkan,速度差距非常明显。

如果专有名词、术语总被识别错,去高级设置里填初始提示(initial prompt),把术语和背景塞进去给模型上下文。另外,确定音频语言时手动指定,别交给自动检测,能省掉一部分误判。

如果 Windows 安装时报安全警告,不用慌,安装包本身没签名,"更多信息"→"仍要运行"就是标准解法。

如果 PyPI 装的版本 GPU 不生效,多半是因为默认装的是 CPU 版 torch。按 README 的说明改装带 CUDA 后缀的 torch 和对应运行库,N 卡才能跑起来。

二次开发入口

想接新转录后端,看 buzz/transcriber/ 目录,Whisper、Whisper.cpp、Faster Whisper、Hugging Face 各占一个文件,照着写一个实现接口即可。插件机制在 buzz/plugins/,内置的 AI 摘要、DOCX 导出、自动调整字幕时长都在这,想加自定义后处理就从这里入手。命令行完整参数一览在 docs/docs/cli.md。


更多使用细节看 docs/docs/ 里的文档;跑批任务遇到问题,或者有想要的功能,直接去项目 Issues 提,维护者更新很勤。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/20 10:36:46

大模型双雄对决:Grok 4.6 vs DeepSeek V4 Pro选型与搭配指南

上周信息流被同一件事刷屏:Grok 4.6 和 DeepSeek V4 Pro 选择了同一天上线。对于像我这种每天要跟大模型打交道的人来说,这种“撞车”反而难得——正好可以在同一时间段内把两个新模型放在同一批任务里横向对比,不用来回切换时间窗口。我这两…

作者头像 李华
网站建设 2026/9/20 10:34:20

APISIX Admin API 实战指南:8 个核心管理场景一次讲透

APISIX Admin API 实战指南:8 个核心管理场景一次讲透 【免费下载链接】apisix The Cloud-Native API Gateway 项目地址: https://gitcode.com/GitHub_Trending/ap/apisix 如果你刚接手一个 Apache APISIX 集群,需要动态增删路由、调整后端权重、…

作者头像 李华
网站建设 2026/9/20 10:33:29

Jetson边缘嵌入式实战课程总结:从环境搭建到AI部署的完整链路

很多朋友跟着这套Jetson实战课程一路走到了第十讲,从最开始对着开发板手足无措,到现在能独立部署目标检测、跑通SLAM、甚至在本地点起大模型,这个成长过程非常值得复盘。作为讲师,我在第九讲结束时就收到不少留言,希望…

作者头像 李华
网站建设 2026/9/20 10:33:25

CC Switch 接 TaoToken:Claude Code 一条 Key 切换多家模型

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/20 10:33:17

使用Unidbg模拟执行阿里系so库:生成x-sign与x-mini-wua签名实战

如果你抓过阿里系App的包,大概率会在某个请求头里见过x-sign、x-mini-wua这两个名字。跟普通的query参数不一样,这两个值是跟着每次请求动态算出来的,而且几十个字符背后往往是一整套JNI调用链,牵扯好几个so库。之前我想绕过它们&…

作者头像 李华
网站建设 2026/9/20 10:32:11

TabPFN 实践指南:三步从表格数据到分类与回归预测

TabPFN 实践指南:三步从表格数据到分类与回归预测 【免费下载链接】TabPFN ⚡ TabPFN: Foundation Model for Tabular Data ⚡ 项目地址: https://gitcode.com/GitHub_Trending/ta/TabPFN TabPFN 是一个面向表格数据的基础模型,能在你手头的小样本…

作者头像 李华