news 2026/9/13 10:41:10

Buzz 离线语音转录完整指南:免费在本地把音频转成文字

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz 离线语音转录完整指南:免费在本地把音频转成文字

Buzz 离线语音转录完整指南:免费在本地把音频转成文字

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款离线语音转录工具,基于 OpenAI 的 Whisper 模型,把音频和视频转成文字,还能翻译成其他语言。整个流程跑在自己的电脑上,不需要账号,没有订阅费,断网照常使用。支持 Windows、macOS 和 Linux 三个平台,开源免费(MIT 许可)。

为什么用本地转录,而不是在线服务

先说结论:Buzz 完全跑在本地,音频文件从头到尾不出设备,网络断了照样转录。

补三个理由:

  • 隐私:会议录音、采访、课堂内容不经过任何第三方服务器
  • 成本:开源免费,装好永久用,不按时长计费
  • 限制:没有文件大小、每月时长、免费额度这些天花板

在线服务一般要先上传音频,长录音还会碰到额度墙。走本地这条路,上传环节直接消失,剩下的只是本机算力的问题。

安装 Buzz 的两种路径

按使用习惯分两条路。

图形版:Windows 和 macOS 用户从官方发布渠道下载预编译安装包,macOS 是 .dmg 镜像。注意新版本的 macOS 版只支持 Apple Silicon 芯片,Intel Mac 停留在 1.4.5。Linux 一条命令装 Flatpak 版:

flatpak install flathub io.github.chidiwilliams.Buzz

终端版:已有 Python 环境的用户,装好 ffmpeg 后执行:

pip install buzz-captions python -m buzz

两个小坑提前说:Windows 安装包没有数字签名,首次运行会弹警告,选"更多信息"再"仍要运行"即可;PyPI 版依赖 ffmpeg 解析音频,没装会直接报错。

🎯 第一次转录:三步出结果

第一步,放文件。把音频或视频拖进主窗口,也可以直接粘贴一个链接,Buzz 会自动建好转录任务。

第二步,选设置。模型和语言是必选项,拿不准就选小一点的模型,语言选"自动检测"。

第三步,等结果。任务列表里有实时进度,首次运行会自动下载对应模型,之后再转同样的内容就走本地缓存,不用再等。

转完后结果落在查看器里,带音频,可以搜索、可以播放,逐段对照原文。

转完的字能干什么

导出支持三种格式:TXT 适合阅读和全文检索,SRT 和 VTT 是字幕格式,丢进剪辑软件就能用。

查看器不只是"看"。支持关键词搜索、播放速度调节,点任意一段文字就跳到对应音频位置。识别错了直接改文字,时间戳不准可以按段调整,改完重新导出。

两个进阶能力:

  • 说话人识别:多人录音自动区分说话人,标注谁说了什么,访谈和会议记录用得上
  • 文件夹监视:指定一个文件夹,新丢进去的音频自动开始转录,批量处理不用盯着

日常用法的详细说明在 官方文档,功能篇集中在 使用指南。

⚙️ 引擎和模型怎么选

Buzz 内置多个转录后端,各自适合不同机器:

选项特点
WhisperOpenAI 官方实现,综合表现稳定
Whisper.cpp轻量,可借 Vulkan 在大多数显卡上加速
Faster Whisper速度快,内存占用低

除此之外,还能接 Hugging Face 上的 Whisper 兼容模型(包括 Parakeet、Qwen3-ASR 等社区模型),或者接 OpenAI API 做云端转录——最后这条是可选项,关掉它 Buzz 依然 100% 离线。

硬件加速有三档:CUDA(NVIDIA 显卡)、Apple Silicon(Mac)、Vulkan(通用方案,集显也能用)。

选型按这条规则走:

  • 模型大小:tiny、base、small、medium、large 五档,越大越准但越慢。普通笔记本从 small 起步,桌面 GPU 可以上 medium
  • 机器较弱:Whisper.cpp 配 tiny 或 base,速度优势明显
  • 有独显:在偏好里确认启用了加速项

🔌 插件能做什么

Buzz 带插件系统,仓库里预置了 5 个官方插件,都在 plugins/ 目录下:

  • AI 摘要:转录完成后调用 AI 接口(兼容 OpenAI 格式)自动生成摘要
  • 转录分段:按字符数、时长或标点把长句拆成短行,字幕直接能用
  • 跳过已转录:批量处理时自动略过已完成的文件,不重复烧算力
  • DOCX 导出:把结果导出成 Word 文档
  • 增强语言检测:提升自动识别语言的准确度

谁适合用,先做什么

三种典型用法:

  • 字幕制作者:视频丢进监视文件夹自动转录,用分段插件拆好行,导出 SRT 进剪辑软件
  • 研究人员:批量转访谈录音,区分说话人后按关键词定位特定讨论段落
  • 学生:转录课堂录音,用 AI 摘要插件出要点,对照原录音复习

不太适合的两类:需要真正实时同传的场景(Buzz 的麦克风实时转录比较吃资源,官方标注不保证跟上语速);以及已有稳定云服务、完全不介意上传音频的用户。

快速上手清单:

  1. 按上一节装好 Buzz
  2. 按机器配置选模型,先从 small 开始
  3. 设一个监视文件夹,丢第一段音频跑通全流程

现在就做

打开终端,输入:

pip install buzz-captions python -m buzz

窗口起来后,拖入第一段音频。模型下载完,第一次转录就开始跑了。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/13 10:39:48

程序员面试算法题备战指南:从Hot 100到外包OD全解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/13 10:39:44

STM32与Emm-V4.2闭环步进驱动速度控制及PI整定指南

简介:这份STM32步进电机控制资源包,聚焦Emm-V4.2驱动器的闭环与速度控制,面向嵌入式电机控制开发者及自动化相关专业学习者,解决高速高负载下步进电机精准定位与平稳调速问题。压缩包共163个文件,大小仅6.88MB&#xf…

作者头像 李华
网站建设 2026/9/13 10:39:08

Surely Vue Table 水印去除实战:CSS与JS双层绕过方案

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/13 10:38:26

Keil #20错误排查:头文件包含顺序与条件编译导致的符号未定义

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华