news 2026/9/7 15:53:02

Buzz 语音转文字:离线转录快速上手指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz 语音转文字:离线转录快速上手指南

Buzz 语音转文字:离线转录快速上手指南

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款完全本地的离线语音转文字工具:导入音频或视频,它就在你自己电脑上用 OpenAI Whisper 把语音变成文字,还能顺手翻译成目标语言。全程不经过云端,产出带时间戳的字幕文件,这篇文章带你跑完第一遍转录。

先搞懂它凭什么

底座是 OpenAI 的 Whisper 语音识别模型,Buzz 在其上加了完整界面和多套推理后端:Whisper.cpp 和 Faster Whisper 都可选,CPU、核显、独立显卡都能跑。

和常见的在线转写服务相比,它的差别在三点:

  • 数据不出本机,不注册账号、不联网、不按时长收费
  • 支持词级时间戳,每个词一行、各自带时间,为后续切字幕留好接口
  • 插件可扩展:内置降噪、语言检测、AI 摘要、导出 DOCX 等插件,拖拽即可调整执行顺序,见 plugins 文档

把它装好

最省事的路径是用 pip 安装,三个平台通用,装完启动一次:

pip install buzz-captions python -m buzz

其他平台各一句话带过:macOS 可下载 .dmg 双击安装;Linux 走 Flatpak 或 Snap 官方渠道;Windows 有独立安装包,未签名,弹窗警告时手动确认"仍要运行"即可。

跑通第一次

  1. 点"文件 → 导入媒体文件"(快捷键 Ctrl+O),弹出文件选择框
  2. 选中音频或视频,在导入框里把任务设为"Transcribe"、指定源语言,模型保持默认
  3. 点"Run",任务出现在列表里,等状态变成"Completed"
  4. 双击该行打开转录查看器,看到按片段划分、带起止时间的全文

给视频做出字幕文件

你要的结果:一份能直接拖进剪辑软件的 SRT/VTT 字幕。

  • 导入时勾上"Word-Level Timings",让每个词单独打时间戳
  • 转录完成后点查看器里的"Resize",按最大字幕长度合并、按标点断句
  • 原音频还在的话,它会分析静音间隙修正字幕边界,也能给每条字幕追加停留秒数
  • 最后从"Export"菜单选 SRT 或 VTT 落地成文件

完整参数说明在 编辑与调整文档。

把外语音频翻成中文

你要的结果:整段音频的中文译文,可导出 TXT。

  • 导入时把任务直接设为"Translate",指定原音频语言
  • 转录完成后在查看器点"Translate",选目标语言开始
  • 顶部切到翻译模式,页面只显示译文

边开会边出文字

你要的结果:讲话的同时,文字实时滚上屏幕。

  • 切到"录音转录"标签页,选好麦克风和语言
  • 按红色录制键开始,说话过程中文本逐步出现
  • 结束后点停止,结果自动存进任务列表

⚠️ 实时转录对硬件要求高,建议 Whisper.cpp 后端配小模型,体感更流畅。

效率技巧与常见坑

  • 模型怎么选:求快选 tiny/base,均衡选 small,求准选 large;Nvidia 显卡显存 6GB 以上可换 Faster Whisper,非 Nvidia 和 Mac 用 Whisper.cpp
  • 校对快捷键:Ctrl+F 搜索、Ctrl+P 播放/暂停、Ctrl+Shift+P 重播当前片段、Ctrl+←/→ 调片段起点、Ctrl+Shift+←/→ 调终点,每次 0.5 秒
  • 播放支持 0.5x~2x 变速,勾上"循环片段"和"跟随音频",校对不用反复拖进度条
  • 自动语言检测容易误判,导入时手动指定语言更稳
  • 模型下坏了会导致崩溃:在"帮助 → 偏好设置 → 模型"里删除后重新下载;完全离线的机器可以把别处的模型缓存目录整体拷过来
  • CPU 需要支持 AVX2,过老的机器跑不了

下一步:进"帮助 → 偏好设置 → 模型"把模型下好,拿一段长音频完整跑一遍。更多问题查 官方 FAQ;想读源码就git clone https://gitcode.com/GitHub_Trending/buz/buzz,从 buzz/transcriber/ 的转录逻辑看起。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/7 15:51:55

Scala样例类与模式匹配:从求面积到工程最佳实践

写了几年代码,看过不少Scala教程,真正让我觉得“这门语言有点东西”的,恰恰是“样例类(case class) 模式匹配(pattern matching)”这种看起来很基础、很想当然的组合。很多人入门时写过Circle、…

作者头像 李华
网站建设 2026/9/7 15:51:37

GPU电压噪声根因与压测复现:从di/dt到IR drop的硬核解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/7 15:51:20

扫地机器人选购技术拆解:导航避障拖地基站四大维度怎么判断

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/7 15:50:07

用Makefile一键构建DIFY本地Web镜像,告别docker build卡顿

在本地跑过 DIFY 的人应该都经历过这种抓狂时刻:官方文档说得明明白白,docker compose up -d一把梭,结果镜像拉取慢得像蜗牛,前端 Web 那个镜像更是动不动就构建到一半卡死,甚至直接报错退出。尤其当你改了 DIFY Web 端…

作者头像 李华
网站建设 2026/9/7 15:47:14

ADS7950实战:12位8通道SAR ADC的SPI驱动与硬件设计全解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/7 15:45:12

深入解析MCP Transport层:从Stdio到HTTP的选型与排坑指南

1. MCP的Transport到底在解决什么问题先说结论:MCP的Transport层是整个协议的地基,它决定了你的MCP server怎么被找到、怎么被连接、怎么传数据、怎么处理断连。前面几篇笔记我分别梳理了MCP的协议模型、工具调用链路和资源体系,这篇专门把Tr…

作者头像 李华