news 2026/9/7 7:54:23

Buzz 离线音频转文字实操指南:本地 Whisper 转录一次讲清

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz 离线音频转文字实操指南:本地 Whisper 转录一次讲清

Buzz 离线音频转文字实操指南:本地 Whisper 转录一次讲清

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款基于 OpenAI Whisper 的离线音频转文字工具,录音、播客、采访视频交给它,全部处理发生在你的电脑本地,全程不上传文件。它面向三类人:整理会议录音的打工人、处理采访素材的记者,以及给视频加字幕的创作者。下文按"装好、转出第一稿、把结果改到你满意"的顺序讲。

🎯 Buzz 是什么:三句话说清

  • 本地离线音频转录:音频不离开你的电脑,没有网络也能跑,前提是把模型提前下好
  • 多种 Whisper 实现可切换,NVIDIA 显卡、Apple Silicon、集显都能加速
  • 支持批量导入多个音频/视频文件排队处理,结果可导出 TXT、SRT、VTT

💻 Buzz 安装与第一次离线音频转文字

Windows 和 macOS 从官方渠道下载安装包即可,Windows 版未签名,安装时看到警告选择"更多信息 → 仍要运行";Linux 用 Flatpak 或 Snap 安装,Python 用户也可以走 PyPI 装(需要 Python 3.12 和 ffmpeg)。Linux 下用 Flatpak 只需一行:

flatpak install flathub io.github.chidiwilliams.Buzz

装好后打开主界面,工具栏的"+"按钮(或 Ctrl/Cmd + O)就是导入入口。选几个 MP3、WAV、FLAC、MP4 之类的文件加入队列,选择任务(原语言转写,或翻译成英文)、语言、模型类型和大小,点"Run"。队列按顺序执行,状态变成"Completed"后双击那一行,就打开了带时间戳的转录结果。如果人名、产品名总被识别错,点"Advanced..."在 Initial prompt 里写上这些词,错字会明显减少。

⚙️ Whisper 模型选择:按场景对号入座

模型大小直接决定速度和准确性,官方文档里的 FAQ 给了明确方向:

你的场景建议备注
求快tiny / base,配 Whisper.cpp 后端错字多,适合先出一稿再人工修
求准Large-V3偶尔会"幻觉"出音频里没有的词,交付前需核对
均衡Large-V2 或 TurboLarge-V2 对不少语言更稳,Turbo 兼顾速度和准确性

后端选择也有讲究:Whisper.cpp 支持各类显卡甚至纯 CPU,是 Mac 上的首选;Faster Whisper 需要 N 卡且至少 6GB 显存;Whisper 原版准确但慢、吃内存。另外带.En的模型只支持英语,别拿来转中文。模型在"Help → Preferences → Models"里下载和管理,也可以填下载地址导入自定义.bin模型。

✂️ 转录之后:编辑、字幕调整、导出与实时转录

编辑文字:转录查看器里可以逐段改文字和时间戳,自带搜索(Ctrl+F)、播放控制、0.5 到 2 倍调速,还有"跟随音频"自动滚动,长音频校对不用手动找位置。

字幕调整:点"Resize"打开调整面板。如果转录时勾选了词级时间戳,可以按字幕最大长度、是否按标点拆分来重新合并字幕,并且会分析音频静音段以提高切分准确性;没勾词级时间戳的转录只能重新合并长度。还能给每条字幕统一延长显示时间,适合让字幕在屏幕上停留更久。

导出:工具栏的导出菜单选 TXT(纯文本)、SRT 或 VTT 字幕格式,默认导出文件名可在设置里用变量自定义,比如带上原文件名和日期。

麦克风实时转录:选一个录音任务,点工具栏麦克风按钮,说话就会被持续转成文字,适合现场记录、讲座和即时字幕。官方提醒:实时模式建议用 Whisper.cpp 后端加小模型,否则电脑会吃力。录音还能开"Presentation window",把实时字幕投到第二块屏幕。

📌 实用细节速览

  • 明确选语言:自动检测靠开头几秒猜,官方建议已知语言就直接选,质量更稳。
  • 批量与自动:多文件一次性导入即自动排队;开启监控文件夹后,新文件落盘就自动转录。
  • 快捷键:Ctrl/Cmd + O 导入、Ctrl/Cmd + F 搜索、Ctrl/Cmd + G 跳到当前播放位置,都在"偏好设置 → 快捷键"里可改。
  • 模型缓存:存在系统缓存目录(Linux 为~/.cache/Buzz,macOS 为~/Library/Caches/Buzz),损坏就删掉重下;完全离线的环境可从别的电脑拷贝模型文件夹过去。
  • 硬件前提:CPU 需要支持 AVX2,过老的机器跑不起来。

装好应用、选对模型、导入文件、点运行、导出结果——从一段原始音频到可交付的文本或字幕,就是这几步。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/7 7:53:22

抖音数据采集实战:接口模拟、签名参数与爬虫稳定性设计

简介:这是一份基于Python的抖音移动端爬虫学习项目,核心思路是利用Appium驱动Genymotion模拟器中的抖音App、配合Mitmproxy拦截应用与服务器的通信流量,再通过Python脚本完成请求解析与数据提取,适合想实战移动应用爬虫、掌握App自…

作者头像 李华
网站建设 2026/9/7 7:53:15

Agentic Edge AI:让边缘设备从被动感知走向自主决策的实战指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/7 7:46:16

VB.NET实现非均匀B样条曲线:Cox-de Boor递推与GDI+交互拖拽实战

简介:一份面向VB.NET开发者与计算机图形学习者的非均匀B样条(NURBS)曲线实现项目。这份工程以完整Visual Studio项目呈现,包含控制点定义、节点向量与基函数计算、曲线求值及反算等核心模块,并封装为可直接调用的VB类&…

作者头像 李华