news 2026/9/7 4:35:13

Buzz 完整指南:免费本地转录,三步把会议录音变成文字

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz 完整指南:免费本地转录,三步把会议录音变成文字

Buzz 完整指南:免费本地转录,三步把会议录音变成文字

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一个免费开源的离线转录工具,基于 OpenAI Whisper 在你的电脑上完成音频转录与翻译——录音不用上传到任何服务器,结果直接落在本地,支持 Windows、macOS、Linux 三大平台。本文从安装讲起,依次走完"文件转录、实时录音、字幕导出"三条最常用的路径,最后给你两个批量处理的自动化捷径。

🎯 第一次转录:把一段会议录音变成文字

三大平台各有一条安装路径

Windows 下载官方 .exe 安装包,安装时若提示"未知发布者",选"更多信息 → 仍要运行"即可;macOS 下载 .dmg 拖入 Applications;Linux 任选一条命令:

# Flatpak 方式 flatpak install flathub io.github.chidiwilliams.Buzz # 或 Snap 方式 sudo snap install buzz

导入音频,做三个决定

点工具栏的"+"(或 Ctrl+O)选入 MP3、WAV、MP4 等音频或视频文件,也可以粘贴 YouTube 链接。导入时只需要决定三件事:任务是 Transcribe 还是翻译成英文;语言建议手动指定,自动检测只靠开头几秒判断,混杂音频容易跑偏;模型先用默认值,下一节细讲。点 Run,等状态变成 Completed,双击该行即可打开转录结果。

第一次运行的稳妥参数

30 分钟以内的文件选 base 或 small 模型,普通电脑几分钟能跑完;语言写中文就填 zh;导出格式默认 TXT 即可。

⚡ 挑一个和你的硬件匹配的 Whisper 模型

按大小定速:tiny 到 large 差 30 倍

模型体积与速度、准确率大致成正比:tiny 约 75MB 最快但错字多,base 约 142MB,small 约 466MB,medium 约 1.5GB,large 约 2.9GB 精度最高。日常会议和课程录音 small 通常够用,重要内容再上 medium 或 large。模型只下载一次并缓存到本机(Linux 在~/.cache/Buzz),之后断网也能继续转。

有 N 卡选 Faster Whisper,没有选 Whisper.cpp

官方 Whisper 实现准确但吃内存;Faster Whisper 在 6GB 以上显存的 N 卡上快一个数量级;Whisper.cpp 是 C++ 实现,没有独显的笔记本靠集显甚至纯 CPU 也能跑实时转录,Mac 上首选它。

完全离线的机器:把模型文件夹拷过去

在一台联网电脑上下载好所需模型,通过 Preferences → Models 的"Show file location"找到缓存目录,把模型文件夹拷到离线机器的相同位置就能用;仓库里的 scripts/download-models.py 就是专门用来预生成离线模型缓存的。

🎙️ 实时录音:开会、听讲座边说边出字

麦克风直出文字

在实时录音面板选好任务、语言和麦克风,点 Record,说出的话逐句变成文字。实时场景官方文档建议切到 Whisper.cpp 后端并选小模型,否则任务队列会越积越长。

第二屏投出实时字幕

录音进行中会多出一个 Presentation window 选项,打开后大字号字幕投到另一块屏幕,适合现场同传展示或让观众实时看到文稿。

多人对话:分清谁说了什么

转录完成后在查看器里点 Identify speakers,Buzz 会给每句话标上说话人标签,可试听任意一句的 10 秒片段确认身份,并把自动标签改成真名;保存时勾选"合并同一说话人的句子",整场对话就按人归好了。

✂️ 转录后处理:改错字、调字幕、导出三种格式

逐句校对文字与时间戳

查看器里每句话都带时间轴,点哪句音频就跳到哪个位置播放,还能调节播放速度;改错字、合并或拆分句子直接在行内表单里完成。

字幕太长?用 Resize 重新切分

导入时若勾选了 Word-Level Timings,Resize 就能按"最大字幕长度"把词句重新合并,并按标点断句,还能给每条字幕统一延长显示时长;原音频文件还在的话,它会分析静音区间让切分更准。

导出 TXT、SRT 或 VTT

改完点导出:TXT 进笔记软件,SRT 拖进剪辑软件当视频字幕,VTT 用于网页端字幕。

🤖 两个自动化捷径:命令行与文件夹监控

一条命令批处理

装好 PyPI 版(需 Python 3.12 与 ffmpeg,命令为pip install buzz-captions)后,终端里可以直接跑:

buzz add --task transcribe --language zh --model-type whisper --model-size small 会议录音.mp3

--srt --vtt可同步导出字幕文件,完整参数见 docs/docs/cli.md。

文件落进文件夹就自动转

在 偏好设置 的 Folder Watch 标签页指定一个目录,之后任何丢进去的音频都会自动排队转录——适合"每天把当天录音丢进同一个文件夹"的固定工作流。

📋 落地建议:三条起步路径与两个常见坑

新手第一天的顺序

  1. 用 base 模型转一段 5 分钟以内的短音频,跑通"导入 → 运行 → 打开结果"全流程;
  2. 换 small 模型重转同一段,对比错字率,建立对模型大小的体感;
  3. 试一次实时录音并导出 TXT,检查格式是否符合你的笔记习惯。

两个容易踩的坑

  • 不指定语言:自动检测依赖开头几秒音频,中英混杂的内容经常猜错,手选语言准确率明显更高。
  • 老电脑跑不起来:Buzz 需要 CPU 支持 AVX2,太老的机器无法运行;另外模型下载残缺会导致崩溃,到 Preferences → Models 删除重下一次即可。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/7 4:34:56

留个神!并非所有 AI 都能帮你写论文,2026 导师力荐工具汇总

每年毕业季,无数同学深陷论文难题:开题毫无思路、搭建框架耗费数日、初稿逻辑松散、查重标红泛滥、AI检测超标、格式反复被导师驳回。面对日益严峻的学术规范要求,不少学生转向通用型AI工具寻求帮助,但市面上大多数AI平台存在明显…

作者头像 李华
网站建设 2026/9/7 4:33:19

Claude Code安装配置全攻略:跨平台AI编程助手实战指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/7 4:32:33

免安装PLSQL Developer 13部署:中文语言设置与Oracle连接配置实战

简介:PL/SQL Developer 13中文免安装版是一套面向Oracle数据库管理员和开发人员的实用工具,解压即可运行,无需复杂安装,适合在多台电脑间快速部署或搭建临时开发环境。该工具提供SQL与PL/SQL双编辑器,涵盖语法高亮、自…

作者头像 李华
网站建设 2026/9/7 4:31:37

高敏玩家调参指南:从DPI到edpi的系统优化全解析

hyp 高敏玩家最近被讨论得很多。很多人第一反应是“高敏是不是就是指鼠标灵敏度调得非常高”,实际上它背后涉及的是一整套从硬件参数、系统设置到游戏内配置的综合调校链路。不同语境下 hyp 可能是某款 FPS 项目或某个平台的缩写,但不管具体指哪款游戏&a…

作者头像 李华