news 2026/9/7 20:13:15

Buzz 离线语音转文字实战指南:本地音频免费转成字幕只需三步

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz 离线语音转文字实战指南:本地音频免费转成字幕只需三步

Buzz 离线语音转文字实战指南:本地音频免费转成字幕只需三步

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

你的会议录音散落在手机、电脑和 U 盘里,想转成文字,又不放心把敏感内容交给在线服务?Buzz 基于 OpenAI Whisper,把整个语音转文字过程放在你自己的电脑上跑:导入音频、点运行,得到带时间戳的文本和字幕,全程不出本机。

为什么选 Buzz:五个值得留意的点

  • 音频不出设备:模型和推理都在本地运行,涉密录音、客户访谈可以放心处理。
  • 免费且开源:不订阅、不按分钟收费,支持 99 种以上语言的转写与翻译成英文。
  • 离线可用:只需首次联网下载模型,之后断网照常工作。
  • 界面与命令行双通道:日常用图形界面点两下就行,批量任务可以写进脚本。
  • 覆盖录音到字幕的全流程:实时录音出字、说话人区分、字幕拆分导出都内置,不需要再拼一堆外部工具。

一条命令跑起来:安装与启动

最省心的路径是 Python 环境(建议 3.12,并先装好 ffmpeg):

pip install buzz-captions python -m buzz

不想折腾环境的话:Windows 装官方安装包(首次运行遇到"未签名应用"提示,点"更多信息"→"仍要运行"即可);macOS 下载 DMG 拖进"应用程序";Linux 用flatpak install flathub io.github.chidiwilliams.Buzz或 snap 包。想跟进最新功能,克隆源码即可:git clone https://gitcode.com/GitHub_Trending/buz/buzz

三步把一段音频变成文稿

适合:单人访谈、课程录音、手机备忘音等单声源材料。

  1. 点工具栏"+"图标(或"文件"菜单)导入音频,Buzz 对 MP4、MKV 等视频文件会自动抽取音轨。
  2. 任务选"转录",语言建议手动选——自动检测只看开头几秒,选错整段都会跑偏。
  3. 选好模型点"运行",状态变成"已完成"后双击这一行。

打开查看器后,播放器逐句对齐文字,你可以边听边改;需要修正易错的人名、产品名时,在"高级设置"的初始提示里列出来,再导出一份 TXT 就齐活了。

多人对话:自动区分并标注说话人

适合:多人访谈、播客、小组讨论——最终文稿要能看出"谁说了什么"。

  1. 先按普通流程完成转录,双击打开查看器。
  2. 点"识别说话人",Buzz 会把每句话打上说话人标签。
  3. 试听任意一句的 10 秒片段,确认无误后把自动标签改成真实姓名;若勾选"合并同一说话人的连续句子",同一段发言会合成一个段落,读起来更像人工整理的纪要。

注意:说话人识别依赖本地音频文件仍在原位置,且 macOS Intel 版本暂不支持。

从录音到成品字幕:词级时间戳 + 字幕拆分

适合:给视频配字幕,要直接进播放器或剪辑软件。

  1. 导入视频文件,在"高级设置"里打开"词级时间戳"。
  2. 转录完成后点"调整大小":可以按最大字幕行长度、是否在标点处断句来组合字幕;只要原音频还在,Buzz 还会分析静音间隔,让断行更贴合语流。
  3. 若嫌每条字幕停留太短,可给每段加几秒的延长量(不会侵入下一条的起点)。
  4. 导出 SRT 或 VTT,即可挂载到视频上。

不用手动点:文件夹监视与批量命令

适合:录音固定投进某个归档目录,或希望流程可脚本化。

  • 文件夹监视:在偏好设置里指定一个目录,新文件一放进去就自动生成转录任务;再启用"跳过已转录文件"插件,同一批文件重复导入时直接复用旧结果,不重复跑模型。
  • 命令行:一条命令完成转录并导出 SRT:
buzz add --task transcribe --model-size small --srt /path/to/audio.mp3

参数较多时看buzz add -h,官方文档里也有完整列表。

让识别更快更准的几个开关

  • 换后端:模型类型切到 Whisper.cpp 能吃到 GPU 加速——Nvidia 走 CUDA,AMD/Intel 走 Vulkan;显存紧张时选 q_5 这类量化模型,或在偏好设置里开 8 位量化压低显存占用。
  • 按场景选模型:草稿和实时录音用 base / small 控制延迟;终稿校对再上 medium / large 换准确率。
  • 手动定语言:已知语种就别交给自动检测,误识别率明显更低。
  • 初始提示:把人名、术语、产品名写进提示,专名拼写会稳定很多。
  • 噪声环境:勾选"语音提取"先分离人声,或用 DeepFilterNet 插件先降噪再转录。
  • 环境变量:CPU 速度不理想可调BUZZ_WHISPERCPP_N_THREADS改线程数;老显卡开加速反而更慢时设BUZZ_FORCE_CPU=true;国内下载模型慢,设HF_ENDPOINT指向 hf-mirror.com 镜像。

谁该用,谁可以不用

维度Buzz云端转录服务纯命令行 Whisper 脚本
音频存放位置本机,不上传需传到服务器本机
网络要求仅首次下载模型必须联网离线
费用免费按量计费免费
操作方式图形界面 + 命令行网页仅命令行
实时录音出字支持支持不支持

适合你,如果你处理的是不想外传的录音、需要字幕产出、又希望操作尽量傻瓜化;不必用它,如果你是"全云端"工作流用户,或者只需要一次性脚本化转录且能接受纯命令行。

延伸阅读

  • CLI 参数全集:docs/docs/cli.md
  • 偏好设置详解:docs/docs/preferences.md
  • 转录引擎源码:buzz/transcriber/
  • 插件系统源码:buzz/plugins/

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/7 20:12:30

智能家居与物联网入门:数值一直跳,是传感器坏了还是你误解了ADC?

智能家居与物联网入门:数值一直跳,是传感器坏了还是你误解了ADC? [!NOTE] ADC把电压变成数字,却不会自动把数字变成准确的温度、亮度或电量。分辨率、输入范围、校准、噪声和传感器公式都会影响最终结果。本文用经典ESP32的ADC1输入建立一个低压采样实验,同时观察原始计数…

作者头像 李华
网站建设 2026/9/7 20:12:23

vLLM 在 IBM Z(s390x)平台上的 CPU 从源码构建与容器部署指南

vLLM 在 IBM Z(s390x)平台上的 CPU 从源码构建与容器部署指南 【免费下载链接】vllm A high-throughput and memory-efficient inference and serving engine for LLMs 项目地址: https://gitcode.com/GitHub_Trending/vl/vllm 导读 本文面向需要…

作者头像 李华
网站建设 2026/9/7 20:08:45

4.6 元组:固定信息的封装

文章目录 4.6 元组:固定信息的封装 4.6.1 什么是元组 4.6.2 元组的创建与基本操作 4.6.3 元组的不可变性与适用场景 不可变性演示 适用场景 元组与列表的转换 元组的常用方法 实战脚本 4-16:Docker 容器启动模板 4.7 综合实战:命令行运维资源清单 4.7.1 需求分析 4.7.2 技术…

作者头像 李华
网站建设 2026/9/7 20:08:40

Svelte 模板语法深度解析:{key} 块如何基于键值销毁重建内容

Svelte 模板语法深度解析:{#key} 块如何基于键值销毁重建内容 【免费下载链接】svelte web development for the rest of us 项目地址: https://gitcode.com/GitHub_Trending/sv/svelte 导读:本文聚焦 Svelte 模板语法中的 {#key ...} 块——一种…

作者头像 李华
网站建设 2026/9/7 20:05:04

HarmonyOS 7 新特性(四十一)|冷启动网络预建:首包加速与一致性

HarmonyOS 7 把“冷启动网络预建”列为启动体验的重要增强方向。它解决的不是带宽不足,而是用户点击页面之后,DNS、建连、TLS 握手、鉴权和首个业务请求串行发生,导致首屏数据迟迟不能出现。真正的工程目标不是把所有请求提前发出去&#xff…

作者头像 李华
网站建设 2026/9/7 20:04:56

[论文分析]SciTrace:面向科学发现代理的轨迹感知安全推理

SciTrace:面向科学发现代理的轨迹感知安全推理 论文重点 SciTrace是卡内基梅隆大学团队提出的一种科学AI Agent安全框架,核心洞察在于:现有安全机制只是“输出过滤器”,而非“推理的一部分”。论文提出了两个核心机制——Safety…

作者头像 李华