news 2026/9/10 9:40:16

Buzz零门槛离线语音转文字完整指南:3步把会议录音变成纪要

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz零门槛离线语音转文字完整指南:3步把会议录音变成纪要

Buzz零门槛离线语音转文字完整指南:3步把会议录音变成纪要

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款基于 OpenAI Whisper 的全离线语音转文字工具。导入录音或视频,它在你的电脑上转成文本,可导出 TXT/SRT/VTT。全程不联网、数据不出本机、免费不订阅。如果你常处理会议纪要或视频字幕,这是最快的上手路径。

值不值得用:看这张表再决定

如果你还在纠结本地转录工具能不能替代在线服务,用这张表判断。

对比项在线转录服务Buzz 本地转录
数据出不出你的电脑上传第三方服务器留本地,不联网
使用成本订阅或按分钟计费免费,装一次用一年
网络依赖断网就用不了完全离线环境照样转
支持格式看服务商给什么MP3、MP4、WAV、M4A、FLAC,连 YouTube 链接都行
硬件加速服务器端,你感知不到用你自己的 GPU,CUDA/Vulkan/Apple Silicon 都支持

跑起来:从安装到第一次转写

本节带你从空电脑到出第一份文本,共 7 步。

  1. 先装 ffmpeg(Buzz 靠它解码音频)
  2. 选一种安装方式:
    • macOS/Windows:下载安装包直接运行;Windows 若提示"未签名",点"更多信息 → 仍要运行"
    • Linux:snap 一行装好
sudo snap install buzz
  • 喜欢源码方式:Python 3.12+ 下pip install buzz-captions,再执行python -m buzz
  1. 首次启动,到"偏好设置 → 模型"里下载一个转录模型(新手选 Base,约 1GB)
  2. 把录音拖进主窗口,或用菜单导入
  3. 在任务上选好模型和语言(留空即自动识别),勾选需要的输出格式
  4. 点"转录"
  5. 双击转录结果打开编辑器

任务一:把 47MB 会议录音变成可编辑纪要

如果你有一段会议录音要变成文字底稿,按这 4 步走。

  1. 导入会议录音,MP3/WAV/MP4 都行
  2. 选模型:日常会议用 Base;口误多、环境吵就换 Medium
  3. 中文会议把语言设为 zh;英文会议留空让它自动检测,不用手动选
  4. 勾选"单词级时间戳",后面想拆字幕行时才用得上

转完双击结果进编辑器:播放进度和文本同步,逐句改错别字、修专有名词,最后导出 TXT 底稿。

任务二:给课程视频挂 SRT 字幕

如果你的目标是给视频挂字幕,关键在转写前勾对"单词级时间戳",再用"Resize"工具分句。

  1. 导入视频,选 Small 或 Medium 模型(课程视频长,Medium 更稳)
  2. 任务里勾上单词级时间戳 + SRT/VTT 输出
  3. 转完在查看器点"Resize":设好单条字幕最大长度、按标点断开,自动切行
  4. 想让字幕停留更久,加一个"延长结束时间",每段多留几百毫秒

任务三:批量文件不想一个个点

如果你有几十个音频要处理,别手动逐个导入,用文件夹监控或命令行。

配置文件夹监控

  1. 在"偏好设置 → 常规"里设好监控文件夹、默认模型和输出格式
  2. 以后新文件丢进这个文件夹就自动转录,人不用守着

顺带把导出文件名的默认模板也改了(比如自动带日期),归档时不用改名。

用命令行一句话

脚本化或挂在服务器上跑时:

buzz add --model-type whispercpp --model-size small --srt --vtt /path/to/meeting.mp3

完整参数见 CLI 文档。

让它跑满:模型和硬件 30 秒决策

如果转录慢或内存吃紧,多半是模型选错了,先看这张表:

场景选哪个模型吃不吃内存值不值得开
只查大致内容Tiny<500MB最快,适合粗稿
日常会议Base约 1GB速度和准确率最均衡
要字幕级质量Medium约 3GB音频吵时值得
存档级要求Large约 8GB有 GPU 才开

两条榨速度的技巧:

  • 🚀 GPU 用户:在"偏好设置 → 模型"里选 whispercpp 后端开 Vulkan/CUDA;显存紧张就换量化版(q_5),省一半显存
  • CPU 跑嫌慢时,设环境变量BUZZ_WHISPERCPP_N_THREADS为核数一半,往往比拉满线程更快,详见高级设置文档

卡住了:高频问题速查

某一步卡住时,先查这里,再翻安装文档。

现象可能原因一句话解法
Linux 起不来、没声音缺系统音频库sudo apt-get install libportaudio2后重启
Windows 安装提示未签名官方包没做签名"更多信息 → 仍要运行"
模型下载失败网络问题手动把模型文件下到模型缓存目录
转录慢模型太大或 CPU 弱换 Base 或 Tiny
准确率低音频吵或模型小勾"提取语音"先降噪,再升 Medium
GPU 没生效驱动或后端不对换 whispercpp 后端,确认 CUDA/Vulkan 装好

Buzz 只做一件事:把音频文件在你自己的电脑上免费转成文字,全程离线。如果你不想让会议录音和采访音频经过任何服务器,装好它、选个模型、丢进文件就行。想读源码或提改进,把仓库克隆到本地即可:

git clone https://gitcode.com/GitHub_Trending/buz/buzz

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/10 9:38:44

高斯混合MCMC线性地震反演:从正演模型到后验分布

简介&#xff1a;一套面向本硕博教研人群的线性地震反演Matlab仿真资源&#xff0c;聚焦高斯混合马尔科夫-蒙特卡洛&#xff08;GM-MCMC&#xff09;算法的编程实现与原理验证。资源包共13个文件&#xff0c;压缩后约1.9MB&#xff0c;其中包含9个M脚本/函数、2个MAT数据文件、…

作者头像 李华
网站建设 2026/9/10 9:28:56

Go gRPC流式通信实战与性能优化指南

1. Go gRPC 流式通信实战指南在微服务架构中&#xff0c;高效的数据传输机制直接影响系统性能。gRPC作为云原生时代的主流RPC框架&#xff0c;其流式通信能力能有效解决传统请求-响应模式在实时数据传输场景中的局限性。去年我在处理物联网设备数据采集项目时&#xff0c;正是通…

作者头像 李华
网站建设 2026/9/10 9:25:14

树莓派Pico+MicroPython温度记录器:文件读写从入门到实战

1. 项目思路与硬件选型&#xff1a;为什么是 Pico 加 MicroPython做温度数据记录这个事&#xff0c;很多人第一反应是用电脑加传感器&#xff0c;再写个上位机程序。但真正用过就会发现&#xff0c;用树莓派 Pico 这类单片机来做反而更合适。原因其实很简单&#xff1a;Pico 体…

作者头像 李华
网站建设 2026/9/10 9:25:14

py进球游戏

操场上……“小何&#xff0c;接球&#xff01;”小方喊道。咻&#xff01;“球要进了&#xff01;“小何说。啊&#xff01;不好&#xff01;被防住了&#xff01;结束后……小方&#xff1a;“小何&#xff0c;你会编出进球游戏吗&#xff1f;现实踢球&#xff0c;太没意思&a…

作者头像 李华
网站建设 2026/9/10 9:25:02

扩散模型-2020-理论基础:DDPM【目前“文本生图像”所采用的扩散模型大都是来自于DDPM】【输入:带噪音的图片+文本+噪音程度值;输出:待去除的噪音】【带噪音的图片-输出的噪音=生成的图片】

原始论文:Denoising Diffusion Probabilistic Models 分析论文:Understanding Diffusion Models: A Unified Perspective 分析论文:The Curious Case of Neural Text Degeneration 分析论文:Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predict…

作者头像 李华