Sherpa-onnx 新增 Whisper Large V3 Turbo 支持:本地语音识别如何又快又准
【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnx
想让离线语音识别又快又准?Sherpa-onnx 把 Whisper Large V3 Turbo 搬进了本地推理,开发者不用改现有架构,换个模型文件就能用上更快的语音转文字能力。
这件事为什么和你有关
做字幕、会议转写、离线听写的人都有同一种纠结:Whisper 小模型跑得快但识别率低,large 级别模型准但慢到没法实时。Turbo 版相当于给标准版加了涡轮——马力(准确率)基本没减,油耗(计算量)却大幅下降。据 OpenAI 公开数据,large-v3-turbo 的解码层数比 large-v3 少 8 倍,推理速度约为其 8 倍,准确率基本持平。对嵌入式设备、树莓派这类算力有限的场景,这意味着"准"和"快"第一次可以兼得。
这次更新到底改了什么
sherpa-onnx 在 1.10.28 版本中加入 whisper turbo 支持(PR #1390)。仓库里的 ONNX 导出脚本 scripts/whisper/export-onnx.py 和 scripts/whisper/export-onnx-with-attention.py 现在都把turbo列为合法模型名,并与large、large-v3同组处理——因为它们输入特征维度都是 128(即 16kHz 音频的 mel 频谱帧),推理管线无需任何改动。
说人话:Whisper 分 encoder(听音频、提特征)和 decoder(把特征变成文字)两段。Turbo 版砍掉的是 decoder 的冗余层数,只保留单遍输出。变化是:同样一段 10 秒音频,标准版要跑两遍、Turbo 一遍出结果,端侧延迟随之减半再减半。
开发者怎么快速用起来
路径很简单:找模型 → 放同一目录 → 跑示例。
- 从项目 Release 的 asr-models 页面下载已导出的 turbo 模型包(含 encoder、decoder、tokens 三个文件),解压即可,无需自己导出;
- 先克隆仓库:
git clone https://gitcode.com/GitHub_Trending/sh/sherpa-onnx,直接参考现成示例,把模型路径改成你自己的:- Python:python-api-examples/offline-whisper-decode-files.py
- C/C++:c-api-examples/whisper-c-api.c、cxx-api-examples/whisper-cxx-api.cc
- C#:dotnet-examples/offline-decode-files/run-whisper-large-v3.sh 里已写好
--whisper-encoder、--whisper-decoder、--tokens三个参数的完整命令行,照着换文件名即可。
如果你手上有原始权重,用 scripts/whisper/export-onnx.py 也能自行导出。
选型参考:和同类模型怎么比
判断标准就四条,按自己场景各打各的分:
| 维度 | Whisper Large V3 Turbo | SenseVoice 等轻量模型 | Whisper large-v3 标准版 |
|---|---|---|---|
| 语言覆盖 | 99 种语言,多语混合强 | 中英日韩为主 | 同 Turbo |
| 噪声鲁棒性 | 优 | 优 | 优 |
| 算力需求 | 中 | 低 | 高 |
| 部署复杂度 | 与 sherpa-onnx 现有 Whisper 模型一致,零迁移成本 | 低 | 同 Turbo |
别只看表格。示例脚本里都内置了 RTF(实时率 = 耗时/音频时长)统计逻辑,建议拿自己业务里的真实音频各跑一遍,数据比任何对比文章都可信。
换模型不换架构,这就是 Sherpa-onnx 接入 Turbo 的最大价值:多语言的离线识别,从"够用的快"升级到"够快且够准"。
【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnx
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考