Whisper与wav2vec 2.0:Maths, CS & AI Compendium自监督ASR架构解析
【免费下载链接】maths-cs-ai-compendiumBecome a cracked AI/ML researcher/engineer with this unconventional textbook covering maths, computing, and ML with intuition.项目地址: https://gitcode.com/GitHub_Trending/mat/maths-cs-ai-compendium
在Maths, CS & AI Compendium这本开源直觉派教材中,自动语音识别(ASR)是语音章节的核心。本文带你快速读懂两大现代架构:Whisper(大规模弱监督 Transformer)与wav2vec 2.0(自监督预训练),并对比它们的训练方式、适用场景与选型思路,新手无需任何背景也能看懂。
为什么自监督学习是ASR的破局点?
传统语音识别依赖海量「音频 + 人工转写」配对数据,标注成本极高。而互联网上的无标注音频几乎是无限的。
自监督学习的思路很直接:先在海量无标注音频上预训练语音表示,再用极少量标注数据微调即可达到强基线。这正是 NLP 领域 BERT 范式在语音上的落地,也是 Compendium 在 02. automatic speech recognition.md 中反复强调的"用数据规模换标注成本"的范式转变。
Whisper:68万小时数据喂出来的多任务Transformer
Whisper(OpenAI, 2023)是目前最出圈的开源 ASR 模型之一,架构本身并不新,赢在数据规模:
- 输入:80 通道 log-mel 语谱图(25 ms 窗口 / 10 ms 跳跃),归一化到零均值单位方差
- 编码器:标准 Transformer 编码器 + 正弦位置编码
- 解码器:自回归 Transformer,逐 token 生成文本,使用字节级 BPE分词器(约 5 万词表)
- 多任务:一个模型同时支持转写、翻译、语种识别、时间戳预测,只需切换解码器前的特殊任务 token
教材给出的关键结论:决定 Whisper 泛化能力的不是架构创新,而是 68 万小时弱监督数据——这使得它对口音、领域、噪声都表现出惊人的鲁棒性。🎯
wav2vec 2.0:自监督语音表示的三步架构
wav2vec 2.0(Meta, 2020)是语音自监督的开创性工作,整个架构分为三部分:
- 特征编码器:多层 1D CNN 处理原始波形,输出 20 ms 帧率的隐向量
- 量化模块:用乘积量化把隐向量离散化进有限码本,作为对比学习的"伪标签"
- 上下文网络:Transformer 编码器接收(被掩码的)隐表示,输出上下文表示
训练目标:掩码 + 对比学习
预训练时随机掩蔽一段隐向量,模型要在"真值 + 若干干扰项"中认出被掩码位置的正确量化目标——本质上是 InfoNCE 对比损失(与视觉自监督同源)。再配合多样性损失保证码本被均匀利用。
效果有多强?仅用53,000 小时无标注音频预训练后,10 分钟标注数据微调就能接近当时的最先进水平。这正是自监督 ASR 对低资源语言的最大价值。✨
Whisper vs wav2vec 2.0:一张表看懂选型
| 维度 | Whisper | wav2vec 2.0 |
|---|---|---|
| 训练数据 | 68 万小时弱监督(有近似转写) | 无标注音频 + 极少标注微调 |
| 架构 | 编码器-解码器 Transformer | CNN + 量化 + Transformer |
| 典型用途 | 离线多语言转写/翻译 | 低资源场景、流式前端、预训练底座 |
| 代表衍生 | Distil-Whisper(6 倍提速)、Parakeet | HuBERT、USM(1200 万小时)、MMS(1100+ 语言) |
教材对整个生态的总结:现代 ASR 正收敛为四种模式——Conformer 系编码器(流式)、编码器-解码器 Transformer(离线多任务)、自监督预训练(低资源),以及"规模本身就是准确率"。选型时只需回答四件事:延迟预算、算力、语言数量、流式还是批量。
延伸阅读:Compendium 中的相关章节
想补齐前置知识?按这条路径阅读即可:
- 信号与特征:MFCC、梅尔滤波器、语谱图 → 01. digital signal processing.md
- ASR 全家桶:CTC、RNN-T、LAS、Conformer、WER 评估 → 02. automatic speech recognition.md
- Transformer 基础:注意力与编码器-解码器原理 → 04. transformers and language models.md
Whisper 证明了"数据规模 + 朴素架构"的威力,wav2vec 2.0 证明了"无标注数据 + 自监督目标"可以彻底改写 ASR 的成本曲线。读懂这两条路线,你就握住了现代语音识别架构的完整地图。🚀
【免费下载链接】maths-cs-ai-compendiumBecome a cracked AI/ML researcher/engineer with this unconventional textbook covering maths, computing, and ML with intuition.项目地址: https://gitcode.com/GitHub_Trending/mat/maths-cs-ai-compendium
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考