DIAMOND的神经音频编解码器:Descript Audio Codec在语音修复中的关键作用
【免费下载链接】diamond-1.0项目地址: https://ai.gitcode.com/hf_mirrors/nineninesix/diamond-1.0
DIAMOND是一款基于神经音频编解码器的语音修复工具,它能够将受损的音频转化为接近录音室品质的44.1 kHz语音。其核心技术在于采用了Descript Audio Codec作为神经音频编解码器,通过自回归RQ-Transformer架构实现对音频 tokens 的预测与合成,为语音修复领域带来了革命性的突破。
什么是神经音频编解码器?
神经音频编解码器是一种基于深度学习的音频处理技术,它能够将原始音频信号压缩为离散的 tokens,同时也能从这些 tokens 中重建出高质量的音频。与传统的音频编解码技术相比,神经音频编解码器具有更高的压缩效率和更好的音质还原能力,在语音处理、音乐生成等领域有着广泛的应用前景。
Descript Audio Codec的独特优势
Descript Audio Codec作为DIAMOND中所使用的神经音频编解码器,具有以下独特优势:
- 高保真音质:支持44.1 kHz的采样率,能够保留音频中的细节信息,尤其是高频部分的声音,如嘶嘶声和“空气感”,让修复后的语音更加自然、清晰。
- 9-codebook RVQ结构:采用9码本的残差矢量量化(RVQ)技术,能够对音频信号进行精细的编码,为后续的语音修复提供丰富的信息。
- 86 frames/s的处理速度:在保证音质的同时,具备较高的处理效率,能够满足实际应用中的需求。
DIAMOND如何利用Descript Audio Codec实现语音修复
DIAMOND的工作流程充分发挥了Descript Audio Codec的优势,具体步骤如下:
首先,双向Transformer对受损的梅尔频谱进行编码,捕捉音频中的上下文信息。然后,带有交叉注意力机制的自回归解码器预测冻结的神经音频编解码器(即Descript Audio Codec)的 tokens。最后,Descript Audio Codec根据这些预测的 tokens 合成出修复后的波形。
这种基于神经音频编解码器 tokens 的序列到序列生成方式,使得DIAMOND不仅仅是简单地对音频进行滤波,而是能够根据幸存的共振峰生成缺失的内容,从而实现真正意义上的语音修复。
DIAMOND语音修复效果展示
以下是一些实际的语音修复示例,通过对比受损输入和修复后的音频,我们可以直观地感受到DIAMOND的强大修复能力(音频文件位于项目的samples目录下,如example1_degraded.wav、example1_restored.wav等):
| # | 受损输入 | 修复后(44.1 kHz) | DNSMOS OVRL |
|---|---|---|---|
| 1 | example1_degraded.wav | example1_restored.wav | 2.16 → 3.50 (+1.34) |
| 2 | example2_degraded.wav | example2_restored.wav | 2.83 → 3.59 (+0.76) |
| 3 | example3_degraded.wav | example3_restored.wav | 2.56 → 3.65 (+1.10) |
| 4 | example4_degraded.wav | example4_restored.wav | 3.32 → 3.89 (+0.57) |
从上述数据可以看出,DIAMOND在DNSMOS OVRL指标上有显著提升,平均提高了0.94分,修复效果明显。
DIAMOND的模型参数与细节
- 模型类型:自回归序列到序列语音修复(编码器 + 基于编解码器 tokens 的RQ-Transformer解码器)
- 编码器:双向Transformer,无下采样 - 20层,512d,8头(63.9M参数)
- 解码器/时间Transformer:因果自注意力 + 交叉注意力 - 20层,512d,8头(88.7M参数)
- 码本读取/深度Transformer:帧内9个RVQ码的局部自回归 - 4层,384d,6头(14.0M参数)
- 参数总数:约166.6M可训练参数(Descript Audio Codec约74M参数在运行时下载且冻结)
- 训练数据:681.5小时的工作室语音,约2.5k说话人,28%为原生宽带。
如何获取和使用DIAMOND
如果你对DIAMOND感兴趣,可以通过以下步骤获取和使用:
- 克隆仓库:
git clone https://gitcode.com/hf_mirrors/nineninesix/diamond-1.0 - 参考项目中的相关文档和示例,进行模型的部署和使用。
DIAMOND的应用场景与注意事项
应用场景
DIAMOND适用于离线修复和数据集清理任务,能够将大量受损的录音(如播客、采访、档案和经过有损编解码器处理的用户生成音频)转化为足够干净的素材,用于训练等用途。
注意事项
- 内容保真度:作为自回归解码器,DIAMOND在处理困难片段时偶尔会出现词语模糊的情况。在内容保真度至关重要时,需要检查转录文本。
- 解码速度:解码是串行的,不是实时的。这是离线修复,而非实时过滤器。
- 语言限制:训练数据为英语,其他语言未经测试。
- 生成性质:它是生成式的,不是过滤式的。编解码器截止频率以上的内容是根据上下文发明的,是合理的推测,而非真实恢复。不要将输出视为所说内容的法医证据。
请负责任地使用。修复后的语音是合成语音。不要将其呈现为未更改的录音,也不要用它来编造或错误归因某人的言论。
总结
Descript Audio Codec作为DIAMOND的核心神经音频编解码器,为其实现高质量的语音修复提供了坚实的基础。通过结合自回归RQ-Transformer架构,DIAMOND在语音修复领域取得了显著的成果,为处理受损音频提供了一种高效、可靠的解决方案。随着技术的不断发展,相信DIAMOND在未来会有更广泛的应用和更出色的表现。
【免费下载链接】diamond-1.0项目地址: https://ai.gitcode.com/hf_mirrors/nineninesix/diamond-1.0
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考