你第一次用多轨分离,看到输出是人声、鼓、贝斯、其他四轨,第一反应大概是疑惑:为什么不是按乐器给我十几轨?编曲里明明有吉他、钢琴、弦乐、合成器,凭什么它们全被塞进"其他"这一个筐里?换个工具试试,有的给六轨——多出来的是钢琴和吉他——但仍然有个"其他"。这个划分看起来很随意。
它不随意。这四轨或六轨的边界,是数据集、频谱可分性和商业需求三方共同决定的结果。
误解:轨数不是模型能力的刻度
很多人把轨数当性能指标:四轨是入门,六轨更强,将来会有十六轨。
不是这样。每增加一轨,都需要一整套带该乐器独立干轨的训练数据。而这类数据的获取成本极高——你需要拿到商业音乐的原始分轨工程文件,这属于唱片公司的核心资产。
学术界通用的基准数据集 MUSDB18 只有 150 首歌,标注恰好是四类:vocals、drums、bass、other。几乎所有主流模型的四轨划分,直接来自这个数据集的标注结构。不是研究者认为四轨最合理,而是公开可用的、有干轨标注的数据就这么分。
底层原理:分离是能量分配,掩码之和必须为一
回顾标准流程:短时傅里叶变换(STFT,Short-Time Fourier Transform)→ 掩码预测 → 逆变换重建。
多轨分离的关键约束在于,模型为每一路输出一个掩码,且这些掩码在每个时频点上要满足:
M_vocals(f,t) + M_drums(f,t) + M_bass(f,t) + M_other(f,t) ≈ 1
这个约束叫完备性(Completeness),它保证所有能量都有归属,各轨相加能还原原始混音。
由此推出结构性结论:必须存在一个兜底类别。如果只定义人声、鼓、贝斯三类,那么吉他的能量无处可去,模型会把它强行摊派给这三类——你会听到吉他的泛音混在人声里、低音弦混在贝斯里。
"其他"这一轨不是偷懒,是完备性约束的数学必需品。任何多轨分离系统都必须有它,无论对外叫 other、accompaniment 还是 residual。
分层拆解:三个层面决定了轨的边界
第一个层面:频谱可分性——哪些乐器天然好分
分离难度取决于目标声源与其他声源在时频平面上的重叠程度。四轨划分恰好选中了重叠度最低的三类。
贝斯最好分。它的能量几乎全部集中在 40–250Hz,这个频段里其他乐器很少有持续的基频能量。频段隔离度高,模型只需学会"低频里持续的谐波结构"。
鼓次之。它靠的不是频率隔离,而是时间特征:极短的启动时间(Attack)、宽带瞬态、非谐波结构。底鼓有低频冲击、军鼓有中频噪声爆发、镲片是高频宽带衰减。这些时域特征极其独特,模型很容易识别。
人声居中。人类听觉系统对语音敏感,训练数据也最丰富,且共振峰结构(Formant)与颤音特征鲜明。难点在于它的频段(100Hz–8kHz)与几乎所有旋律乐器重叠。
为什么吉他和钢琴难分:它们和人声在频段、谐波结构、动态包络上高度相似。钢琴中音区的谐波列与人声共振峰重叠严重;失真吉他的频谱几乎是宽带噪声,与嘶哑人声难以区分。这不是数据量的问题,是它们在时频域上确实相像。
第二个层面:数据可得性——为什么六轨模型多的是这两轨
六轨模型(人声、鼓、贝斯、吉他、钢琴、其他)多出来的正是吉他和钢琴。原因不是它们变好分了,而是这两类的独立干轨数据相对容易获得:
• 钢琴有大量独奏录音和 MIDI 合成数据,可以程序化生成带标注的混音
• 吉他有丰富的教学素材、Loop 库和独奏轨
而弦乐组、管乐组、合成器则不然:它们在流行编曲中极少单独出现,商业分轨又拿不到。所以这些乐器永远留在"其他"里,不是技术问题,是数据问题。
顺带解释一个常见困惑:为什么六轨模型的吉他轨经常带人声残留?因为吉他类别本身分得勉强,模型置信度低。轨数增加不代表每一轨质量都提升,反而可能因为类别边界模糊而让原本干净的轨变脏。
第三个层面:商业需求——用户真正要什么
轨数划分还受实际用途约束。绝大多数需求集中在两类:
•要伴奏(去人声):只需人声与非人声二分
•要某个乐器(扒谱、采样、练习):最常见的是鼓和贝斯——因为它们最容易被听清、也最常被单独使用
而"我要单独的第二小提琴声部"这种需求近乎不存在。为极少数需求增加一个类别,代价是全局精度下降——因为掩码之和的约束意味着新增类别会从已有类别里抢能量。
这是工程上的取舍:四到六轨是精度与实用性的平衡点,不是能力上限。
能力边界:四件做不到的事
没有独立类别的乐器无法单独提取。弦乐、管乐、合成器在四轨和六轨模型里都归入 other。这是类别定义决定的,换模型参数不解决。
轨数越多,单轨质量不一定越高。新增类别会与已有类别争夺能量,边界模糊的类别(吉他、钢琴)既自身不干净,也可能污染原本干净的轨。
分离出的多轨再合并,不等于原音频。高频细节缺失、相位关系破坏、瞬态钝化、混响信息丢失。想靠"拆开再合并"洗音质,方向就错了。
同频段深度重叠的声源分不开。男声与大提琴挤在 200Hz 附近,任何模型都只能给概率划分。这是算法层面的限制,不是产品层面的。
还有一条必须说清:原曲编曲密度决定分离上限。留白多、声部错开的编曲天然好分;全频段塞满的墙式编曲(Wall of Sound),再多轨也出不来干净结果。选素材比选轨数重要。
落地:按需求选轨数而非按轨数选工具
原理讲清了,剩下是执行。如果只是临时处理素材、不想为此配本地环境,网页端工具能覆盖常见需求,以 AIFooler 这类在线音轨提取工具为例说明对应关系。
第一步,先明确要几轨再选功能。只要伴奏或人声,走人声分离——用二轨专用路径而不是多轨再合并,对应上面选型表第一条。要单独的鼓、贝斯、钢琴、吉他,走多音轨分离。
第二步,注意输入条件。上传时长给足 5 秒以上,能给 WAV 就不给 MP3。素材在平台视频里的话,直接贴链接提取音频,比录屏转码少一层有损编码
第三步,按轨的可靠性排序验收。处理完先听鼓和贝斯——这两轨如果都不干净,说明源素材本身编曲太密或音质不足,换模型也没用。吉他钢琴轨有残留属于正常,那是类别边界模糊的必然结果,不是处理失败。
实际条件是网页端直接用、不装客户端、支持 MP3 / WAV 等常见格式、上传文件 24 小时后自动删除。对"扒一段鼓组当采样"这类一次性需求,省下的环境配置时间通常比处理时间本身长。
最后
多轨分离的轨数不是能力刻度,而是数据可得性、频谱可分性、实用需求三者的交集。贝斯和鼓分得好,因为它们在频域和时域上足够独特;吉他钢琴分得勉强,因为它们和人声太像;弦乐管乐没有独立轨,因为没有可用的训练数据。
而"其他"这一轨永远存在,因为掩码之和必须为一——所有能量都得有个去处。理解了这套约束,就不会再期待某个模型突然给出十六轨干净分离,也不会在吉他轨有残留时误以为自己操作错了。