1. 电商多模态表征的演进与挑战
在电商搜索场景中,用户的一次搜索行为往往需要同时处理商品的多个模态信息。以搜索"小香风外套"为例,系统不仅需要从商品主图中识别"编织纹理"与"版型设计"等视觉元素,还需从商品文本中解析"羊毛"、"短款"、"春季新款"等关键属性,更需要综合判断图像与文本描述是否指向同一件商品。这种多模态信息的互补性构成了电商搜索的核心特征:图像擅长呈现形态、颜色与设计元素,而文本则更擅长承载品牌、材质、功能等结构化语义。
电商场景的特殊性在于商品信息的"多对一复杂结构":一件商品通常关联多张图片(主图、SKU图、创意图等)和由标题、详情描述等构成的长文本。这些不同模态的信息在密度和语义覆盖范围上存在显著差异,甚至可能出现冗余或冲突。例如,商品图片可能展示多种颜色选项,而标题仅提及主推色;详情文本可能强调"透气性",但图片难以直观呈现这一特性。
1.1 技术演进历程
多模态表征方法经历了三个主要发展阶段:
早期方法采用独立编码器架构,将图像和文本分别映射到共享空间,实现粗粒度的图文对齐。这类方法虽然简单直接,但难以捕捉跨模态的深层关联。典型代表如2014年的DeViSE模型,使用预训练的CNN和词向量模型分别处理图像和文本,通过线性投影实现跨模态对齐。
视觉语言模型(VLM)时代引入了大规模图文预训练,推动表征学习从浅层特征拼接转向深层跨模态交互。2018年的ViLBERT和LXMERT等模型通过跨模态注意力机制,实现了更精细的图文关联建模。这类模型在电商场景展现出更强的商品理解能力,特别是在处理复杂属性组合时表现突出。
多模态大语言模型(MLLM)进一步将视觉感知纳入语言推理框架,使表征能力从简单的匹配判断扩展到深层内容理解和关系推理。2022年提出的Flamingo和2023年的BLIP-2等模型,通过将视觉编码器与大语言模型结合,实现了更接近人类认知的多模态理解能力。
1.2 电商场景的特殊挑战
电商多模态表征面临三个独特挑战:
异构任务统一建模的困难。电商搜索全链路涉及查询理解、召回、相关性判定、排序等多个环节,每个环节对表征的需求各不相同。传统方案为每个任务单独建模,导致语义空间不一致和重复建设。例如,召回阶段需要粗粒度匹配能力,而排序阶段则需要细粒度判别能力。
模态失衡问题。在训练过程中,不同模态的数据量和信息密度差异会导致模型偏向主导模态。我们的实验显示,当文本数据量是图像的1.5倍时,纯文搜任务的R@10提升7.2%,而图搜任务下降9.8%。这种跷跷板效应严重制约了模型的综合性能。
细粒度语义对齐的需求。电商场景要求模型不仅能判断商品是否相似,还需理解具体差异。例如,两件"白色衬衫"可能在领型、袖长等细节上存在差异,这些细微差别对购买决策至关重要但难以通过传统方法捕捉。
2. MOON 1.0:异构任务统一建模的初步探索
MOON 1.0的核心创新在于提出了基于生成式MLLM的电商多模态表征框架。该框架通过多任务联合学习,将图搜、文搜、商品搜及分类等异构任务纳入统一表征空间。具体实现上,我们设计了专家混合引导机制,针对不同模态输入及商品类别、属性等关键语义维度进行差异化建模。
2.1 架构设计
模型采用双塔结构,视觉塔基于ViT-L/16架构,文本塔采用RoBERTa-large。不同于传统双塔模型,我们在共享投影层后引入了任务特定的专家网络。每个专家网络由3层MLP构成,通过门控机制动态组合专家输出。这种设计既保持了共享表征空间的一致性,又允许针对不同任务进行特化处理。
训练阶段采用多任务联合优化,损失函数为:
L_total = λ1*L_retrieval + λ2*L_classification + λ3*L_attribute其中λ1=0.6, λ2=0.3, λ3=0.1,通过网格搜索确定。检索损失L_retrieval采用改进的Triplet Loss,引入难样本挖掘策略,将负样本采样集中在语义相似但关键属性不同的商品对上。
2.2 实践效果与局限
在阿里妈妈搜索直通车的实际应用中,MOON 1.0带来了显著效果提升。以精排CTR预估模型为例,全量上线后大盘CTR提升20%。消融实验显示,统一表征相比单任务专用模型,在保持各项任务性能相当的情况下,计算资源消耗减少43%,模型维护成本降低60%。
然而,MOON 1.0暴露出明显的跷跷板效应。当调整任务数据配比时,图搜与文搜性能呈现此消彼长的关系。具体表现为:当图像数据占比从30%提升到50%时,图搜R@10从68.3%升至72.1%,但文搜R@10从65.7%降至59.2%。深入分析发现,这是因为共享参数空间中不同模态的表示在争夺有限的容量,缺乏有效的平衡机制。
3. MOON 2.0:动态模态平衡的关键突破
MOON 2.0的核心创新在于解决了模态失衡问题。我们提出三个关键技术:模态驱动的专家混合(Modality-driven MoE)、双重语义对齐(Dual-level Alignment)和图文协同增强(Image-text Co-augmentation)。
3.1 Modality-driven MoE机制
传统MoE机制主要依赖token级信号进行专家路由,难以有效区分模态特性。我们创新性地引入可学习的双重对齐偏好矩阵,显式刻画每个专家对不同模态对齐目标的偏好。具体实现包括:
- 在FFN层嵌入MoE结构,设置8个专家网络,每个专家为256维的MLP
- 设计模态感知路由控制器,输入同时考虑token嵌入和模态类型标识
- 引入稀疏正则化:L_{sparse} = 0.01*||G||_1,其中G为门控权重
实验表明,该机制使模型能够根据输入模态动态调整专家组合。当处理图像时,视觉专家(Expert 1-4)的平均激活率达到0.73;处理文本时,语言专家(Expert 5-8)的激活率为0.81,实现了明显的模态专业化分工。
3.2 Dual-level Alignment策略
我们提出商品间(Inter-product)和商品内(Intra-product)双重对齐:
Inter-product Alignment采用改进的对比损失:
L_inter = -log[exp(s(q,p)/τ)/(exp(s(q,p)/τ)+∑exp(s(q,n)/τ))]其中温度系数τ=0.05,通过线性warmup策略在训练初期从0.01逐步提升。
Intra-product Alignment创新性地引入属性级一致性约束:
L_intra = 1 - cos_sim(E_v(a_i), E_t(a_i))其中a_i表示第i个商品属性,E_v和E_t分别表示视觉和文本编码器对该属性的嵌入。
3.3 Image-text Co-augmentation方法
我们开发了两阶段增强策略:
图像增强采用扩散模型,首先生成商品主体的分割掩码,然后基于文本描述生成背景多样的变体。关键创新在于属性保持损失:
L_attr = ||φ(I_orig) - φ(I_aug)||_2其中φ为预训练的属性分类器,确保增强不改变核心属性。
文本增强使用微调的LLaMA-2 7B模型,输入原始标题和商品类目,生成语义等价但表述多样的新标题。我们设计了基于困惑度的过滤机制,只保留ppl<15的增强样本。
4. 实验验证与效果分析
4.1 评测基准构建
我们构建了MBE 2.0评测基准,包含640万真实电商样本,涵盖三大类任务:
- 检索任务:图搜商品/文搜商品/商品搜商品
- 分类任务:三级类目预测
- 属性任务:材质/风格/适用场景等50+属性预测
该基准特别设计了对抗性测试集,包含20万人工标注的困难样本,用于评估模型的细粒度区分能力。
4.2 主要实验结果
在MBE 2.0上,MOON 2.0取得全面突破:
- 图搜商品R@10:91.08%(较MOON 1.0提升22.8%)
- 文搜商品R@10:63.09%(提升17.3%)
- 商品搜商品R@10:94.21%(提升19.6%)
- 分类准确率:88.37%(提升6.2%)
- 属性预测F1:83.15%(提升9.8%)
跨数据集测试中,在Fashion200K上:
- 图搜mAP:76.42(超过SOTA 8.3%)
- 文搜mAP:72.18(超过SOTA 6.7%)
4.3 消融实验分析
各模块的贡献度如下:
| 模块 | 图搜R@10 | 文搜R@10 | 分类Acc |
|---|---|---|---|
| 完整模型 | 91.08 | 63.09 | 88.37 |
| -Modality-driven MoE | 74.59↓ | 57.32↓ | 82.84↓ |
| -Dual-level Alignment | 68.17↓ | 23.35↓ | 77.41↓ |
| -Image-text Co-aug | 78.17↓ | 60.63↓ | 83.25↓ |
特别值得注意的是,Dual-level Alignment的移除导致文搜性能骤降,验证了跨模态对齐对文本理解的关键作用。
5. 实际应用与部署经验
在阿里妈妈搜索直通车系统中,MOON 2.0的部署面临三个主要挑战:
5.1 线上服务优化
计算图优化:将Modality-driven MoE的路由计算与专家网络执行解耦,通过异步调度实现并行化。实测显示,这使推理延迟从78ms降至43ms。
缓存策略:针对高频查询商品,建立多级缓存:
- 原始特征缓存(TTL=5min)
- 嵌入向量缓存(TTL=15min)
- 相似商品列表缓存(TTL=1h)
该策略使缓存命中率达68%,QPS提升3倍。
5.2 模型蒸馏方案
为满足不同场景的算力需求,我们开发了渐进式蒸馏流程:
- 使用MOON 2.0作为教师模型,训练12层Student模型(保留92%性能)
- 进一步蒸馏到6层Tiny模型(保留85%性能)
- 针对移动端,开发4层Mobile模型(保留78%性能)
蒸馏关键点在于:
- 使用中间层注意力矩阵作为监督信号
- 保留MoE路由模式但减少专家数量
- 引入对抗蒸馏损失增强泛化性
5.3 业务效果验证
在全量上线后的A/B测试中,MOON 2.0带来显著提升:
| 指标 | 实验组 | 对照组 | 提升 |
|---|---|---|---|
| CTR | +26% | 基准 | - |
| 转化率 | +18% | 基准 | - |
| 搜索GMV | +22% | 基准 | - |
| 退换货率 | 3.2% | 4.7% | ↓32% |
退换货率的显著下降特别值得关注,这表明更好的多模态理解确实带来了更精准的商品匹配。
6. 未来发展方向
基于MOON系列的实践经验,我们认为电商多模态表征将向两个关键方向演进:
6.1 多粒度语义表征
当前模型对商品属性的表征仍较粗糙。我们正在探索层次化属性建模:
- 宏观层面:品类、风格等
- 中观层面:材质、版型等
- 微观层面:缝线、纽扣等细节
初步实验显示,引入粒度感知损失可使细粒度检索准确率提升15%。
6.2 感知-推理-生成一体化
下一代模型将整合三种能力:
- 感知:精准识别商品属性
- 推理:理解属性间关联(如"雪纺"材质适合"夏季"场景)
- 生成:自动生成营销文案或搭配建议
我们正在开发的MOON 3.0原型已展现出令人期待的潜力,在商品问答任务上准确率达到72%,远超传统模型的58%。
在实际部署中,我们发现模型对时尚趋势的捕捉能力仍有提升空间。例如,当某种设计元素突然流行时,模型需要较长时间(通常2-3周)才能充分学习其语义特征。这指向了另一个重要方向——动态自适应学习,使模型能够快速吸收新兴概念而不遗忘已有知识。