电商多模态表征技术:从VLM到MLLM的演进与实践 1. 电商多模态表征的演进与挑战在电商搜索场景中用户的一次搜索行为往往需要同时处理商品的多个模态信息。以搜索小香风外套为例系统不仅需要从商品主图中识别编织纹理与版型设计等视觉元素还需从商品文本中解析羊毛、短款、春季新款等关键属性更需要综合判断图像与文本描述是否指向同一件商品。这种多模态信息的互补性构成了电商搜索的核心特征图像擅长呈现形态、颜色与设计元素而文本则更擅长承载品牌、材质、功能等结构化语义。电商场景的特殊性在于商品信息的多对一复杂结构一件商品通常关联多张图片主图、SKU图、创意图等和由标题、详情描述等构成的长文本。这些不同模态的信息在密度和语义覆盖范围上存在显著差异甚至可能出现冗余或冲突。例如商品图片可能展示多种颜色选项而标题仅提及主推色详情文本可能强调透气性但图片难以直观呈现这一特性。1.1 技术演进历程多模态表征方法经历了三个主要发展阶段早期方法采用独立编码器架构将图像和文本分别映射到共享空间实现粗粒度的图文对齐。这类方法虽然简单直接但难以捕捉跨模态的深层关联。典型代表如2014年的DeViSE模型使用预训练的CNN和词向量模型分别处理图像和文本通过线性投影实现跨模态对齐。视觉语言模型VLM时代引入了大规模图文预训练推动表征学习从浅层特征拼接转向深层跨模态交互。2018年的ViLBERT和LXMERT等模型通过跨模态注意力机制实现了更精细的图文关联建模。这类模型在电商场景展现出更强的商品理解能力特别是在处理复杂属性组合时表现突出。多模态大语言模型MLLM进一步将视觉感知纳入语言推理框架使表征能力从简单的匹配判断扩展到深层内容理解和关系推理。2022年提出的Flamingo和2023年的BLIP-2等模型通过将视觉编码器与大语言模型结合实现了更接近人类认知的多模态理解能力。1.2 电商场景的特殊挑战电商多模态表征面临三个独特挑战异构任务统一建模的困难。电商搜索全链路涉及查询理解、召回、相关性判定、排序等多个环节每个环节对表征的需求各不相同。传统方案为每个任务单独建模导致语义空间不一致和重复建设。例如召回阶段需要粗粒度匹配能力而排序阶段则需要细粒度判别能力。模态失衡问题。在训练过程中不同模态的数据量和信息密度差异会导致模型偏向主导模态。我们的实验显示当文本数据量是图像的1.5倍时纯文搜任务的R10提升7.2%而图搜任务下降9.8%。这种跷跷板效应严重制约了模型的综合性能。细粒度语义对齐的需求。电商场景要求模型不仅能判断商品是否相似还需理解具体差异。例如两件白色衬衫可能在领型、袖长等细节上存在差异这些细微差别对购买决策至关重要但难以通过传统方法捕捉。2. MOON 1.0异构任务统一建模的初步探索MOON 1.0的核心创新在于提出了基于生成式MLLM的电商多模态表征框架。该框架通过多任务联合学习将图搜、文搜、商品搜及分类等异构任务纳入统一表征空间。具体实现上我们设计了专家混合引导机制针对不同模态输入及商品类别、属性等关键语义维度进行差异化建模。2.1 架构设计模型采用双塔结构视觉塔基于ViT-L/16架构文本塔采用RoBERTa-large。不同于传统双塔模型我们在共享投影层后引入了任务特定的专家网络。每个专家网络由3层MLP构成通过门控机制动态组合专家输出。这种设计既保持了共享表征空间的一致性又允许针对不同任务进行特化处理。训练阶段采用多任务联合优化损失函数为L_total λ1*L_retrieval λ2*L_classification λ3*L_attribute其中λ10.6, λ20.3, λ30.1通过网格搜索确定。检索损失L_retrieval采用改进的Triplet Loss引入难样本挖掘策略将负样本采样集中在语义相似但关键属性不同的商品对上。2.2 实践效果与局限在阿里妈妈搜索直通车的实际应用中MOON 1.0带来了显著效果提升。以精排CTR预估模型为例全量上线后大盘CTR提升20%。消融实验显示统一表征相比单任务专用模型在保持各项任务性能相当的情况下计算资源消耗减少43%模型维护成本降低60%。然而MOON 1.0暴露出明显的跷跷板效应。当调整任务数据配比时图搜与文搜性能呈现此消彼长的关系。具体表现为当图像数据占比从30%提升到50%时图搜R10从68.3%升至72.1%但文搜R10从65.7%降至59.2%。深入分析发现这是因为共享参数空间中不同模态的表示在争夺有限的容量缺乏有效的平衡机制。3. MOON 2.0动态模态平衡的关键突破MOON 2.0的核心创新在于解决了模态失衡问题。我们提出三个关键技术模态驱动的专家混合Modality-driven MoE、双重语义对齐Dual-level Alignment和图文协同增强Image-text Co-augmentation。3.1 Modality-driven MoE机制传统MoE机制主要依赖token级信号进行专家路由难以有效区分模态特性。我们创新性地引入可学习的双重对齐偏好矩阵显式刻画每个专家对不同模态对齐目标的偏好。具体实现包括在FFN层嵌入MoE结构设置8个专家网络每个专家为256维的MLP设计模态感知路由控制器输入同时考虑token嵌入和模态类型标识引入稀疏正则化L_{sparse} 0.01*||G||_1其中G为门控权重实验表明该机制使模型能够根据输入模态动态调整专家组合。当处理图像时视觉专家Expert 1-4的平均激活率达到0.73处理文本时语言专家Expert 5-8的激活率为0.81实现了明显的模态专业化分工。3.2 Dual-level Alignment策略我们提出商品间Inter-product和商品内Intra-product双重对齐Inter-product Alignment采用改进的对比损失L_inter -log[exp(s(q,p)/τ)/(exp(s(q,p)/τ)∑exp(s(q,n)/τ))]其中温度系数τ0.05通过线性warmup策略在训练初期从0.01逐步提升。Intra-product Alignment创新性地引入属性级一致性约束L_intra 1 - cos_sim(E_v(a_i), E_t(a_i))其中a_i表示第i个商品属性E_v和E_t分别表示视觉和文本编码器对该属性的嵌入。3.3 Image-text Co-augmentation方法我们开发了两阶段增强策略图像增强采用扩散模型首先生成商品主体的分割掩码然后基于文本描述生成背景多样的变体。关键创新在于属性保持损失L_attr ||φ(I_orig) - φ(I_aug)||_2其中φ为预训练的属性分类器确保增强不改变核心属性。文本增强使用微调的LLaMA-2 7B模型输入原始标题和商品类目生成语义等价但表述多样的新标题。我们设计了基于困惑度的过滤机制只保留ppl15的增强样本。4. 实验验证与效果分析4.1 评测基准构建我们构建了MBE 2.0评测基准包含640万真实电商样本涵盖三大类任务检索任务图搜商品/文搜商品/商品搜商品分类任务三级类目预测属性任务材质/风格/适用场景等50属性预测该基准特别设计了对抗性测试集包含20万人工标注的困难样本用于评估模型的细粒度区分能力。4.2 主要实验结果在MBE 2.0上MOON 2.0取得全面突破图搜商品R1091.08%较MOON 1.0提升22.8%文搜商品R1063.09%提升17.3%商品搜商品R1094.21%提升19.6%分类准确率88.37%提升6.2%属性预测F183.15%提升9.8%跨数据集测试中在Fashion200K上图搜mAP76.42超过SOTA 8.3%文搜mAP72.18超过SOTA 6.7%4.3 消融实验分析各模块的贡献度如下模块图搜R10文搜R10分类Acc完整模型91.0863.0988.37-Modality-driven MoE74.59↓57.32↓82.84↓-Dual-level Alignment68.17↓23.35↓77.41↓-Image-text Co-aug78.17↓60.63↓83.25↓特别值得注意的是Dual-level Alignment的移除导致文搜性能骤降验证了跨模态对齐对文本理解的关键作用。5. 实际应用与部署经验在阿里妈妈搜索直通车系统中MOON 2.0的部署面临三个主要挑战5.1 线上服务优化计算图优化将Modality-driven MoE的路由计算与专家网络执行解耦通过异步调度实现并行化。实测显示这使推理延迟从78ms降至43ms。缓存策略针对高频查询商品建立多级缓存原始特征缓存TTL5min嵌入向量缓存TTL15min相似商品列表缓存TTL1h该策略使缓存命中率达68%QPS提升3倍。5.2 模型蒸馏方案为满足不同场景的算力需求我们开发了渐进式蒸馏流程使用MOON 2.0作为教师模型训练12层Student模型保留92%性能进一步蒸馏到6层Tiny模型保留85%性能针对移动端开发4层Mobile模型保留78%性能蒸馏关键点在于使用中间层注意力矩阵作为监督信号保留MoE路由模式但减少专家数量引入对抗蒸馏损失增强泛化性5.3 业务效果验证在全量上线后的A/B测试中MOON 2.0带来显著提升指标实验组对照组提升CTR26%基准-转化率18%基准-搜索GMV22%基准-退换货率3.2%4.7%↓32%退换货率的显著下降特别值得关注这表明更好的多模态理解确实带来了更精准的商品匹配。6. 未来发展方向基于MOON系列的实践经验我们认为电商多模态表征将向两个关键方向演进6.1 多粒度语义表征当前模型对商品属性的表征仍较粗糙。我们正在探索层次化属性建模宏观层面品类、风格等中观层面材质、版型等微观层面缝线、纽扣等细节初步实验显示引入粒度感知损失可使细粒度检索准确率提升15%。6.2 感知-推理-生成一体化下一代模型将整合三种能力感知精准识别商品属性推理理解属性间关联如雪纺材质适合夏季场景生成自动生成营销文案或搭配建议我们正在开发的MOON 3.0原型已展现出令人期待的潜力在商品问答任务上准确率达到72%远超传统模型的58%。在实际部署中我们发现模型对时尚趋势的捕捉能力仍有提升空间。例如当某种设计元素突然流行时模型需要较长时间通常2-3周才能充分学习其语义特征。这指向了另一个重要方向——动态自适应学习使模型能够快速吸收新兴概念而不遗忘已有知识。