news 2026/7/29 19:51:51

阿里巴巴淘宝的推荐系统,是怎么用AI读懂你的购物心思的?

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
阿里巴巴淘宝的推荐系统,是怎么用AI读懂你的购物心思的?

这项由阿里巴巴淘宝技术团队完成的研究,于2026年7月以技术报告形式公开发布,论文编号为arXiv:2607.15591,有兴趣深入了解的读者可以通过该编号查询完整论文。

每次打开淘宝首页,你看到的那些"猜你喜欢"商品,背后其实有一套极其复杂的大脑在运转。这套大脑不只是在统计你点击过什么、买过什么,而是在真正"理解"你为什么点,推断你此刻最可能需要什么。这听起来有点科幻,但阿里巴巴的研究团队已经把它做成了现实——而且是服务着数亿日活跃用户的真实系统。

这篇报告介绍的是他们最新一代推荐系统RecGPT-V3的完整技术方案。要理解它的价值,得先理解它的前辈们解决了什么、又留下了哪些麻烦。RecGPT-V1是第一个把大型语言模型(也就是类ChatGPT的AI)真正放进推荐流水线的版本,让系统从"你买过A,所以给你推A类似的B"变成"你买A是因为你在追求某种生活方式,所以给你推能满足这种生活方式的C"。RecGPT-V2在此基础上引入了一个"规划者+多个专家"的协作架构,就像一个主编带着多个专栏作者,各司其职地分析用户的不同兴趣维度。两代系统都已在淘宝主页部署,带来了可观的用户体验和商业指标提升。

然而,当这套系统在真实的亿级用户规模下运转时,三个根本性的问题暴露出来,每一个都像是绊脚石,卡住了系统进一步变好的路。研究团队花了大量精力识别、描述并解决这三个问题,这也是RecGPT-V3这篇报告最核心的贡献所在。

最终的成绩单相当亮眼:在淘宝首页"猜你喜欢"场景的大规模线上A/B测试中,RecGPT-V3相比RecGPT-V2实现了商品页面浏览量提升1.28%、点击率提升1.00%、成交量提升1.97%、成交金额提升3.97%,同时端到端的服务计算成本降低了52.4%。效果和效率同步改善,这在工业级AI系统里并不常见。

---

一、三块绊脚石:系统在哪里卡壳了

以一个热爱羽毛球的用户为例。他在过去两年里点击、收藏、购买了各种羽毛球装备,还买了一些数码产品和婴儿用品。每次他打开淘宝,RecGPT-V2的规划者就要把他这两年所有的行为记录从头到尾重新读一遍,然后分析他的兴趣偏好,再决定推什么。

这就是第一个问题,研究团队称之为"无状态行为建模"。对于一个活跃用户来说,两年的行为记录可能多达数万条操作,翻译成AI处理的文字大约是五万个"词"(token)。每次请求都重新处理这五万个词,不仅浪费巨大,还从根本上忽视了一个事实:很多东西上次分析完就已经知道了,根本不需要再推导一遍。更深层的问题在于,系统每次都是从零开始,无法积累对用户的理解,就像一个每次见面都要重新自我介绍的朋友,永远停留在陌生人阶段。

第二个问题叫"标签到商品的信息瓶颈"。RecGPT-V1和V2的工作方式是:AI分析完用户后,输出一些自然语言标签,比如"旋转可调羽毛球拍支架",然后由另一个下游模型根据这个标签去商品库里找匹配的实物。问题在于,"旋转可调羽毛球拍支架"这个描述对应的商品可能有成千上万件,良莠不齐,什么价位、什么品牌、什么款式全都混在一起。语言文字本质上是模糊的,无法精确指向某一类具体商品。这就像你告诉导购"我要一件好看的衣服",导购只能给你看一个巨大的试衣间,里面什么都有,帮助有限。

第三个问题叫"显式推理效率低下"。为了真正理解用户意图,AI需要进行多步骤的推理,也就是业内说的"思维链":先分析用户是什么类型的人,再推断他最近可能在关注什么,再结合当前的季节、趋势,最后才输出推荐。这个推理过程平均需要生成大约三千个词,耗时长、计算重,在亿级用户同时在线、每秒请求量极高的场景下,成本根本撑不住。但如果直接砍掉推理过程,推荐质量就会明显下降,而且系统会变成一个"黑盒",谁也不知道它为什么推这个商品。

RecGPT-V3针对这三个问题,分别提出了三套解决方案:记忆中枢、混合模态推荐基础模型,以及潜在意图推理。下面一一拆解。

---

二、记忆中枢:让系统拥有真正的"用户档案"

以往的系统就像一个没有记事本的客服,每次接待你都从头问起;记忆中枢的目标,是给系统配上一本随时更新的"用户专属档案"。

具体做法是这样的:第一次处理某个用户时,系统会把他所有的历史行为读一遍,然后把这些行为"提炼"成一组结构化的记忆单元。每个记忆单元对应用户的一种行为模式,比如"羽毛球爱好者""数码发烧友""新手爸爸"。每个单元包含两个核心内容:一个是模式的名称,来自一个预先设计好的、涵盖主要电商行为类型的分类体系;另一个是自然语言写成的偏好描述,比如"钟情全碳素进攻型球拍,近期从天斧系列转向了更高端的款式"。此外,每个单元还记录着它是从哪些原始行为推导出来的——这一点很关键,保证了系统的可解释性,出了问题能追溯。

这个提炼过程能把五万个词的行为历史压缩成几个简洁的记忆单元,token数量减少了94.5%。此后,系统处理这个用户时,只需要读这些精炼的记忆单元,加上他最近几天的新行为,就够了,不用再翻那本厚厚的老账。

但用户的兴趣是会变的。研究团队把这种变化分成了三种情况,并设计了相应的处理机制,统称为"渐进式记忆整理"。有些记忆单元需要更新:比如用户原来关注的是0到6个月婴儿用品,但最近开始买6到12个月的产品,说明孩子长大了,记忆单元就把"0-6个月"这个描述更新为"6-12个月",并补充上新出现的学步车、早教玩具等偏好。有些记忆单元不需要动:比如他对户外跑步的兴趣没有任何新的行为支撑,那就保持原样,不干扰它。还有些行为是全新的,不属于任何现有单元:比如他突然开始搜索和购买宠物用品,那就为他新建一个"新手铲屎官"的记忆单元。

在论文给出的案例中,一个用户在2025年底的记忆单元包含科技数码、羽毛球、家居三个维度。到了2026年中,经过渐进式整理后,科技维度更新为定制键盘和折叠手机,羽毛球维度更新为Astrox系列球拍,家居维度保持不变,同时新增了一个跑步维度,记录了他开始关注Saucony和HOKA品牌。整个过程不需要重读原始历史记录,只基于最新的行为增量进行局部更新。

在实际部署中,这个记忆整理每两个月运行一次。最终效果是,全局规划者(负责分析用户意图的主模块)的计算成本降低了55.8%。研究团队还对记忆单元的质量做了大规模人工标注验证:2514条行为模式标注的准确率达到82.89%,21268条行为索引的准确率达到95.27%,说明系统产生的记忆单元确实是可靠的。

---

三、混合模态推荐基础模型:给AI装上"商品语言"

解决了记忆的问题,第二个要攻克的是语言标签到实际商品之间那道信息鸿沟。

研究团队提出的解决思路很直接:与其让AI说"我要推带旋转架的羽毛球拍支架"然后让下游系统去猜,不如让AI直接"说出"具体商品的编号。他们为此创造了一种叫做"语义ID"(Semantic ID,简称SID)的东西。

语义ID的核心思想是:把每件商品用一串数字编码来表示,但这串数字不是随便分配的,而是根据商品的实际内容和用户行为特征来生成的,使得语义相似的商品拥有相似的编码。就像邮政编码一样,北京的邮编都以10开头,上海的都以2开头——只要看编码,你就大致知道这件商品在"商品世界"的哪个区域。

生成这套编码分两步走。第一步是让每件商品产生一个综合了文字、图片和属性信息的"统一特征向量"。系统用CN-CLIP这个多模态编码器分别处理商品的标题、主图和侧边属性,然后通过一个叫Q-Former的融合模块把三路信息整合成一个向量。为了让这个向量真正反映商品之间的相似关系,训练时采用了对比学习:凡是在用户行为中频繁共同出现、且内容也确实相近的商品对,就当作"正样本"来训练,让它们的向量靠近;其他商品当作"负样本",让向量远离。

第二步是把这个连续的特征向量"量化"成离散的编码,用的是一种叫RQ-VAE的残差量化技术。最终每件商品得到两个编码,合称语义ID,例如某款音箱的语义ID是``。第一个编码代表粗粒度的语义类别,第二个编码在该类别内进一步区分。系统总共引入了65536个新的语义ID词元,扩充进了语言模型的词汇表。

有了这套编码系统,下一步是训练AI真正理解并会使用这些编码,这就是"混合模态推荐基础模型"的训练过程,分两个阶段完成。

第一阶段叫持续预训练,主要目标是让模型记住每个语义ID代表什么商品。训练数据的主体(约90%)是一种"ID-商品配对"样本,格式大致是"语义ID `` 对应的商品是:标题为XXX,类目为XXX,价格为XXX"。通过大量这样的配对训练,模型逐渐建立起语义ID和商品内容之间的对应关系。剩余约10%的训练数据来自通用领域,包括数学推理、编程、科学文献等,目的是防止模型在学了大量电商专业知识后,把原本的通用能力给"忘掉"——这个现象在AI领域被称为"灾难性遗忘",是个老大难问题。

第二阶段叫指令微调,目标是让模型学会在各种任务场景下灵活运用语义ID。训练任务覆盖了六种不同的映射方向:从语义ID生成商品标题、从商品标题预测语义ID、从语义ID生成搜索标签、从搜索标签预测语义ID、从语义ID预测商品类目,以及完全在语义ID空间内做序列推荐(根据用户的点击历史ID序列预测下一个可能点击的商品ID)。每种任务占整体训练数据的比例都经过精心调配,通用领域任务占约20%,以维持模型的综合能力。

在效果验证上,研究团队设计了一系列评测。在通用能力保留方面,混合了通用数据的版本在GSM8K数学题测试上只下降了1.66个百分点,在MMLU综合知识测试上下降了2.65个百分点,在CMMLU中文语言理解测试上下降了4.49个百分点,在IFEval指令执行测试上从81.52%降至75.60%——损失有限,主要能力都保住了。而去掉通用数据的版本则几乎完全崩溃,GSM8K只剩4.70分,MMLU只剩0.12分,近乎失去了推理和知识能力。在商品推荐质量方面,混合通用数据的版本在类目命中率HR@30指标上达到0.3050,而去掉通用数据的版本只有0.2250,差距明显。

---

四、潜在意图推理:把长篇思考"压进"几个神奇的词

即便有了精炼的用户记忆和语义ID,推理过程本身仍然太慢。如何保留推理带来的质量提升,同时把推理的时间成本压下来?这是第三个要解决的问题,也是RecGPT-V3最具技术创新色彩的部分。

研究团队的核心思路是:既然推理过程可以让AI产生更好的输出,那我们就把这个推理过程"内化"进几个特殊的词元里,让AI在推理时不需要把思考过程一个字一个字地写出来,而是用这几个特殊词元在内部完成思考,最后直接输出结论。这就好像一个围棋高手,他的大脑在落子之前经历了深度的推算,但他不需要把每一步推算都说出声来,最终呈现给你的只是那手棋。

具体实现上,系统引入了一组全新的"潜在词元"(记作z?, z?, ...z?),这些词元本身不对应任何自然语言单词,它们的含义完全是在训练过程中从推理数据里学出来的。每个潜在词元负责编码推理过程中的一个片段。整个推理轨迹被划分成若干个连续片段,每个片段包含大约20步推理内容,压缩进一个潜在词元。最多使用10个潜在词元,对应最多200步左右的推理过程。

但这些潜在词元初始化时完全是随机的噪声,什么含义都没有。如何让它们学会编码推理内容?研究团队设计了一套多粒度对齐训练机制,本质上是一个"解码还原"游戏,包含三种难度递增的关卡。

第一关叫单段重建:把推理链中的某一段替换成对应的潜在词元,但其他所有段仍然保留完整文字,然后要求模型把被替换的那段文字还原出来。由于上下文线索非常充足,这是相对容易的,主要作用是把每个潜在词元和它代表的推理内容建立初步的对应关系。

第二关叫多段重建:同时替换推理链中的几个片段,要求模型同时还原这几段文字。难度明显上升,迫使每个潜在词元在有其他词元存在的情况下,仍然各司其职地编码好自己的信息。

第三关叫全链重建:把整条推理链的所有片段都替换成潜在词元,模型面对的只有输入上下文、一串潜在词元和最终输出,然后要求它把整条推理链从头到尾完整还原出来。这是最高难度的关卡,通过它之后,这串潜在词元就相当于对整个推理过程做了一次无损压缩,随时可以解码还原。

这种设计有一个特别重要的副产品:可解释性。任何时候,系统都可以把推理用的潜在词元"解码"还原成人类可读的文字推理过程。这意味着工程师在排查问题时不是面对一个完全不透明的黑盒,运营人员在需要时也能看到系统为何推荐了某件商品。这在工业推荐系统里是很难得的特性。

完成这套对齐训练后,还有第二阶段的强化学习微调。RecGPT-V2用的强化学习奖励是"命中率":看模型推荐的标签能否命中用户实际点击的商品,命中越多奖励越高。但研究团队发现这个奖励信号有两个缺陷:一是太稀疏,很多情况下同一组样本的奖励都一样,导致学不到有效梯度;二是这个奖励和真实的线上商业效果之间存在偏差,因为模型输出的标签还要经过检索、排序等多道工序才会展现给用户。

RecGPT-V3改用了一种叫"排序反馈强化学习"的新方案。对于模型输出的一组标签,系统先用这些标签去检索候选商品,然后把这些候选商品丢进线上的生产排序模型(也就是实际决定商品展示顺序的那个模型)打分,取得分最高的前100件商品的平均分作为奖励。这个奖励信号解决了两个问题:平均100件商品的分数比离散的命中率连续得多,梯度信息更丰富;从生产排序模型那里取奖励,保证了训练目标和线上实际效果的一致性。在此基础上,系统还保留了对齐分、多样性分和长度分三个约束条件,只有当这三个指标都达到阈值时,主奖励才生效,防止模型为了刷高分而走捷径。

---

五、把三块拼图拼在一起:系统全貌与实验结果

记忆中枢、混合模态基础模型、潜在意图推理,这三个部分在RecGPT-V3里是协同工作的。

工作流程大致如下:当用户访问淘宝首页时,记忆中枢提供这个用户的压缩记忆单元,加上他最近的行为序列,一起送给全局规划者。规划者分析用户当前的意图,把任务分配给若干个专领域的专家模型(比如运动装备专家、数码产品专家、母婴专家)。每个专家模型基于混合模态基础模型,同时输出自然语言标签和语义ID两种形式的意图表达,推理过程通过潜在意图推理机制大幅压缩。最后,一个混合检索模型把文字标签和语义ID综合起来,从商品库里找出最匹配的候选商品送入排序流水线。

在计算成本结构上,研究团队给出了详细的数据。引入语义ID和潜在意图推理之后,专家模型的上下文变长了,单个专家模型的计算成本比RecGPT-V2版本增加了约15%。但全局规划者的计算量比专家模型大约20倍,而记忆中枢把规划者的计算成本削减了55.8%。两相权衡,整体资源消耗降低了52.4%。换一个角度看,RecGPT-V3使用的算力仅相当于RecGPT-V1的19%。

在推理效率的具体数字上,显式思维链版本的专家模型每个样本平均生成2840个词,处理1000个样本需要1020秒;潜在意图推理版本每个样本只生成122个词,同样的1000个样本只需要295秒,速度提升了3.46倍,输出长度减少了95.7%。

在推荐质量的逐步消融实验中,各个组件的贡献也清晰可见。单纯的Qwen3-14B基础语言模型在类目命中率指标HR@30上得0.2276,开启内置思维链后只提升到0.2347,说明没有领域知识的推理作用有限。加上混合模态基础模型的预训练之后,HR@30跳升到0.3050,提升幅度最大。再加上显式思维链微调,达到0.3508。用潜在意图推理替换显式思维链,基本持平(0.3462),但推理效率大幅改善。最后加上强化学习,HR@30进一步提升至0.3693,点击率指标CTR从0.0624提升至0.0679,全面超过显式思维链版本。

在文字标签和语义ID两种模态的互补性验证上,研究团队做了专门的分析。文字标签的"品类广度"平均覆盖1.40个类目,用户间的重叠度达到11.36%;语义ID即使每个标签配了多个ID,覆盖的类目平均只有0.84个,用户间重叠度只有4.61%。这说明文字标签更具普适性和覆盖广度,而语义ID则更能捕捉每个用户独特的个性化信号。把两种模态的检索结果合并后,HR@500从0.1539(纯语义ID)提升到0.1571,HR@1000从0.2144提升到0.2168,两种模态确实是互补关系,并集起来比任何一方单独工作都要好。

---

六、在淘宝线上跑出来的真实成绩

所有这些技术创新,最终都要接受真实流量的检验。

RecGPT-V3在淘宝首页"猜你喜欢"场景部署后,与RecGPT-V2并行运行了A/B测试,实验组和对照组各承载1%的总流量,以确保统计显著性同时控制风险。

在纯商品推荐场景下,提升幅度最为显著:商品页面浏览量提升3.08%,点击率提升0.98%,页面浏览量提升2.02%,成交量提升3.10%,成交金额提升高达7.51%。成交金额的提升幅度远大于点击率,说明推荐的商品不只是更容易被点击,而是更符合用户的购买意图,用户进入商品详情页后更愿意实际下单。

在包含商品、广告、直播等多种内容类型的综合信息流场景下,提升相对保守但依然全面:商品页面浏览量提升1.28%,点击率提升1.00%,页面浏览量提升0.83%,日活跃用户数提升0.56%,成交量提升1.97%,成交金额提升3.97%。日活跃用户数和页面浏览量的提升说明改善效果覆盖了广泛的用户群体,而不只是在某个特定用户群里集中体现。

---

归根结底,RecGPT-V3回答的是一个非常基本的问题:推荐系统能不能真正"理解"用户,而不只是"统计"用户?答案是肯定的,但要做到这一点需要解决一系列工程和算法上的真实挑战,这篇报告详细记录了阿里巴巴团队解决这些挑战的完整路径。

记忆中枢让系统从"每次从零认识你"变成了"记得你的老朋友"。语义ID让系统的理解结果和商品库之间建立起了精准的连接,不再隔着一层模糊的语言翻译。潜在意图推理让深度思考不再是奢侈品,把高质量推理的成本压缩到实际可部署的水平。

三项创新都不是孤立的技巧,而是针对工业推荐系统在大规模运营中暴露的真实瓶颈量身定制的解决方案,而且每一项都在真实的A/B测试中得到了验证。这种从问题出发、到系统落地的完整链路,是这项工作值得关注的地方。

有兴趣深入研究细节的读者,可以通过arXiv:2607.15591找到这篇完整的技术报告,里面还包含了意图到商品检索模块的完整架构描述和潜在推理重建的示例案例。

---

Q&A

Q1:语义ID和普通的商品ID有什么区别,为什么需要重新设计一套编码?

A:普通商品ID只是一个数据库主键,两个相邻的ID之间没有任何语义联系。语义ID则不同,它是根据商品的实际内容特征和用户行为数据学出来的,语义相似的商品会拥有相似的编码——相关商品共享同一个"粗粒度编码",就像同一区域的邮政编码前缀相同。这让AI模型可以通过编码本身就感知到商品之间的相似关系,而不是把每件商品当成完全独立的个体,大幅降低了从语言理解到商品检索之间的信息损耗。

Q2:潜在意图推理中的潜在词元能还原出来的推理文字,和AI真正用到的思考内容是一样的吗?

A:严格来说,两者不完全等同。潜在词元编码的是从训练数据中学到的"压缩表示",还原出来的文字是模型对这个压缩表示的最优解码结果,而非AI推理时字面上的中间步骤。但论文中给出的案例显示,还原出来的文字在内容上与原始推理轨迹高度一致,能够合理解释为什么推荐了某些商品。研究团队把这称为"可解释性",意思是虽然不是逐字还原,但足以支撑工程和运营层面的可追溯需求。

Q3:记忆中枢的渐进式记忆整理每两个月才运行一次,会不会错过用户的即时兴趣变化?

A:这个问题在系统设计上有对应的处理方式。记忆中枢负责的是长期、稳定的兴趣模式,例如用户是羽毛球爱好者、是新手爸爸。而最近几天甚至几小时的新行为,系统会直接作为"近期行为序列"单独输入给推荐模型,不经过记忆压缩。两条通路并行:稳定偏好走记忆单元,即时兴趣走原始序列。这样既避免了每次都重新处理全部历史的浪费,又不会因为记忆更新周期太长而错过用户最新的兴趣信号。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/7/29 19:50:27

MATLAB坐标轴箭头绘制全攻略:从annotation到quiver的三种实现方法

1. 从“一根线”到“一个方向”:为什么坐标轴箭头很重要在MATLAB里画图,我们最常打交道的对象就是坐标轴。默认情况下,坐标轴就是两条平平无奇的直线,在原点交汇,然后向正负方向无限延伸。这种默认样式对于大多数科学绘…

作者头像 李华
网站建设 2026/7/29 19:44:36

工业视觉云边 AI 推理总是卡顿?SD-WAN 打通边缘算力互联

一边是产线上每秒产生的百兆级工业图片,一边是云端GPU集群等待训练的AI模型。中间隔着不稳定的网络——带宽被挤占、链路闪断、延时忽高忽低。传统专线太贵,公网又缺乏保障。当5G工厂数量突破1200家,云边协同成为刚需时,SD-WAN提供…

作者头像 李华
网站建设 2026/7/29 19:44:28

自建清洗中心VS托管安全服务:2026年企业DDoS防护ROI深度测算

当一次T级DDoS攻击持续48小时,自建清洗中心要烧掉的电费、带宽和人力,可能比一次勒索谈判的赎金还贵。2026年,全球DDoS攻击纪录已被刷新至3.8Tbps,脉冲式攻击占比超过41%,企业面对的不再是"防不防得住"的问题…

作者头像 李华
网站建设 2026/7/29 19:43:50

Mac播放器怎么选,VLC、Popvee、IINA、Infuse最新测评,速码

刚入手Mac电脑,你是不是也遇到过这些问题:想看个电影,双击文件,结果屏幕弹出“此影片格式不受支持”。换了部片子,终于能打开了,画面却发灰发白,4K HDR的片源看着还不如手机清楚。好不容易找到一…

作者头像 李华
网站建设 2026/7/29 19:43:45

Dell PowerEdge R760(16G)R770 (17G)服务器 CPU 详细信息

Dell PowerEdge R760 属于 Dell 第 16 代(16G) 产品线,是一款 2U 双路机架式服务器。以下是其 CPU 方面的完整规格支持的处理器代际R760 同时兼容两代 Intel Xeon Scalable 处理器:内存配置(与CPU相关)每颗…

作者头像 李华
网站建设 2026/7/29 19:42:06

Windows 11优化三部曲:用Win11Debloat打造纯净高效系统

Windows 11优化三部曲:用Win11Debloat打造纯净高效系统 【免费下载链接】Win11Debloat A simple, lightweight PowerShell script that allows you to remove pre-installed apps, disable telemetry, as well as perform various other changes to declutter and c…

作者头像 李华