RACE:基于多源证据锚定的智能体化商品目录增强方案
论文原信息:arXiv:2608.20844v1
摘要
商品目录是电商平台搜索、商品发现与推荐系统的底层基础,但电商目录普遍存在属性稀疏问题:消费者与下游系统依赖的商品属性要么埋藏在标题、图片这类非结构化内容中,要么直接缺失。面对规模庞大且持续迭代的商品库,依靠人工完成目录增强并不具备可行性。本文提出**(\mathcal{T})RACE**,一套基于智能体大语言模型实现自动化商品目录属性增强的全新框架。
框架包含两个智能体:侦察智能体(ScoutAgent)聚合商户目录、合作数据源、身份匹配网页检索的多模态证据,生成附带支撑依据的候选属性值;裁判智能体(JudgeAgent)针对每一条候选属性值,结合证据开展核验,决定直接入库、拦截或是转交人工复核。
离线人工评测数据集上,(\mathcal{T})RACE输出候选属性的准确率98.2%,属性覆盖率74.7%。部署到工业级真实商品目录后,(\mathcal{T})RACE将四大业务类目下曝光加权的属性增强覆盖率提升90.4%。线上对照实验表明,在商品详情页展示增强后的结构化属性,可使下单转化率提升0.48%。
1 引言
电商与交易市场平台的商品目录融合非结构化内容(标题、图片)和结构化属性(品牌、规格、饮食标签等)。结构化属性能够帮助消费者筛选、对比商品;帮助搜索系统理解查询背后的属性意图;也让推荐模型学习细粒度的商品偏好。
实际业务场景中,卖家提供的目录数据往往属性稀疏。很多属性信息藏在非结构化文本内,没有转为结构化字段,甚至完全缺失。带来两类后果:一是消费者缺少信息支撑,无法建立对商品的准确预期,影响购买决策;二是下游系统只能使用粗粒度商品表征,降低检索精度、限制个性化推荐效果。
商品目录增强的目标就是挖掘、补全缺失属性,输出结构化字段。人工处理需要阅读自由文本、解析图片,还要整合格式、质量参差不齐的多源证据,不仅容易出错,面对海量高速增长商品库也完全不可行。
早期商品属性抽取研究,训练任务专用NLP模型,从商品文本与图片还原结构化属性。大模型兴起后,借助零样本、少样本能力,降低标注数据与任务微调的依赖。但现实业务仍存在两大核心难题:
- 部分属性无法仅凭平台自有数据可靠推断,必须从外部获取,同时严格匹配到** exact 目标商品**;
- 基于某一时刻目录评测得到的模型准确率,会随着商品集合迭代而失效。系统平均效果再好,依然可能输出无依据、错配商品的属性;对于过敏原、饮食限制这类安全敏感属性,错误属性会造成严重后果。
针对上述痛点,本文提出(\mathcal{T})RACE框架,采用双智能体工作流:ScoutAgent负责多源证据搜集,JudgeAgent在写入目录前完成核验。本文主要贡献:
- 提出面向工业级商品目录增强的端到端智能体大模型框架,可融合异构多源证据并完整保留证据溯源;
- 引入身份匹配检索锚定机制,补全平台自有数据无法推断的属性;
- 将JudgeAgent嵌入线上服务链路作为“先核验再写入”的闸门,对每一条候选属性执行统一证据标准,降低商品集合变化对输出质量的冲击。
跨4个业务类目离线实验表明,(\mathcal{T})RACE可以实现接近专家人工的准确率,同时具备人工无法企及的处理规模与吞吐能力。
图1 (\mathcal{T})RACE架构:ScoutAgent接收SKU记录、目录、合作数据源、图片证据,执行迭代式身份匹配网页检索,输出带证据溯源的候选属性;JudgeAgent独立核验每一条候选,可补充网页检索,输出每条属性的裁决结果;写入闸门执行:写入(WRI(\mathcal{T})E) / 拦截(BLOCK) / 人工复核(REVIEW)三种路由。
2 相关工作
基于生成式模型从文本、图片还原结构化属性是成熟研究方向。早期方案对编解码模型微调做属性生成;近期多使用基座模型零样本/少样本提示,部分方案会检索相似目录条目辅助预测。多智能体系统也被用于迭代优化属性预测、交叉校验抽取结果,但这类工作大多假设目标属性能够从平台自有数据得到,且同类商品已经完成属性抽取。
大模型作为裁判(LLM‑as‑judge)广泛用于模型输出评估,包含锚定事实场景、多模型陪审团降低单模型偏见。可以作为独立评估器,也可以作为多智能体流程中的批判模块。但现有研究很少将大模型裁判集成到生产环境目录增强流水线,针对证据质量动态变化、商品与属性集合持续演变的场景,完成单条属性的发布决策。
外部检索增强可以弥补大模型内部知识的时效性、专业性短板,智能体工具增强检索让模型交替推理与调用搜索,降低幻觉风险。但检索增强不能直接套用在商品目录增强任务:搜索返回内容只是主题相关,很可能描述相近但并不等同的商品变体。商品属性抽取必须做显式身份匹配,保证证据严格对应待增强的目标SKU。
3 方法
3.1 总览
记sss为库存单元SKU;xsx_sxs为该SKU目录记录;csc_scs为叶子类目。类目专属模板,将csc_scs映射为一组需要优先抽取的属性集合:
A∗s=(T)emplate(c∗s;(T))\mathcal{A}*{s}=\mathrm{(\mathcal{T})emplate}(c*{s};\mathcal{(\mathcal{T})})A∗s=(T)emplate(c∗s;(T))
其中(T)\mathcal{(\mathcal{T})}(T)是全部属性模板集合;模板约束只抽取对该类目业务有意义的属性。
针对每一个属性a∈A∗sa\in\mathcal{A}*{s}a∈A∗s,系统输出带证据支撑的候选值,或者显式选择放弃输出(abstention)。候选属性的表达形式:
c∗a=(a,,va,,Ea,,τa,,qa,,za)c*{a}=\left(a,,v_{a},,E_{a},,\tau_{a},,q_{a},,z_{a}\right)c∗a=(a,,va,,Ea,,τa,,qa,,za)
- vav_ava:候选属性值
- EaE_aEa:支撑证据集合
- τa\tau_aτa:证据来源类型
- qaq_aqa:模型输出置信度分数
- zaz_aza:抽取状态:
extracted已抽取 /not_found未找到 /not_applicable属性不适用 /ambiguous信息模糊 /conflict证据冲突
系统最终会把每个候选映射三种业务动作:WRI(\mathcal{T})E写入、BLOCK拦截、REVIEW转交人工复核。
(\mathcal{T})RACE采用两阶段“先核验再写入”架构:
- ScoutAgent聚合多源证据,校验外部检索证据是否匹配目标商品,输出带事实锚定的候选属性;
- JudgeAgent使用更严格核验策略复审全部候选,决定是否发布、拦截或者人工复核。
算法1:单个SKU的(\mathcal{T})RACE增强流程
输入:SKU s,类目属性模板集合 \(\mathcal{T}\),置信度阈值 \(\theta\) 输出:候选属性,附带 {write, block, review} 业务动作 1: 𝒜ₛ ← \(\mathcal{T}\)emplate(s, 𝒯) 2: if 𝒜ₛ = ∅ then 3: return ∅ 4: end if 5: E ← Catalog(s) ∪ Syndicated(s) ∪ Image(s) 6: for all a ∈ 𝒜ₛ 且现有证据E无法解析该属性 do 7: for all p ∈ Search(Query(s,a)) do 8: if IdentityMatch(p,s) # 检索页面p与SKU s身份匹配 9: E ← E ∪ ExtractEvidence(p,a) 10: end if 11: end for 12: end for 13: C ← Reconcile(𝒜ₛ,E) # 归一化、合并证据,必要时放弃输出 14: Y ← JudgeAgent(C,E) 15: d ← WritePolicy(Y,C,confidence,\(\theta\)) 16: Apply(d,c) 17: return C3.2 ScoutAgent侦察智能体
ScoutAgent搜集并整合每个目标属性的证据,数据源分为三类:
- 商户目录数据:卖家提供结构化、非结构化商品信息,商品标题描述、商品图片。
- 商业合作数据源:第三方商业数据服务商输出商品档案,可提供权威规格参数,但是覆盖率、映射质量参差不齐。
- 智能体网页检索:自有证据不足以判定属性时,结合商品标识与目标属性构造查询,网页检索补充证据。
商品图片虽然来自前两类数据源,但图片抽取噪声更高,(\mathcal{T})RACE将图片证据作为独立层级。策略上优先采信文本证据;同时针对材质、认证标识、包装印刷这类适合视觉判断的属性使用图片。
基于身份锚定的网页检索
网页检索经常返回主题相关,但实际描述其他商品/变体的页面。目录增强任务不能只看查询相关性,必须保证证据对应目标SKU。
ScoutAgent基于ReAct推理循环完成身份匹配校验,利用目录记录、网页页面内标识符与元数据做比对。只有页面确认匹配目标SKU,才从中提取属性证据,否则直接丢弃该页面。算法中IdentityMatch(p,s)代表该推理校验步骤,不是独立外部模型调用。
证据调和与放弃输出机制
搜集全部证据后,ScoutAgent做值归一化:合并等价写法,如NiMH与nickel‑metal hydride;60 Hz与60Hz。同源证据指向同一个归一化值就合并,完整保留每一条原始证据来源溯源。
当证据不足、信息模糊、证据互相冲突时,ScoutAgent不会依靠模型内部知识强行输出,选择放弃输出,标记状态:extracted / not_found / not_applicable / ambiguous / conflict。输出候选记录包含归一化取值(如果有)、支撑证据、来源类型、置信度、抽取状态,完整交给JudgeAgent。
ScoutAgent完整提示词模板参见附录A图3。
3.3 JudgeAgent裁判智能体
候选属性写入目录前,全部交由JudgeAgent裁决。输入包含ScoutAgent输出完整候选记录:属性取值、证据、来源、抽取状态。JudgeAgent重新评估证据是否匹配目标商品、证据是否能够支撑候选取值。当已有证据不足以核验,JudgeAgent同样可以调用网页检索补充信息。
JudgeAgent以SKU为单位,可以对多个SKU并行处理。证据采信标准比ScoutAgent更加严格,核心判断:现有证据是否能够针对该SKU支撑候选取值。
裁决分类体系Verdict taxonomy
每条候选返回4种裁决结果:
- PASS通过:现有证据支撑目标商品该候选取值;
- FAIL失败:证据与候选矛盾/无法支撑取值,附带子诊断类型,例如幻觉、证据矛盾;
- UNVERIFIED未核验:没有证据反驳候选,但也没有直接证据确认该取值适用于目标商品;代表核验证据不足,不等于判定错误;
- UNCER(\mathcal{T})AIN不确定:证据互相冲突、信息模糊,无法给出可靠判定。
UNVERIFIED和UNCER(\mathcal{T})AIN的区分:前者缺少确认证据;后者证据内部存在实质性分歧,4.3节有实验分析。
裁决映射目录写入动作
裁决结果与业务写入策略解耦。低于置信度阈值θ\thetaθ直接拦截。
KaTeX parse error: Can't use function '\mathcal' in text mode at position 123: …=\texttt{UNCER(\̲m̲a̲t̲h̲c̲a̲l̲{T})AIN},\ \tex…
- yay_aya:JudgeAgent裁决结果
- qaq_aqa:ScoutAgent输出置信度
解耦设计好处:可以修改业务发布规则,不需要改动JudgeAgent内部裁决逻辑。
JudgeAgent完整提示词模板参见附录A图4。
4 实验
实验数据来自电商平台真实生产目录,覆盖多个业务类目;结合人工评估与JudgeAgent自动裁决衡量目录增强质量。若无特殊说明,ScoutAgent、JudgeAgent后端基座统一使用Gemini 2.5 Flash。4.4节对比其他多模态基座。
4.1 数据集采集
4大业务类目:杂货、酒水、电子产品、家装;目标属性数量区间:杂货11个,家装最高409个。
- 杂货&酒水数据集:500个SKU,2497条SKU‑属性对。人工标注标准答案,另一批审核人员复核ScoutAgent输出。用来衡量人工校验下抽取质量,分析JudgeAgent和人类判断的差异。
- 电子产品&家装数据集:955个SKU,4990条SKU‑属性对。没有完整人工标注,使用JudgeAgent做全量自动裁决,作为可规模化业务质量信号。
4.2 评价指标
针对ScoutAgent:
- 抽取准确率:输出非空值中正确样本占比;人工校验准确率代表正确性由人工审核确认。
- 属性覆盖率:目标SKU‑属性对中输出非空候选值的比例。
JudgeAgent自动评估数据集:统计PASS / UNVERIFIED / FAIL / UNCER\(\mathcal{T}\)AIN各类裁决占比;裁判支持率 judge‑supported rate= PASS + UNVERIFIED占全部抽取结果的比例。该指标只代表符合JudgeAgent证据标准,不等同人工验证准确率。
4.3 实验结果
杂货&酒水
在全人工标注数据集,ScoutAgent实现98.2%抽取准确率,74.7%属性覆盖率。
使用人工标注分析JudgeAgent行为(只有ScoutAgent输出非空候选才进入核验链路)。早期版本JudgeAgent只做二分类PASS/FAIL,把证据矛盾、证据不足、信息冲突全部归为拒绝。
- PASS样本中,98.4%得到人工确认正确;
- JudgeAgent和人工不一致案例:87.8%属于错误拒绝(JudgeAgent判FAIL,但人工判定正确);仅12.2%属于错误放行。
二分类策略放行样本精度很高,但大量正确候选被拒绝,召回偏低,策略过于保守。这推动本文设计四分类裁决体系:保留PASS标准;拒绝类拆分为FAIL(证据反驳)、UNVERIFIED(无确认证据但无矛盾)、UNCER(\mathcal{T})AIN(冲突模糊)。
JudgeAgent输出作为规模化业务审计信号,和人工校验准确率分开报告。
电子产品&家装
ScoutAgent属性覆盖率87.8%;抽取出来的值中97.4%得到JudgeAgent的PASS/UNVERIFIED支持。
4.4 大模型基座对比
固定JudgeAgent(Gemini 2.5 Flash),替换ScoutAgent后端多模态模型,在电子产品&家装数据集对比效果。
表1 ScoutAgent基座模型对比
| VLM基座模型 | 裁判支持率 | 属性覆盖率 | 发布覆盖率 | 相对成本 |
|---|---|---|---|---|
| Gemini 2.5 Flash | 97.4% | 87.8% | 85.5% | 1.00× |
| Gemini 3.5 Flash | 92.7% | 88.3% | 81.9% | 7.21× |
| GP(\mathcal{T})‑5.4 | 87.1% | 84.0% | 73.2% | 1.93× |
| Claude Sonnet 5 | 78.9% | 80.5% | 63.5% | 3.05× |
- Gemini 3.5 Flash抽取覆盖率小幅上涨0.5个百分点,但裁判支持率下降,最终可自动发布覆盖率从85.5%降到81.9%,推理成本提升7倍以上。
- GP(\mathcal{T})‑5.4、Claude Sonnet5可发布覆盖率进一步下降。
错误分析:其他基座的主要问题不是明显幻觉矛盾,而是抽取结果缺少足够证据支撑;集中在需要大量证据的属性,例如包装数量、自由文本描述。说明基座选型不只影响“能不能抽出来”,还影响抽取结果是否满足自动发布证据门槛。
全部实验组JudgeAgent保持不变,属于受控业务行为对比,不是直接等价于人工准确率。
5 部署
(\mathcal{T})RACE上线生产环境,完成4个业务类目合计3100万SKU的目录增强。曝光加权属性增强覆盖率提升90.4%(曝光加权:按消费者商品浏览曝光量统计增强属性占比)。
图2 商品详情页PDP增强前后对比:增强前属性信息埋藏在非结构化文本;(\mathcal{T})RACE结合内部外部数据源生成结构化属性展示。
5.1 用户业务影响
商品详情页PDP是消费者购买决策核心页面。属性缺失会造成信息差,消费者对商品预期和实物不符。假设:PDP展示(\mathcal{T})RACE生成结构化属性,可以缩小信息差,改善购买决策,降低售后问题。
开展为期5周随机A/B测试;90%流量实验组展示增强属性PDP;10%流量对照组保持原有页面。测试衡量完整链路:生成‑核验‑前端展示的端到端业务效果。
表2 线上A/B测试业务指标(相对对照组变化,95%置信区间、p‑value)
| 指标 | 相对变化 | 95%置信区间 | p‑value |
|---|---|---|---|
| 下单转化率 Checkout conversion | +0.48% | [+0.04%, +0.92%] | 0.034 |
| 下单转化率(重度用户) | +1.18% | [+0.24%, +2.12%] | 0.014 |
| 错发/漏发商品上报率 | −1.08% | [−2.04%, −0.13%] | 0.026 |
结果:整体下单转化率提升0.48%;重度用户提升达到1.18%;错发漏发反馈率下降1.08%。印证假设:更完备结构化商品信息帮助消费者建立准确预期,优化购物决策。
6 局限性
- 电子产品、家装类目使用JudgeAgent裁判支持率作为规模化业务指标,不能完全替代人工精度。JudgeAgent在校验集(杂货酒水)完成调优,但跨类目迁移只做有限人工校验。主实验中ScoutAgent、JudgeAgent使用同系列模型,二者可能存在共有的失效模式。
- 线上A/B测试评估整套系统端到端收益,无法单独剥离JudgeAgent、写入闸门策略带来的独立贡献。
7 结论
本文提出(\mathcal{T})RACE多智能体证据锚定商品目录增强框架,将候选生成与证据核验解耦:ScoutAgent聚合多源证据生成候选;JudgeAgent执行更严格证据校验,控制写入目录权限。
跨多个业务类目实验证明(\mathcal{T})RACE可以高质量、工业规模运行;人工标注数据集准确率98.2%。线上随机实验证明:详情页展示增强属性,下单转化率提升0.48%,错漏商品反馈下降。
实验证明基于商品专属证据锚定、写入前核验,既提升目录数据质量,又改善终端用户体验。
生成式AI声明
论文撰写阶段,作者使用生成式AI完成语法拼写检查、文本复述改写;作者完成全部审核修改,对整篇论文内容承担全部责任。
附录A:精简版智能体提示词模板
说明:为排版精简,省略重复描述、本体枚举、SKU原始内容、工具调用schema;尖括号
<>代表每个SKU运行时动态填入字段。(\mathcal{T})RACE每个合格SKU调用1次ScoutAgent,1次JudgeAgent;每次调用返回每个属性的输出映射。
ScoutAgent 精简指令契约
任务:处理单个零售SKU。使用可用证据抽取全部需要的优先属性;证据不足直接放弃输出,不要臆测。
证据优先级(冲突时高优先级覆盖低优先级;网页检索用来填补信息缺口,不是推翻商户目录):
- 商户目录;2. 高质量合作数据源;3. 商品图片;4. 网页检索。
检索规则<SEARCH_\(\mathcal{T}\)OOL>用于解析不充分属性;检索query构造顺序:UPC/G(\mathcal{T})IN/EAN → 品牌+商品名+规格变体 → 型号MPN → 厂商官网 → 属性专项查询。
来源偏好:优先官网、手册;其次大型零售商;普通零售商;聚合网站。禁止博客、论坛、用户评论、UGC内容。
身份匹配规则:使用图片、网页证据前,必须校验品牌、变体、规格、包装数量完全匹配;依靠UPC/型号MPN确认匹配;不使用相近变体证据;来源身份不匹配,该属性标记identity_mismatch。
取值约束:枚举值严格取自给定集合;字符串尽量使用推荐词汇;布尔值输出\(\mathcal{T}\)rue/False。多源合并取值需要每个来源提供独立有效信息。
事实锚定:每一个抽取值输出:取值、来源、来源类型、来源链接、原文证据片段,置信度[0,1];证据尽量引用原文;最多合并3段短原文用于合成字段。
输出严格JSON:
{ "identity":{ "matched_brand":"...", "matched_variant":"...", "matched_size":"...", "matched_pack":"...", "confidence":0.0 }, "attributes":{ "<SLUG>":{ "status":"extracted|not_found|not_applicable|ambiguous|conflict|identity_mismatch", "value":null|"...", "source":["cd","hq","image","web"], "source_type":"catalog|hq|image|official_web|official_doc|major_retailer|retailer|aggregator|other", "source_ref":"...", "quoted_evidence":"...", "confidence":0.0 } } }状态为非extracted时,value设为null,省略溯源、置信度字段。
输入Payload:<PRIORI\(\mathcal{T}\)Y_A\(\mathcal{T}\)\(\mathcal{T}\)RIBU\(\mathcal{T}\)ES>属性标识、定义、示例、数据类型、枚举/推荐词汇、是否多值标记;<SKU_CON\(\mathcal{T}\)EX\(\mathcal{T}\)>商品名称、详情、规格、标识符、品牌、类目;<CA\(\mathcal{T}\)ALOG_EVIDENCE>目录证据;<SYNDICA\(\mathcal{T}\)ED_EVIDENCE>合作数据源证据;<IMAGE>图片。
要求输出全部目标属性SLUG。
JudgeAgent精简指令契约
角色:高精度质量审核员,可调用网页检索。针对单个SKU每一组<属性标识,取值,状态>输出裁决:PASS / FAIL / UNVERIFIED / UNCER\(\mathcal{T}\)AIN。
决策执行顺序:
- 状态为
not_found / not_applicable / ambiguous / conflict / identity_mismatch:合理放弃输出则PASS;如果证据明显可以抽取却放弃,则FAIL标记MISSING_EX\(\mathcal{T}\)RAC\(\mathcal{T}\)ION。 - 如果目录、合作数据源、图片直接支持候选取值 → PASS,无需搜索;直接矛盾 → FAIL标记
CON\(\mathcal{T}\)RADIC\(\mathcal{T}\)ION,无需搜索。 - 如果候选来自网页,现有证据不足:调用
<SEARCH_\(\mathcal{T}\)OOL>;查询构造:品牌+型号MPN+商品名+属性,补充UPC/G(\mathcal{T})IN。严格校验品牌、型号、变体、规格包装;完全匹配商品确认证据 → PASS;完全匹配商品出现矛盾 → FAIL/INCORREC(\mathcal{T})_VALUE;只找到近似变体、通用页面、无结果 → UNVERIFIED。 - 如果目录/合作数据源/图片给出的引用,实际并不支撑候选断言 → FAIL/UNSUPPOR(\mathcal{T})ED_INFERENCE;禁止用网页证据“挽救”内部来源的错误断言。
- 多个完全匹配商品来源出现实质性冲突 → UNCER(\mathcal{T})AIN。
FAIL与UNVERIFIED区分:FAIL必须有明确证据证明断言错误/编造。候选听起来合理、没有反证,但无法针对确切变体确认,输出UNVERIFIED。
归一化规则:布尔同义词、标准技术缩写、等价计量单位视为相同;数值允许2%或者0.5绝对误差内微小舍入。
文本处理:目录、合作数据源引用尽量原文;网页断言要有事实支撑。部分原文只能支持核心主张,后续附加内容缺少证据 → UNVERIFIED;如果无证据附加引入全新事实主张 → FAIL/PAR(\mathcal{T})IAL_EX(\mathcal{T})RAC(\mathcal{T})ION。
FAIL子类型枚举:INCORREC\(\mathcal{T}\)_VALUE, UNSUPPOR\(\mathcal{T}\)ED_INFERENCE, HALLUCINA\(\mathcal{T}\)ION, CON\(\mathcal{T}\)RADIC\(\mathcal{T}\)ION, SCHEMA_MALFORMED, PAR\(\mathcal{T}\)IAL_EX\(\mathcal{T}\)RAC\(\mathcal{T}\)ION, INVALID_FORMA\(\mathcal{T}\), UNSAFE, MISSING_EX\(\mathcal{T}\)RAC\(\mathcal{T}\)ION
输出严格JSON:
{ "verdicts":{ "<SLUG>":{ "verdict":"PASS|FAIL|UNVERIFIED|UNCER\(\mathcal{T}\)AIN", "failure_type":null|"<FAILURE_\(\mathcal{T}\)YPE>", "reasoning":"最多30字", "url":null|"证据链接" } } }输入Payload:<SKU_CON\(\mathcal{T}\)EX\(\mathcal{T}\)>、目录证据、合作数据源证据、图片、<CANDIDA\(\mathcal{T}\)E_VALUES>(ScoutAgent完整属性输出);必须对全部候选输出裁决。