news 2026/8/7 0:39:15

阿里Qwen出手:Skill-RM把奖励模型做成可复用Agent Skill

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
阿里Qwen出手:Skill-RM把奖励模型做成可复用Agent Skill

一句话讲清楚👉🏻阿里巴巴 Qwen 团队提出 Skill-RM ,把异构的奖励评估标准( rubric 、参考答案、 checklist 、 verifier 等)封装成可执行的 Reward-Evaluation Skill ,让 Agent 按需检索资源、收集证据并聚合打分,在 RewardBench2 、 RM-Bench 、 JudgeBench 三项基准上以 Qwen3.5-27B 骨干取得 86.2 平均分,超越同骨干 LLM-as-a-Judge 基线 2.3 分。

  • 论文标题:Skill-RM: Unifying Heterogeneous Evaluation Criteria via Agent Skill
  • 论文链接:https://arxiv.org/abs/2606.03980
  • Github 链接:https://github.com/Qwen-Applications/Skill-RM

一道 JSON 题,暴露 RM 的「拼凑困境」

论文 Figure 1 给了一个极简但典型的判卷场景。 Prompt 要求:写一个normalizeScores(values)函数,返回包含minScoremaxScorenormalizedScores的 JSON 字符串。

两个候选回答摆在一起:

A:用了 snake_case 键名, JSON 结构也不对;

B: camelCase 键名正确,字段齐全。

怎么判?如果只看「像不像好代码」,两个回答都可能骗过浅层 judge 。真正靠谱的评估要同时动用好几类资源:

1.Rubric(代码类任务优先跑测试);

2.Checklist( camelCase 标识符、精确 JSON 键名);

3.Verifier( Python sandbox 执行parse_json检查);

4.Aggregation rule(正确性优先于风格,平局才看次要维度)。

传统 LLM-as-a-Judge 会把上述内容全塞进一个 prompt ,让模型自己琢磨先看哪条、后看哪条。 Skill-RM 换了个思路:把这些资源写进 Reward-Evaluation Skill ,按固定流程「诊断 → 选资源 → 验证 → 聚合」走一遍。论文示例轨迹里, A 得 2/5 , B 得 5/5 ,最终选 B——每一步证据都挂在结构化输出里,事后能复查。

这个例子虽小,却点中了当下 RM 的核心矛盾:评估标准已经碎片化,编排层却还停留在 flat prompting

背景: RM 从「打分器」变成「多源验证器」

做过 RLHF 管线的人大概都踩过坑:训练用的 reward 信号,和线上用户真实偏好经常对不上。数学题步骤全对、答案错一位,标量 RM 仍可能给高分;代码能跑通、变量命名违规, flat judge 有时又过度纠结风格。

大模型后训练里, Reward Model ( RM )是 RLHF 、 RFT 、 GRPO 等流程的「方向盘」。早期范式是点式标量预测,优化目标为

是 prompt , 是回答, 输出一个数。简单、快,但信息损失大。

模型能力往推理、代码、工具调用方向扩张后,「怎么判好坏」也跟着变复杂:

■数学题要对答案、跑 verifier ;

■代码题要过单元测试;

■安全场景要拆约束、做 policy veto ;

■事实类问题要查 reference 、检索证据;

■Agent 轨迹要逐步校验 tool call 合法性。

信号来源各异,现有设计却缺统一编排。标量 RM 把多维证据压成不透明分数; LLM-as-a-Judge 能写理由,但资源选择、证据追踪、信号聚合往往藏在模型「直觉」里,难复现。 rubric 条件化、工具增强 judge 等方向各有进展,大多一次只暴露一种资源模态——缺的是可复用、可编排、证据可追溯的抽象层。

Agent Skill 范式为何能迁移到 RM ?

Anthropic 的 Agent Skills 、开源 agentskills.io 规范,把「怎么做一类任务」打包成文件系统制品:核心是SKILL.md(流程 + 元数据),旁边挂脚本、参考文档、可执行资源, Agent 按需渐进式加载。

奖励评估和 Agent 做任务,底层逻辑很像:都要在多种工具/文档里选对资源、按步骤执行、留下可复查记录。 Anthropic 的 Skill 把这类流程固化成文件; Skill-RM 把它专门用到「怎么给模型回答打分」。

论文把资源库分成五类,每类在判卷链路里各司其职:

资源类型例子作用
Rubric & Criterion有用性、正确性、安全定义评判维度与优先级
Reference答案键、证据段落支撑事实/数学正确性
Checklist & Constraint格式要求、禁止行为把指令遵循拆成可检查项
Verifier & ToolPython sandbox产出可执行观测
Calibration & Aggregation证据优先级规则解决冲突、映射到最终判断

Skill-RM 的核心动作:把奖励知识外化成Reward-Evaluation Skill——带资源库、调用协议、证据 schema 的可执行评估程序,相当于给 judge 一份「判卷说明书」加「工具箱」。

Skill-RM 总览: Reward-Evaluation Skill 含流程文档与结构化资源库,评估时动态检索 rubric 、 verifier 等资源,产出可追溯的 Agentic 评估轨迹。

三步走: Skill-RM 实际怎么判一道题?

把形式化定义翻译成工程语言,流程可以压成三步。

第一步,加载 Skill 规格。 类似读SKILL.md:这次要评哪些准则?输出格式是点式分数、成对偏好,还是从 个候选里选一个?论文把 Skill 记为 —— 是说明书, 是工具箱。

第二步,按协议收集证据。 Agentic judge 逐步执行:列出可用资源 → 检视 rubric → 调 verifier → 填 checklist 。每激活一条准则 ,就记一条证据 : 是观测(比如 sandbox 返回parse_json: pass), 是局部判定(满足/违反/不确定)。所有证据汇总成 , 是最终结论字段。

第三步,确定性读出奖励。 读出函数 从完整轨迹 映射到任务所需输出: 给标量, 给最优候选编号, 即成对偏好。点式 RM 、 pairwise RM 、 rubric 聚合 RM 被收进同一套 Skill 执行范式——差别只在最后一步怎么读 。

关键设计是渐进式披露:资源默认潜伏, Skill 规格触发才加载。 flat prompt 把整库资源一次性倒给 judge ,上下文噪声会把关键信号淹没——后面消融实验会验证这一点。

资源库本身通过 LLM 辅助策展:从文献、 benchmark 文档、可验证评估实践里聚合候选,去重、泛化、版本冻结。论文 Appendix 列了 6 类通用资源( helpfulness rubric 、 math answer-first rubric 、 code test-first rubric 、 safety bounded-help rubric 、 JSON format checklist 、 evidence priority aggregation rule )加样本级扩展接口。

实验:同骨干对比才是硬指标

RewardBench2 / RM-Bench / JudgeBench 主结果

论文在三大 RM benchmark 上对比了标量 RM 、生成式 RM 、 rubric 系统、 agentic judge 等基线。外行看榜单容易被 MoE 大模型分数吸引,内行应盯同骨干 Qwen3.5-27B

方法RewardBench2RM-BenchJudgeBench平均
GPT-4o Judge64.973.159.865.9
Skywork-Reward-V2-Llama-3.1-8B84.192.880.085.6
Qwen3.5-27B Judge81.189.880.883.9
RewardAgent (Qwen3.5-27B)82.080.566.376.3
Skill-RM (Qwen3.5-27B)85.091.582.186.2

同骨干下, Skill-RM 三项全涨,平均从 83.9 提到 86.2 (+2.3 )。 RewardBench2 和 RM-Bench 拿到完整行最高; JudgeBench 上 122B MoE 变体冲到 85.2 , 27B 版 82.1 也已超过同骨干 judge 的 80.8 。

三大 benchmark 完整对比;加粗为最高、下划线为次高。 Skill-RM (Qwen3.5-27B) 平均 86.2 为完整行第一。

和 TIR-Judge-Zero ( agentic verifier judge ,平均 76.4 )比, Skill-RM 的优势在统一编排多种资源,而不只是挂一个 Python 执行器。和 OpenRubrics 、 Auto-Rubric 等 rubric 系统比, Skill-RM 能同时调度 rubric 、 reference 、 verifier 、聚合规则,不必为每种任务单独改 prompt 模板。

挂载样本级资源: RL 场景的关键增益

标准 benchmark 通常只给 prompt 和候选回答。真实 RL 管线里, per-sample 的 reference 、约束、 verifier 输出经常可用。 Skill-RM 通过 Skill 接口挂载这些sample-specific资源:

方法RewardBench2RM-BenchJudgeBench平均
Qwen3.5-27B Judge81.189.880.883.9
OpenRS + sample-spec.84.087.593.188.2
Skill-RM85.091.582.186.2
Skill-RM + sample-spec.86.091.589.789.1

OpenRS 在 JudgeBench 上冲到 93.1 (定制评估协议),但同骨干平均最高仍是 Skill-RM + sample-spec. 的 89.1。无样本资源时 Skill-RM 已 +2.3 ;挂上样本资源后再 +2.9 ,说明 Skill 接口对 RL 下游价值更大。

消融: append 资源反而降分

这篇论文最有启发的一行数据在这里:

方法平均Δ
Baseline (Qwen3.5-27B Judge)83.90.0
+ appended resources81.0-2.9
+ appended + sample-spec.82.0-1.9
+ Python tool83.6-0.3
Skill-RM86.2+2.3
Skill-RM + sample-spec.89.1+5.2

把 reference 和 verifier 直接粘进 prompt ,平均分从 83.9 掉到 81.0 。 append 模式下 judge 同时看到 rubric 、 checklist 、 verifier 说明,却缺少 Skill 协议规定的「先诊断再选资源」顺序,关键信号(如 sandbox 的 parse_json 结果)容易被长 prompt 稀释——这和渐进式披露的设计正好相反。单独给 Python 工具也几乎没增益( 83.6 )。2.3 分的提升,更像是编排赢了,而不是资源变多了

论文还在 GPT-4o 、 Claude-3.5-Sonnet 、 DeepSeek-V3 等多个骨干上做了补充实验( Appendix Table 8 ),趋势一致: Skill-RM 相对同骨干 flat judge 均有正向提升,说明机制不绑死 Qwen 一家。

Best-of-N 重排:哪里赚、哪里还难

JETTS 固定池实验用 Qwen2.5-72B-Instruct 生成 10 个候选,比较重排质量(和生成能力无关)。 Baseline 和 Skill-RM 走相同 sequential pairwise knockout ; Skywork-Reward-V2-Qwen3-8B 独立打分选最高。

GSM8K: Skill-RM 97.8 , Oracle@10 上界 97.9 , Baseline 97.7——数学近乎饱和, Skill 只是把最后 0.1 抠出来;

IFEval 、 HumanEval+: Skill-RM 明显超过 Baseline 和 Skywork ,指令遵循和代码场景收益最实在;

BigCodeBench: Skill-RM 有正向提升,但距 Oracle 仍有明显差距,复杂代码任务的重排仍是短板。

如果你在工程里做采样解码 + Best-of-N, IFEval 和 HumanEval+ 值得优先加 Skill-RM 式重排层; BigCodeBench 这类复杂代码任务,单靠 judge 重排很难贴近 Oracle@10 上界。

指令遵循 RL :能当奖励源吗?

IF-RewardBench 排序

Kendall 相关( overall assessment ):

方法Single-TurnMulti-TurnSystem-Prompt平均
Gemini-3-Flash0.5890.4600.4890.513
Qwen3.5-27B0.5070.4400.2870.411
Skywork-V2-Llama3.1-8B0.1530.2050.0390.133
Skill-RM0.6190.5400.4130.524

标量 RM ( Skywork 平均 0.133 )在 IF 场景几乎失灵; Skill-RM 平均 0.524 最高, Single-Turn ( 0.619 )和 Multi-Turn ( 0.540 )拉满。 System-Prompt 子集 0.413 ,仍落后 Gemini-3-Flash 的 0.489——长系统提示是指令遵循 judge 的硬骨头,后续 Skill 扩展值得盯。

VerInstruct + GRPO 下游训练

方法IFEvalIFBenchAdvancedIF平均
Tulu 382.627.625.045.1
VerIF83.727.622.844.7
Skill-RM84.827.625.445.9

VerIF 是最接近的对照(同样用 VerInstruct + GRPO )。 Skill-RM 平均 45.9 最高, IFEval +1.1 、 AdvancedIF +2.6 , IFBench 持平 27.6 。增幅不大,但方向正确——Skill-RM 可以端到端接入 RL 奖励链路,而不只是离线 benchmark 刷分。

和 TIR-Judge 、 OpenRS 差在哪?

快速对照三条代表性路线:

TIR-Judge-Zero:给 judge 挂 Python 执行器,让模型写代码验证答案。强项是 verifiable 任务,弱项是资源类型单一——rubrics 、 checklists 、聚合规则仍靠 prompt 硬塞。

OpenRS:样本级资源做得深, JudgeBench 上样本资源挂载后极强( 93.1 )。代价是评估协议定制程度高,跨任务泛化要单独适配。

Skill-RM:用 Skill 抽象统一调度所有资源类型,默认协议下就能涨分,挂载样本资源后进一步拉升。 trade-off 是推理开销:多步 Agentic 轨迹比单次标量 RM 慢,论文也承认需要 early stopping 、证据缓存、 artifact 剪枝来控成本。

局限:三件事还没解决

作者列了三条边界:

1.评估范围以文本 IF 和标准 RM benchmark 为主,多模态、长程 Agent 、主观偏好待扩展;

2.Skill 靠人工策展,自动化构建与持续更新是开放题;

3.推理成本高于标量 RM ,生产环境要算 ROI——Best-of-N 重排可能划算,每 token 在线 RL 奖励可能要慎重。

RM 竞争正在转向「评估基础设施」

Skill-RM 本质是把 agentskills.io 那套「说明书 + 工具箱」搬进判卷:同一骨干 Qwen3.5-27B 上,编排式 Skill 比 flat judge 平均高 2.3 分, append 资源反而掉 2.9 分——说明问题在流程,不在堆料。对齐训练要的是稳定、可审计的奖励信号; flat prompt 每次让 judge 从零决定资源用法,复现性和透明度都吃亏。

几条工程建议,基于论文数据而非空泛展望:

■RL 管线里已有 reference / verifier 的,试试封装成 Skill 式接口,别直接 append 进 prompt——消融已经证明会降分;

■采样解码后加 Best-of-N 重排, IFEval / HumanEval+ 收益明确;

■System-Prompt 长上下文场景仍是弱点,值得单独扩 Skill 资源库;

■上线前算清楚延迟: Agentic 多步评估的 token 开销,能不能被 Best-of-N 的质量增益覆盖。

开源仓库 https://github.com/Qwen-Applications/Skill-RM 已放出。 Qwen 应用团队这条线如果和 Qwen3.5 训练栈深度整合,有机会成为开源对齐方案里「可编排奖励」方向的标杆实现。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/7 0:23:07

GridPlayer多视频网格播放器:让4个视频同时播放变得如此简单!

GridPlayer多视频网格播放器:让4个视频同时播放变得如此简单! 【免费下载链接】gridplayer Play videos side-by-side 项目地址: https://gitcode.com/gh_mirrors/gr/gridplayer 你是否曾经需要在同一个屏幕上同时观看多个视频?无论是…

作者头像 李华
网站建设 2026/8/7 0:18:55

耦合电感引脚编号不同,能直接改吗?

耦合电感引脚编号不同,能直接改吗?在对比两款四引脚耦合电感时,经常会遇到一种情况:外形、焊盘位置和绕组结构看起来相同,但规格书中的引脚编号却不一样。这是否意味着产品不能替换?答案是:不一…

作者头像 李华
网站建设 2026/8/7 0:14:37

播客转文字工具哪家好用?通勤播客一键变结构化笔记

如果你每天通勤都在听播客,却不记得上周听了什么,问题不在你记性差,而在播客这个形式留不下东西。 翻出几款能把播客转成文字的工具实测了一轮,我将逐个拆开讲,末尾有决策建议。 通勤播客为什么总要转成文字 通勤路上听…

作者头像 李华
网站建设 2026/8/7 0:14:06

科创综评怎么积累?普通学生也能轻松拿捏科创素材

科创综评怎么积累?普通学生也能轻松拿捏科创素材多数家长和学生认为科创实践难度极高,需要专业知识、科创天赋与高阶奖项,普通学生无法积累科创综评素材,导致科创板块长期空白,错失大量综评加分机会。其实中小学科创综…

作者头像 李华
网站建设 2026/8/7 0:00:49

2026社区团购订货小程序推荐:团长每天收单混乱时该选哪类系统

今天给大家带来2026社区团购订货小程序推荐:团长每天收单混乱时该选哪类系统。据中国物流与采购联合会披露,2026年上半年,我国农产品与食材消费市场规模约为4.68万亿元,同比增长2.02%;国家统计局数据显示,1…

作者头像 李华