一句话讲清楚👉🏻阿里巴巴 Qwen 团队提出 Skill-RM ,把异构的奖励评估标准( rubric 、参考答案、 checklist 、 verifier 等)封装成可执行的 Reward-Evaluation Skill ,让 Agent 按需检索资源、收集证据并聚合打分,在 RewardBench2 、 RM-Bench 、 JudgeBench 三项基准上以 Qwen3.5-27B 骨干取得 86.2 平均分,超越同骨干 LLM-as-a-Judge 基线 2.3 分。
- 论文标题:Skill-RM: Unifying Heterogeneous Evaluation Criteria via Agent Skill
- 论文链接:https://arxiv.org/abs/2606.03980
- Github 链接:https://github.com/Qwen-Applications/Skill-RM
一道 JSON 题,暴露 RM 的「拼凑困境」
论文 Figure 1 给了一个极简但典型的判卷场景。 Prompt 要求:写一个normalizeScores(values)函数,返回包含minScore、maxScore、normalizedScores的 JSON 字符串。
两个候选回答摆在一起:
■A:用了 snake_case 键名, JSON 结构也不对;
■B: camelCase 键名正确,字段齐全。
怎么判?如果只看「像不像好代码」,两个回答都可能骗过浅层 judge 。真正靠谱的评估要同时动用好几类资源:
1.Rubric(代码类任务优先跑测试);
2.Checklist( camelCase 标识符、精确 JSON 键名);
3.Verifier( Python sandbox 执行parse_json检查);
4.Aggregation rule(正确性优先于风格,平局才看次要维度)。
传统 LLM-as-a-Judge 会把上述内容全塞进一个 prompt ,让模型自己琢磨先看哪条、后看哪条。 Skill-RM 换了个思路:把这些资源写进 Reward-Evaluation Skill ,按固定流程「诊断 → 选资源 → 验证 → 聚合」走一遍。论文示例轨迹里, A 得 2/5 , B 得 5/5 ,最终选 B——每一步证据都挂在结构化输出里,事后能复查。
这个例子虽小,却点中了当下 RM 的核心矛盾:评估标准已经碎片化,编排层却还停留在 flat prompting。
背景: RM 从「打分器」变成「多源验证器」
做过 RLHF 管线的人大概都踩过坑:训练用的 reward 信号,和线上用户真实偏好经常对不上。数学题步骤全对、答案错一位,标量 RM 仍可能给高分;代码能跑通、变量命名违规, flat judge 有时又过度纠结风格。
大模型后训练里, Reward Model ( RM )是 RLHF 、 RFT 、 GRPO 等流程的「方向盘」。早期范式是点式标量预测,优化目标为
是 prompt , 是回答, 输出一个数。简单、快,但信息损失大。
模型能力往推理、代码、工具调用方向扩张后,「怎么判好坏」也跟着变复杂:
■数学题要对答案、跑 verifier ;
■代码题要过单元测试;
■安全场景要拆约束、做 policy veto ;
■事实类问题要查 reference 、检索证据;
■Agent 轨迹要逐步校验 tool call 合法性。
信号来源各异,现有设计却缺统一编排。标量 RM 把多维证据压成不透明分数; LLM-as-a-Judge 能写理由,但资源选择、证据追踪、信号聚合往往藏在模型「直觉」里,难复现。 rubric 条件化、工具增强 judge 等方向各有进展,大多一次只暴露一种资源模态——缺的是可复用、可编排、证据可追溯的抽象层。
Agent Skill 范式为何能迁移到 RM ?
Anthropic 的 Agent Skills 、开源 agentskills.io 规范,把「怎么做一类任务」打包成文件系统制品:核心是SKILL.md(流程 + 元数据),旁边挂脚本、参考文档、可执行资源, Agent 按需渐进式加载。
奖励评估和 Agent 做任务,底层逻辑很像:都要在多种工具/文档里选对资源、按步骤执行、留下可复查记录。 Anthropic 的 Skill 把这类流程固化成文件; Skill-RM 把它专门用到「怎么给模型回答打分」。
论文把资源库分成五类,每类在判卷链路里各司其职:
| 资源类型 | 例子 | 作用 |
|---|---|---|
| Rubric & Criterion | 有用性、正确性、安全 | 定义评判维度与优先级 |
| Reference | 答案键、证据段落 | 支撑事实/数学正确性 |
| Checklist & Constraint | 格式要求、禁止行为 | 把指令遵循拆成可检查项 |
| Verifier & Tool | Python sandbox | 产出可执行观测 |
| Calibration & Aggregation | 证据优先级规则 | 解决冲突、映射到最终判断 |
Skill-RM 的核心动作:把奖励知识外化成Reward-Evaluation Skill——带资源库、调用协议、证据 schema 的可执行评估程序,相当于给 judge 一份「判卷说明书」加「工具箱」。
Skill-RM 总览: Reward-Evaluation Skill 含流程文档与结构化资源库,评估时动态检索 rubric 、 verifier 等资源,产出可追溯的 Agentic 评估轨迹。
三步走: Skill-RM 实际怎么判一道题?
把形式化定义翻译成工程语言,流程可以压成三步。
第一步,加载 Skill 规格。 类似读SKILL.md:这次要评哪些准则?输出格式是点式分数、成对偏好,还是从 个候选里选一个?论文把 Skill 记为 —— 是说明书, 是工具箱。
第二步,按协议收集证据。 Agentic judge 逐步执行:列出可用资源 → 检视 rubric → 调 verifier → 填 checklist 。每激活一条准则 ,就记一条证据 : 是观测(比如 sandbox 返回parse_json: pass), 是局部判定(满足/违反/不确定)。所有证据汇总成 , 是最终结论字段。
第三步,确定性读出奖励。 读出函数 从完整轨迹 映射到任务所需输出: 给标量, 给最优候选编号, 即成对偏好。点式 RM 、 pairwise RM 、 rubric 聚合 RM 被收进同一套 Skill 执行范式——差别只在最后一步怎么读 。
关键设计是渐进式披露:资源默认潜伏, Skill 规格触发才加载。 flat prompt 把整库资源一次性倒给 judge ,上下文噪声会把关键信号淹没——后面消融实验会验证这一点。
资源库本身通过 LLM 辅助策展:从文献、 benchmark 文档、可验证评估实践里聚合候选,去重、泛化、版本冻结。论文 Appendix 列了 6 类通用资源( helpfulness rubric 、 math answer-first rubric 、 code test-first rubric 、 safety bounded-help rubric 、 JSON format checklist 、 evidence priority aggregation rule )加样本级扩展接口。
实验:同骨干对比才是硬指标
RewardBench2 / RM-Bench / JudgeBench 主结果
论文在三大 RM benchmark 上对比了标量 RM 、生成式 RM 、 rubric 系统、 agentic judge 等基线。外行看榜单容易被 MoE 大模型分数吸引,内行应盯同骨干 Qwen3.5-27B:
| 方法 | RewardBench2 | RM-Bench | JudgeBench | 平均 |
|---|---|---|---|---|
| GPT-4o Judge | 64.9 | 73.1 | 59.8 | 65.9 |
| Skywork-Reward-V2-Llama-3.1-8B | 84.1 | 92.8 | 80.0 | 85.6 |
| Qwen3.5-27B Judge | 81.1 | 89.8 | 80.8 | 83.9 |
| RewardAgent (Qwen3.5-27B) | 82.0 | 80.5 | 66.3 | 76.3 |
| Skill-RM (Qwen3.5-27B) | 85.0 | 91.5 | 82.1 | 86.2 |
同骨干下, Skill-RM 三项全涨,平均从 83.9 提到 86.2 (+2.3 )。 RewardBench2 和 RM-Bench 拿到完整行最高; JudgeBench 上 122B MoE 变体冲到 85.2 , 27B 版 82.1 也已超过同骨干 judge 的 80.8 。
三大 benchmark 完整对比;加粗为最高、下划线为次高。 Skill-RM (Qwen3.5-27B) 平均 86.2 为完整行第一。
和 TIR-Judge-Zero ( agentic verifier judge ,平均 76.4 )比, Skill-RM 的优势在统一编排多种资源,而不只是挂一个 Python 执行器。和 OpenRubrics 、 Auto-Rubric 等 rubric 系统比, Skill-RM 能同时调度 rubric 、 reference 、 verifier 、聚合规则,不必为每种任务单独改 prompt 模板。
挂载样本级资源: RL 场景的关键增益
标准 benchmark 通常只给 prompt 和候选回答。真实 RL 管线里, per-sample 的 reference 、约束、 verifier 输出经常可用。 Skill-RM 通过 Skill 接口挂载这些sample-specific资源:
| 方法 | RewardBench2 | RM-Bench | JudgeBench | 平均 |
|---|---|---|---|---|
| Qwen3.5-27B Judge | 81.1 | 89.8 | 80.8 | 83.9 |
| OpenRS + sample-spec. | 84.0 | 87.5 | 93.1 | 88.2 |
| Skill-RM | 85.0 | 91.5 | 82.1 | 86.2 |
| Skill-RM + sample-spec. | 86.0 | 91.5 | 89.7 | 89.1 |
OpenRS 在 JudgeBench 上冲到 93.1 (定制评估协议),但同骨干平均最高仍是 Skill-RM + sample-spec. 的 89.1。无样本资源时 Skill-RM 已 +2.3 ;挂上样本资源后再 +2.9 ,说明 Skill 接口对 RL 下游价值更大。
消融: append 资源反而降分
这篇论文最有启发的一行数据在这里:
| 方法 | 平均 | Δ |
|---|---|---|
| Baseline (Qwen3.5-27B Judge) | 83.9 | 0.0 |
| + appended resources | 81.0 | -2.9 |
| + appended + sample-spec. | 82.0 | -1.9 |
| + Python tool | 83.6 | -0.3 |
| Skill-RM | 86.2 | +2.3 |
| Skill-RM + sample-spec. | 89.1 | +5.2 |
把 reference 和 verifier 直接粘进 prompt ,平均分从 83.9 掉到 81.0 。 append 模式下 judge 同时看到 rubric 、 checklist 、 verifier 说明,却缺少 Skill 协议规定的「先诊断再选资源」顺序,关键信号(如 sandbox 的 parse_json 结果)容易被长 prompt 稀释——这和渐进式披露的设计正好相反。单独给 Python 工具也几乎没增益( 83.6 )。2.3 分的提升,更像是编排赢了,而不是资源变多了。
论文还在 GPT-4o 、 Claude-3.5-Sonnet 、 DeepSeek-V3 等多个骨干上做了补充实验( Appendix Table 8 ),趋势一致: Skill-RM 相对同骨干 flat judge 均有正向提升,说明机制不绑死 Qwen 一家。
Best-of-N 重排:哪里赚、哪里还难
JETTS 固定池实验用 Qwen2.5-72B-Instruct 生成 10 个候选,比较重排质量(和生成能力无关)。 Baseline 和 Skill-RM 走相同 sequential pairwise knockout ; Skywork-Reward-V2-Qwen3-8B 独立打分选最高。
■GSM8K: Skill-RM 97.8 , Oracle@10 上界 97.9 , Baseline 97.7——数学近乎饱和, Skill 只是把最后 0.1 抠出来;
■IFEval 、 HumanEval+: Skill-RM 明显超过 Baseline 和 Skywork ,指令遵循和代码场景收益最实在;
■BigCodeBench: Skill-RM 有正向提升,但距 Oracle 仍有明显差距,复杂代码任务的重排仍是短板。
如果你在工程里做采样解码 + Best-of-N, IFEval 和 HumanEval+ 值得优先加 Skill-RM 式重排层; BigCodeBench 这类复杂代码任务,单靠 judge 重排很难贴近 Oracle@10 上界。
指令遵循 RL :能当奖励源吗?
IF-RewardBench 排序
Kendall 相关( overall assessment ):
| 方法 | Single-Turn | Multi-Turn | System-Prompt | 平均 |
|---|---|---|---|---|
| Gemini-3-Flash | 0.589 | 0.460 | 0.489 | 0.513 |
| Qwen3.5-27B | 0.507 | 0.440 | 0.287 | 0.411 |
| Skywork-V2-Llama3.1-8B | 0.153 | 0.205 | 0.039 | 0.133 |
| Skill-RM | 0.619 | 0.540 | 0.413 | 0.524 |
标量 RM ( Skywork 平均 0.133 )在 IF 场景几乎失灵; Skill-RM 平均 0.524 最高, Single-Turn ( 0.619 )和 Multi-Turn ( 0.540 )拉满。 System-Prompt 子集 0.413 ,仍落后 Gemini-3-Flash 的 0.489——长系统提示是指令遵循 judge 的硬骨头,后续 Skill 扩展值得盯。
VerInstruct + GRPO 下游训练
| 方法 | IFEval | IFBench | AdvancedIF | 平均 |
|---|---|---|---|---|
| Tulu 3 | 82.6 | 27.6 | 25.0 | 45.1 |
| VerIF | 83.7 | 27.6 | 22.8 | 44.7 |
| Skill-RM | 84.8 | 27.6 | 25.4 | 45.9 |
VerIF 是最接近的对照(同样用 VerInstruct + GRPO )。 Skill-RM 平均 45.9 最高, IFEval +1.1 、 AdvancedIF +2.6 , IFBench 持平 27.6 。增幅不大,但方向正确——Skill-RM 可以端到端接入 RL 奖励链路,而不只是离线 benchmark 刷分。
和 TIR-Judge 、 OpenRS 差在哪?
快速对照三条代表性路线:
TIR-Judge-Zero:给 judge 挂 Python 执行器,让模型写代码验证答案。强项是 verifiable 任务,弱项是资源类型单一——rubrics 、 checklists 、聚合规则仍靠 prompt 硬塞。
OpenRS:样本级资源做得深, JudgeBench 上样本资源挂载后极强( 93.1 )。代价是评估协议定制程度高,跨任务泛化要单独适配。
Skill-RM:用 Skill 抽象统一调度所有资源类型,默认协议下就能涨分,挂载样本资源后进一步拉升。 trade-off 是推理开销:多步 Agentic 轨迹比单次标量 RM 慢,论文也承认需要 early stopping 、证据缓存、 artifact 剪枝来控成本。
局限:三件事还没解决
作者列了三条边界:
1.评估范围以文本 IF 和标准 RM benchmark 为主,多模态、长程 Agent 、主观偏好待扩展;
2.Skill 靠人工策展,自动化构建与持续更新是开放题;
3.推理成本高于标量 RM ,生产环境要算 ROI——Best-of-N 重排可能划算,每 token 在线 RL 奖励可能要慎重。
RM 竞争正在转向「评估基础设施」
Skill-RM 本质是把 agentskills.io 那套「说明书 + 工具箱」搬进判卷:同一骨干 Qwen3.5-27B 上,编排式 Skill 比 flat judge 平均高 2.3 分, append 资源反而掉 2.9 分——说明问题在流程,不在堆料。对齐训练要的是稳定、可审计的奖励信号; flat prompt 每次让 judge 从零决定资源用法,复现性和透明度都吃亏。
几条工程建议,基于论文数据而非空泛展望:
■RL 管线里已有 reference / verifier 的,试试封装成 Skill 式接口,别直接 append 进 prompt——消融已经证明会降分;
■采样解码后加 Best-of-N 重排, IFEval / HumanEval+ 收益明确;
■System-Prompt 长上下文场景仍是弱点,值得单独扩 Skill 资源库;
■上线前算清楚延迟: Agentic 多步评估的 token 开销,能不能被 Best-of-N 的质量增益覆盖。
开源仓库 https://github.com/Qwen-Applications/Skill-RM 已放出。 Qwen 应用团队这条线如果和 Qwen3.5 训练栈深度整合,有机会成为开源对齐方案里「可编排奖励」方向的标杆实现。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~