1 常用的Reward类型
1.1 基于人类/模型偏好的奖励
- 代表方法:Bradley-Terry Model, DPO/IPD 隐式奖励
- 工作原理:收集(yw,yl)(y_w, y_l)(yw,yl)偏好对(ywy_wyw为优选回复,yly_lyl为劣选回复),训练一个 Reward Model 来拟合人类的偏好。在 PPO 等算法中,该 RM 的输出即为奖励信号。
- 优点:
- 捕捉复杂、难以形式化的人类价值观(如幽默感、同理心)。
- 避免了绝对分数标注的困难(排序比打分容易)。
- 缺点:
- Reward Hacking 重灾区:模型容易学会迎合 Reward Model 的偏见而非真实意图(如冗长偏差、格式讨好)。
- 分布外泛化差:RM 在训练数据之外的区域可能给出荒谬的高分。
- 成本高昂:需要持续的人工标注或高质量 Judge Model。
1.2 Rubric-based Rewards(LLM-as-Judge)
- 工作原理:预先定义包含多个维度(如准确性、完整性、安全性、语气)的评分细则,每个维度有明确的等级描述(如1-5分及对应标准)。Judge Model 根据 Rubric 逐条打分并给出理由,最终加权汇总为奖励信号。
- 相比纯偏好奖励的优势:
- 可解释性强:模型知道“为什么得分/扣分”,而非仅得到一个标量分数。
- 细粒度控制:可针对特定维度(如“减少废话”)单独优化,避免全局偏好模型的耦合问题。
- 局限性:
- LLM-as-Judge 本身就是 Hacking 来源:Judge Model 可能被策略性输出欺骗,给出符合量规字面意思但实质错误的高分。
- 高方差:奖励信号可能被高方差淹没。
- 设计成本高:高质量 Rubric 需要领域专家反复迭代验证。
1.3 可验证奖励 (Verifiable Rewards / RLVR)
- 适用场景:数学、代码、逻辑推理、事实核查等有明确 Ground Truth 的任务,用规则而非LLM来判断结果对不对。
- 工作原理:
- 数学任务:最终答案精确匹配或符号验证。
- 代码任务:运行代码测试,根据结果,Pass=1, Fail=0。
- 相比 Rubric/RM 的核心优势:
- 真正抗 Reward Hacking:编译器/验证器不会被输出欺骗,奖励信号与任务真实目标完全一致。
- 无噪声:验证结果确定,训练更稳定,收敛更快。
- 局限性:
- 需要准确设计verifier,仅适用于可验证任务,无法覆盖开放式任务,对于不同任务需要设计不同的verifier
2 RLPR: Extrapolating RLVR to General Domains without Verifiers
- RLPR是从另一个角度出发设计的,把模型对答案输出打分的prob作为reward信号,这样无需每个任务单独设计verifier,也不需要LLM-as-judge的方式
- 尤其适合例如deep search这种场景答案形式可能存在多个的情况(例如某个问题的答案既可以是马斯克,也可以是埃隆马斯克,它们指向是一样的),使用RLPR的方式,是正确答案的情况下prob的概率高,错误答案时prob的概率低,无需做穷举
2.1 基本思想
基于一个核心观察:LLM 生成正确答案的原生概率,可以直接反映模型内部对推理质量的评判。在RLPR 中,使用标准答案的逐 token decoding probability 作为 reward signal。
现有很多 RLVR 方法依赖领域专用,搭建这类验证器需要大量人工启发式规则与工程成本;而 RLPR 的 reward 计算仅依赖 policy model 自身:
设问题QQQ对应的一条输出响应o=(o0,⋯ ,oN)o = (o_0, \cdots, o_N)o=(o0,⋯,oN),oio_ioi代表响应内单个 token。
执行概率提取流程:
- 从完整序列ooo中拆分出模型生成答案yyy,剩余文本为推理过程zzz;
- 构造改造序列o′=(o0′,⋯ ,oN′′)o' = (o'_0, \cdots, o'_{N'})o′=(o0′,⋯,oN′′):把模型生成答案yyy替换成训练集标准参考答案y∗y^*y∗;
- 将o′o'o′输入 policy model,得到序列概率(p0,⋯ ,pN′)(p_0, \cdots, p_{N'})(p0,⋯,pN′);
- 序列 reward 计算公式:
r=fseq({pi∣oi′∈y∗})(2) r = f_{\text{seq}}(\{p_i | o'_i \in y^*\}) \tag{2}r=fseq({pi∣oi′∈y∗})(2)
fseqf_{\text{seq}}fseq的作用是把多个逐 token probability 聚合为单个标量 reward。
如果选用序列似然(归一化概率乘积)fseq=∏pnf_{\text{seq}}=\sqrt[n]{\prod p}fseq=n∏p,虽然能够表征参考答案整体生成概率,但存在方差过高、对同义词、微小token波动极度敏感的缺陷。
举例:token概率序列(0.01,0.7,0.9)(0.01, 0.7, 0.9)(0.01,0.7,0.9)和(0.05,0.7,0.9)(0.05, 0.7, 0.9)(0.05,0.7,0.9),仅首token存在小幅差异,乘积形式下得分差距巨大。
为此 RLPR 改用token均值:
fseq=1∣y∗∣∑pi f_{\text{seq}} = \frac{1}{|y^*|}\sum p_ifseq=∣y∗∣1∑pi
均值聚合得到更鲁棒的 reward signal,与答案质量相关性更强。
该概率奖励具备直观特性:当模型输出答案yyy和参考答案语义接近时,获得高 reward;反之 reward 偏低。
2.2 Reward Debiasing
虽然基于概率的 reward 和响应质量具备强相关性,但结果会被多种隐变量干扰。
将概率奖励rrr的来源记作UrU_rUr,做隐因子分解:
Ur=Uz+Uothers(3) U_r = U_z + U_{\text{others}} \tag{3}Ur=Uz+Uothers(3)
- UzU_zUz:推理内容zzz带来的影响;
- UothersU_{\text{others}}Uothers:问题、参考答案等其余外部因素带来的干扰。
直接使用原始rrr作为 reward,会引入UothersU_{\text{others}}Uothers带来的偏差,损害奖励有效性。
RLPR 的去偏方案:不经过中间推理zzz,直接让模型解码参考答案y∗y^*y∗,算出基准分数r′r'r′。
可以认为Uz≈Ur−r′U_z \approx U_r - r'Uz≈Ur−r′,最终去偏概率奖励:
r^=clip(0,1, r−r′)(4) \hat{r} = \text{\(\text{clip}\)}(0, 1,\ r - r') \tag{4}r^=clip(0,1,r−r′)(4)
clip\text{\(\text{clip}\)}clip限制 reward 落在(0,1)区间。该形式剔除了问题UQU_QUQ、参考答案Uy∗U_{y^*}Uy∗的固有偏差。
2.3 Standard Deviation Filtering
传统 RLVR在Rollout时会过滤掉过难、过简单的样本,只保留中等难度样本稳定训练,做法是剔除全部正确/全部错误的样本(例如DAPO和DUPO中)。但 RLPR 的 reward 是连续值,无法直接套用基于二元对错的过滤方式,很难设定通用阈值区分样本好坏。
通过分析精度过滤机制,RLPR 提出替代方案:过滤 reward 标准差过低的prompt。PR reward 被约束在 (0,1),如果一个样本所有Rollout输出全部高分 / 全部低分,分数对应的标准差会很小,对应样本就是极度简单/极度困难样本,丢弃 reward 标准差<β<\beta<β的样本,基于每一步训练样本的平均标准差动态更新阈值β\betaβ。
2.4 RLPR的优点
- 与E-GRPO(《Repurposing Synthetic Data for Fine-grained Search Agent Supervision》)类似,在E-GRPO中,在输出答案和标准答案不一样时,会看推理过程里面提及的实体和推理标准答案所需实体的交集,打一个软分数,而不是直接赋0分,把全错和部分错区分出来。
- RLPR也能够灵活的处理这种假阴性的情况,文中把模型的输出人工进行了标注,人工判断回答对/错作为金标准,对比不同的verifier,RLVR的方式AUC是很低的(容易错误把正确答案判断为错误的),RLPR的AUC非常高!
- 即使在数学等完全标准答案的数据集上,RLPR未必会输给RLVR
- 对于Deep Search、Deep Research、知识问答等任务,RLPR可能是一个更好的选择