news 2026/8/3 11:13:17

【大模型LLM学习】RLPR——模型的答案置信度作为Reward

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
【大模型LLM学习】RLPR——模型的答案置信度作为Reward

1 常用的Reward类型

1.1 基于人类/模型偏好的奖励

  • 代表方法:Bradley-Terry Model, DPO/IPD 隐式奖励
  • 工作原理:收集(yw,yl)(y_w, y_l)(yw,yl)偏好对(ywy_wyw为优选回复,yly_lyl为劣选回复),训练一个 Reward Model 来拟合人类的偏好。在 PPO 等算法中,该 RM 的输出即为奖励信号。
  • 优点:
    • 捕捉复杂、难以形式化的人类价值观(如幽默感、同理心)。
    • 避免了绝对分数标注的困难(排序比打分容易)。
  • 缺点:
    • Reward Hacking 重灾区:模型容易学会迎合 Reward Model 的偏见而非真实意图(如冗长偏差、格式讨好)。
    • 分布外泛化差:RM 在训练数据之外的区域可能给出荒谬的高分。
    • 成本高昂:需要持续的人工标注或高质量 Judge Model。

1.2 Rubric-based Rewards(LLM-as-Judge)

  • 工作原理:预先定义包含多个维度(如准确性、完整性、安全性、语气)的评分细则,每个维度有明确的等级描述(如1-5分及对应标准)。Judge Model 根据 Rubric 逐条打分并给出理由,最终加权汇总为奖励信号。
  • 相比纯偏好奖励的优势:
    • 可解释性强:模型知道“为什么得分/扣分”,而非仅得到一个标量分数。
    • 细粒度控制:可针对特定维度(如“减少废话”)单独优化,避免全局偏好模型的耦合问题。
  • 局限性:
    • LLM-as-Judge 本身就是 Hacking 来源:Judge Model 可能被策略性输出欺骗,给出符合量规字面意思但实质错误的高分。
    • 高方差:奖励信号可能被高方差淹没。
    • 设计成本高:高质量 Rubric 需要领域专家反复迭代验证。

1.3 可验证奖励 (Verifiable Rewards / RLVR)

  • 适用场景:数学、代码、逻辑推理、事实核查等有明确 Ground Truth 的任务,用规则而非LLM来判断结果对不对。
  • 工作原理:
    • 数学任务:最终答案精确匹配或符号验证。
    • 代码任务:运行代码测试,根据结果,Pass=1, Fail=0。
  • 相比 Rubric/RM 的核心优势:
    • 真正抗 Reward Hacking:编译器/验证器不会被输出欺骗,奖励信号与任务真实目标完全一致。
    • 无噪声:验证结果确定,训练更稳定,收敛更快。
  • 局限性:
    • 需要准确设计verifier,仅适用于可验证任务,无法覆盖开放式任务,对于不同任务需要设计不同的verifier

2 RLPR: Extrapolating RLVR to General Domains without Verifiers

  • RLPR是从另一个角度出发设计的,把模型对答案输出打分的prob作为reward信号,这样无需每个任务单独设计verifier,也不需要LLM-as-judge的方式
  • 尤其适合例如deep search这种场景答案形式可能存在多个的情况(例如某个问题的答案既可以是马斯克,也可以是埃隆马斯克,它们指向是一样的),使用RLPR的方式,是正确答案的情况下prob的概率高,错误答案时prob的概率低,无需做穷举

2.1 基本思想

基于一个核心观察:LLM 生成正确答案的原生概率,可以直接反映模型内部对推理质量的评判。在RLPR 中,使用标准答案的逐 token decoding probability 作为 reward signal。
现有很多 RLVR 方法依赖领域专用,搭建这类验证器需要大量人工启发式规则与工程成本;而 RLPR 的 reward 计算仅依赖 policy model 自身

设问题QQQ对应的一条输出响应o=(o0,⋯ ,oN)o = (o_0, \cdots, o_N)o=(o0,,oN)oio_ioi代表响应内单个 token。
执行概率提取流程:

  1. 从完整序列ooo中拆分出模型生成答案yyy,剩余文本为推理过程zzz
  2. 构造改造序列o′=(o0′,⋯ ,oN′′)o' = (o'_0, \cdots, o'_{N'})o=(o0,,oN):把模型生成答案yyy替换成训练集标准参考答案y∗y^*y
  3. o′o'o输入 policy model,得到序列概率(p0,⋯ ,pN′)(p_0, \cdots, p_{N'})(p0,,pN)
  4. 序列 reward 计算公式:
    r=fseq({pi∣oi′∈y∗})(2) r = f_{\text{seq}}(\{p_i | o'_i \in y^*\}) \tag{2}r=fseq({pioiy})(2)
    fseqf_{\text{seq}}fseq的作用是把多个逐 token probability 聚合为单个标量 reward。

如果选用序列似然(归一化概率乘积)fseq=∏pnf_{\text{seq}}=\sqrt[n]{\prod p}fseq=np,虽然能够表征参考答案整体生成概率,但存在方差过高、对同义词、微小token波动极度敏感的缺陷。
举例:token概率序列(0.01,0.7,0.9)(0.01, 0.7, 0.9)(0.01,0.7,0.9)(0.05,0.7,0.9)(0.05, 0.7, 0.9)(0.05,0.7,0.9),仅首token存在小幅差异,乘积形式下得分差距巨大。
为此 RLPR 改用token均值
fseq=1∣y∗∣∑pi f_{\text{seq}} = \frac{1}{|y^*|}\sum p_ifseq=y1pi
均值聚合得到更鲁棒的 reward signal,与答案质量相关性更强。
该概率奖励具备直观特性:当模型输出答案yyy和参考答案语义接近时,获得高 reward;反之 reward 偏低。

2.2 Reward Debiasing

虽然基于概率的 reward 和响应质量具备强相关性,但结果会被多种隐变量干扰。
将概率奖励rrr的来源记作UrU_rUr,做隐因子分解:
Ur=Uz+Uothers(3) U_r = U_z + U_{\text{others}} \tag{3}Ur=Uz+Uothers(3)

  • UzU_zUz:推理内容zzz带来的影响;
  • UothersU_{\text{others}}Uothers:问题、参考答案等其余外部因素带来的干扰。

直接使用原始rrr作为 reward,会引入UothersU_{\text{others}}Uothers带来的偏差,损害奖励有效性。
RLPR 的去偏方案:不经过中间推理zzz,直接让模型解码参考答案y∗y^*y,算出基准分数r′r'r
可以认为Uz≈Ur−r′U_z \approx U_r - r'UzUrr,最终去偏概率奖励
r^=clip(0,1, r−r′)(4) \hat{r} = \text{\(\text{clip}\)}(0, 1,\ r - r') \tag{4}r^=clip(0,1,rr)(4)
clip\text{\(\text{clip}\)}clip限制 reward 落在(0,1)区间。该形式剔除了问题UQU_QUQ、参考答案Uy∗U_{y^*}Uy的固有偏差。

2.3 Standard Deviation Filtering

传统 RLVR在Rollout时会过滤掉过难、过简单的样本,只保留中等难度样本稳定训练,做法是剔除全部正确/全部错误的样本(例如DAPO和DUPO中)。但 RLPR 的 reward 是连续值,无法直接套用基于二元对错的过滤方式,很难设定通用阈值区分样本好坏。
通过分析精度过滤机制,RLPR 提出替代方案:过滤 reward 标准差过低的prompt。PR reward 被约束在 (0,1),如果一个样本所有Rollout输出全部高分 / 全部低分,分数对应的标准差会很小,对应样本就是极度简单/极度困难样本,丢弃 reward 标准差<β<\beta<β的样本,基于每一步训练样本的平均标准差动态更新阈值β\betaβ

2.4 RLPR的优点

  • 与E-GRPO(《Repurposing Synthetic Data for Fine-grained Search Agent Supervision》)类似,在E-GRPO中,在输出答案和标准答案不一样时,会看推理过程里面提及的实体和推理标准答案所需实体的交集,打一个软分数,而不是直接赋0分,把全错和部分错区分出来。
  • RLPR也能够灵活的处理这种假阴性的情况,文中把模型的输出人工进行了标注,人工判断回答对/错作为金标准,对比不同的verifier,RLVR的方式AUC是很低的(容易错误把正确答案判断为错误的),RLPR的AUC非常高!
  • 即使在数学等完全标准答案的数据集上,RLPR未必会输给RLVR
  • 对于Deep Search、Deep Research、知识问答等任务,RLPR可能是一个更好的选择
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/3 11:12:32

终极指南:如何免费解锁Wand专业版并实现手机远程控制

终极指南&#xff1a;如何免费解锁Wand专业版并实现手机远程控制 【免费下载链接】Wand-Enhancer Advanced UX and interoperability extension for Wand (WeMod) app 项目地址: https://gitcode.com/GitHub_Trending/we/Wand-Enhancer 你是否曾经在享受游戏时被突然弹出…

作者头像 李华
网站建设 2026/8/3 11:09:11

Spark 核心之 Driver 原理剖析

摘要&#xff1a;如果把 Spark 应用比作一个人&#xff0c;Driver 就是它的大脑。从 spark-submit 敲下回车的那一刻起&#xff0c;SparkContext 初始化、DAGScheduler 切分 Stage、TaskScheduler 分发 Task、SchedulerBackend 与集群通信、SparkEnv 管理运行时环境——所有这些…

作者头像 李华
网站建设 2026/8/3 11:09:05

扬声器内磁盖模具设计要点与精密成型技术

1. 扬声器内磁盖模具设计概述扬声器内磁盖是扬声器磁路系统中的关键部件&#xff0c;其作用是固定磁体并形成均匀的磁场间隙。模具设计质量直接影响内磁盖的尺寸精度、机械强度和电磁性能。在实际项目中&#xff0c;一套优秀的内磁盖模具需要同时满足精密成型、高效生产和成本控…

作者头像 李华
网站建设 2026/8/3 11:05:48

Keyviz完全指南:免费开源键鼠可视化工具让你的操作一目了然

Keyviz完全指南&#xff1a;免费开源键鼠可视化工具让你的操作一目了然 【免费下载链接】keyviz Keyviz is a free and open-source tool to visualize your keystrokes ⌨️ and &#x1f5b1;️ mouse actions in real-time. 项目地址: https://gitcode.com/gh_mirrors/ke/…

作者头像 李华
网站建设 2026/8/3 11:05:08

信息系统架构设计与优化实战指南

1. 信息系统基础认知第一次接触信息系统这个概念是在2008年&#xff0c;当时我参与了一个零售企业的库存管理系统升级项目。那套老旧的系统每天要处理上万条出入库记录&#xff0c;经常在业务高峰期崩溃。项目经理指着那台嗡嗡作响的服务器说&#xff1a;"这就是我们企业的…

作者头像 李华