news 2026/8/29 2:42:13

RL算法推导!PPO -> GRPO -> DAPO -> GSPO -> SAPO

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
RL算法推导!PPO -> GRPO -> DAPO -> GSPO -> SAPO

RL算法推导!PPO -> GRPO -> DAPO -> GSPO -> SAPO

在小说阅读器中沉浸阅读

原文:https://zhuanlan.zhihu.com/p/1986141224588027138

在DPO(Direct Policy Optimizatio)之后,后续的典型工作发展路线为:GRPO -> DAPO -> GSPO -> SAPO,在有PPO的理论推导基础后,这些论文的理论推导过程就会容易很多。

1. GRPO 相比PPO的改进有哪些?

首先PPO的优化目标为:

GRPO的优化目标:

其中

其采用组采样的方式和基于规则的reward函数,也能够像DPO仅加载两份模型,即Actor和参考文献 Model,从而在训练参数量比较大的模型时,有效降低显存的占用,好坏样本的覆盖程度则依赖于Rollout过程,当Rollout采样的过程足够多时,可以假设它能够覆盖大部分情况。

从上述角度来讲,想要覆盖大部分case的数据组织成本,要比DPO小很多,个人猜测是目前GRPO系列方法比较流行的一个原因,该方法的核心在于组采样。但在实际训练时,比较耗费时间的为Rollout阶段。

2. DAPO 相比GRPO的改进有哪些?

其优化目标如下:

其中 和前面保持一致,其不同地方则用红色显示,如下为DAPO的具体改进点:

归一化系数(对应论文中的Token-Level Policy Gradient Loss): 这里采用全局token系数进行归一化,使得在处理组内长度回复差异较大时,梯度会更稳定点。

非对称裁剪(对应论文中的Clip-Higher): 更精细地控制策略的更新程度。

Dynamic Sampling: 直接丢弃掉采样后奖励值为0或1的样本, 当组内所有采样结果相同时,此时按照上式计算得到的优势为0,即不能带来有效梯度更新。刚开始训练时,会有较大可能出现组内奖励值全0的情况,训练阶段后期,则会有较大可能出现组内奖励值全1的情况,为了提升Rollout阶段的采样效率,直接选择丢弃奖励值为0或1的样本。

Overlong Reward Shaping: 该改进并没有在DAPO的优化目标中体现,在GRPO训练时可能会出现当Rollout输出达到预先设置的最大长度时,仍没有输出有效结果,此时计算的奖励值为0。为了降低模型输出时的思考长度,则在输出长度方面,增加一个对应软惩罚:

3. GSPO 相比GRPO有哪些改进?

优化目标如下:

其中

该优化目标相比GRPO,仅改变了重要性采样的系数,其相比GRPO采样系数用的是整条句子的概率情况,而不是单token概率,这点对于MoE模型RL训练十分有帮助。

对于单token概率,可能存在Rollout Engine和 Model Engine选择的专家路由差异,因此往往需要通过Routing Reply机制来确保两种Engine在同样的样本选择的路由保持一致。

一个稍微有意思的点,在LLM进行预训练时,需要观察模型在训练预料的PPL(文本困惑度)是否呈现出下降趋势,PPL的公式与上述公式极为相似,对于一个序列

其困惑度的定义如下:

将PPL的定义带入 则有 ,对于正样本,希望 较大,即对应到 减小, 增大。

4. SAPO 相比GRPO和GSPO有哪些改进?

其优化目标如下:

其中

其相比GRPO将clip操作替换为上述软控制,其具有如下特点:

  • • token级别的软信任区域,token级别具有更细的控制力度。

  • • 非对称温度设计,对于正负token则采取不同的操作。

Reference

1. DeepSeekMath(GRPO): https://arxiv.org/pdf/2402.03300 2. DAPO: https://arxiv.org/pdf/2503.14476 3. GSPO: https://arxiv.org/abs/2507.18071 4. SAPO: http://arxiv.org/pdf/2511.20347
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/26 4:34:37

上海交大团队:迈向超长程自主智能体科学 ai scientist

上海交大团队:迈向超长程自主智能体科学缺乏超长程自主性,即无法在跨越数日、甚至数周的实验周期中持续保持战略一致性并不断迭代修正,阻碍了智能体(Agent)从被动辅助向自主驱动科学前沿发现的跨越。为克服这一瓶颈&am…

作者头像 李华
网站建设 2026/8/24 15:58:12

收藏!AI时代程序员破局指南:转型AI产品经理,抢占35-80万年薪赛道

在AI技术全面重构职场规则的当下,传统程序员正面临技能替代、赛道内卷等多重困境。而AI产品经理这一新兴高薪岗位的崛起,为程序员群体提供了全新的职业破局方向。本文深度剖析程序员在AI浪潮中的职业痛点,拆解AI产品经理的岗位价值与薪资优势…

作者头像 李华
网站建设 2026/8/24 17:38:44

深度学习风格迁移教程:算法原理、模型搭建与实战案例,快速生成艺术级图片效果

文章目录 风格迁移入门教程:从原理到实战,让你的图片秒变艺术大师之作![在这里插入图片描述](https://i-blog.csdnimg.cn/direct/1f8b414952844b15b0dff6632de15647.png) 一、风格迁移是什么?为什么它如此迷人? 二、风格迁移的核心原理:让机器理解“内容”与“风格” 1. 内…

作者头像 李华
网站建设 2026/8/25 5:39:04

风格迁移×GAN入门指南:从基础概念到上手项目,让你用AI做出惊艳视觉作品

文章目录 零基础入门风格迁移与GAN:从原理到趣味实践 引言:当技术邂逅艺术,AI如何玩转“风格穿越”? 一、风格迁移:让图像在艺术风格间“穿越” 1. 什么是风格迁移? 2. 如何实现风格迁移?靠神经网络“拆解+重组” (1)内容损失:确保“灵魂不变” (2)风格损失:确保“…

作者头像 李华
网站建设 2026/8/24 15:00:49

【计算机毕业设计案例】基于Web的社交媒体平台(程序+文档+讲解+定制)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

作者头像 李华