本文介绍两个R1后新范式最佳实践的模型(系列):Seed-Thinking-v1.5和Qwen3,感受一下R1后新范式的实践情况。
Yarz-Logic:R1-Zero相关实验报告
过完年上班后开始关注R1,然后就开始尝试做一些实验,2月底到3月中旬陆陆续续做了不少实验,一直没时间整理,终于抽出点空来简单整理一下,做个记录。
首先,项目是基于Logic-RL[1],之所以选择这个项目有几个主要原因:
- 当时这个复现感觉相对比较规范,飞书文档上记录了一些过程和评测结果(当时其实已经有不少复现了,但很多都没有评测,这种一概略过了)。
- 实在不想看数学的英文,一个是数学本来也不太好,另一个是很多公式在代码里就没法看,不好看Case。这个是逻辑题目,以自然语言文本为主。
- 这个项目基于verl[2]和TinyZero[3],仅做了很少的改动,而verl和TinyZero我之前都了解过,相对比较熟悉。这样上手就比较方便。
所以,R1-Zero相关的实验就都基于这个项目了。因为我的关注点和原项目不同,我更加想验证一些自己的想法(原项目未涉及),所以就另外起了个名字:Yarz-Logic,Yarz就是Yet Another R1-Zero。
VAPO:基于价值方法的新突破
刚出了 DAPO:为GRPO的锦上加四点花 | Yam[1],字节Seed团队马上就送来新的 VAPO[2],同样的清晰、高质量。
VAPO,全称 Value-based Augmented Proximal Policy Optimization,没错了,这是基于价值的方法。本文指出了困扰基于价值方法的三个关键挑战:价值模型偏差、序列长度异质性以及奖励信号的稀疏性,并分别对其进行优化,最终在 AIME 2024 上比 DAPO 提升10个点,并且更加稳定,需要的训练步数更少。
R1相关:R1-Zero的进一步理解和探索
TL;DR
本文通过对近期几篇R1-Zero相关工作进行梳理,同时结合部分已有的工作,从整体上对R1-Zero及其范式进行更深层次的理解和探索。主要观点整理如下:
- Base模型是核心,RL在激活能力
- 强模型需高难度数据充分激活能力,弱模型需渐进引导。
- 强模型对格式限制不敏感,弱模型需适配模板以避免探索抑制。
- 自我反思频率与准确率无必然关联,需结合数据质量分析。模型层数增加时,简单问题易被“过度思考”,复杂问题感知简化。
- LLM学习模式的关键发现
- 反思能力在预训练早期即显现,随训练逐步提升。
- LLM依赖模式记忆而非数学规则。
- 预训练知识获取分三阶段:统计学习→平台期(记忆回路形成)→个体知识获取。数据调度策略(如“热身训练”)可加速知识获取,微调易导致幻觉与知识损坏。
- RL算法
- 算法改进:DAPO、Dr GRPO。
- 强化已有正确推理行为(非注入新知识),领域预训练可显著提升上限。
- 分阶段扩展上下文窗口(短→长任务),按难度课程式学习匹配模型能力。
- 工程实践关键
- Base模型优先同系列大模型,小模型需更多探索,慎用SFT冷启动(可能限制RL潜力)。
- 数据应覆盖多领域、多难度、多样化回答,避免固定格式限制(弱模型尤其敏感)。
- 弱Base没做过LongCoT的可以先LongCoT。遵循课程式数据设计和训练策略:从短任务逐步过渡到长难题。
总之,Base模型是核心,Base不行先继续训练或LongCoT。RL是激活手段,需结合数据难度与模型能力动态适配。工程上分阶段、重数据质量与课程设计,避免过度依赖微调。
异曲同工之妙的DrGRPO——DAPO几乎同时出现的又一GRPO优化!
DrGRPO来自Understanding R1-Zero-Like Training: A Critical Perspective,是oat-zero同一个团队的最新成果。没错,这虽然是一篇综合分析Base和RL的文章,但我们这里重点关注其中的RL部分,尤其是针对GRPO两个偏差的优化。它的发布时间就在DAPO发布一周后。
DAPO:为GRPO的锦上加四点花
GitHub:BytedTsinghua-SIA/DAPO: An Open-source RL System from ByteDance Seed and Tsinghua AIR
Paper:DAPO: An Open-Source LLM Reinforcement Learning System at Scale
DAPO
DAPO,一个对GRPO全方位优化的Policy优化算法,有必要单独记录一下。损失如下:
其中:
看着和GRPO有点像。为了便于对比,把GRPO损失一并贴出来:
其中:
r和A同上。oi表示输出的第i个Token。
DAPO去掉了KL,观点是,模型分布可能与初始模型有很大差异,因此不需要这种限制。这点和我本人之前的认知不太一样,我认为Base是相对稳定的,分布差异应该不大。所以自然就有个疑惑:去掉KL到底是因为RL后续训练偏离Base较大导致限制没作用,还是偏离Base较小所以没作用?后来X哥提醒了一句:“这个应该不是偏离过大,而是针对Base到LongCoT本来变化大”,从这个角度看KL确实没太多意义。
奖励函数还是简单的规则:正确1分,否则-1分。
DeepSeek R1后应用、职业与行业影响——2025年梳理
突然就想写点应用、开发相关的东西,一方面是不断有企业和朋友问我他们可以用DeepSeek做什么,怎么用;另一方面是这个方向的职业、行业也在不知不觉中慢慢改变。干脆顺便一起梳理一下,记录在案。
DeepSeek R1后LLM新范式
本文通过10篇R1相关的研究,介绍R1后LLM的新范式。其核心就是如何进一步增强LLM的能力。
基本框架
首先是整体的框架,如下所示。
- Base+SFT
- R1冷启动
- LIMO (817 Data Selection)
- s1 (1000)
- Base+RL
- GRPO: R1-Zero
- GRPO: oat-zero (Base can Aha、RL enhance)
- PPO: LIMR (Data Selection)
- PPO: orz (Scaling quality, diversity)
- DPO: Online-DPO-R1 (Different RL Algo)
- DPO: LIMD (Data Selection)
- SFT+RL
- R1蒸馏
- DeepScaleR (Length Scaling)
- Self-rewarding correction (LLM can reward itself, explicit Aha)、L1(LCPO)
我将其分成3个部分,前两个部分是Base模型的基础上使用SFT或RL提升效果,最后是SFT结合RL进一步提升效果。每个部分的第一个都是R1论文中的内容,上面没有R1本身,是因为R1本身是一个比较综合的过程。
值得说明的是,关于R1相关的研究肯定不止这些,列出这些一方面是因为我自己精力有限,只仔细阅读了这些;另一方面是逐步整理的过程中感觉到框架基本趋于完善。因此,本文也算是一个阶段性整理的输出。
本文内容相对比较通俗,如果对相关内容感兴趣,可以移步到对应的解读文章。
OMNI论文速览(2025)
OMNI相关论文。
R1相关:DPO数据选择与DPO等RL算法
本文介绍两篇与DPO以及其他RL算法相关的。R1-Zero在表现出潜力后,GRPO自不必多说,得到大家关注。PPO、Reinforce++等也被用来尝试实验,结果也很亮眼。既然如此,其他RL算法可以吗,尤其是前LLM时代流行的DPO。于是就有了本文的两篇研究。