谈到 GRPO,我们不由自主会想到它的“抛光”特点——在 Base 的基础上做进一步锐化,我们之前在不少文章中都提到过,比如《RL究竟能不能突破Base边界——关于推理能力外推、稳定性与训练条件的系统分析 | 长琴[1]》。为了保持模型的探索性,常见的基本做法就是控制熵,这个方向有一大堆论文研究,我们也写过一点,比如《GRPO“第一背锅侠”Token Level X2:GTPO双“T”傍地走 | 长琴[2]》、《GRPO优化在继续——CISPO和熵 | 长琴[3]》。
今天介绍一个新的思路和方向,比训练中控制更前一步,直接优化 Pass@k,而不是 Pass@1——《2508 Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models[4]》,来自字节 seed × 人大。至于为什么会突然关注到这个方向,那自然是工作中遇到需要保持多样性的优化问题了。发现这个新方向后感觉还挺有意思,就拿来了解一下。
