随着 GRPO 在后训练的不断应用和成熟,越来越多的任务都开始采用 RL 作为进一步提升效果的方案。但是对于那些缺乏明确标准答案的场景,除了人工标注外,还有没有其他比较高效、低成本的方案呢?
R1 之后出现了一种比较激进的方案:无验证 RL,模型不再依赖外部验证器,而是仅利用自身内部信号,如一致性、置信度或分布特征等来构造学习信号。
从最早的多数投票(TTRL、SRT),到基于熵与自确定性的强化学习,再到引入语义多样性与进化机制的最新方法,这个方向看似在不断取得进展,但其实这一类方法有个很严重的问题:“绝大多数内部反馈机制,本质上都在推动策略熵持续下降。”
这既解释了它们在训练初期或部分任务的有效性,同时也揭示了很多时候性能退化和探索崩塌的缘由。最新的工作从各个角度提出改进策略,如优势重塑、多样性奖励到进化式选择等等,但归根结底也都是在增加模型的探索能力,或者说平衡探索-利用。那么,对这种新的 RL 范式,你怎么看?
TL;DR
- TTRL / SRT、EM / RENT、Intuitor、EMPO 等方法都在显式或隐式地最小化策略熵。
- 内部反馈奖励几乎必然导致策略熵单调下降,最终引发探索不足与性能退化。
- ETTRL 通过高熵 token 分支 rollout 与基于熵的 advantage 重塑,缓解早期过度自信。
- Darling 将语义多样性显式并入奖励,增加探索。
- EVOL-RL 以“多数选择 + 新颖性变异”模拟进化过程,在稳定与探索之间取得更优平衡。
- RESTRAIN 利用全部 rollout 信号,对低一致性与过度自信样本进行系统性惩罚。
| 方案 | 具体做法 | 特点 |
|---|---|---|
| TTRL 250422[1] / SRT 250527[2] | 多数投票答案 | 部分领域(数学)使用 |
| EM 250521[3] FT | 直接最小化 token 级别熵(类似 SFT) | 数学和编码任务中强 |
| EM 250521[3] RL / RENT 250528[4] | 熵作为奖励 | 能在大型数据集上收敛 |
| EM 250521[3] INF | 将 LLM 输出的 logits 视为可自由优化的参数 | 最小化输出分布的熵 |
| EMPO 250408[5] | 将输出按语义聚类,语义簇熵作为奖励 | 增加一点多样性 |
| Intuitor 250526[6] | 自确定性(输出分布与均匀分布的平均 KL 散度)作为奖励 | 对“更长文本偏好”偏差不敏感 |
| ETTRL 250815[7] | 树状分支 rollout + Advantage clip | 降低成本、缓解早期估计偏差 |
| Darling 250902[8] | 奖励×多样性 | 增加回复的语义多样性 |
| EVOL-RL 250918[9] | 模拟生物进化增加新颖性奖励 | 防止熵崩塌 |
| RESTRAIN 251002[10] | 惩罚低一致性样本同时保留高潜力推理链 | 无监督自我改进 |
