「差值即信号」:OPD 蒸馏的新范式

随着 OPD 不断成熟,现在的做法早已不再是简单的 teacher 蒸馏了,最近看了几篇相关文章,发现一个研究范式转移:从「怎么蒸馏(温度/KL方向/采样策略)」到「蒸馏什么(信号分解与归因)」。具体做法可以用一个简单公式说明:

1
有效信号 = f(output_A) − f(output_B)

A、B 在恰好关心的那一维度不同,其余对齐。这个本质是反事实对比在 token-level 蒸馏上的应用——不学习教师原始输出,而是学习「教师在特定条件变化下的输出差」。简单来说,不是直接学教师,而是学教师在不同情况下的「差异」,类似于学这种「能力」。本文我们就看看它们都是怎么做的,以及会给我们什么启发。

W2S OPD

首先来看 Microsoft 的《2607 Weak-to-Strong On-Policy Distillation》,它一开始就提到了一个有意思的观察:「随着模型逼近前沿,已不存在更大的教师模型可供提炼,从而限制了性能上限」。所以,采用源合并策略:不假设存在单一优越的教师模型,而是从共享的基
础模型出发,并行训练多个领域专家,再将其能力提炼回一个学生模型。这类似 MOPD(我们在《LLM 强化的“炼金术”:主流开源模型的 RL 优化策略赏析 | 长琴》介绍过)的思路(DeepSeek-V4 也是这样弄的),但 MOPD 成本比较高。

本文的弱到强模式(W2S),目标是从多个弱模型蒸馏一个强模型。思路很简单,教师模型由一个正向模型和一个负向模型构成的对比对生成,两者均显著小于学生模型且获取成本低廉。Logit 差异分离出了能力方向,W2S-OPD 将这一方向训进学生模型。如下图所示:

文章还提出三种正负模型的构建方法:

  • 强化学习前与后的模型;
  • 更大和更小的模型;
  • 模型在正确与错误提示条件下的变体。

而且该方法天然也支持多组正负模型组合。

Lightning OPD 2.0

这个来自 MIT 的《2607 Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models》本来是解决 Lightning OPD 的风格偏差问题,具体来说,Lightning OPD 提前生成 rollout 并算好 log-prob,但 SFT 数据的来源可能由多个模型生成的,复用 SFT 数据时这种多 teacher 来源可能造成不一致。

站在 token 角度,有些 token 承载了与具体问题相关的推理信息,而另一些 token 主要用于表达响应风格,两种情况在更新时无法区分,导致后者可能会系统性地干扰更加依赖具体上下文的推理信号。论文提出一种可观测的统计代理指标:与风格 token 相关的不一致更可能通过相似的词汇选择、响应位置以及相对于参考策略的惊讶程度水平,在不同的无关 rollout 之间重复出现;而与推理相关的不一致则更强地依赖于当前的问题和推理状态。

因此,这里的做法就是将 rollout 之间具有可预测性的那部分成分视为风格 token 偏差的代理指标,并将剩余的残差部分视为可能承载与推理相关的 teacher 信息的候选信号。如下图所示:

  • 计算 OPD 教师与 SFT 参考之间的 token 级别对数概率差异。
  • 将缓存的 rollouts 划分为多个 fold,并使用其他 fold 来构建两个查找表:一个以 token identity 为索引;另一个以归一化响应位置和参考策略意外度为索引。通过对这两个查找表中的值取平均,可以为每一个 held-out token 估计其重复出现的风格偏差,同时避免使用该 token 所在 rollout 本身的信息。其实就相当于根据 token + 位置 + 意外度计算 style 成分。
  • 从原始的 log 概率差中减去这一估计值,并将得到的残差替代原始的不一致信号用于优化目标。

这里 cross-fitted 很关键,它避免了“用自己的 rollout 预测自己的 style bias”的数据泄漏问题。也就是说,一个 token 的风格偏差估计来自其他 rollout,而不是它自己,因此得到的 residual 更接近真正的问题相关 teacher 信号。

VAD

这是来自小红书的《2607 VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation》是一个多模态方向的,不过做的事情也是类似的。它要解决的是多模态蒸馏中,教师的 token 纠正有多少真的由视觉输入驱动(source 混合问题),看起来和 Lightning OPD 2.0 有点类似。

VAD 是视觉归因蒸馏,一种反事实目标重构算法,用于估计教师修正中可归因于视觉的部分,评估同一固定教师在相关证据(与当前细粒度视觉推理任务最相关的局部图像区域)存在和被移除两种情况下的表现。具体来说,对于每个由学生生成的前缀,VAD 在保持文本上下文不变的情况下,用同一固定教师在“存在证据”和“移除证据”两种视角下计算下一个 token 的分布。如下图所示:

  • 有证据 vs 无证据,分别跑教师,取 centered log-prob 变化量作为代理指标 ut。中心化主要是消除偏移,凸显变化。
  • 采用正则化投影,将教师校正投影到 ut 方向上,来估计原始教师校正中与该干预相一致(视觉相关)的部分;其余部分则被视为代理信号无法解释的残差,而不是简单地将其视为纯粹的非视觉成分。注意,这里 ut 只是一个方向指针,而不是“合理的概率分布”,所以需要投影到干预方向上。
  • 重构目标(基准+校正向量)作为主要监督,原始教师作为弱正则项约束“仅用视觉目标蒸馏”时可能出现的文本漂移、重复生成、格式失控以及停止符行为异常等问题,起到稳定语义和格式的作用。

RP-OPSD

中科大的《2607 RP-OPSD: Resolution-Privileged On-Policy Self-Distillation for Multimodal Large Language Models》主要出发点是解决 OPSD 特权信息问题:现有方法通常使用参考答案、经过验证的解题轨迹或上下文示例,这些方式非常适合答案定义清晰的文本任务。然而,多模态模型产生错误的原因可能包括遗漏物体、视觉细节丢失、定位不准确或跨模态关联薄弱等问题,因此往往需要额外的区域标注、多模态解释或证据定位信息。现有方法依赖于外部生成、目标识别、区域分割或局部裁剪等操作,增加了数据构建和质量控制的成本。而且,额外的上下文并不一定能够提供有效的教师信号,因为 OPD 的效果还可能取决于教师模型的选择、学生模型的能力以及监督上下文。

因此,OPSD 扩展到多模态的关键是找到简单且有效的特权信息,其来源需具备三个理想特性:应在教师与学生之间形成有意义的能力差距;保留其输入的语义内容;并且既不需要外部模型、也不需要额外的标注。本文用分辨率作为这个信息,如下图所示:

  • 学生 policy 从 1/4 原始分辨率图像生成 on-policy 轨迹。
  • 教师 policy 使用原始分辨率图像提供监督。
  • 最小化学生轨迹上两个输出分布的差异。

学生模型学习教师模型在高分辨率输入下的预测行为,从而增强其低分辨率能力,并将学习到的改进迁移到原始分辨率推理中。 这个方法算是一个比较通用的方案,利用了高分辨率视觉细节这个特性。

STEP-OPD

这篇是来自阿里的《2608 STEP-OPD: Rethinking Output Targets and Internal Dynamics in On-Policy Distillation for Diffusion Models》,一篇多模态相关的,出发点就是解决 OPD 教师上限问题。还有一个逐层对齐的问题,不过这里我们暂不考虑。

为了将 OPD 扩展至教师之外,文章提出输出外推法——利用每个任务教师与一个共享的 base 模型的差异进行学习,具体来说,构造外推目标:

1
2
ṽ = v_teacher + α(s) · (v_teacher − v_base)
= v_base + (1 + α(s)) · (v_teacher − v_base)

差值 (v_teacher − v_base) = 后训练相对于 base 模型引入的能力方向。α(s) 从 0 线性预热,逐步放大外推幅度,并最终固定。同时(为了解决对齐问题)对 student/teacher 的中间层表示做方向+幅度对齐,不只在输出层监督。如下图所示:

左侧表示在选定的相邻块之间对齐 teacher/student 隐藏状态变化的方向和幅度,右侧是任务特定输出外推法,教师和基础模型均保持冻结,差值不传播梯度。

Poly-OPD

最后这篇是来自京东 Joy 的《2608 Poly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow Models》,主要解决多个异构 teacher(不同架构/latent space 不兼容)如何同时蒸馏的问题。这里有三个难题:用教师生成的图像进行训练(绕开坐标系不一致问题)是 off-policy,训推不一致限制了学生学习教师行为;将多种能力蒸馏到同一个网络中会产生能力之间的相互干扰;构图能力本身也存在不均衡问题(有的技能很快饱和,有的一直是瓶颈)。

Poly-OPD 将学生自身的样本解码为「像素」这个异构模型唯一共享的坐标系,然后重新编码至教师潜在空间,由教师根据匹配的噪声水平进行优化,并在通用的 DINOv2 特征空间中用作感知监督。

可选择能力的适配器隔离特定模式的前馈网络更新,同时共享注意力 LoRA 解决能力干扰问题。Gap 感知的采样则将组合提示重新分配给教师与学生之间差异最大的类别,解决能力不均衡问题。如下图所示:

这里的重点就是这个「Gap 感知自适应采样」,也就是,训练时不再根据绝对难度分配资源,而是根据“教师–学生之间尚未弥合的差距”来分配。

每 K 步用 k 条探针计算各能力类别的 teacher-student 分差,指数移动平均平滑后 softmax 采样,自动向差距最大的类别倾斜训练预算。差距收敛后权重自然退化为均匀分布,无需外部调度。

1
2
gap_k = max(teacher_score_k − student_score_k, 0)
p(category) = softmax(smoothed_gap / τ) τ=0.1

温度参数 τ 控制采样对最大差距类别的偏好程度:τ 越小,越倾向于优先采样差距最大的类别。

对比总结

介绍完相关 paper,我们把它们的「共性」——基于差值训练——整理成下表。

对比维度 差值用途 场景
W2S-OPD 正/负弱模型能力对 构造 proxy teacher logit 数学/代码(LLM)
Lightning OPD 2.0 内容 vs 风格成分 减掉 style 噪声 数学/代码(LLM)
VAD 有/无视觉证据 投影得到纯视觉校正 多模态(LLM)
RP-OPSD 低分辨率 vs 高分辨率输入 用高分辨率行为监督低分辨率轨迹 多模态(LLM)
STEP-OPD teacher vs base model 外推超越 teacher 图像生成(diffusion)
Poly-OPD teacher 得分 vs student 得分(类别级) 动态课程权重(选哪里学) 图像生成(flow)

差值用途可以简单归为三类:

  • 重构训练目标(W2S、Lightning、VAD、RP-OPSD):差值决定学什么
  • 外推超越教师(STEP-OPD):差值给出方向再放大
  • 动态课程调度(Poly-OPD):差值决定从哪里学

虽然场景各不相同,但思想非常类似,而且不同场景的 idea 其实也是可以互相借鉴的。

再谈OPSD与RL

最后,我们简单收一下,其实无论是 OPD 还是 OPSD,最重要的就是注入「外部信息」。OPD 需要 teacher,天然有外部渠道;OPSD 则需要借助验证器、reward、evaluation 等反馈作为外部渠道。不过本文梳理的这种模式其实是自带「外部渠道」,其来源正是不同的 condition,触发不同的表现,其差异作为「外部渠道」。

这个思路和我们在《从持续学习到下一代 AI 方向探讨 | 长琴》介绍的「持续学习」方案非常契合,只不过那个外部渠道换成了实时交互的经验反馈。再回顾我们在《通向 AGI 的技术路径:多模态、强化学习与新架构的交汇点——结合近期研究者访谈的一些技术判断与个人思考 | 长琴》中提到的:“强化学习是自主进化的核心机制:预训练擅长吸收信息,RL 擅长通过试错优化策略,可能是持续学习、自我修正和边缘能力提升的关键。”很明显,「经验 OPSD + RL 少量参数更新」将会构造出新的学习范式,那里是持续学习、实时学习的战场。