On-policy 蒸馏:为什么蒸馏质量是路由的门禁
蒸馏过去意味着复制。冻结一个教师模型,在静态语料上收集它的输出,训练学生去模仿。on-policy 蒸馏(OPD)打破了这个框架:学生是在由自身当前策略诱导的状态上训练的。学生生成 rollout,由教师模型或自教师模型打分,然后基于自己的错误更新,而不是教师筛选过的错误。
这一转变让 OPD 成为 2026 年最活跃的后训练方向之一。这也正是我在意它的原因:我把真实的 agent 流量路由给小模型,而路由质量是一个蒸馏问题。
领域地图
最好把 OPD 理解为一个从反馈到更新的问题,而不是某个单一的损失函数家族。下面这篇综述把领域组织成两条路线:直接的分布损失,把学生的分布推向教师的分布;策略梯度式的 log-ratio 更新,按教师与学生的一致程度对采样动作加权。决定成败的变量是状态兼容性、支撑集构造、时间信用分配与门禁。KL 方向与教师访问方式的重要性都不及这些。
第二条轴是对教师模型的访问方式。logit 级蒸馏信号密集,但需要访问教师模型内部。黑盒蒸馏只依赖文本输出,这是闭源教师模型下唯一的选项。我在路由中实际对上的教师模型全部位于黑盒这一半。
这篇综述还在明确的证据边界之下,覆盖了验证器或结果引导的混合方法、工业界报告、框架实现、失败模式与稳定化配方。最后这个习惯值得效仿:论文仔细区分了哪些 claim 是已被证明的、哪些还是假设。关于它在 models 支柱中的位置,见 基础模型:一张领域地图。
精读:三篇论文
综述:把 OPD 看作从反馈到更新的问题
A Formula-Driven Survey and Research Agenda for On-Policy Distillation(Zhang, 2026)是这张地图。它把 sampled-token OPD 讨论中通常被混为一谈的两种机制区分开。时间信用分配问的是:教师–学生的 log-ratio 回报应当如何在一个 rollout 内对采样动作加权。词表路由问的是:当负反馈抑制一个被采样的 token 时,概率质量应当流向哪里。估计器的选择(即时、return-to-go、折现、基线校正)落在一条偏差边界上;综述还论证了 GAE-OPD 作为 log-ratio 回报的一种基于价值的假设,以及朝「教师支持、学生可达」备选项的反事实路由。结尾几节是我读了两遍的部分:开放问题与一份报告清单,两者都被映射回同一组从反馈到更新的变量。
黑盒 OPD:判别器作为奖励模型
Black-box On-Policy Distillation of Large Language Models(Ye et al., 2025)是我见过的最有意思的黑盒结果。生成式对抗蒸馏(GAD)把学生定位为生成器,训练一个判别器来区分学生回复与教师回复;这是一个极小极大博弈,判别器在其中充当与学生共同演化的 on-policy 奖励模型。在他们的实验中,用 GAD 训练的 Qwen2.5-14B-Instruct 在 LMSYS-Chat 自动评测上达到与其教师模型 GPT-5-Chat 相当的水平,并稳定胜过序列级知识蒸馏。
这种对抗式设定正是路由工程师应当盯住的。一个持续适应的奖励模型能抵抗作弊,但也让训练动态更难推理,因为学生是在对一个移动目标训练。而这整套框架就是为闭源教师模型而生的:没有 logits、没有参数、只有文本输出,这正是每一条真实路由 pipeline 都身处其中的约束。
确定性的错觉
The Illusion of Certainty: Decoupling Capability and Calibration in On-Policy Distillation(Zhang et al., 2026)发现了一条误校准的缩放定律:OPD 稳定提升任务准确率,同时把模型困在严重的过度自信里。成因是信息错配。教师监督是在训练时可用的特权上下文下形成的,而部署后的模型只能用部署时信息来报告置信度。以教师为条件的成功不是部署时置信度的有效目标;有用的特权上下文会诱发熵塌缩和系统性的乐观偏差。
他们的修复方案 CaOPD 从模型 rollout 中估计经验置信度,用这个以学生为依据的目标替换自报置信度,再通过同一条自蒸馏 pipeline 蒸馏修订后的回复。它在保持能力的同时达到 Pareto 最优的校准,并在分布外与持续学习设定下保持泛化。
这是我会要求每个路由团队都读的一篇论文。没有校准的准确率比不蒸馏更糟,因为失败是静默的。
我的立场:蒸馏质量是路由的门禁
我的立场是:路由决策就是蒸馏决策。当路由器把一个任务发给小模型时,它押了两件事:模型能做这个任务,并且模型知道自己什么时候做不了。OPD 的失败模式同时攻击这两个赌注。误校准意味着小模型在出错时听起来很确定,这对一个在低置信度时向上升级的路由器来说是最坏情况。这种失败是有方向的:过度自信产生静默的错误答案,而能力不足只是浪费前沿 API 的开销与延迟。只有第二种会出现在你的日志里。
由此而来的构建:把蒸馏作为路由 pipeline 内部的一道能力门禁,每个任务簇配留出考试;校准在在线服务的模型上测,而不是在训练 checkpoint 上——具体说,是用模型言语化置信度对其实证 rollout 置信度的期望校准误差,也就是 CaOPD 蒸馏所朝的那个以学生为依据的目标——再加一条定期演练的回退路径,而不是只在事故当天才启用。这份 OPD 阅读清单就是这道门禁的规格。
关联之处:PiPlan.ai 的路由
在 PiPlan.ai,动态路由层把常规 agent 步骤跑在自托管的 vLLM 节点上,把复杂规划升级到前沿 API。VerifierForge 训练小模型接管昂贵的任务簇。这两个赌注归结为同一个问题:小模型真的知道自己在做什么吗?它知道自己什么时候做不到吗?这是一个蒸馏质量问题,也是上面的 OPD 工作对我而言并非纯学术的原因。同一闭环的奖励一侧见 验证器工程。
本文链接的来源均已抓取并核实。