← logs/

扩散语言模型进入对话

ICML 2026 的杰出论文奖之一颁给了一篇关于扩散语言模型的论文。它不是一场 benchmark 横扫,也不是一个服务技巧:「The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models」(Ni、Wang、Yue 等)主张,这个领域花了数年时间为一种让推理更糟的自由搭建机器。这是我 MODELS 领域地图系列中的一篇。

先快速回顾,以防你没有一直跟进:扩散语言模型(dLM)从掩码出发生成,而不是从左到右。一切起初都是未知的;模型对所有位置打分,保留置信度高的 token,对其余部分重新加掩码,然后重复。

Autoregressive:   tok1 -> tok2 -> tok3 -> tok4      one token per step
Masked diffusion: [M] [M] [M] [M] -> refine in parallel, unmask in any order

dLM 实际买到了什么

有三条收益经得起现实的检验。

  1. 并行解码。所有被掩码的位置在一次前向传播内完成打分,因此每一步可以产出多个 token。在 batch size 为 1 时,这是相对自回归解码的实际耗时优势,而且随着序列变长,优势会复利式累积。
  2. 填充。任意片段都可以被掩码,所以你可以重新生成一份文档或一个代码函数的中间部分而不动其余内容——这个技巧,自回归模型只能靠碰运气来近似。
  3. 可控性。被掩码的位置就是图钉:固定输出格式、固定一个签名、围绕约束生成。

2024 年以来的争论围绕第四条主张。因为模型可以以任意顺序写 token,其解空间严格包含固定的从左到右轨迹,所以推理理应严格更好。LLaDA、Diffusion-of-Thoughts 和 Beyond Autoregression 系列工作各自展示了扩散对推理任务的良好处理。The Flexibility Trap 补上了这个领域跳过的对照实验,结果令人不安。

灵活性陷阱

论文给出的机制很简单,值得直白陈述。在一般推理任务(数学、代码)上,dLLM 利用顺序自由来绕开高不确定性的 token。在从左到右的链条中,模型被迫对中间步骤做出承诺:等式、子目标、计划。一旦给模型选择顺序的余地,它就会悄悄推迟那个困难的 token,探索得更少,解的覆盖早早塌缩。那个看起来像轨迹超集的灵活性,在实践中是逃避探索的逃生口。

补救方案极简到了近乎戏仿的程度。JustGRPO:标准的 Group Relative Policy Optimization,固定从左到右的顺序,没有组合式轨迹处理,没有 ELBO 近似,没有任何扩散特有的适配。结果:GSM8K 上 89.1%,同时完整保留了让 dLM 一开始就值得关注的并行解码。

令人不安的部分是,这个领域为了避免这一结论而造出来的东西:那些复杂度大多只为保住任意顺序而存在的 RL pipeline,包括难处理的似然与轨迹组合数学。这篇陷阱论文要说的正是:这套机器保住的恰恰是那个 bug。

这个结果对任何在比较 RL 配方的人也是一个干净的数据点:胜利来自拆除机器,而不是增加机器。当在同一模型家族上,更简单的目标函数打赢了更繁复的那个,繁复的目标函数就是混杂因素。

细微差别同样重要:对于 sudoku 这类约束满足问题,灵活性确实有帮助。这篇论文说的不是「任意顺序是坏的」,而是「任意顺序是一个工具,而在推理负载上它是错误的工具」。

推理论战的两面

支持扩散的结果并没有消失;它们落在另一个变量上。LLaDA(Nie 等)在标准预训练 + SFT 范式下从零训练一个掩码扩散模型,在通用、数学、代码 benchmark 上与自回归基线表现相当,让 LLaDA 8B 在 in-context learning 上可与 LLaMA 3 8B 竞争,并干净利落地修复了逆转诅咒。Diffusion-of-Thoughts(Ye 等)直接对推理步骤本身做扩散:一个小型扩散模型在多位数乘法、布尔逻辑和小学数学上打败了大得多的自回归模型,自我修正确实可用,self-consistency 也带来增益。Beyond Autoregression 的后续工作(Ye 等)用子目标失衡解释了原因:离散扩散学到的是自回归模型跳过的难子目标,在 Countdown 上打出 91.5% 对 45.8%,在 Sudoku 上 100% 对 20.7%。

与陷阱论文放在一起读,这些结果并不矛盾。收益来自并行性、覆盖面和结构化生成,而不是自由顺序。DoT 仍然是在思维链脚手架内部做扩散;MGDM 的子目标优先行为是训练诱导出的习得顺序,而不是固定的生成方向。LLaDA 最终仍要对每一个 token 做出承诺。陷阱论文把顺序单独隔离为变量,发现在数学和代码上,自由顺序是一种负债。「扩散模型能推理」与「任意顺序生成损害推理」,两者都成立。

我的立场

这场交锋之后,有三件事在我这里站得住。

第一,围绕 dLLM 任意顺序 RL 的研究议程是一笔交错了的税。扩散语言建模的价值在于并行精炼与片段级编辑,而不在于以任意顺序生成的权利。

第二,这重塑了我会在哪里部署 dLM。推理保持自回归。扩散在 AR 结构性吃亏的地方挣得一席之地:填充代码编辑、带固定片段的结构化输出,以及 agent 循环中的并行候选生成——一次起草多个补全,再验证最好的那个。并行解码也改变了服务层的数学,这关联到我的 面向 agent 负载的推理系统 笔记。

第三,如果你确实想要一个做推理的 dLM,记住 JustGRPO 的教训:标准 GRPO,固定顺序,不新建 RL 技术栈。这个角落里最难的问题都是自我造成的。当有人向你引用一个 dLM 推理数字时,问一句顺序约束是什么。这个领域两年的困惑,就装在这一个问题里。

什么会改变我的看法:一个自由顺序的 dLM 在解码预算保持不变的条件下,于规模上在 MATH 级别的推理中追平一个用 JustGRPO 训练的固定顺序模型。如果这实现了,那么这个陷阱就是训练配方的伪象,而非顺序自由的固有属性,上面的第一条也随之反转。

dLM 是一种解码策略,不是自回归大脑的替代品。把这篇陷阱论文读成一份许可:在它们擅长的地方使用它们,在其余所有地方不再为顺序道歉。论文:arXiv。获奖:ICML 2026 官方获奖公告

本文中链接的来源均已抓取并核实。