← logs/

基础模型:一张领域地图

我的工作横跨三个大多数人视为各自独立专长的领域:后训练、LLM 模型编辑与推理。我把它们当作一个闭环。你用可验证奖励训练行为,用定向编辑维护知识,并在延迟与成本约束下服务两者。每个阶段有同一个瓶颈:廉价、可靠的信号。训练要验证器,编辑要归因探针,路由要可观测性。

这篇就是我在深入下面任何一篇深读之前想要的那张地图。对三个领域中的每一个,它都覆盖了这个领域想做什么、眼下真正难在哪里、以及我的工作所处的位置。结尾是我会关注什么、会构建什么,然后是各篇深读的链接索引。

闭环,而非学科

post-training          model editing          inference
verifiable reward      targeted updates      paged KV, routing
RLVR / GRPO family     weights vs context   test-time compute
        |                     |                     |
        v                     v                     v
     behavior             knowledge          cost per useful token

有趣的工作发生在接缝处。为 RLVR 构建的验证器,在线服务时兼任路由信号。编辑的失败模式(遗忘),不过是训练失败模式(灾难性干扰)换了身衣服。测试时计算改变了后训练需要优化的目标。我自己的工作中也一直回到同样的三个接缝处。

后训练与可验证奖励

这个领域想做的事:把基础模型变成一个能推理、能遵循工具协议、并且只要输出能被程序检查就能改进的系统。检查才是承重的部分。DeepSeek-R1 表明,以可验证结果做强化学习,无需人工标注的推理轨迹就能引出推理,而且自省、验证这类行为是涌现出来的,而非教出来的。DeepSeekMath 提供了让这一切变得便宜的算法:GRPO,一种 PPO 变体,用组内相对基线换掉学得的 critic,砍掉策略梯度训练的内存开销,也改变了领域的默认成本曲线。

GRPO 家族如今已经是个小生态,我对 GRPO 家族树 的深读逐个过了一遍这些变体。RLVR 一侧也有自己的裂缝,收录在 RLVR 及其裂缝。依我之见,眼下难的是:

  • 验证器工程。奖励的好坏取决于检查器。程序化验证器运行便宜、对奖励黑客免疫,但要写出一个既给部分分、又不泄露捷径的验证器,本身就是一门设计纪律。我在 验证器工程 里写过这个。
  • 坍缩。大规模 RLVR 运行会出现熵坍缩和冗长坍缩。DAPO 是对两者的最好公开记录:它开源了一个完整系统,从 Qwen2.5-32B 基座出发在 AIME 2024 上拿到 50 分,还开源了让这一切成立的四个技巧,包括用解耦裁剪拖住熵坍缩、用动态采样让 rollout 只花在仍带梯度信号的提示上。
  • 样本效率。RLVR 看起来嗜数据;One-Shot RLVR 的结果说并非如此,至少在数学上。短版本是下面两篇精读之一;长版本在 RLVR 深读里。
  • 蒸馏。R1 报告的第二个阶段把长推理轨迹蒸馏进更小的模型,现在人人都把轨迹蒸馏当作标准动作。它值得比现在更多的审视;见 on-policy 蒸馏

精读:GRPO 的起源论文

DeepSeekMath 真正的遗产不是数据 pipeline,而是算法:GRPO 在一组采样补全内部计算优势,而不是来自学得的值函数;这移除了 critic 连同它的内存占用,让 RLVR 便宜到随处可跑。我的读法:GRPO 赢在简单,而不是赢在有原理依据——这个组就是 Monte Carlo 基线,此后的大部分 RLVR 文献都是对这个近似的一连串补丁。逐个变体的梳理在 GRPO 家族树

精读:One-Shot RLVR

One-Shot RLVR 直接问效率问题:如果数据集只有一个样本呢?答案改写了我对 RLVR 中数据量的看法;我把这个结果当作探针:如果在你的验证器下一个样本都推不动模型,那么约束就在奖励上。数字,以及紧挨这个结果的裂缝,都在 RLVR 及其裂缝

LLM 模型编辑

这个领域想做的事:在不重训的前提下修复已部署模型中的事实与行为。两个阵营。权重侧的方法定位相关参数并打补丁:ROME、MEMIT、AlphaEdit 及其后代变体。上下文侧的方法不动权重,经由外部记忆或上下文内检索来路由。真正的需求——这个领域一直没抓住的那个——是大语言模型的序列化编辑:模型被持续编辑数千次,同时对已知的一切保持准确。两个侧面我都覆盖了,在 LLM 序列化知识编辑权重 vs 上下文记忆

眼下难的是:

  • 规模化遗忘。下一篇精读就是权威示范。
  • 归因。如果你无法证明答案来自编辑而非检索或先验,你就无法放心交付编辑。这是与 RLVR 同一个可验证性问题,只是高一级。
  • 会撒谎的评测。只测一次或几次编辑的 benchmark 看不见序列化退化;许多在编辑方向上报出的「state of the art」结果,撑不过几百次编辑。

精读:遗忘之墙

Model Editing at Scale leads to Gradual and Catastrophic Forgetting(Gupta 等人,2024)是我会递给任何以为编辑问题已经解决之人的论文。它在 LLM 序列化模型编辑下评估 ROME 和 MEMIT 这两种典范的「先定位后编辑」方法:对同一个模型一个接一个地应用数百次编辑。结果是,被编辑的模型持续遗忘先前编辑过的事实、失去下游任务能力,分两个阶段:先是渐进的、逐步加剧的遗忘,然后是一个突然的灾难性阶段。

我的读法:这重新框定了这个领域的评测文化。单次编辑的可靠性、泛化与局部性都是必要条件,但远远不够;要紧的是横跨数千次编辑的遗忘曲线,以及无关知识会发生什么。论文呼吁带着可扩展性去评测,这个呼吁已经慢慢成为严肃工作的默认:AlphaEdit(ICLR 2025)把每次更新投影到保留知识的零空间,正是为了让 LLM 序列化模型编辑不再扰乱先前的内容;MEMOIR(NeurIPS 2025)把编辑稀疏化为残差记忆,让长长的编辑流不再互相覆盖。这两篇论文之所以存在,是因为序列化曲线如今才是算数的指标。我在这个领域构建的一切,都把它当作头号指标。

推理与服务

这个领域想做的事:服务那些工作负载不再像单轮 Q&A 的模型。agent 工作负载产生长上下文、tool calling 循环和长度极不稳定的推理轨迹。一次请求的成本,现在是分布,而不是数字。

锚点结果是 vLLM:PagedAttention 把 KV cache 当作虚拟内存对待,削减碎片化、允许缓存共享,在相同延迟下吞吐量是当时最优系统(FasterTransformer、Orca)的 2-4 倍。在线服务从此变成内存管理问题,此后每个正经服务栈都是它的后代变体。我对当前版图的笔记在 面向 agent 的推理系统

第二条线是测试时计算。Snell 等人 表明,测试时搜索的算力最优缩放,效率上比 best-of-N 基线高出约 4 倍;而且,在 FLOPs 对齐的比较中,带测试时计算的小模型在较易和中等难度的提示上,能胜过比它大 14 倍的模型——前提是预算按提示分配,而不是平均分配。s1 把机制做得简单到离谱:1,000 道精选问题、在推理轨迹上做 SFT、以及预算强制——在生成中途终止或延长模型的思考(追加「Wait」会让它重新检查)。s1-32B 在竞赛数学上最高胜过 o1-preview 27%。训进模型的东西与请求时计算的东西之间的边界,如今是一个真正的工程决策;我在 测试时计算的边界 里深挖它在哪里破裂。

第三条线是成本曲线本身。Muon(一种带权重衰减和逐参数更新缩放的矩阵正交化优化器)报告,在算力最优训练下相对 AdamW 有约 2 倍的算力效率,并在 Moonlight——一个在 5.7T tokens 上训练的 3B/16B MoE——上得到验证。如果优化器的收益在大规模下站得住,它们会改变训练和编辑后重训两者的经济学。更多见 Muon 优化器复兴。架构在 架构 2026 里有自己的地图,扩散一侧在 扩散语言模型

眼下难的是:为推理密集的流量做 batching(长生成会毁掉天真的调度器)、在前沿模型与专才小模型之间路由、以及训练时与测试时计算的取舍——没有公认的核算口径。这三个我从一个产品上了解得很细:在 PiPlan.ai,我的路由层把常规 agent 步骤发给自托管的多 GPU vLLM 节点,把复杂规划升级给前沿 API;而这个分工是否划算,恰好由上面那些 batching、路由和预算问题决定。

我的立场

三个押注,直说。

第一,可验证奖励是整个闭环里杠杆最高的输入。R1 表明行为会涌现;One-Shot RLVR 表明数据可以很少;DAPO 表明失败模式可以修。剩下的瓶颈是验证器质量,所以我把时间花在那里。一个毫秒级跑完的程序化验证器,比一个更大的模型更有价值。

第二,LLM 序列化模型编辑首先是服务问题,然后才是研究问题。墙不在更新的数学,而在大规模证明更新成立的同时其他一切保持完好。这意味着归因探针、带检查点的编辑历史,以及针对遗忘曲线的回归测试套件。这个领域会先收敛出工具,再收敛出理论。

第三,路由是后训练与服务的交汇处。一旦你有了验证器训练出的小专才模型,问题就变成何时调用它们、而非前沿模型。这个决定需要一个信号,而这个信号就是你训练时用的同一个验证器。我会围绕验证器构建路由器,让延迟启发式打破平局。

具体说,接下来的产物:一个把证伪对照当作强制产物而非可选附加的训练闭环,让每个交付的 checkpoint 都附上证明——增益并非来自格式;一个 eval 是序列化遗忘曲线的编辑 harness;以及一个服务层,其中按提示词的测试时预算是头等旋钮,由验证器置信度设定。

我的工作落点

这些联系,按我能辩护的程度陈述。

  • 后训练:VerifierForge 用 GRPO 对抗程序化验证器训练小模型,带证伪对照。已展示的闭环是 NL-to-SQL 工作负载:50 个训练样本、在固定的 60 题留出考试上做选择(pass@1 从 58.3% 到 78.3%)、以及一个刻意不完美的随机奖励参照——其训练池监控指标收在 0.40,而验证器奖励侧的监控指标收在 0.80;仓库自己也称之为证伪检查,明确够不上严格的因果实验。验证器对冻结 schema 执行每条生成的 SQL 并比较结果集,所以奖励是可执行检查,而非裁判模型。
  • 复现:我把论文复现——其中就有 GRPO 和 One-Shot RLVR——放在我的 HoReN-paper-reproduction 仓库里。一个训练主张,我在自己控制的硬件上跑过之前,不会相信它。
  • LLM 模型编辑:我关于 LLM 序列化模型编辑的第一作者预印本还在审,所以我这里不夸大它;完整论述在 LLM 序列化知识编辑。上面的复现 harness 还让 GRACE——那种面向终身编辑的离散键值适配器方法——跑在同一个代码库上,我的遗忘曲线工具就来自这里。
  • 在线服务:在 PiPlan.ai 我跑一个带动态路由的自托管多 GPU vLLM 节点。我一直沿用的教训:当你控制服务层时,验证器与路由器就能共享同一个信号,小专才模型不再是研究课题,而变成运维决策。

地图

各篇深读嵌在这张总览之下,地图每个节点一篇:

随便挑一个节点;闭环才是重点:训练你能检查的行为,编辑你能归因的知识,在你理解的成本曲线上服务两者。

本文所链来源均已抓取并核实。