← logs/

测试时计算:多想何时有用,模型何时迷失

测试时计算是推理技术栈里最容易拉动的杠杆:不需要重新训练、不需要新数据、不需要奖励模型,只需让模型想得更久。但这个杠杆有一个失败模式,是这个领域在理解它之前就已经测量到的:在错误的条件下,多思考并不能修正答案,反而让模型以更高的置信度执着于一条错误的路径。

这篇文章读三篇从两端界定这一现象的论文。s1 精确展示了预算强制能买到什么。LIMO 展示了有多少「推理能力」早已在权重之中。而关于 LLMs 在多轮对话中迷失的 ICLR 2026 Outstanding Paper,是故事中失败的那一面。

领域地图:思考是一种预算,而非一种能力

o1 时代把推理重新定义为一种资源:模型把 token 花在隐藏的思考上,投入越多,性能越好。复现浪潮分成了两个阵营。一方把测试时计算当作可按请求旋动的旋钮:提前终止,或逼着模型继续想。另一方则认为,看起来像思考能力的东西,大多是对早已在权重里的知识的引出,真正的杠杆是后训练数据,推理预算只是次要的。两个阵营都对了一半,而分歧最终归结为一个问题:额外的思考到底改变了模型内部状态的什么?

精读:s1,以及那个有效的旋钮

s1: Simple test-time scaling(Muennighoff 等人,斯坦福,2025 年 1 月)是旋钮阵营最清晰的表述。两个要素。第一,一个小数据集:s1K,1,000 道带推理轨迹的问题,按三个经消融验证的标准精选:难度、多样性和质量。第二,预算强制:一个解码时的控制器,能强行终止模型的思考,或在模型试图结束时追加多次「Wait」来延长思考。这一招让模型能复核自己的答案,而且常常能修正错误的推理步骤。

数字很惊人。在 s1K 上对 Qwen2.5-32B-Instruct 做监督微调之后,得到的 s1-32B 在竞赛数学上最高超出 o1-preview 27%(MATH 和 AIME24)。预算强制还能推过模型不经干预时的水平:AIME24 从 50% 到 57%。没有重新训练、没有新数据、没有奖励模型;这个旋钮有效。

这篇论文间接揭示的是前提条件:只有当模型接下来的 token 是合理的推理步骤时,预算强制才划算。「Wait」是一种廉价的方式,用来重新打开提前一步关闭的思维链。当模型自信地犯错时它毫无作用,因为多出来的 token 都花在了重新推导同一个错误框架上。

论文还报告了这个旋钮自身的极限:随着预算增长,预算强制的收益趋于平缓,而且这一招受限于上下文窗口,因为每追加一个「Wait」都在消耗上下文,而一条长链本来就已经在消耗它(§4.4.3)。旋钮有效,但它有天花板,而且计费表在走。

精读:LIMO,以及本就在那里的知识

LIMO: Less is More for Reasoning(Ye 等人,2025 年 2 月)从训练侧攻击同一个问题。LIMO 是在 817 道精心挑选、带长推理轨迹的数学题上的普通监督微调,大约是此前方法所需训练数据的 1%。结果:AIME24 上 63.3%、MATH500 上 95.6%,而此前微调过的模型分别是 6.5% 和 59.2%;此外在多样的分布外 benchmarks 上有 45.8 个百分点的绝对提升,超过了用一百倍数据训练的模型。数据集是公开的

LIMO 假说陈述了机制:到基础模型预训练完成时,领域知识已经编码在权重里。后训练样例不是教模型推理;它们充当认知模板,展示该走哪些推理路径。按照这一观点,测试时计算看似新增的一大部分——产出长而正确的链的能力——其实是潜在能力正在被引出。

两篇论文并不互相矛盾;它们切分的是同一个现象。s1 表明你可以推动模型在推理时多花一些潜在能力。LIMO 表明让这种能力变得可用只需极少后训练数据。两者都认为,难的并不是思考预算,而是模型是否有一条正确的路径可以花这笔预算。

精读:LLMs Get Lost in Multi-Turn Conversation

失败的一面是 LLMs Get Lost in Multi-Turn Conversation(Laban、Hayashi、Zhou 和 Neville,Microsoft Research 与 Salesforce Research),被评为 ICLR 2026 Outstanding Paper。实验设置:作者把单轮 benchmarks 中完整给出的指令分片,在模拟对话中每轮揭示一片,然后与一次性给出完整指令的单轮基线对比。

这些结果对任何把上下文当作免费资源的人都是一个警告。在 15 个 LLM 和六项生成任务上,超过 200,000 场模拟对话中,从单轮到多轮,平均性能下降了 39%,绝对降幅 25 个百分点,从约 90% 掉到 65%。论文把这种下降分解为能力上的小幅损失与不可靠性的大幅上升。模型在早期轮次做出假设,过早尝试最终方案,然后过度依赖它们。用作者的话说:当 LLM 在对话中走错了一步,它们就会迷失且无法恢复。

我觉得最要命的细节是:模型选择刻意包含了两个推理模型,o3 和 DeepSeek-R1,专门用来探测多轮对话中的测试时计算。它们也一样迷失了。额外的思考没有救回它们,因为失败不是缺少推理步骤,而是执着于一个早期假设,后续再多的深思也不会回头审视它。这正是限制预算强制的同一个病理:「Wait」能重新打开思维链,但打不开问题的框架。

我的立场:让预算变成有条件的

对我来说,综合结论是:测试时计算是模型当前所在路径上的一个旋钮,而不是探路器。它只有在两个条件下才划算:知识在权重里(这是 LIMO 的观点),以及模型仍能发现并修正自己的错误(这是 s1 的观点)。当模型已经锁定一个错误框架时它就会失败——这正是多轮对话的失败模式。s1 自己报告的极限也指向同一方向:当收益趋于平缓、上下文窗口耗尽时,即使身在旋钮阵营,无条件的预算也是错误的默认设置。

接下来的构建是一个预算控制器,设计上就是有条件的:

  • 可验证、竞赛式任务获得大预算,因为成功可以核查,重新打开思维链是划算的;
  • 开放式与对话式润色任务获得上限,因为它们的错误模式是执着,而不是过早停止;
  • 控制器监视轨迹中的执着信号——过早的最终答案、重复出现的假设、长时间没有修正——并通过重新框定、加入对实际需求的复述,或终止来干预;
  • 评测转向多轮分片式设置,因为单轮分数系统性地高估同一模型在实际使用中的表现。

多轮论文里有一个结果支持我所知道的最便宜的干预:RECAP 设置,即在对话结束后用一个额外的轮次复述每一个分片。这个适用范围值得精确说明:RECAP 只在两个模型和四项任务上测试过,恢复是部分的,单轮的天花板仍然够不着。即便如此,相当一部分损失能从这一个廉价的轮次里找回来,这让重新锚定成为全论文性价比最高的一笔交易。控制器的职责不是最大化思考,而是发现模型何时锁死在错误的路径上,然后对此采取行动。

这对 PiPlan.ai 意味着什么

PiPlan.ai 的对话式规划器–执行器仍在进行中,所以这是一条设计笔记而不是结果。在我看来,这篇多轮论文就像一份这份 agent 必须扛过什么的规格说明。规划对话接近论文的分片式设置:用户的约束分多轮到来,模型中途草拟出计划,而失败模式是执着于对问题的早期框定。

随之而来的是两条设计要求。第一条是分片耐受性:agent 不能把草拟的计划当作定稿,因为后续轮次通常会推翻草稿赖以建立的假设。第二条是在计划时重新锚定,即把 RECAP 模式用到规划上。在任何计划被提交之前,执行器复述它累积起来的完整需求集,并对照这份复述来核查计划,而不是对照它的滚动摘要。提交前复述只花一个轮次,而论文的部分恢复结果就是证据:便宜不等于弱。它在我们自己的负载下是否成立,要等 agent 上线后再测量,而不是我现在声称的。

本文中链接的来源均已抓取并核实。