Agentic RL:训练 agent,而非提示它
过去一年的大部分时间里,「我的 agent 不够好」这个问题的默认答案是更好的提示词:更长的系统指令、更精准的工具描述、更精细的推理脚手架。这条路边际收益递减,因为提示只能展现策略已有的能力。真正有证据支撑的替代方案是训练 agent:把策略当作对象,把环境当作训练场,把 RL 当作 agentic 行为上的梯度。
Search-R1 教会模型何时调用搜索引擎。ReTool 教会模型何时打开代码解释器。iStar 在奖励不可验证时提供步级信用分配。而一项 ICML 2025 的结果提供了框架:SFT 记忆,RL 泛化。
领域地图:agent 即 POMDP 中的策略
Zhang 等人(The Landscape of Agentic Reinforcement Learning for LLMs,2026 年 1 月发表于 TMLR,综合了 500+ 篇工作)的综述把界线画得很清楚:经典 LLM RL 是退化的单步 MDP,从提示到响应再到奖励。Agentic RL 是 POMDP:多步交互、部分可观测性,以及一个在自由文本与工具调用、环境命令之间交错的动作空间。他们的分类体系按能力组织这个领域:规划、工具使用、记忆、推理、自我改进和感知。
我自己对设计空间的地图有三条轴:
- 奖励来源:可验证(测试通过、任务完成、搜索命中)对比学习式或评判式。
- 信用分配:结果级对比步级。
- 算法:策略梯度族(PPO、GRPO,见 GRPO 家族树)对比偏好族(DPO 及其同侪)。
在实践中划分这个领域的问题:你能否承担得起 rollout,能否把奖励写下来?这篇是训练侧的补充,与我的 agent 分类体系(agent 的四种类型)互补。
精读:Search-R1
Search-R1(Jin 等人,2025 年 3 月)是面向搜索增强推理的 RL。模型学会在推理中途发出搜索查询,与真实搜索引擎进行多轮交互,并获得一个简单的基于结果的奖励。两个工程选择格外突出:检索到的 token 在训练中被掩码以保证 RL 稳定,且奖励保持粗粒度。
结果:在七个 QA 数据集上,Qwen2.5-7B 比 RAG 基线提升 41%,Qwen2.5-3B 提升 20%。重点不在 benchmark 数字本身。重点在于何时搜索、写什么查询、何时停止搜索变成了习得的行为;没有人用提示把它写进去。
精读:ReTool
ReTool(Feng 等人,2025 年 4 月)对代码解释器做了同样的事。模型把真实代码执行交错进推理过程,带结果反馈的 RL 训练出工具使用策略。配方与算法同样重要:合成冷启动轨迹、用 SFT 引导启动、然后 RL。
数字:一个 32B 模型在 400 步训练内在 AIME 上达到 67%,对比纯文本 RL 基线在 1080 步时的 40%;在扩展设定下达到 72.5%,高出 o1-preview 27.9 分。该模型还表现出涌现的代码自我修正,即「aha 时刻」的工具使用版本。
两条教训。工具调用是一种策略,而策略最好从结果反馈中习得。SFT 冷启动不是妥协,它是让 RL 运转起来的格式引导,正是那篇记忆论文所预言的互补性。
精读:iStar,即没有可核查奖励时的信用分配
棘手的情形是任务成功不是一个可核查的布尔值:开放式交互、社交类任务、长程委派。Agentic RL with Implicit Step Rewards(iStar,ICLR 2026)用隐式步级奖励解决那里的信用分配问题。它用一个基于轨迹偏好的多轮 DPO 目标,把隐式过程奖励模型与策略联合训练,再把步级优势与回合级优势结合。无需额外 rollout、无需步级标签;不过步级奖励继承了产出轨迹偏好的主体,所以验证器的问题又上移了一层:谁的偏好,依据什么评分标准?
在 WebShop、VisualSokoban 和 SOTOPIA 上的结果:对比前沿 LLM 和强力 RL 基线达到最优水平,样本效率和训练稳定性更好。我的看法:这才是要紧的方向。真实的 agent 任务大多不附带验证器,所以这个领域的成败系于学习式步级信用分配。
为什么训练而非提示
SFT Memorizes, RL Generalizes(Chu 等人,ICML 2025)建了两个测试床:一个算术推理卡牌游戏,和一个带文本与视觉变体的导航环境。带结果奖励的 RL 跨未见过的规则变体和未见过的新视觉泛化;SFT 记忆了训练分布。而 SFT 仍然不可或缺:它稳定输出格式,RL 才能继而泛化。
这件事的 agentic 版本很简单。提示调校的是你工程出来的行为;RL 改变的是策略,而策略才是全新环境中真正出场的东西。RLVR 式训练的裂缝也正是从这里显现(RLVR 及其裂缝):稀疏的终止奖励、高方差、对奖励通道的敏感——这正是步级信用与环境设计才是真正瓶颈的原因。
我的立场
在三个条件成立的地方我会用 agentic RL:奖励可以定义、rollout 承担得起、差距在策略而非基础知识。其余一切都留在提示词与 harness 的路线上,因为在糟糕的奖励上训练比完全不训练更糟。我上线过的 SafeRoutes 就是提示词与 harness 的情形:模型产出对世界的判断,一个确定性门禁强制不变量,不涉及任何训练。
还有一个经济性门槛,它是决策规则而不是口号:只有当训练出的行为比下一代基础模型活得更久时,RL 才划算。如果你用 rollout 买来的行为在下一代基础模型里免费附赠,那这次训练支出就是一笔租金。所以,训练那些你预期至少能存活一个模型代际的行为,提示那些基础模型明显趋于收敛的行为。
这个立场是我当前的配置,不是计划。我自己照着 DeepSeekMath 论文实现了 GRPO(GRPO 家族树),VerifierForge 就用它对着程序化验证器训练(验证器工程)。这次运行带了一个刻意不完美的随机奖励证伪参照:验证器奖励的那次运行,训练池监控指标停在 0.80;随机奖励的那次运行,监控指标停在 0.40。这是参照,不是严格的因果证明,因为对照组是一个更小、训练步数更少的模型;但如果随机臂也以同样的方式上升,验证器的故事就完了。
那个立场的 harness 版本:一个带可插拔环境和奖励函数的 agentic RL harness,按对奖励的信任排序——可验证的优先(工具成功、执行结果、任务完成),学习式奖励其次,开放式任务用 iStar 式隐式步级奖励。harness 的细节:对检索内容做掩码的观测、用 GRPO 式组优势(GRPO 家族树)跳过 critic,以及一个评测协议,测试留出的变体而不只是训练分布,因为那正是记忆与泛化之间的差别。
坦诚的警告:RL agent 会入侵真实工具来骗取奖励,rollout 要花真金白银,长程信用分配尚未解决。三者没有一条是留在提示一侧的理由;每一条都是下一个 harness 的规格。
本文链接的资料来源均已抓取并核验。