第 20 章 · Agentic RL
本章导读
核心内容
- 理解 Agentic RL 与单轮 RL 的根本差异:训练对象从 completion 变成 trajectory,rollout 必须在真实环境里执行。
- 掌握多轮交互的 MDP 形式化——联合状态、结构化动作、POMDP 视角,以及它为什么不是单轮 MDP 的简单扩展。
- 区分 ORM(结果奖励)与 PRM(过程奖励)、trajectory-level 与 step-level 信号,理解信用分配在多轮场景中为何变得尖锐。
- 建立 Agentic RL 训练系统的工程图景:异步 rollout、沙箱环境、异构轨迹长度,以及同步与异步框架的核心取舍。
核心公式
本章公式的作用
模型一旦接入工具,就不再只是写完一段回答。它会先行动,看到环境返回,再决定下一步。强化学习要训练的对象也随之改变:从生成一段回答,变成完成一条多步交互过程。
订机票 Agent 就是这样的任务。用户说"帮我订一张明天北京到上海最便宜的早班机票",模型不能直接写一句"已为你订好"。它要先把航班搜出来,再按时间和价格筛选,确认目标航班还有余票,最后把正确的乘机人、航班号和舱位信息传给下单接口。前面某一步如果带入了错误信息,后面的动作就会沿着错误状态继续执行,直到出票失败。
因此,训练时首先要保存的不是最终回答,而是完整过程:模型在什么状态下采取了什么动作,环境又返回了什么观测。这个过程称为轨迹,记作:
这里的 表示第 步前的状态, 表示模型采取的动作, 表示环境随后返回的观测。它把对话、工具调用和环境返回统一放进同一条序列里。后面讨论轨迹概率、动作掩码和逐步记录,都建立在这个表示之上。
轨迹记录了发生过什么,但它还没有说明模型能看到什么。订机票时,模型能读到搜索结果页的航班列表,却读不到航空公司的完整数据库;它能看到工具返回的库存提示,却不知道价格下一分钟会不会变化。真实环境有完整状态,模型只能看到其中一部分。这个设定用 POMDP 表示:
其中 是环境和上下文共同构成的状态空间, 是模型可采取的文本动作或工具动作, 描述动作如何改变环境和后续观测, 给出任务奖励, 表示模型实际能看到的观测。POMDP 在这里强调一件事:策略不是在完整世界状态上决策,而是在有限观测和历史上下文上决策。
有了轨迹和观测设定,优化目标也要跟着改变。单轮 RL 最大化的是一段输出的期望奖励:
Agentic RL 最大化的是整条轨迹的累积回报。模型在第 步搜什么,会影响第 步看到哪些航班;第 步选哪趟航班,又会影响第 步需要检查什么库存。目标函数因此写成:
这里的 表示轨迹由当前策略与环境交互采样得到, 用来折扣远期奖励, 表示第 步动作带来的奖励或最终奖励回传后的贡献。这个公式把训练目标从"让回答得高分"改成了让交互过程的总回报更高。
轨迹回报解决了"优化什么",还没有解决"每一步怎么学"。订票成功,不表示每个动作都值得强化;模型可能前面绕了远路,最后才补救回来。订票失败,也不表示每个动作都错;前几步可能已经找到正确航班,只是在最后下单时填错了参数。最终奖励必须拆回每一步,训练才知道该强化哪个动作、修正哪个动作。
这就是逐步优势要解决的问题:
它把整条轨迹的结果 和同一状态附近的基准回报 作比较,判断第 步之后的表现是否高于通常水平。后续小节里的结果奖励、过程奖励、轮次折扣、组内优势,都是在构造更可靠的 ,让最终奖励能更准确地影响每一步动作。
本章沿用前面已经建立的 MDP、策略梯度、GRPO 和可验证奖励,把它们放进多轮交互任务里重新看。到了 Agent 场景,训练不只要更新策略,还要处理环境异步、沙箱管理、轨迹长度不一致和长时程信用分配等工程问题。
章节安排
| 小节 | 核心问题 |
|---|---|
| 22.1 Agentic RL 总览 | 单轮到多轮的范式转移、智能体四组件、最简 Agent Loop、工业框架全景 |
| 22.2 多轮 RL 形式化 | 多轮 MDP 怎么写?联合状态、结构化动作、POMDP、step-level 轨迹、action mask |
| 22.3 轨迹信用分配 | 多轮交互失败了,该怪谁?ORM vs PRM、turn-level discounting、group-based advantage |
| 22.4 工具调用 RL | 训练数据从哪来?轨迹合成、工具调用策略、沙箱与异步 rollout |
| 22.5 Search-Augmented RL | 搜索增强 Agent 怎么训?DeepSeek-Researcher、Kimi-Researcher 的训练范式 |
| 22.6 Code Interpreter RL 工业实战 | 代码 Agent 的真实训练陷阱:不稳定、长度失控、reward hacking 的工程对策 |
| 22.7 多智能体协作与 Agent Swarm | 多个 Agent 怎么协作?角色分工、通信协议、群体优势分配 |
学习目标
读完本章后,你应该能够:
- 用 POMDP 六元组 形式化一个多轮 Agent 任务,并指出它相比单轮 MDP 新引入的要素(联合状态、结构化动作、外部环境)。
- 说清 ORM 与 PRM 的取舍——为什么可验证任务适合 ORM、为什么复杂推理需要 PRM、以及 SALT/group-based 这类介于两者之间的方案在解决什么问题。
- 理解 Agentic RL 训练系统的工程骨架——rollout 与 policy update 的交替、异步训练的代价与收益、沙箱环境的设计原则——并能据此判断 OpenRLHF、verl、AReaL 等框架的适用场景。
本章会频繁用到以下概念,建议先复习:
- GRPO 与 RLVR——"可验证奖励"是 Agentic RL 的天然奖励来源
- PPO 与奖励模型——策略优化的基础框架
- MDP 五元组——形式化多轮交互的出发点
准备好后,先从 Agentic RL 的整体图景开始——22.1 Agentic RL 总览。