多轮交互 RL 与信用分配(已拆分)
内容位置
这一页保留为旧链接入口。原来的内容已按主题拆分为两节:
- 形式化部分(多轮 MDP、POMDP、轨迹结构、action mask)→ 19.2 多轮强化学习
- 信用分配部分(ORM/PRM/SALT、turn-level discounting、Mini Agent Loop 实验)→ 19.3 轨迹信用分配
请从上面两个链接进入对应内容。
这一页保留为旧链接入口。原来的内容已按主题拆分为两节:
- 形式化部分(多轮 MDP、POMDP、轨迹结构、action mask)→ 19.2 多轮强化学习
- 信用分配部分(ORM/PRM/SALT、turn-level discounting、Mini Agent Loop 实验)→ 19.3 轨迹信用分配
请从上面两个链接进入对应内容。