外观
附录 C 论文、榜单与产业地图
本附录提供动态索引,不用公司新闻替代技术证据。阅读顺序始终是:原始论文、官方代码、官方文档、可重复实验,最后才是产品演示。
四问阅读法
阅读一篇世界模型论文时,先回答四个问题:
- 它改了系统的哪一段接口?
- 表示中保留了什么,又丢掉了什么?
- 训练目标怎样约束多步未来或动作后果?
- 哪项实验能证明这个取舍值得?
如果四问答不清,先不要抄架构图。
论文路线
| 路线 | 起点 | 继续阅读 |
|---|---|---|
| 决策与规划 | World Models、PlaNet | Dreamer、MuZero、TD-MPC2 |
| 交互式视频 | VideoGPT、Genie | GameNGen、DIAMOND、Diffusion Forcing |
| 特征预测 | I-JEPA | V-JEPA、V-JEPA 2-AC |
| 具身智能 | RT-1、ACT | OpenVLA、Octo、π0、SmolVLA、GR00T、Track2Act |
| 空间世界 | NeRF、3DGS | DriveDreamer、GAIA、Cosmos、未来占用预测 |
| 世界模型×机器人(2026 前沿) | τ0-WM、GE-Sim 2.0 | WALL-WM、RoboDream、RISE、RAW-Dream、PhysBrain |
最后一行是 2026 年的前沿,它们不是新方向,而是 7.4 三种用法的工程化:τ0-WM 把策略和后果检查器焊进同一个视频模型,GE-Sim 2.0 是数据引擎加"世界裁判",RoboDream 专攻合成数据,PhysBrain 从人类第一视角视频里提炼物理常识再接到 VLA。读它们时用四问阅读法,都能落回本书的接口图上。
评测基准
基准也按证据层次阅读:
- 生成质量:FVD、VBench、WorldScore;
- 世界一致性:WorldModelBench、多步与反事实测试;
- 决策控制:DMControl、Atari、真实环境回报;
- 机器人:LIBERO、SimplerEnv、ManiSkill、HumanoidBench;
- 空间与驾驶:nuPlan、占用预测和闭环驾驶协议。
榜单名次必须连同数据版本、输入条件、推理预算和是否使用额外数据一起阅读。
产业路线
中美团队的产品形态可以按技术需求观察,而不按公司名单背诵:
| 需求 | 常见技术路线 | 代表系统 |
|---|---|---|
| 通用操作 | VLA、生成策略、机器人数据 | π0、OpenVLA、GR00T、GEN-1.5 |
| 家庭机器人 | 长时记忆、恢复、世界模型检查器 | 1X World Model |
| 人形与全身控制 | 运动先验、分层控制、Sim-to-Real | Unitree RL Lab、GR00T |
| 自动驾驶 | 视频世界模型、BEV、未来占用 | GAIA、DriveDreamer |
| 可交互内容 | 动作条件视频、实时生成 | Genie、GameNGen |
开源状态
每个系统必须标注一种状态:
- 代码+权重+数据:主要实验可以复现;
- 部分开放:只开放部分代码、权重或数据;
- 仅论文/演示:可以学习思路,不能宣称复现;
- 未公开:只能作为需求和产品路线案例。
开放状态会变化。正式引用时记录访问日期、release 或 commit、许可证,以及代码、权重、数据分别是否可得。

