Skip to content

附录 C 论文、榜单与产业地图

本附录提供动态索引,不用公司新闻替代技术证据。阅读顺序始终是:原始论文、官方代码、官方文档、可重复实验,最后才是产品演示。

四问阅读法

阅读一篇世界模型论文时,先回答四个问题:

  1. 它改了系统的哪一段接口?
  2. 表示中保留了什么,又丢掉了什么?
  3. 训练目标怎样约束多步未来或动作后果?
  4. 哪项实验能证明这个取舍值得?

如果四问答不清,先不要抄架构图。

论文路线

路线起点继续阅读
决策与规划World Models、PlaNetDreamer、MuZero、TD-MPC2
交互式视频VideoGPT、GenieGameNGen、DIAMOND、Diffusion Forcing
特征预测I-JEPAV-JEPA、V-JEPA 2-AC
具身智能RT-1、ACTOpenVLA、Octo、π0、SmolVLA、GR00T、Track2Act
空间世界NeRF、3DGSDriveDreamer、GAIA、Cosmos、未来占用预测
世界模型×机器人(2026 前沿)τ0-WM、GE-Sim 2.0WALL-WM、RoboDream、RISE、RAW-Dream、PhysBrain

最后一行是 2026 年的前沿,它们不是新方向,而是 7.4 三种用法的工程化:τ0-WM 把策略和后果检查器焊进同一个视频模型,GE-Sim 2.0 是数据引擎加"世界裁判",RoboDream 专攻合成数据,PhysBrain 从人类第一视角视频里提炼物理常识再接到 VLA。读它们时用四问阅读法,都能落回本书的接口图上。

评测基准

基准也按证据层次阅读:

  • 生成质量:FVD、VBench、WorldScore;
  • 世界一致性:WorldModelBench、多步与反事实测试;
  • 决策控制:DMControl、Atari、真实环境回报;
  • 机器人:LIBERO、SimplerEnv、ManiSkill、HumanoidBench;
  • 空间与驾驶:nuPlan、占用预测和闭环驾驶协议。

榜单名次必须连同数据版本、输入条件、推理预算和是否使用额外数据一起阅读。

产业路线

中美团队的产品形态可以按技术需求观察,而不按公司名单背诵:

需求常见技术路线代表系统
通用操作VLA、生成策略、机器人数据π0、OpenVLA、GR00T、GEN-1.5
家庭机器人长时记忆、恢复、世界模型检查器1X World Model
人形与全身控制运动先验、分层控制、Sim-to-RealUnitree RL Lab、GR00T
自动驾驶视频世界模型、BEV、未来占用GAIA、DriveDreamer
可交互内容动作条件视频、实时生成Genie、GameNGen

开源状态

每个系统必须标注一种状态:

  • 代码+权重+数据:主要实验可以复现;
  • 部分开放:只开放部分代码、权重或数据;
  • 仅论文/演示:可以学习思路,不能宣称复现;
  • 未公开:只能作为需求和产品路线案例。

开放状态会变化。正式引用时记录访问日期、release 或 commit、许可证,以及代码、权重、数据分别是否可得。