Skip to content

附录 B 数据、算力与交付标准

本附录统一规定数据切分、泄漏检查、算力配置、实验复现与课程交付。正文只引用这些规则,不重复罗列清单。

数据切分

世界模型的数据单位是 episode,而不是彼此独立的帧。默认先按 episode 切分,再从每个集合内部采样序列:

text
episodes
├── train
├── validation
└── test

同一 episode 的相邻帧不得分散到训练集和测试集。多个相机同时记录同一事件时,也必须作为同一组切分。

泄漏检查

提交实验前逐项确认:

  • 归一化统计量只由训练集计算;
  • 测试 episode 没有参与码本、词表或缓存构建;
  • 预测时没有读取 horizon 内的未来帧;
  • teacher forcing 与自由 rollout 分开报告;
  • 数据增强没有把同一原始片段复制到不同集合;
  • 机器人多视角数据按任务实例而非单帧切分。

数据可用状态

外部数据统一标注为四种状态:

  1. 仓库内生成:代码、种子和生成器版本齐全;
  2. 可自动下载:固定 URL、版本、许可证和校验值齐全;
  3. 需手动申请:正文提供申请入口和预期目录;
  4. 不可公开:只用于背景介绍,不作为必做实验。

算力配置

每个实验区分三档:

配置用途允许的结论
smoke检查接口、shape 与梯度只能说明代码可运行
course完成课程对照实验可以报告课程指标
research扩大数据、模型或种子可以探索研究假设

课程主线以单张 24GB 显卡为上限;CPU smoke 不得冒充完整训练证据。

复现记录

每次正式运行至少记录:

text
experiment
git_commit
command
seed
dataset_version
split
device
wall_time
peak_memory
checkpoint_sha256
metrics

推荐使用仓库中的 RunManifest。没有测量到的字段保留为空,不用估计值补齐。

动手实验达标线与产物接力

全书 23 个动手页共用一条规则:达标线必须是一个可检查的事实,不是一个感觉。各页的评分表/验收标准给出细则,本表给出全局最低线——没过这条线,该页不算完成。

动手页达标线(全局最低)
1.4 在想象中驾驶完成交互体验:能说明问号、猜对、猜错分别意味着什么
2.7 核心组件全部接口断言与单元测试通过
3.5 表格型世界模型九格闭环跑通;留出 episode 上转移预测一致;数据卡齐全
3.6 神经网络世界模型四类评价齐全,找到一组稳定失败,写出下一步需求
4.6 RSSM 从零实现梦境分数与真实分数同时报告,并解释两者差异
4.7 想象训练配方档:想象 rollout 上的策略更新跑通;简洁档:八项必交证据齐全
5.5 交互式视频从零实现预测训练收敛;换动作的反事实差异图留档
5.6 受动作控制的视频小世界动作反事实与 teacher forcing/free rollout 对照齐全
6.5 JEPA 从零实现表示坍缩排查通过;linear probe 能读出位置
6.6 视频 JEPA 简洁实现反事实动作差异与公平对照齐全;不把一步选择冒充 MPC
7.6 扩散策略从零实现三档策略同预算对照带置信区间;双模态场景复现 MSE 平均化
7.7 现实迁移三档对照带 n 与置信区间;跨模拟器差异有数字
7.8 世界模型接上身体基线、统计、失败分析三件套齐全;公开 artifact 可访问
8.6 占用网格预测重建/占用指标与对照基线同表报告
8.7 驾驶场景四维世界所选分支评分表全部勾选
9.2 系统评测六项审问跑完,且迁移到自己训练的模型
9.3 失效分析与模型改进稳定失败、两种竞争解释、最小改动、证伪实验四件齐全
9.4 设计新的世界模型短报告含「能证明自己错」的实验设计

产物接力:后页消费前页的权重与数据,不要每页从零开始。

text
1.4 交互体验 → 3.5 表格世界 → 3.6 可学习世界(第一台神经世界模型)
4.6 RSSM / World Models → 4.7 想象训练(配方 + 简洁档,权重)──┐
5.5 交互式视频 → 5.6 受动作控制的视频(权重)──────────────────┤
6.5 JEPA 从零 → 6.6 视频 JEPA 简洁实现(权重)──────────────────┤

7.6 扩散策略 → 7.7 现实迁移 → 7.8 毕业设计
8.6 占用网格 → 8.7 驾驶场景四维世界
所有路线 → 9.2 系统评测(加载你训出的任何一台)→ 9.3 失效分析 → 9.4 新的世界模型

交付规范

一次完整课程交付包括:

  • 可执行命令;
  • 环境与依赖版本;
  • 数据来源与切分;
  • 至少一个弱基线;
  • 主要指标与方差;
  • 多步或闭环结果;
  • 典型成功与失败样例;
  • checkpoint 或其校验值;
  • 已知限制;
  • 一段不夸大的结论;
  • 可公开时,数据集与模型发布到 Hub(或 ModelScope)并附数据卡/模型卡;不可公开时写明原因。

评测方法见第 9 章,本附录只负责让结果可以被复核。