外观
附录 B 数据、算力与交付标准
本附录统一规定数据切分、泄漏检查、算力配置、实验复现与课程交付。正文只引用这些规则,不重复罗列清单。
数据切分
世界模型的数据单位是 episode,而不是彼此独立的帧。默认先按 episode 切分,再从每个集合内部采样序列:
text
episodes
├── train
├── validation
└── test同一 episode 的相邻帧不得分散到训练集和测试集。多个相机同时记录同一事件时,也必须作为同一组切分。
泄漏检查
提交实验前逐项确认:
- 归一化统计量只由训练集计算;
- 测试 episode 没有参与码本、词表或缓存构建;
- 预测时没有读取 horizon 内的未来帧;
- teacher forcing 与自由 rollout 分开报告;
- 数据增强没有把同一原始片段复制到不同集合;
- 机器人多视角数据按任务实例而非单帧切分。
数据可用状态
外部数据统一标注为四种状态:
- 仓库内生成:代码、种子和生成器版本齐全;
- 可自动下载:固定 URL、版本、许可证和校验值齐全;
- 需手动申请:正文提供申请入口和预期目录;
- 不可公开:只用于背景介绍,不作为必做实验。
算力配置
每个实验区分三档:
| 配置 | 用途 | 允许的结论 |
|---|---|---|
| smoke | 检查接口、shape 与梯度 | 只能说明代码可运行 |
| course | 完成课程对照实验 | 可以报告课程指标 |
| research | 扩大数据、模型或种子 | 可以探索研究假设 |
课程主线以单张 24GB 显卡为上限;CPU smoke 不得冒充完整训练证据。
复现记录
每次正式运行至少记录:
text
experiment
git_commit
command
seed
dataset_version
split
device
wall_time
peak_memory
checkpoint_sha256
metrics推荐使用仓库中的 RunManifest。没有测量到的字段保留为空,不用估计值补齐。
动手实验达标线与产物接力
全书 23 个动手页共用一条规则:达标线必须是一个可检查的事实,不是一个感觉。各页的评分表/验收标准给出细则,本表给出全局最低线——没过这条线,该页不算完成。
| 动手页 | 达标线(全局最低) |
|---|---|
| 1.4 在想象中驾驶 | 完成交互体验:能说明问号、猜对、猜错分别意味着什么 |
| 2.7 核心组件 | 全部接口断言与单元测试通过 |
| 3.5 表格型世界模型 | 九格闭环跑通;留出 episode 上转移预测一致;数据卡齐全 |
| 3.6 神经网络世界模型 | 四类评价齐全,找到一组稳定失败,写出下一步需求 |
| 4.6 RSSM 从零实现 | 梦境分数与真实分数同时报告,并解释两者差异 |
| 4.7 想象训练 | 配方档:想象 rollout 上的策略更新跑通;简洁档:八项必交证据齐全 |
| 5.5 交互式视频从零实现 | 预测训练收敛;换动作的反事实差异图留档 |
| 5.6 受动作控制的视频小世界 | 动作反事实与 teacher forcing/free rollout 对照齐全 |
| 6.5 JEPA 从零实现 | 表示坍缩排查通过;linear probe 能读出位置 |
| 6.6 视频 JEPA 简洁实现 | 反事实动作差异与公平对照齐全;不把一步选择冒充 MPC |
| 7.6 扩散策略从零实现 | 三档策略同预算对照带置信区间;双模态场景复现 MSE 平均化 |
| 7.7 现实迁移 | 三档对照带 |
| 7.8 世界模型接上身体 | 基线、统计、失败分析三件套齐全;公开 artifact 可访问 |
| 8.6 占用网格预测 | 重建/占用指标与对照基线同表报告 |
| 8.7 驾驶场景四维世界 | 所选分支评分表全部勾选 |
| 9.2 系统评测 | 六项审问跑完,且迁移到自己训练的模型 |
| 9.3 失效分析与模型改进 | 稳定失败、两种竞争解释、最小改动、证伪实验四件齐全 |
| 9.4 设计新的世界模型 | 短报告含「能证明自己错」的实验设计 |
产物接力:后页消费前页的权重与数据,不要每页从零开始。
text
1.4 交互体验 → 3.5 表格世界 → 3.6 可学习世界(第一台神经世界模型)
4.6 RSSM / World Models → 4.7 想象训练(配方 + 简洁档,权重)──┐
5.5 交互式视频 → 5.6 受动作控制的视频(权重)──────────────────┤
6.5 JEPA 从零 → 6.6 视频 JEPA 简洁实现(权重)──────────────────┤
▼
7.6 扩散策略 → 7.7 现实迁移 → 7.8 毕业设计
8.6 占用网格 → 8.7 驾驶场景四维世界
所有路线 → 9.2 系统评测(加载你训出的任何一台)→ 9.3 失效分析 → 9.4 新的世界模型交付规范
一次完整课程交付包括:
- 可执行命令;
- 环境与依赖版本;
- 数据来源与切分;
- 至少一个弱基线;
- 主要指标与方差;
- 多步或闭环结果;
- 典型成功与失败样例;
- checkpoint 或其校验值;
- 已知限制;
- 一段不夸大的结论;
- 可公开时,数据集与模型发布到 Hub(或 ModelScope)并附数据卡/模型卡;不可公开时写明原因。
评测方法见第 9 章,本附录只负责让结果可以被复核。

