Skip to content

附录 A 数学、代码与术语速查

本附录只收纳正文中反复使用、适合随时查阅的工具,不引入新的课程主线。

概率与期望

Exp(x)[f(x)]=xp(x)f(x)p(x)f(x)dx.

条件分布 p(st+1st,at) 表示在当前状态和动作已知时,下一个状态的可能性。世界模型通常学习的正是这种条件关系。

梯度与链式法则

若损失 L 依赖中间变量 z=fθ(x),则

Lθ=Lzzθ.

多步 rollout 会让梯度穿过重复使用的动力学模型。梯度爆炸时先检查序列长度、归一化和梯度裁剪,不要只调学习率。

KL 与熵

DKL(qp)=Eq(z)[logq(z)logp(z)].

KL 衡量两个分布的差异,不是对称距离。RSSM 中,posterior 使用当前观测,prior 只使用历史与动作;KL 让 prior 学会在没有未来观测时预测 posterior。

H(p)=Ep(x)[logp(x)]

衡量分布的不确定性。熵高不等于模型正确,只表示模型给出的分布更分散。

PyTorch 与 JAX/Flax

任务PyTorchJAX/Flax
参数存放nn.Module 内部状态显式参数树
前向计算y = model(x)y = model.apply(params, x)
梯度loss.backward()jax.grad(loss_fn)
优化器optimizer.step()updates, state = tx.update(...)
随机数全局或 Generator显式传递 PRNGKey
编译torch.compilejax.jit
批处理张量批维jax.vmap

阅读 JAX 项目时,先找到参数树、随机 key 和纯函数边界;阅读 PyTorch 项目时,先找到 Moduleforward 和优化器更新。

常用术语

中文英文缩写
世界模型world modelWM
动力学模型dynamics model
循环状态空间模型recurrent state-space modelRSSM
模型预测控制model predictive controlMPC
交叉熵方法cross-entropy methodCEM
联合嵌入预测架构joint embedding predictive architectureJEPA
视觉语言动作模型vision-language-action modelVLA
鸟瞰图bird's-eye viewBEV
分布外out of distributionOOD
从仿真到现实sim-to-real

术语首次出现在正文时使用“中文(英文,缩写)”,后文优先使用缩写或中文短名。