03 / MODELS
VLA / WAM,
具体看它如何出动作。
本章只比较两类模型:VLA 直接预测动作;WAM 同时预测未来状态并把预测用于动作生成。世界模型、视频模型和动作模型只在它们进入机器人策略时收录。
⏰ 最后更新时间: 2026-08-11 | 查看更新日志;本页内容将每日更新「VLA/WAM 结构、训练目标、动作接口与实机证据」。
1) 只看四个接口差异
| 接口 | VLA | WAM |
|---|---|---|
| 输入 | 图像/视频 + 语言 + robot state | 图像/视频 + 语言 + state + action history |
| 训练目标 | 行为克隆 / action token likelihood / diffusion action | 未来视觉或 latent state prediction + action generation |
| 输出 | action chunk、末端轨迹或关节动作 | 未来 state/video 与动作;可做 rollout 或 action ranking |
| 关键失败 | 语义正确但物理动作错误 | 视频看起来合理但接触动力学错误;rollout 越长误差越大 |
2) 具体方案
Gemini Robotics / VLA Google DeepMind
追踪点:跨机器人形态、embodied reasoning、On-Device 推理。评估时要看真实任务成功率与端到端时延,不只看语言跟随。
DreamZero / WAM NVIDIA GEAR Lab
以视频扩散 backbone 联合预测视频与动作;论文报告 14B 模型 7Hz 闭环控制和真实机器人跨任务泛化。重点核对 action conditioning、推理延迟和 embodiment adaptation。
OpenWAM / Joint WAM Stanford University
提供联合视觉动态与可执行控制的开源框架、消融和 benchmark。重点看 world loss 是否真正改善 action loss,而不是只提升视频指标。
WLA-0 / World-Language-Action 上海交通大学 DENG Lab
把文本子任务、subgoal image 和 robot action 放进同一 autoregressive 链路;重点看 world expert 如何影响 action expert,以及推理时是否可关闭。
3) 实机审计字段
- 动作接口:chunk 长度、控制频率、末端/关节空间、是否 action horizon replan。
- 世界预测:预测对象是 RGB、depth、latent、object state 还是 contact state;是否有 action-conditioned ablation。
- 部署:单步 latency、闭环 Hz、显存、量化、失败恢复和人工接管。
- 证据:必须区分 simulation、offline replay、real-robot rollout;没有实机数据就不写成“已具备物理泛化”。
判断:WAM 的核心不是“能生成视频”,而是未来状态预测是否改变了动作选择。若 world branch 只做展示或训练辅助,却没有 action-conditioned、real-robot、closed-loop 证据,就仍应按视频模型而不是可部署 WAM 记录。