03 / MODELS

VLA / WAM,
具体看它如何出动作。

本章只比较两类模型:VLA 直接预测动作;WAM 同时预测未来状态并把预测用于动作生成。世界模型、视频模型和动作模型只在它们进入机器人策略时收录。

⏰ 最后更新时间: 2026-08-11 | 查看更新日志;本页内容将每日更新「VLA/WAM 结构、训练目标、动作接口与实机证据」。

1) 只看四个接口差异

接口VLAWAM
输入图像/视频 + 语言 + robot state图像/视频 + 语言 + state + action history
训练目标行为克隆 / action token likelihood / diffusion action未来视觉或 latent state prediction + action generation
输出action chunk、末端轨迹或关节动作未来 state/video 与动作;可做 rollout 或 action ranking
关键失败语义正确但物理动作错误视频看起来合理但接触动力学错误;rollout 越长误差越大

2) 具体方案

Gemini Robotics / VLA Google DeepMind

追踪点:跨机器人形态、embodied reasoning、On-Device 推理。评估时要看真实任务成功率与端到端时延,不只看语言跟随。

DreamZero / WAM NVIDIA GEAR Lab

以视频扩散 backbone 联合预测视频与动作;论文报告 14B 模型 7Hz 闭环控制和真实机器人跨任务泛化。重点核对 action conditioning、推理延迟和 embodiment adaptation。

OpenWAM / Joint WAM Stanford University

提供联合视觉动态与可执行控制的开源框架、消融和 benchmark。重点看 world loss 是否真正改善 action loss,而不是只提升视频指标。

WLA-0 / World-Language-Action 上海交通大学 DENG Lab

把文本子任务、subgoal image 和 robot action 放进同一 autoregressive 链路;重点看 world expert 如何影响 action expert,以及推理时是否可关闭。

3) 实机审计字段

🧠 AI 评论

判断:WAM 的核心不是“能生成视频”,而是未来状态预测是否改变了动作选择。若 world branch 只做展示或训练辅助,却没有 action-conditioned、real-robot、closed-loop 证据,就仍应按视频模型而不是可部署 WAM 记录。