07. 具身智能论文追踪 (Papers)
按“可复现价值”优先收录论文:不仅看分数,还看工程代价、开源状态、数据可得性与部署边界。
2026-02(最新增补,默认展开)
LessMimic: Long-Horizon Humanoid Interaction with Unified Distance Field Representations
🟢 通俗解读
这篇工作想解决“人形机器人做长任务时,动作策略对特定物体形状过拟合”的问题。核心思路是改用距离场(Distance Field)作为统一几何线索,让策略更容易跨对象复用技能。
🔴 专业解读
- Problem/Setup:现有方法常依赖 reference motion 或 task-specific reward,导致策略对对象几何和任务模板耦合过强,难以统一支持长时、多技能交互。
- Method:以 Distance Field 作为统一交互表示,把表面距离、梯度、接触相关几何信号注入 whole-body policy,目标是“参考动作可选而非必需”的训练与推理范式。
- 核心优化点 1(表示层):从“对象 ID/模板特征”转向“连续几何场”后,策略学习的是几何关系而不是具体物体纹理,理论上能提升跨对象泛化。
- 核心优化点 2(控制层):统一全身策略减少了“抓取策略/移动策略/避障策略”割裂训练带来的切换误差,更适合长时连续任务。
- 核心优化点 3(规划层):在长链路任务里,把几何线索直接喂给策略可降低“中途重规划”次数,对稳定性有潜在正收益。
- Evaluation:论文强调 long-horizon interaction 与多类 household risk setting 的评测;建议重点查看其安全约束与成功率是否同时提升。
- 工程代价与边界:DF 表示通常带来额外几何计算与感知前处理开销;若系统算力受限,可能需要降低场分辨率或做异步更新。
- 可复现实验建议:做三组对照:① 纯对象特征条件,② DF 条件,③ 混合条件;在同延迟预算下比较成功率、恢复率与安全违规率。
- 来源定位:Abstract / arXiv Entry
🧠 AntiGravity's Commentary
如果后续开源训练细节,LessMimic 值得优先验证两件事:一是“几何泛化是否真的减少重采样数据成本”,二是“统一策略是否会在罕见接触场景下出现不可控长尾失败”。
HALO: A Unified Vision-Language-Action Model for Embodied Multimodal Chain-of-Thought Reasoning
🟢 通俗解读
HALO 试图把“文字推理 + 视觉前瞻 + 动作预测”放到同一条链路中,避免 VLA 在长任务里只会“看到就做”,却无法持续推演未来状态。
🔴 专业解读
- Problem/Setup:传统 VLA 在 long-horizon 与 OOD 任务中常见 failure pattern 是“短期动作合理、全局目标偏离”,本质是缺乏显式中间推理状态。
- Method:提出 EM-CoT(text reasoning → visual foresight → action prediction)串行链路,把“任务意图、未来视觉状态、动作”纳入同一推理轨迹。
- 系统链路拆解(输入→模块→输出):
输入:语言指令 + 当前观测;
模块 A:文本任务分解(子目标/约束);
模块 B:视觉前瞻(预测中间状态);
模块 C:动作解码(输出执行动作);
输出:可执行动作序列与中间推理痕迹。 - Why it works:把“先想后做”显式化后,模型在每一步都可被约束检查(例如目标一致性/安全条件),减少漂移累积。
- Evaluation:论文聚焦 long-horizon 与 OOD 评测;建议优先看 ablation:去掉文本推理或去掉视觉前瞻时性能回落幅度。
- 工程代价与边界:多阶段推理会拉长端到端时延;若控制回路要求高频(如 >20Hz),需要异步规划或低频高层+高频低层分层部署。
- 可复现实验建议:在固定延迟预算下,对比“纯 VLA”与“EM-CoT VLA”的 success rate、recovery rate、平均决策时延三指标,避免只看成功率。
- 来源定位:Abstract / arXiv Entry
🧠 AntiGravity's Commentary
HALO 的工程关键不在“有没有 CoT”,而在“多一步推理是否换来更高成功率而非更高时延”。建议把它和纯策略模型在同一延迟预算下做 A/B 对照。
2026-01(最近论文,默认展开)
Cosmos Policy: Diffusion World Model Policy Learning
🟢 通俗解读
这篇工作的核心是把“动作怎么做、未来会发生什么、该不该这么做”统一在一个策略建模框架里,减少传统流水线里 planner/policy/value 分裂导致的信息损耗。
🔴 专业解读
- Problem/Setup:把具身控制里的 action、future prediction、value estimation 统一到一个 diffusion 风格策略建模范式。
- Method:联合建模动作与未来状态表征,目标是提升长时决策的稳定性与多步规划一致性。
- Evaluation:论文报告在 LIBERO、RoboCasa 和真实机器人任务上的性能表现(详见原文实验章节)。
- Limitations:公开材料尚不足以评估其在线时延预算、实时控制频率上限与故障恢复策略。
- 来源定位:Abstract / §3 Method / §4 Experiments
🧠 AntiGravity's Commentary
如果后续公开训练细节和推理开销,这条路线对工程端的价值会非常高:它天然适合做“单模型回归基座”。但在真实部署里,安全约束与实时性仍是第一门槛。
2024(关键开源与基准扩展)
OpenVLA: An Open-Source Vision-Language-Action Model
🟢 通俗解读
OpenVLA 的意义在于把“VLA 能力”从封闭系统带到开源生态,让团队可以真实复现、微调并接入自己的机器人栈。
🔴 专业解读
- Problem/Setup:闭源 VLA 难以复现、难以工程落地。
- Method:提供可训练、可微调的开源 VLA 基线,强调跨任务策略泛化。
- Evaluation:在标准任务与实机设置中报告性能,对比既有开源/闭源方案。
- Limitations:不同硬件和控制链路下的部署性能仍需二次工程化验证。
- 来源定位:Abstract / Method / Experiments / Project
🧠 AntiGravity's Commentary
OpenVLA 的战略价值是“可控开放”:它把具身大模型从“看得见摸不着”变成“可以上线前压测”的工程对象。
Octo: An Open-Source Generalist Robot Policy
🟢 通俗解读
Octo 试图把“一个策略只能管一个机器人”的局面打破,让同一个模型在不同任务和硬件上都能迁移。
🔴 专业解读
- Problem/Setup:多机器人、多任务场景下,策略复用成本高。
- Method:构建通用策略训练范式,强调跨任务和跨平台可迁移性。
- Evaluation:展示在多任务设置下的泛化表现与迁移能力。
- Limitations:实际部署性能对数据分布、控制接口统一程度高度敏感。
- 来源定位:Abstract / Method / Experiments
🧠 AntiGravity's Commentary
Octo 的难点不在“能不能迁移”,而在“迁移后是否稳定可控”。工程落地通常需要补齐控制和安全回路。
RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots
🟢 通俗解读
RoboCasa 相当于给机器人提供了“家居场景大题库”,帮助团队把策略从简单实验室任务拉到更接近日常生活的复杂交互。
🔴 专业解读
- Problem/Setup:真实家居任务复杂且高成本,数据覆盖不足。
- Method:构建大规模家居任务仿真平台,支持通用策略训练与评测。
- Evaluation:通过多场景任务组合评估策略泛化能力。
- Limitations:仿真到实机仍有 domain gap,需配套 Sim2Real 回流。
- 来源定位:Abstract / Environment / Experiments / Project
🧠 AntiGravity's Commentary
RoboCasa 的价值不是“更漂亮仿真图”,而是“更系统的失败分布”。这对数据工程和回归测试直接有用。
2023(基础论文,默认收起)
RT-2: Vision-Language-Action Models Transfer Web Knowledge
🟢 通俗解读
RT-2 的关键价值是让机器人把“网络世界学到的语义知识”迁移到动作控制中,从而理解更抽象的指令,而不只是模仿固定动作。
🔴 专业解读
- Problem/Setup:传统机器人策略泛化能力弱,换场景就失效。
- Method:把 vision-language 模型能力迁移到 action token 输出,实现语言-视觉-动作统一建模。
- Evaluation:论文给出在多类语义指令任务上的泛化提升(对比 RT-1/基线)。
- Limitations:真实部署端仍需安全控制层、低层控制器和时延鲁棒机制补齐。
- 来源定位:Abstract / Method / Experiments
🧠 AntiGravity's Commentary
RT-2 代表了“语义泛化”里程碑,但不能把它误读为“可直接上线的全栈系统”。上线仍需工程层的安全与恢复机制兜底。
Open X-Embodiment: Robotic Learning Datasets and RT-X Models
🟢 通俗解读
它把“多个实验室各自的数据孤岛”连接起来,证明了跨机构数据联合训练能够显著改善策略泛化能力。
🔴 专业解读
- Problem/Setup:单机构数据分布窄,模型迁移能力差。
- Method:多来源机器人轨迹数据对齐后联合训练 RT-X 系列模型。
- Evaluation:论文报告在跨任务、跨平台设置下的性能收益。
- Limitations:数据许可、标注口径、坐标系与控制接口标准化成本高。
- 来源定位:Abstract / Dataset / Experiments
🧠 AntiGravity's Commentary
这篇工作的战略意义大于单点分数:它说明“数据联盟”是通用具身模型可行路径。但工程上通常需要先解决协议治理与数据质量审计。
Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
🟢 通俗解读
它把机器人动作看成“分步生成”的结果,能更好处理多解任务(同一目标可以有多种动作路径)。
🔴 专业解读
- Problem/Setup:传统回归策略容易输出“平均动作”,导致执行不稳定。
- Method:用 diffusion 建模多峰动作分布,提高复杂操作任务稳定性。
- Evaluation:在多类 manipulation 任务上与行为克隆基线比较。
- Limitations:部署时需重点评估推理耗时与控制频率匹配问题。
- 来源定位:Abstract / Method / Experiments
🧠 AntiGravity's Commentary
Diffusion Policy 是“高维操作任务”里非常实用的基线,但别忽略线上系统约束:控制循环预算才是最终的生死线。
Mastering Diverse Domains through World Models (DreamerV3)
🟢 通俗解读
DreamerV3 的核心思想是“先在模型里想象练习,再去真实环境少量试错”,从而显著减少昂贵的真实交互成本。
🔴 专业解读
- Problem/Setup:真实交互样本成本高,纯在线 RL 难以扩展。
- Method:学习 latent world model 并在模型内 rollout 进行策略优化。
- Evaluation:论文在多域任务上展示样本效率与泛化能力。
- Limitations:world model 误差会累积,部署时仍需实机回流校正。
- 来源定位:Abstract / Method / Experiments
🧠 AntiGravity's Commentary
DreamerV3 对具身的启发在于“样本效率路线”而非直接可部署方案。要落地,通常需要把 world model 的误差监控纳入工程回归体系。