07. 具身智能论文追踪 (Papers)

按“可复现价值”优先收录论文:不仅看分数,还看工程代价、开源状态、数据可得性与部署边界。

最后更新时间: 2026-02-26 | 本页内容将每日更新「具身智能 VLA / 数据 / RL / 仿真相关论文」。
2026-02(最新增补,默认展开)

LessMimic: Long-Horizon Humanoid Interaction with Unified Distance Field Representations

📅 2026-02-25 📄 arXiv:2602.21723 NEW
💻 代码:未公开/未知(以 arXiv 页面为准) 🧱 权重:未公开/未知 🗂️ 数据:未公开/未知

🟢 通俗解读

这篇工作想解决“人形机器人做长任务时,动作策略对特定物体形状过拟合”的问题。核心思路是改用距离场(Distance Field)作为统一几何线索,让策略更容易跨对象复用技能。

🔴 专业解读

  • Problem/Setup:现有方法常依赖 reference motion 或 task-specific reward,导致策略对对象几何和任务模板耦合过强,难以统一支持长时、多技能交互。
  • Method:以 Distance Field 作为统一交互表示,把表面距离、梯度、接触相关几何信号注入 whole-body policy,目标是“参考动作可选而非必需”的训练与推理范式。
  • 核心优化点 1(表示层):从“对象 ID/模板特征”转向“连续几何场”后,策略学习的是几何关系而不是具体物体纹理,理论上能提升跨对象泛化。
  • 核心优化点 2(控制层):统一全身策略减少了“抓取策略/移动策略/避障策略”割裂训练带来的切换误差,更适合长时连续任务。
  • 核心优化点 3(规划层):在长链路任务里,把几何线索直接喂给策略可降低“中途重规划”次数,对稳定性有潜在正收益。
  • Evaluation:论文强调 long-horizon interaction 与多类 household risk setting 的评测;建议重点查看其安全约束与成功率是否同时提升。
  • 工程代价与边界:DF 表示通常带来额外几何计算与感知前处理开销;若系统算力受限,可能需要降低场分辨率或做异步更新。
  • 可复现实验建议:做三组对照:① 纯对象特征条件,② DF 条件,③ 混合条件;在同延迟预算下比较成功率、恢复率与安全违规率。

🧠 AntiGravity's Commentary

如果后续开源训练细节,LessMimic 值得优先验证两件事:一是“几何泛化是否真的减少重采样数据成本”,二是“统一策略是否会在罕见接触场景下出现不可控长尾失败”。

HALO: A Unified Vision-Language-Action Model for Embodied Multimodal Chain-of-Thought Reasoning

📅 2026-02-24 📄 arXiv:2602.21157 NEW
💻 代码:未公开/未知(以 arXiv 页面为准) 🧱 权重:未公开/未知 🗂️ 数据:未公开/未知

🟢 通俗解读

HALO 试图把“文字推理 + 视觉前瞻 + 动作预测”放到同一条链路中,避免 VLA 在长任务里只会“看到就做”,却无法持续推演未来状态。

🔴 专业解读

  • Problem/Setup:传统 VLA 在 long-horizon 与 OOD 任务中常见 failure pattern 是“短期动作合理、全局目标偏离”,本质是缺乏显式中间推理状态。
  • Method:提出 EM-CoT(text reasoning → visual foresight → action prediction)串行链路,把“任务意图、未来视觉状态、动作”纳入同一推理轨迹。
  • 系统链路拆解(输入→模块→输出)
    输入:语言指令 + 当前观测;
    模块 A:文本任务分解(子目标/约束);
    模块 B:视觉前瞻(预测中间状态);
    模块 C:动作解码(输出执行动作);
    输出:可执行动作序列与中间推理痕迹。
  • Why it works:把“先想后做”显式化后,模型在每一步都可被约束检查(例如目标一致性/安全条件),减少漂移累积。
  • Evaluation:论文聚焦 long-horizon 与 OOD 评测;建议优先看 ablation:去掉文本推理或去掉视觉前瞻时性能回落幅度。
  • 工程代价与边界:多阶段推理会拉长端到端时延;若控制回路要求高频(如 >20Hz),需要异步规划或低频高层+高频低层分层部署。
  • 可复现实验建议:在固定延迟预算下,对比“纯 VLA”与“EM-CoT VLA”的 success rate、recovery rate、平均决策时延三指标,避免只看成功率。

🧠 AntiGravity's Commentary

HALO 的工程关键不在“有没有 CoT”,而在“多一步推理是否换来更高成功率而非更高时延”。建议把它和纯策略模型在同一延迟预算下做 A/B 对照。

2026-01(最近论文,默认展开)

Cosmos Policy: Diffusion World Model Policy Learning

📅 2026-01-27 📄 arXiv:2601.16163 NEW
💻 代码:未公开/未知 🧱 权重:未公开/未知 🗂️ 数据:未公开/未知

🟢 通俗解读

这篇工作的核心是把“动作怎么做、未来会发生什么、该不该这么做”统一在一个策略建模框架里,减少传统流水线里 planner/policy/value 分裂导致的信息损耗。

🔴 专业解读

  • Problem/Setup:把具身控制里的 action、future prediction、value estimation 统一到一个 diffusion 风格策略建模范式。
  • Method:联合建模动作与未来状态表征,目标是提升长时决策的稳定性与多步规划一致性。
  • Evaluation:论文报告在 LIBERO、RoboCasa 和真实机器人任务上的性能表现(详见原文实验章节)。
  • Limitations:公开材料尚不足以评估其在线时延预算、实时控制频率上限与故障恢复策略。

🧠 AntiGravity's Commentary

如果后续公开训练细节和推理开销,这条路线对工程端的价值会非常高:它天然适合做“单模型回归基座”。但在真实部署里,安全约束与实时性仍是第一门槛。

2024(关键开源与基准扩展)

OpenVLA: An Open-Source Vision-Language-Action Model

📅 2024-06-13 📄 arXiv:2406.09246 OPEN
💻 代码:GitHub 🧱 权重:按项目发布(见项目主页) 🗂️ 数据:训练数据组合口径见论文与项目说明

🟢 通俗解读

OpenVLA 的意义在于把“VLA 能力”从封闭系统带到开源生态,让团队可以真实复现、微调并接入自己的机器人栈。

🔴 专业解读

  • Problem/Setup:闭源 VLA 难以复现、难以工程落地。
  • Method:提供可训练、可微调的开源 VLA 基线,强调跨任务策略泛化。
  • Evaluation:在标准任务与实机设置中报告性能,对比既有开源/闭源方案。
  • Limitations:不同硬件和控制链路下的部署性能仍需二次工程化验证。

🧠 AntiGravity's Commentary

OpenVLA 的战略价值是“可控开放”:它把具身大模型从“看得见摸不着”变成“可以上线前压测”的工程对象。

Octo: An Open-Source Generalist Robot Policy

📅 2024-05-20 📄 arXiv:2405.12213
💻 代码:见 Project 🧱 权重:项目提供公开模型 🗂️ 数据:依项目/论文披露的数据组合

🟢 通俗解读

Octo 试图把“一个策略只能管一个机器人”的局面打破,让同一个模型在不同任务和硬件上都能迁移。

🔴 专业解读

  • Problem/Setup:多机器人、多任务场景下,策略复用成本高。
  • Method:构建通用策略训练范式,强调跨任务和跨平台可迁移性。
  • Evaluation:展示在多任务设置下的泛化表现与迁移能力。
  • Limitations:实际部署性能对数据分布、控制接口统一程度高度敏感。

🧠 AntiGravity's Commentary

Octo 的难点不在“能不能迁移”,而在“迁移后是否稳定可控”。工程落地通常需要补齐控制和安全回路。

RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots

📅 2024-06-04 📄 arXiv:2406.02523
💻 代码:GitHub 🧱 权重:基准平台为主 🗂️ 数据:场景/任务生成逻辑见项目文档

🟢 通俗解读

RoboCasa 相当于给机器人提供了“家居场景大题库”,帮助团队把策略从简单实验室任务拉到更接近日常生活的复杂交互。

🔴 专业解读

  • Problem/Setup:真实家居任务复杂且高成本,数据覆盖不足。
  • Method:构建大规模家居任务仿真平台,支持通用策略训练与评测。
  • Evaluation:通过多场景任务组合评估策略泛化能力。
  • Limitations:仿真到实机仍有 domain gap,需配套 Sim2Real 回流。

🧠 AntiGravity's Commentary

RoboCasa 的价值不是“更漂亮仿真图”,而是“更系统的失败分布”。这对数据工程和回归测试直接有用。

2023(基础论文,默认收起)

RT-2: Vision-Language-Action Models Transfer Web Knowledge

📅 2023-07-28 📄 arXiv:2307.15818
💻 代码:未公开/未知 🧱 权重:未公开/未知 🗂️ 数据:未公开/未知

🟢 通俗解读

RT-2 的关键价值是让机器人把“网络世界学到的语义知识”迁移到动作控制中,从而理解更抽象的指令,而不只是模仿固定动作。

🔴 专业解读

  • Problem/Setup:传统机器人策略泛化能力弱,换场景就失效。
  • Method:把 vision-language 模型能力迁移到 action token 输出,实现语言-视觉-动作统一建模。
  • Evaluation:论文给出在多类语义指令任务上的泛化提升(对比 RT-1/基线)。
  • Limitations:真实部署端仍需安全控制层、低层控制器和时延鲁棒机制补齐。

🧠 AntiGravity's Commentary

RT-2 代表了“语义泛化”里程碑,但不能把它误读为“可直接上线的全栈系统”。上线仍需工程层的安全与恢复机制兜底。

Open X-Embodiment: Robotic Learning Datasets and RT-X Models

📅 2023-10-13 📄 arXiv:2310.08864
💻 代码:见项目入口 RT-X Project 🧱 权重:部分开放/按项目发布 🗂️ 数据:部分公开(按子数据集许可)

🟢 通俗解读

它把“多个实验室各自的数据孤岛”连接起来,证明了跨机构数据联合训练能够显著改善策略泛化能力。

🔴 专业解读

  • Problem/Setup:单机构数据分布窄,模型迁移能力差。
  • Method:多来源机器人轨迹数据对齐后联合训练 RT-X 系列模型。
  • Evaluation:论文报告在跨任务、跨平台设置下的性能收益。
  • Limitations:数据许可、标注口径、坐标系与控制接口标准化成本高。

🧠 AntiGravity's Commentary

这篇工作的战略意义大于单点分数:它说明“数据联盟”是通用具身模型可行路径。但工程上通常需要先解决协议治理与数据质量审计。

Diffusion Policy: Visuomotor Policy Learning via Action Diffusion

📅 2023-03-07 📄 arXiv:2303.04137
💻 代码:GitHub 🧱 权重:未统一公开/以复现实验为主 🗂️ 数据:依任务数据集配置

🟢 通俗解读

它把机器人动作看成“分步生成”的结果,能更好处理多解任务(同一目标可以有多种动作路径)。

🔴 专业解读

  • Problem/Setup:传统回归策略容易输出“平均动作”,导致执行不稳定。
  • Method:用 diffusion 建模多峰动作分布,提高复杂操作任务稳定性。
  • Evaluation:在多类 manipulation 任务上与行为克隆基线比较。
  • Limitations:部署时需重点评估推理耗时与控制频率匹配问题。

🧠 AntiGravity's Commentary

Diffusion Policy 是“高维操作任务”里非常实用的基线,但别忽略线上系统约束:控制循环预算才是最终的生死线。

Mastering Diverse Domains through World Models (DreamerV3)

📅 2023-01-10 📄 arXiv:2301.04104
💻 代码:见论文附录与社区实现 🧱 权重:按任务配置 🗂️ 数据:以交互轨迹与环境回放为主

🟢 通俗解读

DreamerV3 的核心思想是“先在模型里想象练习,再去真实环境少量试错”,从而显著减少昂贵的真实交互成本。

🔴 专业解读

  • Problem/Setup:真实交互样本成本高,纯在线 RL 难以扩展。
  • Method:学习 latent world model 并在模型内 rollout 进行策略优化。
  • Evaluation:论文在多域任务上展示样本效率与泛化能力。
  • Limitations:world model 误差会累积,部署时仍需实机回流校正。

🧠 AntiGravity's Commentary

DreamerV3 对具身的启发在于“样本效率路线”而非直接可部署方案。要落地,通常需要把 world model 的误差监控纳入工程回归体系。