04. 数据工程(采集与合成) (Data Engineering)

具身智能的核心瓶颈之一是高质量动作数据。本章聚焦你要求的两件事:真实世界数据采集方法、可扩展数据合成方法。

⏰ 最后更新时间: 2026-08-11 | 本页内容将每日更新「真实数据采集、Ego/UMI 数据、合成数据生成与数据质控流程」。

4.1 数据采集方法(Real-World Collection)

方法 优点 挑战 可追溯来源
遥操作示教 动作标签质量高,适合行为克隆初始化 人力成本高,吞吐受限 DROID Dataset
跨机构联合数据 覆盖多机器人、多任务分布 标注口径和坐标系不一致 Open X-Embodiment
语言-动作联合采集 支持高层指令泛化 语言描述与动作时间对齐困难 RT-2

4.2 人类视角与通用操作数据(Ego / UMI)

这两类数据不能混为“视频数据”:Ego 数据提供人类第一视角、手-物交互与过程语义,UMI 则通过手持 gripper 把人的操作轨迹转成可迁移的机器人示范。前者更适合表征学习、意图理解与世界模型预训练,后者更接近可直接训练策略的 action data。

数据路线数据形态适合训练什么关键边界权威入口
Ego4D第一视角长视频、语音/叙述、多任务标注;官方当前介绍为 3,600+ 小时、926 名 camera wearers、74 个地点视觉表征、手-物交互、动作/意图理解、长时记忆不是机器人 action trajectory;需要手部/物体跟踪、时序对齐和动作抽取官方文档 · 论文
Ego-Exo4D v2同步第一/第三视角视频、音频、IMU、眼动、SLAM、3D body/hand pose、步骤与熟练度标注跨视角对齐、技能分解、程序理解、从人类示范学习大部分是人类技能活动,不等于机器人可执行动作;需建立 embodiment/action interface官方文档 · 2026 Challenge
UMI手持 GoPro + 3D printed gripper + relative trajectory;采集时不依赖完整机器人本体模仿学习、Diffusion Policy、动态/双臂/长时操作策略仍需处理视角、末端执行器、动作延迟与机器人 embodiment gap;不是纯视频预训练官方项目 · 论文
UMI Community / FastUMI可共享的 UMI-style 数据与更大规模操作示范集合跨平台策略预训练、数据混合、硬件无关 policy learning格式、许可、传感器和动作定义并不完全统一,训练前必须做 schema registry 和质量审计UMI Data Community · FastUMI

🟢 通俗解读

Ego 数据像“人戴着相机做事的第一视角录像”;UMI 更像“人拿着一个通用手柄替机器人演示动作”。一个教模型理解人怎么做,一个直接提供更像机器人动作的数据。

🔴 专业解析

Ego → state/action 需要从视频恢复手、物体、阶段和接触;UMI 已把操作过程编码为相对轨迹,并通过推理时延匹配和硬件无关接口降低迁移成本。两者组合时,应把 Ego 用作 representation/world-model pretraining,把 UMI/真实机器人轨迹用作 policy/action head 对齐。

🧠 AI 评论

判断:Ego 数据量大但离控制远,UMI 数据量相对小但离动作近。真正的数据飞轮不是二选一,而是“Ego 学会看与理解 → UMI/遥操作学会做 → 实机失败回流校正”。

4.3 数据合成方法(Synthetic Data)

Isaac Sim / Isaac Lab

适合大规模并行采样与 RL 数据生成。

Isaac Sim | Isaac Lab

ManiSkill

围绕操作任务构建的仿真与评测生态。

官方文档

Habitat

导航和具身场景交互任务的常用平台。

官方主页

4.4 工程化数据流水线示意

flowchart LR
    A[任务定义] --> B[真实采集/遥操作]
    A --> C[仿真合成/域随机化]
    B --> D[清洗与时间对齐]
    C --> D
    D --> E[自动标注与质检]
    E --> F[版本化存储]
    F --> G[训练输入打包]
    G --> H[回归评测]
            

4.5 数据质量评估维度(量化视角)

评估项 检查目标 典型失败信号
时间同步完整性 视觉、状态、动作时间戳对齐 动作提前/滞后,策略学习到错误因果
覆盖率 任务、物体、视角、失败类型分布均衡 线上长尾场景大量失败
标签一致性 动作标签、接触状态、任务阶段定义统一 跨数据源训练出现目标漂移
版本可追溯 数据切片与训练版本一一对应 模型回退时无法定位问题样本

参考入口:DROID、 Open X-Embodiment、 Omniverse Replicator。

4.6 仿真环境支持矩阵(数据工程视角)

平台 支持状态 主要任务覆盖 数据/传感器支持特点 典型优势与限制
Isaac Sim / Isaac Lab 活跃迭代 人形、移动操作、并行策略训练 支持多相机、深度、语义标注与仿真日志导出;可与 Omniverse 数据管线协同 优势:GPU 并行与工业生态强;限制:资源开销和工程复杂度较高
MuJoCo 成熟稳定 控制算法、接触动力学基准 适合高频控制实验与动力学对比;视觉数据合成能力需配套外部渲染方案 优势:动力学研究生态成熟;限制:复杂视觉合成能力相对有限
ManiSkill 活跃迭代 操作任务(抓取/装配/工具使用) 围绕操作任务提供环境与评测接口,便于构建任务级数据回归 优势:操作任务生态完整;限制:场景覆盖需结合具体任务扩展
Habitat 活跃迭代 具身导航、场景交互 3D 场景和导航任务成熟,适合多房间/多场景轨迹数据生成 优势:导航任务丰富;限制:高精度操作任务支持相对弱
Gazebo 长期维护 ROS 系统联调、控制验证 与 ROS 生态衔接紧密,适合系统级联调与传感器仿真 优势:工程联调成本低;限制:大规模并行训练能力一般
PyBullet 长期可用 快速原型、教学与轻量实验 上手快、脚本化友好,便于快速生成训练样本 优势:开发效率高;限制:高保真复杂场景需额外验证
Webots 长期维护 教育与中小规模机器人实验 多机器人原型验证友好,支持常见传感器模拟 优势:易用性高;限制:大规模工业级训练链路不如前述平台成熟

官方入口:Isaac Sim / Isaac Lab / MuJoCo / ManiSkill / Habitat / Gazebo / PyBullet / Webots。

4.7 选型观察:按阶段组合平台

🧠 AI 评论

数据体系最容易踩坑的是“只追求规模,不追求失败样本覆盖”。具身系统上线后,决定鲁棒性的往往不是常规样本,而是**罕见失败 + 恢复轨迹**。