04. 数据工程(采集与合成) (Data Engineering)
具身智能的核心瓶颈之一是高质量动作数据。本章聚焦你要求的两件事:真实世界数据采集方法、可扩展数据合成方法。
⏰ 最后更新时间: 2026-08-11 | 本页内容将每日更新「真实数据采集、Ego/UMI 数据、合成数据生成与数据质控流程」。
4.1 数据采集方法(Real-World Collection)
| 方法 | 优点 | 挑战 | 可追溯来源 |
|---|---|---|---|
| 遥操作示教 | 动作标签质量高,适合行为克隆初始化 | 人力成本高,吞吐受限 | DROID Dataset |
| 跨机构联合数据 | 覆盖多机器人、多任务分布 | 标注口径和坐标系不一致 | Open X-Embodiment |
| 语言-动作联合采集 | 支持高层指令泛化 | 语言描述与动作时间对齐困难 | RT-2 |
4.2 人类视角与通用操作数据(Ego / UMI)
这两类数据不能混为“视频数据”:Ego 数据提供人类第一视角、手-物交互与过程语义,UMI 则通过手持 gripper 把人的操作轨迹转成可迁移的机器人示范。前者更适合表征学习、意图理解与世界模型预训练,后者更接近可直接训练策略的 action data。
| 数据路线 | 数据形态 | 适合训练什么 | 关键边界 | 权威入口 |
|---|---|---|---|---|
| Ego4D | 第一视角长视频、语音/叙述、多任务标注;官方当前介绍为 3,600+ 小时、926 名 camera wearers、74 个地点 | 视觉表征、手-物交互、动作/意图理解、长时记忆 | 不是机器人 action trajectory;需要手部/物体跟踪、时序对齐和动作抽取 | 官方文档 · 论文 |
| Ego-Exo4D v2 | 同步第一/第三视角视频、音频、IMU、眼动、SLAM、3D body/hand pose、步骤与熟练度标注 | 跨视角对齐、技能分解、程序理解、从人类示范学习 | 大部分是人类技能活动,不等于机器人可执行动作;需建立 embodiment/action interface | 官方文档 · 2026 Challenge |
| UMI | 手持 GoPro + 3D printed gripper + relative trajectory;采集时不依赖完整机器人本体 | 模仿学习、Diffusion Policy、动态/双臂/长时操作策略 | 仍需处理视角、末端执行器、动作延迟与机器人 embodiment gap;不是纯视频预训练 | 官方项目 · 论文 |
| UMI Community / FastUMI | 可共享的 UMI-style 数据与更大规模操作示范集合 | 跨平台策略预训练、数据混合、硬件无关 policy learning | 格式、许可、传感器和动作定义并不完全统一,训练前必须做 schema registry 和质量审计 | UMI Data Community · FastUMI |
🟢 通俗解读
Ego 数据像“人戴着相机做事的第一视角录像”;UMI 更像“人拿着一个通用手柄替机器人演示动作”。一个教模型理解人怎么做,一个直接提供更像机器人动作的数据。
🔴 专业解析
Ego → state/action 需要从视频恢复手、物体、阶段和接触;UMI 已把操作过程编码为相对轨迹,并通过推理时延匹配和硬件无关接口降低迁移成本。两者组合时,应把 Ego 用作 representation/world-model pretraining,把 UMI/真实机器人轨迹用作 policy/action head 对齐。
🧠 AI 评论
判断:Ego 数据量大但离控制远,UMI 数据量相对小但离动作近。真正的数据飞轮不是二选一,而是“Ego 学会看与理解 → UMI/遥操作学会做 → 实机失败回流校正”。
4.3 数据合成方法(Synthetic Data)
- 域随机化:随机扰动材质、光照、摩擦、质量参数,提升 Sim2Real 泛化。[Tobin et al., 2017]
- 程序化场景生成:批量生成任务布局和障碍组合,补齐真实数据长尾。
- 自动标注导出:在仿真中自动导出位姿、接触、关节状态标签,降低人工标注成本。[Omniverse Replicator]
4.4 工程化数据流水线示意
flowchart LR
A[任务定义] --> B[真实采集/遥操作]
A --> C[仿真合成/域随机化]
B --> D[清洗与时间对齐]
C --> D
D --> E[自动标注与质检]
E --> F[版本化存储]
F --> G[训练输入打包]
G --> H[回归评测]
4.5 数据质量评估维度(量化视角)
| 评估项 | 检查目标 | 典型失败信号 |
|---|---|---|
| 时间同步完整性 | 视觉、状态、动作时间戳对齐 | 动作提前/滞后,策略学习到错误因果 |
| 覆盖率 | 任务、物体、视角、失败类型分布均衡 | 线上长尾场景大量失败 |
| 标签一致性 | 动作标签、接触状态、任务阶段定义统一 | 跨数据源训练出现目标漂移 |
| 版本可追溯 | 数据切片与训练版本一一对应 | 模型回退时无法定位问题样本 |
4.6 仿真环境支持矩阵(数据工程视角)
| 平台 | 支持状态 | 主要任务覆盖 | 数据/传感器支持特点 | 典型优势与限制 |
|---|---|---|---|---|
| Isaac Sim / Isaac Lab | 活跃迭代 | 人形、移动操作、并行策略训练 | 支持多相机、深度、语义标注与仿真日志导出;可与 Omniverse 数据管线协同 | 优势:GPU 并行与工业生态强;限制:资源开销和工程复杂度较高 |
| MuJoCo | 成熟稳定 | 控制算法、接触动力学基准 | 适合高频控制实验与动力学对比;视觉数据合成能力需配套外部渲染方案 | 优势:动力学研究生态成熟;限制:复杂视觉合成能力相对有限 |
| ManiSkill | 活跃迭代 | 操作任务(抓取/装配/工具使用) | 围绕操作任务提供环境与评测接口,便于构建任务级数据回归 | 优势:操作任务生态完整;限制:场景覆盖需结合具体任务扩展 |
| Habitat | 活跃迭代 | 具身导航、场景交互 | 3D 场景和导航任务成熟,适合多房间/多场景轨迹数据生成 | 优势:导航任务丰富;限制:高精度操作任务支持相对弱 |
| Gazebo | 长期维护 | ROS 系统联调、控制验证 | 与 ROS 生态衔接紧密,适合系统级联调与传感器仿真 | 优势:工程联调成本低;限制:大规模并行训练能力一般 |
| PyBullet | 长期可用 | 快速原型、教学与轻量实验 | 上手快、脚本化友好,便于快速生成训练样本 | 优势:开发效率高;限制:高保真复杂场景需额外验证 |
| Webots | 长期维护 | 教育与中小规模机器人实验 | 多机器人原型验证友好,支持常见传感器模拟 | 优势:易用性高;限制:大规模工业级训练链路不如前述平台成熟 |
官方入口:Isaac Sim / Isaac Lab / MuJoCo / ManiSkill / Habitat / Gazebo / PyBullet / Webots。
4.7 选型观察:按阶段组合平台
- P0 快速验证:PyBullet / ManiSkill + 小规模真实采集,尽快验证任务可行性。
- P1 策略迭代:Isaac Lab 或 MuJoCo + 失败样本回流,建立数据回归体系。
- P2 系统联调:Gazebo/ROS 联调 + 真实场景回放,验证部署稳定性与安全评估指标。
- P3 规模化:主平台 + 备用平台双轨回归,避免单一仿真栈导致系统性偏差。
数据体系最容易踩坑的是“只追求规模,不追求失败样本覆盖”。具身系统上线后,决定鲁棒性的往往不是常规样本,而是**罕见失败 + 恢复轨迹**。