04 / REAL-WORLD RL
强化学习,
只写真实可执行的方法。
本章不做 RL 教科书,只记录机器人真实数据如何进入 value/policy 更新,以及探索、回滚和安全边界如何落到控制回路。
⏰ 最后更新时间: 2026-08-11 | 查看更新日志;本页内容将每日更新「真实机器人强化学习算法、数据接口与安全约束」。
1) 算法 → 数据 → 实机约束
| 方法 | 具体更新机制 | 真实机器人用法 | 主要风险 |
|---|---|---|---|
| CQL UC Berkeley / Google Research | 对数据集外动作施加保守 Q 惩罚,避免 critic 对 OOD action 过估计 | 用遥操作/UMI/历史 rollout 做 offline pretrain,再小流量在线微调 | 数据覆盖不足时过度保守;奖励和 Q 标定仍需实机验证 |
| IQL UC Berkeley | 用 value expectile 拟合数据内高价值动作,再 advantage-weighted BC 提取 policy | 适合先从固定示范集学,再接真实交互 fine-tune | 行为数据质量决定上限;未覆盖动作不能靠算法凭空补齐 |
| Residual RL UC Berkeley / Google Research | 固定 controller 输出 base action,RL 只学习 residual action:a = a_base + a_res | 把接触、摩擦、个体差异交给 residual;基础控制器保留稳定性 | 残差幅度、频率和安全投影必须限幅,否则会破坏 base controller |
| Incremental Residual RL Kyushu University | 增量更新 residual,不依赖 replay buffer 或大 batch 更新 | 适合边缘设备和环境变化明显的在线适应;论文包含真实环境实验 | 更新信号必须低噪,且需要策略冻结/回滚机制 |
| Safe RL / CBF | 将动作送入 control barrier function、QP projection 或 safety shield 后再执行 | 把碰撞、关节限位、速度/力矩约束放进每个控制周期 | 安全层可能改变探索分布;需要单独测可达性和性能损失 |
2) 实际训练链路
AUMI / 遥操作
实机 rollout
→实机 rollout
B状态动作
对齐
→对齐
COffline
CQL / IQL
→CQL / IQL
DResidual /
Safe Policy
→Safe Policy
E小流量
真实交互
→真实交互
F成功 / 失败 /
接管 / 碰撞
↺接管 / 碰撞
B回流再训练
审计时必须同时记录:episode return、成功/恢复率、人工接管率、碰撞/急停、动作延迟、策略版本和回滚点。
3) 只接受这类实机证据
- 报告真实机器人交互步数或部署时长,而非只给仿真 episode。
- 说明 reward 来源:任务成功、进度、接触/力、人工偏好还是规则函数。
- 说明策略更新频率、数据是否进入 replay buffer、旧策略如何回滚。
- 将 real-robot success、recovery、intervention、safety violation 分开统计。
判断:真实 RL 的工程核心是“可控地改变一点点”,不是让机器人无约束地探索。优先级应是 offline 初始化 → residual 微调 → safety projection → 小流量实机验证 → 失败回滚。