04 / REAL-WORLD RL

强化学习,
只写真实可执行的方法。

本章不做 RL 教科书,只记录机器人真实数据如何进入 value/policy 更新,以及探索、回滚和安全边界如何落到控制回路。

⏰ 最后更新时间: 2026-08-11 | 查看更新日志;本页内容将每日更新「真实机器人强化学习算法、数据接口与安全约束」。

1) 算法 → 数据 → 实机约束

方法具体更新机制真实机器人用法主要风险
CQL
UC Berkeley / Google Research
对数据集外动作施加保守 Q 惩罚,避免 critic 对 OOD action 过估计用遥操作/UMI/历史 rollout 做 offline pretrain,再小流量在线微调数据覆盖不足时过度保守;奖励和 Q 标定仍需实机验证
IQL
UC Berkeley
用 value expectile 拟合数据内高价值动作,再 advantage-weighted BC 提取 policy适合先从固定示范集学,再接真实交互 fine-tune行为数据质量决定上限;未覆盖动作不能靠算法凭空补齐
Residual RL
UC Berkeley / Google Research
固定 controller 输出 base action,RL 只学习 residual action:a = a_base + a_res把接触、摩擦、个体差异交给 residual;基础控制器保留稳定性残差幅度、频率和安全投影必须限幅,否则会破坏 base controller
Incremental Residual RL
Kyushu University
增量更新 residual,不依赖 replay buffer 或大 batch 更新适合边缘设备和环境变化明显的在线适应;论文包含真实环境实验更新信号必须低噪,且需要策略冻结/回滚机制
Safe RL / CBF将动作送入 control barrier function、QP projection 或 safety shield 后再执行把碰撞、关节限位、速度/力矩约束放进每个控制周期安全层可能改变探索分布;需要单独测可达性和性能损失

2) 实际训练链路

AUMI / 遥操作
实机 rollout
→
B状态动作
对齐
→
COffline
CQL / IQL
→
DResidual /
Safe Policy
→
E小流量
真实交互
→
F成功 / 失败 /
接管 / 碰撞
↺
B回流再训练

审计时必须同时记录:episode return、成功/恢复率、人工接管率、碰撞/急停、动作延迟、策略版本和回滚点。

3) 只接受这类实机证据

🧠 AI 评论

判断:真实 RL 的工程核心是“可控地改变一点点”,不是让机器人无约束地探索。优先级应是 offline 初始化 → residual 微调 → safety projection → 小流量实机验证 → 失败回滚。