多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

EI_模仿学习IL和强化学习RL

EI_模仿学习IL和强化学习RL ELEmbodied IntelligentILImitation LearningRLReinforcement Learning模仿学习 IL vs 强化学习 RL —— 具身智能 / 机器人动作技能领域详细对比前置说明ILImitation Learning模仿学习从专家示范轨迹动捕、遥操作示教学习动作策略目标是复刻专家行为核心输入是「专家演示样本」不需要奖励函数。典型分支BC 行为克隆、DAgger、GAIL/AMP 对抗模仿。RLReinforcement Learning强化学习智能体与环境交互通过奖励函数 Reward试错最大化累积回报不需要专家示范。典型分支PPO、SAC、TD3、RSL-RL人形机器人最常用。在具身机器人场景人形全身运动、灵巧手抓取、双臂装配、VLA 视觉语言操作现在行业主流不是二选一而是混合范式IL 做初始化 RL 做精细优化。一、核心原理、目标、底层逻辑对比表格维度模仿学习 IL强化学习 RL学习信号来源专家示教轨迹动捕 / 遥操作录制学习 “专家怎么做”奖励函数Reward试错探索学习 “怎么做收益最高”优化目标最小化策略动作与专家动作之间的误差MSE、DTW 时序损失对齐专家轨迹分布最大化长期累积奖励 (G\sum\gamma r_t)最大化任务回报是否需要先验示范✅必须BC/DAgger对抗模仿GAIL仅需要专家轨迹做分布对比❌不需要专家示范从零试错当然也可以用示范做预训练初始化探索机制几乎无主动探索学习专家行为分布倾向保守自带探索主动尝试未知动作可能探索出专家想不到的更好策略反馈形式离线静态轨迹数据可以离线训练不和环境交互在线交互反馈必须和仿真 / 真机环境持续交互才能获取奖励二、具身机器人场景适用范围 典型任务模仿学习 IL 擅长场景复杂长时序操作任务双臂装配、灵巧手拧螺丝、抽屉开关、餐具整理、多步骤复合操作任务目标复杂很难设计奖励函数。人类自然动作复刻人体动捕 BVH 映射到机器人复刻人类姿态、操作习惯例如递东西、搬运、交互手势。高自由度灵巧操作多指手指尖精细接触、柔性物体操作布料、线缆这类任务奖励函数极难设计。VLA 视觉语言动作任务ACT / Diffusion Policy以图像 语言作为观测输出长 chunk 动作是当前具身操作的主流方案。安全优先场景高危真机实验IL 策略动作贴近人类专家动作不会过于离谱风险可控。IL 不擅长专家示范存在次优解只能学到专家水平很难超越专家泛化局限遇到和示教差异大的新物体、新姿态容易失效分布偏移BC 经典问题很难自主优化步态稳定性、能耗等隐式指标专家示教不会刻意优化能耗、冲击力矩。强化学习 RL 擅长场景全身运动 /locomotion人形机器人步态行走、爬坡、避障、摔倒自恢复RSL-RL 是行业标配很容易设计奖励前进速度、躯干高度、姿态稳定、能耗惩罚。参数最优优化最小化关节力矩、降低冲击、提升行走鲁棒性找到比人类示范更优的运动方案。环境存在大量扰动的动态适应地面摩擦变化、外力推搡RL 通过大量试错学会抗扰动恢复。简单目标但缺少高质量专家示教机器人平衡、跳跃、负重行走很难用动捕采集大量高质量稳定示范。RL 不擅长长时序多阶段精细操作拧螺丝、组装零件奖励设计地狱。稀疏奖励只有最后成功才给奖励中间大量步骤无反馈很难学习高自由度灵巧手动作空间维度爆炸试错成本极高真机上随机探索极易撞坏硬件目标是复刻人类自然行为奖励很难去定义 “动作像人”真机直接训练随机探索会产生大量危险动作真机试错成本极高。一句话总结适用边界IL学「人的操作行为」适合复杂操作、高自由度灵巧手、VLA 任务RL学「最优控制策略」适合全身运动、抗扰动、性能优化。三、训练特性对比具身机器人重点1. 训练方式ILBC离线训练拿到动捕 / 遥操作数据集后不需要环境交互直接监督学习。训练稳定、收敛快。DAgger 属于半在线 IL在环境中 rollout人工干预补充样本。RL在线交互训练智能体每一步动作都需要环境返回状态与 reward需要大量交互样本采样成本极高。关键差异BC 可以完全离线RL 离不开环境交互。2. 收敛速度 数据需求量IL收敛快几百几千条专家 demo 即可完成基础技能数据是高质量专家轨迹。缺点泛化上限被专家水平锁死。RL采样效率极低需要数十万 / 百万级 episode从零开始训练极其缓慢但一旦收敛性能可以超过示范。3. 分布偏移问题具身机器人最核心痛点ILBC分布漂移covariate shift是原生缺陷。策略预测动作一点点偏离专家轨迹后续误差会不断累积长时序任务容易翻车DAgger 就是专门缓解这个问题。RL在训练过程持续和环境交互策略遇到的状态是自身探索产生的不存在 BC 那种静态数据集带来的分布偏移但容易出现过拟合仿真环境仿真过拟合。4. 安全性IL策略动作贴近人类专家动作范围可控真机测试风险更低只要示教样本安全策略一般不会出现极端失控动作。RL训练探索阶段会随机采样动作极易出现奇异位姿、大幅度冲击真机直接做 RL 训练几乎禁止全部先在仿真内训练。5. 奖励 / 标注成本IL代价是采集专家示范动捕、遥操作人力 硬件成本不需要写奖励函数。RL代价是设计、调优奖励函数奖励塑形reward shaping非常耗费工程师时间稀疏奖励是巨大难点。奖励设计稍有偏差策略会耍小聪明reward hack比如原地不动刷奖励。四、真机部署 Sim2Real 表现对比表格维度ILACT/Diffusion/BCRLPPO/SAC/RSL-RLSim2Real 迁移难度中等策略学习人类真实接触行为真机物理接触更容易对齐但对观测分布敏感图像光照、物体外观变化较高容易在仿真环境过度拟合仿真物理参数到真机出现 “仿真里完美真机直接摔倒”域随机化 DR 是 RL 必备手段推理行为特点动作平滑动作风格贴近人类但抗扰动弱遇到未见过扰动容易卡住 / 失败鲁棒性强抵抗外力、环境扰动动作有时会出现非人类、僵硬的运动模式时序长任务能力强ACT/Diffusion/Mamba 原生支持长时序 Chunk 预测弱长时序稀疏奖励很难训练多阶段任务容易半途放弃推理延迟取决于模型大小Transformer/DiT 较高MLP-TCN 低和训练范式无关策略多为 MLP推理延迟低适合高频 100Hz 闭环步态控制五、行业混合范式头部企业主流不是非此即彼几乎所有头部人形厂商Figure、Optimus、智元、傅里叶都采用IL 预初始化 RL 精细调优的两阶段方案阶段 1模仿学习 BC使用动捕 / 遥操作采集专家示范预训练策略让机器人快速学会基础动作技能此时策略已经可以在仿真 / 真机做基础任务。阶段 2强化学习 RL 在仿真内做优化在 IL 初始化的策略基础上继续 PPO/AMP 训练优化稳定性、抗扰动、能耗、任务成功率。两个细分混合路线AMP对抗运动模仿ILRL 融合代表。用人类动捕轨迹作为参考RL 学习运动对抗判别器判断动作是否像人专门用于人形全身运动。Offline RL离线强化学习 / BCRL 微调在 IL 采集的专家轨迹数据集上做离线 RL不大量在线探索对示教策略做小幅性能提升常用于操作任务。六、优缺点总览模仿学习 IL优点上手快、收敛快小样本即可学会复杂操作不需要设计复杂奖励函数规避稀疏奖励难题动作贴近人类真机安全性更高天然适配动捕示教的工程链路适配 VLA 多模态视觉语言操作ACT/Diffusion Policy 是 IL。缺点性能上限被专家示范限制很难超越专家BC 原生存在协变量偏移长时序任务误差累积泛化能力弱对新物体、新场景适应性差依赖高质量专家示教差的示范会学到错误行为。强化学习 RL优点可以找到优于人类示范的最优策略优化稳定性、能耗、抗扰动智能体自主探索不依赖专家演示持续交互训练没有 BC 的协变量偏移非常适合全身步态、平衡、抗外力扰动。缺点采样效率极低交互成本巨大奖励函数设计困难容易出现 Reward Hack稀疏奖励场景训练极难随机探索动作危险不能直接真机在线训练必须依赖仿真长时序多步骤操作、灵巧手任务训练难度极高。七、典型落地选型对照表工程决策参考表格机器人任务推荐主范式说明灵巧手拧螺丝、组装、柔性物体操作ILBC/DAgger为主离线 RL 微调奖励难以定义依赖人类示教双臂 VLA 任务语言指令操作物体ILACT/Diffusion Policy多模态长时序行业标准方案人形全身行走、爬坡、抗推、摔倒恢复RLPPO/RSL-RLAMP 混合 IL步态优先优化稳定性动捕仅做动作风格参考简单机械臂定点抓取环境简单IL 或 RL 均可小场景两种方案都可行动态扰动下的运动、负重行走RL需要大量试错学习扰动恢复高危真机场景优先保证安全IL避免 RL 随机探索带来硬件损坏八、易混淆关键点澄清AMP 属于 ILRL 混合不是纯 RLRL 负责最大化奖励判别器用人类动捕轨迹做对抗约束动作风格贴近人。Diffusion Policy / ACT 属于模仿学习 BC不是 RL虽然模型是大时序网络本质还是监督学习拟合专家示教动作。DAgger 是模仿学习的在线变体不是 RL依然依赖人工给出正确动作标签不是奖励信号。Offline RL 和 BC 不一样Offline RL 在已有的轨迹数据集里学习最优策略目标最大化回报不是复刻专家动作。九、一句话精简总结模仿学习 IL复刻专家动作适合复杂操作、VLA、灵巧手上手快、安全但泛化上限被示教限制。强化学习 RL试错寻找最优动作适合全身运动、抗扰动性能上限高但采样昂贵、奖励难设计长时序精细操作很难落地。工业界具身智能主流IL 快速打底RL 在仿真里优化性能。
返回列表