多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

Science Robotics 封面论文:ZEST零样本具身技能转移技术框架,教会Atlas跳霹雳舞、爬箱子、后空翻

Science Robotics 封面论文:ZEST零样本具身技能转移技术框架,教会Atlas跳霹雳舞、爬箱子、后空翻 导语想让双足人形机器人学会一套流畅的霹雳舞动作过去往往需要工程师针对这一技能进行数周甚至数月的控制器调试。来自波士顿动力与RAI研究所的研究团队在《Science Robotics》上发表了一项名为ZESTZero-shot Embodied Skill Transfer的统一框架试图改变这一局面它可以让机器人从动作捕捉、手机视频甚至动画关键帧中直接学习运动技能训练完成后零样本部署到真机无需逐项微调。无论是Atlas的军队爬行和霹雳舞还是G1的芭蕾和爬箱子甚至四足Spot的后空翻都源自同一套极简训练流程。本文将深入拆解ZEST的技术细节。一、核心问题人形机器人的“运动自由”为何如此难人形机器人的设计初衷很简单人类环境是为人体形态构建的。因此拥有类似形态的机器人理论上应该能复现人类能完成的日常动作。但这一目标的技术难度极高高自由度、间歇性多接触交互、建模误差都要求控制策略既能捕捉人类运动的丰富性又能承受真实世界的物理不确定性。过去十年间两条主要技术路线各有短板。路线一基于模型的“离线规划在线跟踪”。典型代表是波士顿动力的Atlas跑酷和舞蹈通过MPC加全身控制器来追踪关键帧动画参考。这一路线在良好建模和状态估计条件下效果出众但在高不确定性和复杂接触环境下难以部署且对参考轨迹的物理一致性要求很高。路线二强化学习。从“白纸”开始训练策略具备优秀的敏捷性和鲁棒性但样本效率低、对奖励设计高度敏感容易产生不自然或过于激进的动作。数据驱动运动模仿则试图走中间路线——用运动数据作为先验来规范强化学习从而减少奖励工程。DeepMimic、AMP、ASE等方法推动了这一方向的进展。但现有的模仿类方法仍然存在大量手工组件接触标签、奖励塑形、状态估计器、观察历史、多阶段训练、特定行为重新调参等。这些“工程附件”让运动迁移难以规模化。ZEST的核心主张是把这些复杂性全部拿掉。二、ZEST框架一个极简到“不像真的”的统一方案ZEST是一个单阶段、统一的运动模仿框架。其设计哲学可以概括为一句话用数据源的多样性和训练的智能调度替代人工工程的复杂度。它实现了几个关键的技术舍弃不需要接触标签演示数据只需要运动学信息无需标注哪只脚何时接触地面。不需要未来参考窗口策略只接收“下一步目标状态”而非完整的未来轨迹窗口。不需要观察历史仅使用上一时刻的动作作为最小时序上下文。不需要状态估计器策略不依赖全局位姿或基座线速度这类需要估计的量。不需要大规模奖励塑形奖励项保持通用跨机器人、跨任务只使用一组超参数。不需要多阶段训练单阶段PPO完成训练单张NVIDIA L4 GPU约10小时即可收敛。这些舍弃看似简单实则建立在一个更深层的训练设计之上让困难片段获得更多训练资源并在训练早期提供物理辅助让策略平稳跨越最难的探索阶段。三、三种数据源动作捕捉、手机视频和动画关键帧ZEST的一大特色是异构数据源的统一接入。1. 高保真动作捕捉使用Xsens和Vicon系统采集的自然人体运动是最高精度的数据来源仅需极少的后处理。它保留了人类的细微运动特征比如步态中明显的脚跟-脚尖滚动、接近关节极限的膝盖伸展以及优雅安静的步态过渡。这些特征靠纯奖励塑形很难诱导出来但在高保真动作参考的引导下可以自然涌现。2. 噪声单眼视频ZEST的ViCap流程可以从普通手持手机拍摄的野外视频中重建三维人体运动。该流程组合了MegaSaM用于稳健的相机运动和场景估计和TRAM用于人体姿态估计显著减少了姿态抖动和脚步打滑等重建伪影。这一流程的工程意义巨大从录制视频到生成重定向参考动作只需要几分钟。理论上可以“早上录制新片段白天训练晚上上机运行”。这意味着机器人技能库的扩充速度可以被大幅压缩。3. 非物理约束的动画关键帧关键帧动画则用来创造人类无法实现、或本应属于非人形形态的动作。对于Atlas这包括利用其机器人特有的自由度——比如连续旋转的后偏航关节——实现人体解剖学不可能完成的动作。对于Spot四足机器人动画关键帧更是缺乏人体演示时的主要数据来源。无论来源如何所有以人为中心的数据MoCap和ViCap都通过一个时空优化问题重定向到目标机器人骨骼上。该优化过程同时解决尺度统一、时间重采样、根位置/朝向跟踪、关节对齐并保证前向运动学和非穿透约束。四、训练细节ZEST的技术核心ZEST将其任务形式化为目标条件的马尔可夫决策过程训练中使用非对称演员-评论家架构和近端策略优化。1. 观察空间尽量最小化演员只接收本体感觉信息和下一步目标状态。本体感觉部分仅包括躯干IMU框架的绝对角速度、归一化重力矢量、关节位置/速度、以及上一时刻的动作。刻意排除全局基座位置和线速度等需要状态估计器的量。参考观察也只编码下一步目标基座高度、基座线性/角速度、重力方向、参考关节位置。不使用未来参考窗口不需要接触标记。评论家则额外接收特权信息真实基座线速度、末端执行器位置/速度、接触力、课程相关信号等。这些信息只在模拟中可用帮助价值函数更快收敛。2. 动作空间残差动作策略输出残差动作加到参考关节位置上再作为位置目标送入关节级PD控制器。残差动作的优势在于策略只需学习“偏离参考多少”而不是从零开始综合完整的关节指令从而显著降低探索负担并提升学习稳定性。3. PD增益的选取从解析电枢值出发ZEST为每个关节建模独立的二阶系统利用驱动器的标称电枢惯量通过启发式方法调谐PD增益实现具有期望自然频率的临界阻尼响应。相同的PD增益同时用于仿真和硬件最大程度地减少仿真与现实的差距。这里有一个值得关注的细节ZEST为并联连杆执行器建立了一系列渐进简化的模型。从完整闭环动力学模型到局部投影模型假设支撑链无质量再到动态骨架模型对角线近似最终到名义电枢模型固定配置近似在计算效率与动力学精度之间做了系统取舍。对于更动态的后空翻行为团队还开发了更精细的执行器模型纳入功率限制算法、电机磁饱和以及传动效率损耗等非线性效应并利用真实世界数据优化了正负工作效率。4. 奖励函数刻意保持通用总奖励由三部分构成跟踪奖励、正则化奖励和生存奖励。跟踪奖励采用有界的指数核函数衡量基座线速度、角速度、姿态、关节位置和关键身体位置等与参考的误差。正则化项惩罚快速动作变化、大关节加速度、关节位置和扭矩极限违规。生存奖励在每一步给予恒定正值鼓励更长的时间。所有奖励项均不依赖具体任务或动作也不使用参考接触标签。5. 训练中的两个“智能调度器”自适应参考状态初始化将每个演示轨迹划分为固定时长的小段每段维护一个基于近期跟踪表现的失败分数。重置时倾向于从失败分数高的段落采样初始相位。这一机制让训练集中在最困难的运动段上防止对简单片段的过度采样和对困难片段的欠采样。自动课程辅助扳手对于涉及大基座旋转的高动态技能如倒立、侧手翻和后空翻单纯依靠参考状态初始化往往难以起步。ZEST在基座处施加一个虚拟的空间扳手辅助其强度与各段的失败分数自动联动。随着跟踪性能提升辅助逐步退火至零。这相当于体操教练的“递减支持”机制。五、硬件部署从Atlas到Spot的零样本迁移ZEST在三种不同形态的机器人上完成了硬件验证波士顿动力电驱动Atlas人形约1.8米100千克、Unitree G1人形约1.2米35千克和波士顿动力Spot四足机器人。Atlas人体运动的最大程度复现通过动作捕捉Atlas学会了走路、慢跑、前滚翻、四足爬行、军队爬行、侧手翻、后空翻甚至短暂的霹雳舞。这些动作的共同特点是超出脚部以外的多接触——手、膝盖、前臂、躯干和背部都可能与地面发生交互。这些行为对于传统基于模型的全身控制框架几乎是禁区。通过手机视频Atlas学会了足球踢球和三段舞蹈涉及单脚支撑和连续跳跃需要在持续平衡中精准控制脚步时机。尽管视频参考存在姿态抖动和脚步打滑等伪影零样本迁移后仍然保持了表现力。通过动画关键帧Atlas完成了“倒立反转”这一利用机器人独特自由度的动作——连续旋转后偏航关节并保持手部支撑稳定。这是人类解剖学无法复现的。Unitree G1跨本体迁移的验证在G1上ZEST实现了从动作捕捉到乒乓球和侧手翻的迁移以及从视频到芭蕾舞、跳上箱子、爬箱子、下箱子等场景交互技能的迁移。箱体任务尤其展示了框架的鲁棒性。策略完全基于本体感觉不接收箱体位置的感知输入而是通过训练时对机器人与箱子相对位姿的轻量随机化来学习处理不确定性。测试中成功率为5/5并在随机初始偏移和偏航下全部成功。该策略还支持2千克的躯干负载并能适应训练分布之外的箱体高度。Spot跨形态的杂技行为对于四足Spot动画关键帧使“连续后空翻”“桶滚”“倒立平衡”和“快乐狗”等杂技动作成为可能。在桶滚过程中Spot的机载IMU甚至在空中饱和但它仍然完成了动作。这些结果共同证明同一套策略结构和训练方案不需要针对不同形态或不同技能进行重新设计。六、基于模拟的消融是什么让ZEST有效研究团队在15个Atlas参考动作上训练了单一多技能策略并通过大规模消融实验检验了每个设计选择的价值。关键结论课程和辅助扳手可以移除但样本效率降低。无课程的极简变体在20小时的训练后性能才约等于完整方法10小时的水平。辅助扳手主要帮助高动态动作在训练早期避免灾难性终止。自适应采样移除后性能下降明显因为困难片段被欠采样。热图分析表明采样概率精确追踪了失败分布并将更新集中在高失败区域。参考窗口和观察历史增加未来参考窗口或观察历史5-20步反而损害性能。输入维度增加带来冗余使信用分配更复杂并减慢了收敛。演员-评论家观察设计移除评论家的特权信息会降低价值估计质量导致策略更新变弱。残差动作 vs 绝对动作绝对动作表现最差。早期训练中小的策略输出可能导致大的PD跟踪误差引发关节扭矩爆炸。与MPC基线的对比同样富有启发性。对于走路这类接触时序简单、轨迹良好的行为MPC和RL表现相近。但对于侧手翻、慢跑等更具动态性的动作RL的优势逐渐显现。对于倒立反转、舞蹈B、四足滚动等动作MPC要么因接触标记错误失败要么因点接触约束下手臂扭矩饱和失败。ZEST学习的策略不需要显式接触时间表天然容忍任意身体部位的交互和接触时序的不确定性。七、局限与未来方向ZEST并非没有边界。研究团队坦率指出泛化边界尚未探明目前未测试多技能策略对训练集之外全新运动的泛化能力即“接近但不完全相同”的未见技能。感知缺失当前策略完全基于本体感觉假设地面平坦且不打滑对不平整或柔顺环境的感知留待未来研究。仿真到现实的依赖虽然提供了并联执行器建模和解析电枢PD增益选取的实用程序但全自动系统辨识仍是一个未解难题。长距离任务的挑战对于乒乓球这类需要协调上半身挥拍与动态基座动作的超长时程任务自适应采样策略对成功至关重要。未来方向包括通过紧凑运动嵌入或零/少样本适应实现未知运动的通用跟踪用连续学习扩展运动库训练教师模型跟踪大量参考语料再将知识蒸馏给接受稀疏、人类可理解输入的学生模型最终实现从语言命令到动作执行的闭环。八、结语ZEST证明了一件重要的事在运动模仿领域简单的统一框架可以替代大量逐个技能、逐个机器人的工程调试。它的强大并不来自复杂的网络结构或海量的奖励塑形而来自对训练过程的精细调度——把资源集中在难点上在早期提供物理辅助让策略在足够的多样性中自然收敛。这种“少即是多”的设计哲学正在为人形机器人从“会动”走向“会做事”铺设一条更可扩展的道路。当上午录制的视频能在晚上转化为机器人身上的新技能时人类运动与机器人能力之间的边界开始变得前所未有的模糊。论文信息标题 Embodied skill transfer for locomotion control作者Jean-Pierre Sleiman, Li He, Alfonso Adu-Bredu, Robin Deits, Arun Kumar等机构RAI研究所、波士顿动力等期刊Science Robotics, 2026年8月12日第11卷第117期DOI10.1126/scirobotics.aec7695
返回列表