Science Robotics:伯克利×斯坦福,用扩散模型让人形机器人学会全身运动

11.gif

640.gif

训练只学运动先验,测试靠代价函数零样本解决陌生任务

——一个框架,百种动作

人形机器人模仿人类动作的方案已经不少,DeepMimic、AMP等,能够复现跑步、跳跃等运动。

近日,伯克利与斯坦福联合发布于Science Robotics的BeyondMimic,提出了出一套两阶段解决方案。

第一阶段依靠一套统一配方的强化学习运动跟踪流水线,在共享超参下学习大量高敏捷人类动作,实机完成侧手翻、旋踢、连续特技;

第二阶段训练潜在状态‑动作扩散模型,完成航点导航、摇杆遥操作、关键帧动作补全、障碍物规避,并且在Unitree G1真机完成全部能力验证。

打通了“模仿动作”到“组合技能解决未知任务”的链路。

640.webp

图 | 提出的通用人形机器人控制框架总览示意图©【深蓝具身智能】编译

01.webp

看清现有运动路线躲不开的底层矛盾

  • 基于模型的分层控制

依靠质心、动量、接触时序做上层规划,底层控制器跟踪参考轨迹。

优势是物理可解释;短板是为简化计算会牺牲动作自然度,容易出现膝盖持续弯曲、质心高度固定这类不拟人现象;

对于地面翻滚这类多接触复杂特技,规划器编写难度陡增,高动态运动下仿真现实鸿沟大。

  • 任务定制强化学习(DeepMimic流派)

通过参考运动奖励复现动捕动作,可以实现很自然的特技,但是每个新技能几乎都需要针对性调参,技能规模化扩展成本很高。策略本质是轨迹回放,输入必须是完整参考运动序列,不能响应零散指令,遇到没见过的任务束手无策。

  • VAE类多任务生成运动先验

学习运动分布,支持一定的技能组合。但高度依赖训练阶段的目标条件标注;面对避障这类难以显式描述的隐式目标时,容易输出抖动、物理不合理的动作,泛化能力受限。

  • 分层规划+跟踪器解耦方案

上层生成运动学轨迹,下层独立跟踪控制器。最大隐患是规划‑控制器失配:规划器输出的轨迹不一定满足机器人动力学,下层执行时会出现动作崩坏,两套模块分开训练很难完全对齐。

  • BeyondMimic的思路,是把运动跟踪强化学习与状态‑动作扩散模型结合为完整链路

第一阶段产出大量高质量、可部署的技能教师策略;第二阶段把这些技能蒸馏进入扩散模型,推理时依靠引导梯度,直接在同一个模型内完成规划+控制,规避规划跟踪失配。整套框架训练阶段完全任务无关,任务逻辑全部放到测试时引入。

02.webp

两大核心模块:从批量学技能到推理阶段按需组装任务

第一阶段产出一批运动跟踪教师策略;第二阶段对教师策略的数据做蒸馏,训练潜在状态‑动作扩散模型,最终实机部署的是扩散模型,而非原始RL跟踪策略。

640 (1).webp

图 | 完整框架系统示意图©【深蓝具身智能】编译

可扩展RL运动跟踪

很多人会把这部分简单理解成DeepMimic复刻动作,但实际上是一套MDP配方、同一组超参,训练完全不同的动作,不需要每个特技单独调参

  • 锚点中心相对跟踪目标

不强制全局位姿严格对齐参考,以躯干为锚点,只约束各连杆相对姿态。允许全局发生合理漂移,在保留动作风格的同时,提升对扰动、仿真现实差异的鲁棒性。

  • 极简统一奖励函数

仅由跟踪主项+三项轻量化正则构成:关节限位惩罚、动作平滑惩罚、自碰撞惩罚。没有大量手工设计的启发式奖励,降低调参负担。

  • 无历史观测输入

不堆叠长时间历史状态观测,减少过拟合仿真特有时序模式,提升迁移到真机的稳定性。

  • 自适应采样策略

长参考运动内部难度不均衡,算法自动提高失败片段的采样概率,难题收敛速度大幅提升,解决长序列动捕训练难以收敛的痛点。

  • 适度域随机化

没有做大规模暴力随机,仅对地面摩擦、关节零位、躯干惯量做有限随机;论文给出观点,过度域随机化反而会让动作变得保守僵硬。同时依赖精确的电机armature机械参数建模,这对实机迁移起到关键作用。

该阶段使用约2.5小时的多样化人类动捕数据,仿真完成训练,21个代表性片段直接零样本部署Unitree G1真机,覆盖单腿站立、腾空侧手翻、旋踢、连续特技、舞蹈、倒地起立等。

640 (2).webp

图 | 任务过渡与动作组合效果展示©【深蓝具身智能】编译

潜在状态‑动作扩散模型:训练不管任务,靠引导临场适配需求

第一阶段的RL跟踪策略有本质局限:它需要一条完整的参考运动作为输入。

如果用户只给摇杆速度、航点、零散关键帧,没有完整参考轨迹,策略无法直接使用。

BeyondMimic第二阶段并不直接拿动捕数据训扩散,而是把第一阶段所有RL教师策略跑出来的状态‑动作轨迹作为数据集。

流程分为两步:

  • 训练条件VAE,对教师策略做DAgger蒸馏,把高维的状态动作序列压缩进入平滑潜空间;

  • 在VAE输出的潜轨迹之上,训练Transformer去噪器,得到潜在状态‑动作扩散模型。模型同时建模未来状态序列与动作序列,不只是单纯输出关节动作,隐式学习动作带来的状态演化,自带预测能力。

核心机制:分类器引导(Classifier Guidance)。

训练全程完全看不到导航、避障、遥操作等任务;部署阶段,针对新任务手写简单可微代价函数,在扩散去噪迭代过程中,把代价梯度加到潜变量更新步骤,迭代把生成轨迹推向满足任务目标的方向。

这就实现零样本任务适配:

航点导航就写位置代价;摇杆遥操作写速度代价;避障用符号距离场SDF构建障碍物排斥代价;运动补全任务把给定关键帧作为硬约束。不同代价还可以直接相加组合,实现“一边往航点走一边躲避障碍物”这类复合任务。

640 (3).webp

图 | 引导扩散完成命令条件运动示意图©【深蓝具身智能】编译

这里区分一下它和普通动作扩散的差异:

多数动作扩散只输出关节动作;本模型联合建模状态+动作,自带对未来身体演化的预判,天然适配预测控制闭环。

它不是先生成完整离线轨迹再交给跟踪器,去噪输出的当前步动作直接下发机器人硬件,滚动时域闭环运行。

三类零样本能力:无需重训直接解锁全新任务

  • 命令条件运动(摇杆遥操作、航点导航)

接收速度指令或者目标航点,模型自主在行走、慢跑、奔跑之间做平滑步态切换,这些切换样本在训练数据中非常稀少,属于涌现行为。

真机实现50米以上长距离连续奔跑,外部受到推撞扰动后可以恢复任务目标。

  • 运动补全(Motion Inpainting)

只给定稀疏未来关键帧,例如行走过程中插入一组侧手翻关键姿态,扩散模型自动生成中间平滑过渡轨迹;完成特技之后自动平滑切回正常行走。可以在速度指令模式、关键帧模式之间来回无缝切换。

640 (4).webp

 图 | 任务过渡与组合效果图©【深蓝具身智能】编译

  • 任务代价组合(避障导航)

航点跟踪代价叠加障碍物SDF代价,机器人自主绕行障碍抵达目标,整套能力训练阶段从未见过障碍物样本。

03.webp

实验

研究评测分为仿真消融、用户感知研究、真机硬件实验三部分.

  • 运动自然度用户调研

77名受试者,对比Unitree机器人原生控制器,对行走、跑步片段做二选一投票。70.8%受试者认为BeyondMimic动作更加拟人;跑步场景优势尤其明显,84.7%偏好本方案。

640 (5).webp

图 | 行走跑步拟人化对比与用户调研结果示意图©论文原图

  • 高动态特技实机能力

室外非理想地面(泥土、落叶、不平地表)完成180°侧手翻、连续旋踢、360°翻转踢。腾空阶段骨盆角速度最高可达15.7rad/s,量级和人类运动员特技动作接近。同时完成多次连续C罗庆祝跳跃,早期基线大多只能单次执行。

  • 下游任务定量表现

仿真下行走、奔跑的速度跟踪误差分别为12.14%、13.65%。真机完成遥操作、航点导航、障碍物规避、关键帧运动补全。

但引导式扩散存在固有局限:擅长粗粒度代价目标;精细动作控制效果有限;引导权重需要调试,权重设置不当会造成去噪过程不稳定;在动作模式切换的起始、结束位置机器人容易踉跄失稳

消融实验也验证几个关键结论:

640 (6).webp

图 | 消融研究(方向表示、历史长度、armature、延迟)示意图©论文原图

  • 采用Rot6D连续旋转表示,相比四元数、轴‑角表示,跟踪误差显著降低;

  • 不恰当增大观测历史长度,反而损害sim‑to‑real迁移性能;

  • 通信控制延迟对整套系统影响极大,5ms延迟就会出现失败,说明低延迟C++部署栈是这套方案真机跑通的重要前提。

04.webp

落地收益与无法回避的现实短板

落地层面实际价值

  • 技能规模化成本下降

不需要为每个特技动作重新设计奖励、调参,依靠同一套RL配方,扩展更多动捕片段就可以扩充机器人的技能库,对人形机器人技能库建设提供可行路径。

  • 训练‑测试解耦范式

训练只学习运动先验,不需要预判未来会遇到什么任务。遇到新任务只需要设计可微代价函数,不需要重新训练网络。

  • 规划‑控制一体化闭环

区别于“上层生成轨迹、下层跟踪”的解耦架构,规避规划器‑控制器不匹配的经典问题。

  • 开源带来行业复用价值

该框架已经被MJLab、Unitree RL Lab纳入参考实现,多家硬件厂商在不同人形平台完成复现,证明该配方具备跨机型迁移能力。

640 (7).webp

图 | 部署于人形真机的多样化运动跟踪策略效果展示©【深蓝具身智能】编译

不可忽视的局限

  • 对历史状态存在依赖

模型依赖历史窗口信息,这会带来副作用:运动切换的开头和结尾瞬态阶段容易踉跄;增大引导权重可以改善任务性能,但又会破坏去噪稳定性。

  • 引导权重需要人工调参

面向不同任务,需要调试引导权重,不能做到开箱即用的细粒度控制。

  • 没有原生视觉输入

当前全部基于本体感知(IMU、关节状态),障碍物信息必须依靠外部代价函数输入,机器人本身不能通过相机看到障碍物,无法端到端基于视觉感知做避障。

  • 依赖第一阶段RL教师质量

扩散模型的能力上限由RL教师策略决定;如果RL学不好某个动作,第二阶段扩散也无法凭空造出该技能。

  • 预测视野有限

模型预测时域只有0.64s,适合局部反应式控制,不支持远距离长时序规划。

综合来看,BeyondMimic并没有彻底解决人形全身控制全部难题,瞬态切换不稳、引导调参、缺少视觉端到端感知都是待解决的问题。

但这套“先学技能、后拼任务”的范式,为人形机器人行为基础模型提供重要参考,把模仿学习的边界,从复刻片段推向任务泛化。

编辑|小小怪博士

审编|具身君

Ref

论文标题:BeyondMimic: From motion tracking to versatile humanoid control via guided diffusion 

【深蓝学院】技术交流群

 

💪致力于帮助各位朋友「打破隐形的墙」,共建一个更自由、更有深度、更有价值的交流生态社区!在各大企业工作的,可以相互内推,互通有无;在学校读研读博的,可以交流想法,携手合作。

扫码添加阿蓝,选择想要加入的交流群即可

(按照提交顺序邀请,请尽早选择)

👇

image.png