潜在世界动作模型要解决哪两大难题?人大团队提出 JEPA-WAM,刷新机器人操纵 SOTA

11.gif

640.gif

基于 V-JEPA 共享预测器构建潜态 WAM,联合时序表征提升机械臂域外泛化能力

——从零搭建策略

上图来自中国人民大学、清华AIR、XYZ Embodied AI等团队的联合团队推出JEPA-WAM。

基于预训练V-JEPA构建共享预测器潜态世界模型,无需生成像素画面,依靠时空联合表征实现跨场景强泛化,仿真与真机双平台验证,无大规模机器人预训练条件下LIBERO-Plus数据集79.2%成功率刷新同赛道最优水平,适配现有成熟VLA模型无损提升鲁棒性。

01.webp

现有技术路线

当前机器人VLA世界模型分为两条主流路线:

  • 视频生成式WAM

通过逐帧预测未来图像建模环境变化,理论上能完整还原场景动态,但推理阶段需要循环生成画面,算力消耗巨大,机械臂嵌入式设备很难实时运行;

同时像素重建会冗余记录光照、噪声等无关信息,模型容易过拟合训练环境,域外场景泛化能力弱。

  • 传统独立分支潜态WAM

放弃像素生成,直接在特征空间预测未来,但设计上存在两种缺陷:

一是仅编码单帧未来特征,丢失当前-未来画面之间的局部空间变化关系,物体微小位移、遮挡等关键动作线索丢失;

二是时序预测网络和动作编码器完全分离,时序损失无法反向优化生成动作的主干网络,世界建模的增益很难传递给动作预测分支。

640.webp

四类潜态VLA范式对比图©【深蓝具身智能】编译

对比目前四类潜态VLA范式,能直观看出JEPA-WAM差异化设计逻辑:

  • 传统WAM:世界建模与动作专家分属两套独立主干,信息割裂;

  • 专用潜动力学VLA:单独搭建动力学模块作为动作输入,监督信号间接;

  • 带独立LAM分支VLA:视觉主干输出特征后额外新增动力学子网络,无法共享权重;

  • JEPA-WAM(本文):单Qwen共享预测器同时输出时序表征与动作特征,时序损失直接优化主干,不存在冗余分支。

当前的JEPA衍生机器人方案如VLA-JEPA、JEPA-VLA,仅将JEPA特征作为输入,没有实现时序预测与动作生成耦合,而JEPA-WAM首次把联合时空预测目标嵌入V-JEPA表征空间,一套预测器完成两大任务,从结构上解决特征复用不足的问题。

02.webp

JEPA-WAM核心架构与三大创新设计

整套框架核心由冻结V-JEPA编码器、Qwen2.5-0.5B共享预测器、DiT动作专家三部分构成,训练阶段开启时序预测分支,部署时直接删除预测头,仅保留动作推理链路,不增加上线延迟。

640 (1).webp

JEPA-WAM 整体架构与综合性能总览©【深蓝具身智能】编译

时空联合当前-未来预测目标(核心表征创新)

绝大多数潜世界模型只单独编码未来单帧特征,JEPA‑WAM 创新构造联合时序表征 

将当前帧  与步后的未来帧 沿时间维度堆叠,送入冻结 V‑JEPA 统一编码,输出同尺寸、保留分块空间信息的联合特征。

  1. :同相机时序画面拼接,V‑JEPA 原生双帧 tubelet 编码保证输出空间网格和单帧完全一致;
  2. :冻结目标编码器,避免时序损失破坏预训练视觉能力;
  3.  多视图拼接:全局、腕部相机特征有序拼接,完整保留机械臂多视角空间对应关系。

该表征不单独编码未来,而是直接存储“当前→未来”全部局部变化:

物体移动区域、遮挡变化、手爪交互信息全部保存在分块token里。

640 (2).webp

联合时序表征的空间变化可视化诊断图©【深蓝具身智能】编译

可视化结果显示,联合表征的特征变化区域和画面RGB动态区域高度匹配,模型能精准捕捉手爪、物体交互的局部变化,不会丢失细粒度动作线索。

640 (3).webp

JEPA-WAM详细推理流程图©【深蓝具身智能】编译

单共享预测器耦合时序建模与动作生成

这是JEPA-WAM最关键的结构创新,彻底解决时序监督无法作用于动作主干的行业痛点:

共享预测器选用轻量化Qwen2.5-0.5B,输入V-JEPA视觉特征、语言指令、专用动作占位符token,单次前向传播输出两组特征:

  1. :用于时序预测的视觉位置隐态,保留原始 patch 空间排布,送入 MLP 预测头对齐联合时序目标;

  2. :动作专用聚合表征,单独送入 DiT 动作专家生成连续机械臂动作。

训练总损失为动作匹配损失+时序对齐损失加权和:

采用逐块余弦距离损失,强制预测器学习画面时空变化;基于流匹配预测连续机械臂动作序列。

两套损失同步更新同一个 Qwen 主干,时序学到的空间动态知识直接赋能动作预测,不存在两套网络的信息壁垒。

无侵入式适配现有预训练VLA模型

JEPA-WAM并非独立全新模型,可作为辅助监督模块无损接入π0.5等成熟大规模机器人预训练VLA,无需改动原有视觉、动作推理通路。

实现方式仅新增一组可学习Future Token:

在VLM输入序列末尾追加64个专用时序token,输出隐态重塑为粗特征图,上采样对齐V-JEPA联合目标维度,额外增加时序对齐损失辅助训练。

640 (4).webp

预训练VLA接入时序监督结构图©【深蓝具身智能】编译

在LIBERO-Plus数据集,原生π0.5基线84.5%,接入JEPA时序监督后提升至86.3%,成为全赛道最优结果,证明该时序范式对大尺度预训练VLA同样具备显著增益,适配存量工业VLA算法。

03.webp

仿真与真机双维度实验:指标的收益与局限

实验覆盖LIBERO仿真单臂、RoboTwin 2.0双臂仿真、真实AgileX双机械臂三大平台,区分“无机器人大规模预训练”“带预训练”两组基线横向对比,指标不单纯追求纸面刷榜,区分域内ID、域外OOD两种场景解读实际落地价值。

LIBERO系列仿真基准

  • LIBERO(域内ID场景)

原生JEPA-WAM无预训练平均成功率96.7%,和ResVLA、Fast-WAM等主流方案持平;

接入π0.5预训练模型后提升至97.8%,域内性能无衰减,证明时序监督不会破坏基础任务能力。

640 (5).webp

LIBERO 数据集任务成功率(%),按是否使用大规模机器人预训练分组©【深蓝具身智能】编译

  • LIBERO-Plus(域外OOD核心评测场景)

该数据集通过更换光照、物体摆放、背景、相机视角制造分布偏移,专门测试泛化能力,是行业核心鲁棒性标尺。

无大规模机器人预训练组别:JEPA-WAM 79.2%,超越RoVLA、ResVLA等全部基线,同赛道第一;

带预训练组别:π0.5+JEPA Obj达到86.3%,整体榜单最优;

640 (6).webp

LIBERO-Plus 域外泛化数据集任务成功率(%)©【深蓝具身智能】编译

分维度数据显示,相机偏移、物体布局变化、光照扰动下JEPA-WAM提升幅度最大,证明联合时序表征对视觉扰动鲁棒性提升效果最突出。

RoboTwin 2.0双臂仿真

区分Clean标准场景、Random随机扰动场景(物体乱序、视角切换):

原生JEPA-WAM:Clean 79.9%,Random 36.9%,远超无预训练基线;

π0.5叠加时序监督:Clean场景75.4%→84.6%大幅提升,Random扰动场景性能基本持平;

640 (7).webp

RoboTwin 2.0 仿真标准 / 随机扰动场景单任务成功率(%)©【深蓝具身智能】编译

推理效率补充:单帧推理85ms(11.76Hz),对比ABot-M0(125ms)速度提升32%,嵌入式机械臂控制器可实时运行,不存在视频生成模型的算力瓶颈。

真实双机械臂真机测试

搭建6自由度双臂平台,设计5类操作任务(摆盘、堆叠、抽屉抓取),分别测试标准ID环境、更换背景物体OOD环境:

640 (8).webp

真实双臂机器人五项操作任务的域内 / 域外实验结果©【深蓝具身智能】编译

轻量JEPA-WAM原生模型:ID均值59.8%,OOD均值54.2%,对比原生π0(ID51.8%/OOD22.5%)域外泛化提升一倍以上;

π0.5叠加JEPA时序监督:ID 77.5%→90.3%,OOD72.5%→84.7%,真机复杂物理交互下泛化增益稳定复现。

真机实验核心价值:仿真数据集的泛化优势不是纸面数字,真实相机畸变、机械传动误差、物体摩擦力扰动场景下依旧成立,具备工业落地可行性。

消融实验(优化要点)

表征层面:联合时序目标>仅未来帧>特征差值,分块空间对齐不可压缩;

主干层面:时序监督作用于预测器最后一层效果最优,中层辅助监督收益大幅下滑;

任务隔离:专用动作占位符能避免时序特征干扰动作生成,是平衡多任务的关键;

视觉基座:V-JEPA自带时序表征能力,替换DINO+SigLIP基线,域外平均直接提升3.8%。

640 (9).webp

LIBERO-Plus 数据集分扰动维度消融实验结果©【深蓝具身智能】编译

04.webp

总结

JEPA-WAM跳出“生成像素”、“独立动力学分支”两大传统世界模型设计思维,依托V-JEPA稠密分块表征搭建共享预测器,用联合当前-未来时序目标精准捕捉场景局部时空变化,让时序动态监督直接赋能动作生成主干。

无论是从零训练轻量化VLA,还是优化现有大规模预训练机器人策略,都能稳定提升光照、视角、物体布局扰动下域外任务成功率,同时保持低推理开销,适配工业机械臂嵌入式硬件。

该工作证明JEPA类自监督视频表征是解决VLA泛化瓶颈的优质底座,后续若融合多模态传感、自适应时序偏移参数、语言条件时序目标,有机会进一步拓展至动态工件、长步骤工业装配等高难度机器人任务。

编辑|小小怪博士

审编|具身君

Ref

论文标题:JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling

【深蓝学院】技术交流群

 

💪致力于帮助各位朋友「打破隐形的墙」,共建一个更自由、更有深度、更有价值的交流生态社区!在各大企业工作的,可以相互内推,互通有无;在学校读研读博的,可以交流想法,携手合作。

扫码添加阿蓝,选择想要加入的交流群即可

(按照提交顺序邀请,请尽早选择)

👇

image.png