WAM 八年技术“狂奔”,却仍未达成的定义共识

640.gif

WAM狂奔八年,行业却连定义共识都没达成

——但它正在逼近具身智能的某种本质

当前 WAM 领域呈现出技术快速迭代与核心争议并存的格局:

一方面,"大视频基座 + 轻量动作头" 的工业落地路线得到初步验证;

另一方面,关于 "推理时显式未来预测是否为刚需"、"WAM 与 VLA 的能力边界如何划分" 等核心问题,行业仍处于“争论”当中

——行业对WAM的定义本身尚未形成共识。

但其实早在2018年,WAM的核心概念就已有伏笔:

彼时提出的“在隐空间中模拟世界以替代真实试错”,至今仍是WAM体系的思想原点。

那么,从这一思想原点出发:

WAM在8年间究竟经历了怎样的架构演变?
解耦式探索、两阶段对齐、联合统一建模等关键阶段如何交替推进?
每一次架构取舍又留下了哪些未解难题?

本文将沿着8年技术发展时间线,系统拆解WAM从理论筑基到闭环自主决策的完整演进脉络。

01.webp

技术溯源:纯世界模型筑基,埋下动作融合伏笔

WAM的核心内核源自早期世界模型研究,这一阶段研究重心聚焦让AI学会理解并预判世界,暂未正式结合动作生成,却为后续WAM搭建起底层逻辑框架。

早在2018年,经典论文《World Models》率先提出开创性思路,依托VAE结合循环神经网络构建基础环境表征,让智能体在隐空间内学习环境规律、预测未来状态。

首次确立“以模型模拟世界替代真实试错”的核心思想,彻底改变强化学习依赖海量真实交互数据的旧模式。

640.webp

世界模型(World Model)核心组件:视觉编码、时序记忆与动作控制协同流程©【深蓝具身智能】编译

此后Dreamer系列论文持续迭代升级,创新性采用RSSM时序建模结构,把环境观测信息压缩至紧凑隐空间,依托虚拟环境完成策略规划与训练。

这套成熟的世界预测体系,搭建起环境感知、时序推演的基础能力。但也暴露出核心短板:

仅能完成场景想象,无法输出可落地的控制动作,认知与执行彻底割裂。

640 (1).webp

Dreamer 算法的三大核心组件:动力学学习、想象中行为优化与环境执行流程©【深蓝具身智能】编译

2022年掩码世界模型相关研究的出现,将视频画面视作序列数据开展自回归预测,进一步强化长时序场景推演能力,把视觉时序建模精度推向新高度。

至此,能看懂世界、能预判未来的基础能力全部成型,行业正式迎来从“纯世界建模”向“世界+动作融合建模”转型的技术拐点

——WAM雏形显现。

640 (2).webp

基于 Slot Attention 的目标中心视频模型 SAVi++ 架构与训练流程©【深蓝具身智能】编译

02.webp

雏形探索:解耦式架构落地,视频先验打通动作链路

2023年行业正式开启WAM雏形探索,主流思路走向世界建模与动作生成完全解耦。

依托成熟大视频预训练模型作为环境认知主干,额外搭建轻量化动作映射分支,以低成本方式实现“场景预判+动作输出”基础组合。

640 (1).gif

这一阶段以UniPi为标志,首次抛出“策略即视频”颠覆性理念,构建起文本指令生成未来行为视频、再通过逆动力学模型反推实操动作的完整流程。

研究证实,海量通用视频预训练积累的物理常识、行为逻辑,能够完美填补智能体物理认知短板,轻松实现跨场景基础行为迁移。

640 (3).webp

 UniPi :基于文本条件视频生成的通用策略框架©【深蓝具身智能】编译

但解耦架构的先天缺陷也随之暴露:

视频预测模块与动作决策模块独立训练,二者表征空间无法深度对齐,长时序推演极易出现画面失真、动作偏移;

同时双模块并行运行算力开销庞大,控制精度偏低,仅能适配简单低速场景,复杂实操任务难以胜任。

即便实用性受限,这套架构依旧成为早期低成本搭建WAM系统的通用范式。

03.webp

迭代优化:两阶段对齐升级,隐动作降低适配门槛

迈入2024年上半年,行业针对解耦架构的割裂痛点开展优化,进入两阶段对齐WAM发展阶段,依旧保留双模块独立训练模式,但重点强化两大模块表征对齐能力,同时引入隐动作思路降低视频到实体动作的转化难度。

640 (2).gif

以 LAPA 框架为代表,提出了隐动作预训练方案。

研究不再直接搭建视频与真实机械动作的映射通道,而是先从无标注通用视频数据中学习抽象隐式动作表征,再完成隐动作到实体控制动作的二次映射。

这种分层转化思路,大幅降低跨设备、跨场景动作适配难度,充分盘活海量无标注视频训练资源。

640 (4).webp

LAPA 模型整体框架:基于视频的无监督隐动作预训练流程©【深蓝具身智能】编译

同期 Mimic-Video 进一步落地工程化优化,直接冻结成熟大规模视频预测骨干网络,仅轻量化微调动作解码分支。

该方案在保障环境预测精度不变的前提下,极大缩减训练成本与部署门槛,验证了通用视频先验无缝迁移至机器人实操控制的可行性,让WAM从理论研究逐步走向轻量化落地场景。

640 (1).png

视频 - 动作模型(VAM)与传统 VLA 的范式对比:Mimic-Video 的核心架构与样本效率优势©【深蓝具身智能】编译

同样,两阶段架构依旧没能根除核心矛盾:

先后训练的模式无法实现环境变化与动作调整的实时联动,智能体无法根据实时推演的环境变化动态修正动作,临场应变能力依旧薄弱。

640 (3).gif
04.webp

架构革新:联合统一建模,WAM正式确立核心形态

2024年下半年至2025年上半年,WAM迎来里程碑式技术变革共享骨干联合优化架构正式取代传统两阶段架构,标志着标准形态的WAM全面成型

——也是现阶段学术研究与工业落地的主流核心路线。

640.gif

联合式 WAM 标志研究Scaling Offline Model-Based RL via Jointly-Optimized World-Action Model Pretraining》,打破模块壁垒,采用同一套Transformer主干网络,同步完成环境未来状态预测与连续动作序列生成,实现世界认知与动作决策端到端协同优化。

640 (5).webp

联合 WAM 架构示意图:单流 / 多流耦合©【深蓝具身智能】编译

统一表征空间彻底解决表征错位问题,模型既能精准预判环境演变趋势,又能同步输出适配场景变化的连贯动作,仅依靠少量专家演示轨迹,即可快速完成全新场景任务迁移,综合性能实现质的飞跃。

640 (6).webp

JOWA:面向世界 - 动作联合优化的端到端 Transformer 架构©【深蓝具身智能】编译

随后 WorldVLA 进一步完成多模态融合升级,将视觉图像、自然语言指令、连续控制动作统一转化为离散Token序列,依托自回归生成逻辑实现多模态协同推演。

模型实现环境预测与动作生成双向赋能,场景预判结果优化动作决策,动作执行反馈反向修正环境推演偏差,在各类机器人实操基准测试中成绩大幅提升。

后续迭代衍生出适配连续动作的优化版本,进一步拓宽实用边界。

640 (7).webp

WorldVLA 模型架构:动作模型与世界模型双向增强的自回归 WAM 设计©【深蓝具身智能】编译

联合建模架构补齐了WAM核心能力短板,兼具认知深度与执行灵活性,但想要实现真正意义上的通用具身智能,还需突破场景、设备、任务的泛化壁垒。

05.webp

能力突破:大规模预训练赋能,实现零样本跨域泛化

2025年末至2026年初,WAM技术发展聚焦通用泛化能力,依千亿级大规模视频扩散预训练模型赋能,打造具备零样本适配能力的高阶WAM体系,彻底摆脱场景与设备定制化训练束缚。

NVIDIA推出的 Dream Zero 作为该方向标杆成果,依托超大参数视频扩散主干网络,搭配极简轻量化动作适配头,仅依靠极少量遥操演示数据,就能实现跨品类机器人、未知作业物体、全新陌生场景的零样本自主操控。

这项研究直接证实,通用视觉世界先验足以支撑绝大多数基础具身任务,无需针对细分场景重复大规模训练。

也让行业正式确立“大视频基座+轻量动作头”的极简高效工业落地路线。

640 (8).webp

DreamZero 模型概览:基于 WAM 的零样本泛化与跨具身学习能力©【深蓝具身智能】编译

同期《Co-Evolving Latent Action World Models》针对性解决联合训练极易出现的表征坍塌问题,采用分步预热协同训练策略:

先完成世界模型与隐动作模型基础对齐预训练,再开展双向协同迭代优化,让环境推演模块与动作决策模块相互适配、共同进化,进一步提升复杂动态场景下的运行稳定性与决策合理性。

640 (9).webp

CoLA-World 的核心创新:从两阶段到单阶段的 LAM 与世界模型协同进化训练范式©【深蓝具身智能】编译

06.webp

终极演进:双向交互闭环,打造可行动真实世界模型

当下,WAM技术正式迈入成熟终局形态,研究重心从“同步生成”升级为双向动态交互迭代,彻底告别单向推演、单向输出的固有模式,构建起闭环自主决策体系。

640 (10).webp

从 WAM 到 WAIM:世界动作模型从单向生成到递归交互的范式演进©【深蓝具身智能】编译

最近一项研究 DAWN 搭建起全新交互运行逻辑:

  • 模型先依据当前场景完成未来世界状态推演,以此为条件生成精准可控的原始动作序列;

  • 再通过动作去噪模块优化动作精度;

  • 最终将动作执行带来的场景实时变化反向回传,二次修正优化后续环境推演结果。

640 (11).webp

DAWN 模型架构:隐空间下世界预测与动作去噪的交互增强 WAM©【深蓝具身智能】编译

这种循环往复的双向反馈机制,让WAM具备实时临场调整、长时序精细规划的核心能力,不再是死板的预判执行工具。

而是能够深度融入真实物理世界、自主适配环境波动的可行动世界模型,无限贴近人类观察思考、调整行为的自然决策逻辑。

也为家用服务机器人、工业智能操控、自主移动智能体等高端落地场景扫清最后技术障碍。

07.webp

锚定行业未来格局

走完完整技术演进链路后,也推荐两篇最新综述研究,能够帮助大家快速梳理行业全貌、厘清未来研究方向:

  • 其一为复旦联合多所高校推出的《World Action Models: The Next Frontier in Embodied AI》。

首次完成WAM权威定义,清晰划分级联式、联合式两大主流技术架构,系统性梳理数据集、评测基准、现存技术瓶颈与优化方向。

640 (12).webp

级联 WAM 架构示意图:显式 / 隐式规划©【深蓝具身智能】编译

  • 其二为华为产业视角综述《World Models and World Action Models (WAM): From Foundation Simulators to Embodied Action》。

复盘从传统世界模型到新一代WAM的完整产业演进历程,梳理六大核心技术支柱,同时结合产业落地场景绘制清晰技术发展路线图。

640 (13).webp

具身世界动作模型(WAMs)的分类与全景:三大技术分支与范式演进©【深蓝具身智能】编译

纵观整场技术演进,WAM始终沿着一条主线持续进化:

分离对齐 → 融合统一 → 泛化通用 → 闭环交互

每一次架构跃迁,本质上都是在回答同一个问题——如何在隐空间中更高效地建立对物理世界的认知,并据此产出可执行的动作。

640 (14).webp

但值得注意的是,行业对WAM的定义共识远未达成。

不同研究团队口中的“WAM”可能指向完全不同的架构范式与能力范畴,这在一定的客观程度上增加了技术对比和工程选型的难度。

WAM的演进史本身也在提醒我们:每一阶段的“最优解”都带着特定场景和工程约束的烙印。

本文梳理WAM全貌的目的,希望能为从业者提供一个审视这一技术方向的历史纵深与逻辑线索。在众声喧哗的舆论场中,厘清哪些是底层能力的真实突破,哪些是工程层面的路径选择。

编辑|小小怪博士

审编|具身君

Ref

1、 World Models:https://arxiv.org/pdf/1803.10122(NIPS2018 Oral)
2、 DREAM TO CONTROL: LEARNING BEHAVIORS BY LATENT IMAGINATION:https://arxiv.org/pdf/1912.01603(ICLR 2020)
3、 SAVi++: Towards End-to-End Object-Centric Learning from Real-World Videos:https://arxiv.org/pdf/2206.07764
4、 Learning Universal Policies via Text-Guided Video Generation :https://arxiv.org/pdf/2302.00111(NeurIPS 2023 (Spotlight)
5、 Latent Action Pretraining from Videos:https://arxiv.org/abs/2410.11758(ICLR 2025)
6、 mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs:https://arxiv.org/pdf/2512.15692
7、 Scaling Offline Model-Based RL via Jointly-Optimized World-Action Model Pretraining:https://arxiv.org/abs/2410.00564(ICLR 2025)
8、 WorldVLA: Towards Autoregressive Action World Model:https://arxiv.org/pdf/2506.21539
9、 World Action Models are Zero-shot Policies:https://arxiv.org/abs/2602.15922
10、 CoLA-World: Co-Evolving Latent Action World Models:https://arxiv.org/pdf/2510.26433
11、 The DAWN of World-Action Interactive Modelshttps://arxiv.org/pdf/2605.11550
12、 World Action Models: The Next Frontier in Embodied AI:https://arxiv.org/pdf/2605.12090
13、 World Models and World Action Models (WAM): FromFoundation Simulators to mbodied Action:https://jinxindeep.github.io/papers/WAM/WM_WAM.pdf
【深蓝学院】技术交流群

 

💪致力于帮助各位朋友「打破隐形的墙」,共建一个更自由、更有深度、更有价值的交流生态社区!在各大企业工作的,可以相互内推,互通有无;在学校读研读博的,可以交流想法,携手合作。

扫码添加阿蓝,选择想要加入的交流群即可

(按照提交顺序邀请,请尽早选择)

👇

image.png