世界模型的第一篇论文,比GPU的出现早了九年。

640.webp

五波浪潮背后,世界模型始终在回答同一个问题

——35年发展脉络

世界模型走到今天,行业内部的分歧远比外界看到的更大。

一派坚持生成式可视化:让模型输出高清画面、构建可交互的虚拟世界;

另一派押注纯隐空间推理:放弃像素,只在抽象表征中完成因果推演。

但这种技术路线的根本分歧,早在 1990 年深度学习尚未兴起的行业寒冬期便埋下伏笔。彼时全球算力、数据体量与当下差距悬殊,早期世界模型理论更像是一场超前的人工智能思想实验。

此后三十年,世界模型经历了五次清晰的进化浪潮:

01.webp

1990-1991:理论萌芽,建立世界模型底层数学原理

世界模型的雏形诞生于深度学习尚未兴起的低算力时代,这一阶段的核心命题极为纯粹:

世界模型的核心逻辑是什么?AI能否在自我模拟的虚拟环境中学习进化?

Making the World Differentiable

1990年,尤尔根·施密特胡伯发表《Making the World Differentiable》,提出世界模型最核心的底层原理:

让物理环境可微分(Differentiable World

传统仿真引擎是硬编码规则,只能固定执行预设物理公式,无法被训练优化;而可微分世界可以把环境的每一次状态变化转化为梯度信息,支持神经网络反向传播更新参数。

研究设计的循环神经网络(RNN)双任务架构,奠定了后世所有世界模型的基础:

一是环境预测任务,输入当前状态输出未来状态;二是智能体训练任务,在模型生成的虚拟环境中优化动作策略。

640.gif

图| 早期简陋的世界模型©【深蓝具身智能】编译  

Dyna架构

次年(1991年),强化学习泰斗理查德·萨顿提出Dyna架构,确立观测学习仿真行动四步闭环原理

传统AI将模型学习、策略规划、环境执行拆分为独立模块,效率极低,Dyna首次将三者统一:

智能体既可以在真实环境采样数据,也可以利用学习到的世界模型自主生成虚拟样本,用境仿真补充真实数据,解决了早期强化学习采样成本高、数据稀疏的核心痛点。

这两大理论确立了世界模型的本质:远远不是渲染画面那么简单,而是学习环境因果梯度,用仿真替代真实试错。

受限于当时的算力与数据短板,这两项开创性理论无法落地实践,更像是一场人工智能的思想实验。彼时全球算力总量、数字数据体量与当下相差亿万倍,没有任何硬件与工程能力支撑虚拟世界仿真训练。但这波萌芽浪潮奠定了行业终极方向:

真正的智能,源于对世界动态的模拟与动作因果的试错,不是静态符号的堆砌。

02.webp

2018-2019:可行性验证,现代世界模型标准架构落地

沉寂近三十年是因为那时候算力不足,随着深度学习框架成熟、GPU算力普及、海量视频数据积累,世界模型正式迈入工程化探索阶段。

640 (1).webp

图 | 1999年的达显卡©【深蓝具身智能】编译  

这一阶段的核心命题是:世界模型的理论逻辑能否落地?AI在虚拟梦境中学习的模式是否真的有效?

World Models

2018年,大卫·哈与施密特胡伯发表的《World Models》,落地了行业首个标准化、可端到端训练的世界模型三层架构(V+M+C):

视觉编码器V + 记忆预测模型M + 动作控制器C新智具身智能

其核心技术原理是高维视觉压缩+时序动态预测:

  • 视觉模型(VAE变分自编码器)将千万像素的高维画面,压缩为低维稳定隐向量,过滤冗余画面信息;

  • 记忆模型(RNN循环网络)基于隐向量与时序信息,预测环境未来状态变化;

  • 控制器根据预测结果输出最优动作。

整套架构不依赖任何人工物理规则,纯数据驱动学习环境动态。

该论文首次验证了纯梦境训练、仿真现实迁移(Sim-to-Real的核心逻辑:

智能体全程在模型生成的虚拟场景中训练,零真实环境交互,依然能适配真实游戏场景,证明世界模型具备泛化能力。

SimPLe

2019年的SimPLe算法进一步优化工程落地能力,针对性解决传统强化学习真实交互步数过多的问题。

其核心技术创新是模型自适应采样机制:优先用世界模型仿真样本训练,仅在模型预测失效时补充真实环境数据。

Atari 100k极简基准测试中,仅用10万步真实交互(约2小时游戏时长),即可精通26款游戏,样本效率是传统DQN算法的数十倍。

640 (2).webp

图| SimPLe的内部结构©【深蓝具身智能】编译  

这一波浪潮确立现代世界模型核心范式:隐空间压缩(就是用小空间表示大空间)、时序预测、虚拟预训练、现实迁移,为后续性能迭代打通工程壁垒。

03.webp

2020-2022:性能突破,两大核心技术路线定型

解决能不能做的问题后,行业探索重心转向能不能做好”。

这一阶段的核心命题是:世界模型训练的智能体,性能能否比肩甚至超越人类?

这一阶段行业分化出沿用至今、原理完全对立的两大技术路线,定义了世界模型的技术上限。

DreamerV2

第一条是生成式可视化路线(DreamerV2,2020年,核心技术为RSSM循环状态空间模型。

区别于传统RNNRSSM引入离散随机隐状态建模,不再预测单一固定未来画面,而是建模环境的随机性(环境随机不确定性),可以输出多种合理未来场景。同时通过循环记忆机制,持续累积历史时序信息,适配长序列任务。

凭借该原理,DreamerV2仅用单GPU训练,无需任何真实交互,就在55Atari游戏达到人类平均水平,解决了早期模型时序记忆缺失、预测单一僵化的短板。

640.png

图| DreamerV2和其它模型对比,但请注意,这个来自Dreamer V2自己的论文©【深蓝具身智能】编译  

MuZero

第二条是纯隐空间推理路线(MuZero,2019年,核心技术创新是无规则隐态建模+蒙特卡洛树搜索(MCTS)融合。

MuZero最大的突破在于完全舍弃人工编写的游戏规则、物理参数、奖励函数,仅通过观测画面与最终结果,从零学习环境动态规律。

它不生成任何可视化画面,只在自主构建的抽象隐空间中完成状态推演与决策规划,大幅降低算力消耗。

640 (3).webp

图| MuZero玩各种棋类Atari©【深蓝具身智能】编译  

凭借该原理,MuZero全面超越AlphaGo系列,不仅精通棋类博弈,更适配无固定规则的Atari游戏,证明抽象因果推理比像素生成更适配复杂决策任务

JEPA

2022年两大里程碑技术,进一步完善两大路线的底层逻辑。

杨立昆提出的JEPA(联合嵌入预测架构),是隐式世界模型的集大成者,核心原理为屏蔽预测、因果表征学习

JEPA刻意放弃像素级细节生成,只预测环境的高阶因果表征,主动舍弃光照、纹理、微小抖动等无意义随机噪声,只保留物体位置、运动趋势、物理约束等核心规律。

这一设计彻底解决生成式模型的模糊预测、算力冗余问题,推理速度更快、泛化性更强,成为机器人领域的核心架构。

640 (4).webp

图| 杨立昆的JEAP论文,少见的唯一作者论文©【深蓝具身智能】编译  

IRIS

同年诞生的IRIS架构,将大语言模型的缩放能力引入世界模型,核心技术是视觉令牌化+自回归Transformer预测。

它把连续的图像帧离散为固定词汇表的视觉Token,模仿LLM预测下一个文字的逻辑,预测下一个视觉Token与动作结果。该创新让世界模型继承了Transformer的注意力机制、缩放定律、工程生态,首次实现同等数据量下AI性能超越人类解决了传统循环模型无法大规模扩容的痛点。

这一波浪潮标志着世界模型彻底摆脱“玩具级应用”,在标准化任务中实现对人类能力的超越。

同时确立了生成式可视化仿真、隐式因果推理两大技术路线,为后续场景落地提供了核心技术支撑。

04.webp

2023-2024:交互革新,动作条件建模与实时仿真技术成熟

随着模型性能达标,行业瓶颈转变为交互能力缺失,这一阶段的核心命题是:

能否打造真正可交互、可干预的实时世界模型,区分于普通视频生成模型?

这一阶段的核心技术分水岭,是确立动作条件概率建模(Action-Conditioned的核心原理,彻底区分普通视频模型与真正的世界模型。

  • 普通视频生成模型的数学逻辑为,仅根据历史画面预测下一帧,无交互、无因果;

  • 而世界模型的核心公式为 ,将当前状态+人为/智能体动作作为输入,动作是环境变化的唯一干预变量,实现“动作变、场景变”的实时因果交互。

GAIA-1

2023GAIA-1落地真实场景规模化世界模型,核心技术为时序序列建模+多条件融合。

模型以真实驾驶视频为训练数据,同时接收方向盘操作、车速、天气、文本指令等多维度条件输入,统一编码到时序特征中,实时推演车辆动态与路况变化。

同时首次验证:

世界模型完全遵循大模型缩放定律,数据量、参数量提升,推理精度与真实度稳定上涨,为行业规模化迭代提供理论支撑。

640 (5).webp

图| GAIA-1的架构。©【深蓝具身智能】编译  

DIAMOND

2024DIAMOND架构带来生成式世界模型画质与交互精度的质变,核心技术是隐空间扩散模型+光流匹配。

区别于传统自回归逐Token预测,扩散模型通过反向降噪迭代生成高清帧,保留纹理、光影、物体细微运动等细节;

搭配光流匹配技术,精准建模物体运动轨迹,解决了早期模型动作响应滞后、画面跳变、细节失真的问题。

仅用87小时游戏视频数据,即可训练出可实时操控、物理逻辑自洽的交互式虚拟场景,实现低成本、高精度仿真。

640 (6).webp

图| DIAMOND生成的反恐精英游戏世界©【深蓝具身智能】编译  

Genie

同期谷歌Genie(2024年)模型实现了弱监督通用世界建模,核心创新是自监督动作空间挖掘

无需人工标注按键、操控等动作标签,模型通过视频帧间的环境变化差异,自主聚类、学习人类操控动作空间,可从任意静态图像生成完整、可交互、符合物理逻辑的虚拟世界。

640 (1).png

图| Genie模型示意图©【深蓝具身智能】编译

至此,行业彻底明确技术边界:视频模型是时序画面拟合,世界模型是动作驱动的因果环境仿真,具备可干预、可控制、可训练三大核心特性。

05.webp

2025-至今:产业落地,仿真现实迁移与具身智能技术闭环

当前行业正处于第波核心浪潮,也是世界模型从技术研发走向商业落地的关键阶段,核心命题升级为:

虚拟训练的世界模型,能否真正赋能真实物理世界的机器人、自动驾驶等实体设备?

本阶段核心技术突破是高保真Sim-to-Real(仿真到现实迁移),解决了长期以来虚拟仿真完美、现实落地失效的域偏移问题。

核心原理是:

世界模型训练时不再拟合理想化虚拟物理,而是学习真实世界的随机性、不确定性、微小扰动,让虚拟环境的物理规律、场景分布、故障模式与现实世界无限对齐,实现虚拟训练策略零适配迁移到真实硬件。

自动驾驶领域

GAIA-2搭载时空因子化Transformer+流匹配扩散模型支持多摄像头环视仿真,可精准模拟极端天气、突发障碍物、人车随机交互等现实稀有场景,补齐真实路测数据不足、高危场景无法采集的行业短板;

Comma.ai则落地端到端世界模型驾驶策略,彻底抛弃传统规则化自动驾驶算法,纯仿真训练模型直接量产上车,验证了世界模型在工业级场景的可用性。

640 (7).webp

机器人领域

V-JEPA 2优化了隐式世界模型的具身适配能力,核心技术为掩码自监督预训练+少样本微调

通过百万级无标注视频预训练,学习通用物理因果、物体交互、运动规律,仅需数十小时机器人实操数据,即可完成下游任务适配,实现零样本新环境规划。相比传统机器人模型分钟级的推理耗时,V-JEPA 2依托轻量化隐空间推理,将决策耗时压缩至秒级,大幅提升实操效率。

SIMA 2则开创大模型融合路线,核心技术是言时序推理+3D空间建模LLM的语义理解、多步规划能力与世界模型的空间动态仿真能力结合。

既能理解复杂自然语言指令,又能在三维物理空间中推演动作后果、自主拆分任务、适配未知场景,打通了语言思考、物理行动的智能闭环,成为通用具身智能的核心方向。

产业端

李飞飞World Labs、杨立昆AMI Labs、通用直觉等头部企业纷纷斩获十亿级美元融资,全球资本与人才持续涌入。

640 (8).webp

图| AMI实验室介绍©【深蓝具身智能】编译

发展到现在,世界模型彻底走出实验室,成为自动驾驶、通用机器人、工业仿真、智能游戏引擎等领域的核心底层技术。

06.webp

写在最后

1990年的理论萌芽,到现在的产业落地,世界模型的五波浪潮构成了一条比较明确的进化路:

从思想构想验证技术可行性,从性能迭代超越人类水平,从交互突破搭建虚拟世界,从场景落地赋能真实物理空间

相较于大语言模型的符号化智能(乔姆斯基的理念),世界模型补齐了AI的空间认知、因果推理、动作交互短板。

未来,随着两大技术路线持续融合、仿真迁移精度不断提升,世界模型将彻底重构人工智能的发展格局,也许真的会成为复刻我们所在的这个世界的平行宇宙甚至会发现我们没有发现的我们的世界的规律因为被世界模型自己学习到了。

编辑|咖啡鱼

审编|具身君

【深蓝学院】技术交流群

 

💪致力于帮助各位朋友「打破隐形的墙」,共建一个更自由、更有深度、更有价值的交流生态社区!在各大企业工作的,可以相互内推,互通有无;在学校读研读博的,可以交流想法,携手合作。

扫码添加阿蓝,选择想要加入的交流群即可

(按照提交顺序邀请,请尽早选择)

👇

image.png