
具身智能的“冰山理论”:VLA是浮在水面上的10%,剩下90%藏在水下
——必要非充分条件
老实说,VLA可能是具身智能里最“不稀缺”的能力了。
在之前的分享中,我们梳理了VLM、VLA以及世界模型的核心原理及最新突破。
毫无疑问,大模型为机器人赋予了强大的语义理解和常识推理能力,是当前最具热度的"大脑"。
然而,如果你在2026年准备投身具身智能算法岗位,或者试图在真实物理世界中落地一台通用机器人,你很快就会发现一个现实:
VLM/VLA只是具身智能的"上层建筑",整个技术栈远不止于此。
灵巧操作、全身运动控制、数据引擎与仿真、触觉感知……构成具身智能落地不可或缺的技术底座,却恰恰是VLM/VLA力所不及的地方。
今天,我们将目光从"大脑"向下延伸,盘点2026年这四个同样关键、却常被大模型光环掩盖的方向上的代表性进展。

灵巧操作:VLA告诉机器人"抓什么",但"怎么抓"是另一个问题
不可否认,VLA是具身抓取任务的核心上层模块。它可以精准解析人类语言指令,结合视觉观测输出末端执行器的位姿轨迹,解决了机器人抓取的目标定位与动作指令生成问题。
但,位姿轨迹只是抓取的起点,绝非抓取的终点。
当机器人面对一个异形物体时,多指灵巧手该以什么姿态贴合其表面、施加多大的力、如何在接触过程中动态调整?
这是一个远比"输出抓取位置"更高维度的控制问题。
目前的VLA并不擅长处理。这也是为什么在工业界,灵巧手控制至今仍是一个独立的研究方向,并没有被大模型"顺带解决"。
-
这一方向的代表性进展之一是 DemoFunGrasp(CVPR 2026)。
它的核心思路是将功能性抓取分解为"抓取风格"和"可供性"两个互补组件,通过单次演示编辑重构强化学习问题,让系统能够泛化到未见过的物体和抓取风格组合,而不需要为每种物体单独设计奖励函数。
结合VLM进行上层规划,整个系统在真实世界中实现了自主的指令跟随抓取。

图1 | DemoFunGrasp框架概览,从左至右展示功能性抓取策略(演示编辑强化学习)、策略蒸馏(VLM规划+DiT动作块)及真实世界应用©【深蓝具身智能】编译
-
另一个值得关注的进展是 Dexora(ICRA 2026)。
它直接瞄准了双臂高自由度操作这一更难的问题。支持36自由度(双臂+双手)的开源VLA系统,通过外骨骼背包结合Apple Vision Pro的混合遥操作流水线收集数据,并引入离线判别器对数据质量进行加权训练。
在灵巧任务上,平均成功率达到66.7%,基础任务成功率达到90%,并展现出跨形态的泛化能力。

图2 | Dexora系统概览,展示双臂双手高自由度操作动机(上)、数据集与架构设计(中)及性能与跨形态泛化结果(下)©【深蓝具身智能】编译
灵巧操作解决的是"手怎么动"的问题。但手从来不是孤立的——当机器人需要从A点走到B点再完成操作时,"脚怎么配合手"就成了新的瓶颈。

全身运动控制:手脚协同,人形机器人的真正考验
目前大多数VLA的研究场景,是机器人固定底座、只动手臂。但现实中,从冰箱里取出东西、把重物搬到另一个房间、在拥挤的厨房里穿行……
这种"移动+操作"同时进行的全身协同控制,是当前人形机器人落地的核心瓶颈之一。
问题的复杂性在于:移动和操作的控制频率、动力学特性完全不同,腿部需要高频的平衡控制,手臂需要精细的力控,而两者之间的耦合会产生难以预测的干扰。
-
WholeBodyVLA(ICLR 2026)针对的正是这个数据稀缺的问题。
它提出通过潜在动作模型(LAM)从低成本、无动作标注的第一人称视频中学习全身技能,同时设计了专门面向移动操作的强化学习策略(LMO RL)来保证移动指令的精确执行。
在AgiBot X2人形机器人上,系统能稳定完成跨度超过1.5米的大空间移动操作任务。

图3 | WholeBodyVLA框架架构图,左侧为统一潜在学习模块(LAM),右侧为面向移动操作的LMO强化学习策略,输出上下肢分离的动作指令©【深蓝具身智能】编译
数据来源的问题,还有另一种解法:直接用人类的第一人称视频来训练。
-
EgoHumanoid(RSS 2026)用大量野外人类第一人称演示数据与少量机器人数据协同训练VLA策略。
人类数据覆盖了室外、家庭、超市等多样化场景,远比机器人遥操作数据丰富。通过视角对齐和动作对齐两个核心模块弥合人机形态差异,引入野外人类数据后,系统在未见环境中的泛化性能提升了51%。

图4 | EgoHumanoid框架概览,左侧为野外人类数据(覆盖室外/家庭/超市等多样场景),右侧为受限的机器人数据,通过视角对齐和动作对齐后进行VLA协同训练©【深蓝具身智能】编译

数据引擎与仿真:大模型需要数据,机器人更需要数据
只要VLM/VLA模型架构足够先进,就能实现高性能具身智能?
实际上,VLM/VLA只是数据的「使用者」,而机器人落地需要一套完整的数据生产、提纯、迁移体系。
今年以来,数据引擎和仿真这个方向,受到了越来越多顶级实验室的重视。这也侧面印证了:单靠VLM/VLA无法解决具身智能的落地难题。
目前行业主流突破路径分为两条:
一是在仿真中自动生成大量数据,再迁移到真实世界;
二是让仿真环境尽可能逼真,缩小仿真与现实之间的视觉和物理差距。
-
HumanoidMimicGen 走的是第一条路。
它能够从极少量的源演示出发,通过将单/双臂接触丰富技能与全身移动操作规划交错,自动合成适应新物体位姿、无碰撞的稳定轨迹,实现约1000倍的数据放大。
使用这种合成数据协同训练的全身视觉运动策略,比仅用真实数据训练的性能提升了20%。

图5 | HumanoidMimicGen流程图,展示从单次遥操作仿真演示,经全身规划放大为1000倍数据,最终实现仿真与真实协同训练的完整流程©【深蓝具身智能】编译
-
Re3Sim(ICRA 2026) 则走了第二条路,专注于缩小仿真与现实的视觉鸿沟。
它利用3D重建和神经渲染技术,在物理仿真器中忠实还原真实场景,使仿真图像在几何和外观上都高度接近真实观测。仅使用仿真数据训练的策略,就能实现零样本的Sim-to-Real迁移,平均成功率超过58%,并且仿真中的成功率与真实世界的成功率呈现出强相关性。

图6 | Re3Sim框架概览,(a)多样化操作任务,(b)从真实图像/视频出发经网格重建和视觉渲染生成仿真数据集,(c)仿真与真实观测视觉对比,(d)仿真与真实性能一致性验证©【深蓝具身智能】编译

触觉感知:视觉有盲区,VLM/VLA弥补不了物理交互短板
VLM/VLA依赖视觉输入,但视觉有一个天然的盲区:遮挡。
当机器人的手握住物体时,摄像头往往看不到接触面:不知道抓紧了没有、不知道物体是否在滑动、不知道施加的力是否合适。
对于剥皮、切菜、插U盘、擦白板这类接触丰富的精细操作,纯视觉模型的表现会大幅下降。
触觉传感器能够直接测量接触力、压力分布和滑动信号,是弥补视觉盲区的关键手段。但长期以来,触觉数据的处理方式相对简单,并没有被纳入统一的大模型决策框架。
2026年,这一局面开始改变。
-
Dream-Tac 将触觉感知显式地集成到世界动作模型中。
联合建模动作、未来视觉观察和触觉动态,通过接触门控视觉触觉融合机制,模型能够根据当前接触状态有选择性地整合触觉信号。在剥黄瓜、切香蕉、插U盘等6个接触丰富的操作任务中,相比纯视觉基线,动作准确率平均提升了31.7%,同时在训练和推理速度上也有明显改善。

图7 | Dream-Tac统一触觉世界动作模型,(a)接触信号示例,(b)模型架构(联合建模未来视觉/触觉/动作),(c)与基线的性能对比,(d)六类接触丰富操作任务©【深蓝具身智能】编译

那么,到底该学什么?
回答开篇的问题:做具身智能算法,绝对不止是掌握VLM/VLA就够了。
VLA是入场券,但不是护城河。
如果你正在规划自己的技术路线,以下三个值得重点投入的方向:
-
控制理论与机器人学基础
-
多模态融合感知(触觉、力觉、 proprioception)
-
仿真到现实的迁移能力(Sim-to-Real)
VLM/VLA作为具身智能的「上层大脑」,负责语义理解与粗动作规划;但机器人落地需要的精细灵巧操控、全身手脚协同、数据仿真体系、触觉物理感知,都是完全独立、不可替代的核心技术模块。
未来的具身智能算法工程师,绝不能只局限于大模型调参、主干网络优化。真正的核心竞争力,是打通「语义规划-运动控制-数据引擎-物理感知」的全链路能力。
编辑|阿豹
审编|具身君
1.Mao et al., "DemoFunGrasp: Universal Dexterous Functional Grasping via Demonstration-Editing Reinforcement Learning," CVPR 2026.
2.Zong et al., "Dexora: Open-source VLA for High-DoF Bimanual Dexterity," ICRA 2026.
3.Jiang et al., "WholeBodyVLA: Towards Unified Latent VLA for Whole-Body Loco-manipulation Control," ICLR 2026.
4.OpenDriveLab, "EgoHumanoid: Unlocking In-the-Wild Loco-Manipulation with Robot-Free Egocentric Demonstration," RSS 2026.
5.Mandlekar et al., "HumanoidMimicGen: Data Generation for Loco-Manipulation via Whole-Body Planning,"
6.Xie et al., "Re3Sim: Generating High-Fidelity Simulation Data via 3D-Photorealistic Real-to-Sim for Robotic Manipulation," ICRA 2026.
7."Dream-Tac: A Unified Tactile World Action Model for Contact-Rich Manipulation,"
~【深蓝学院】技术交流群~
?致力于帮助各位朋友「打破隐形的墙」,共建一个更自由、更有深度、更有价值的交流生态社区!在各大企业工作的,可以相互内推,互通有无;在学校读研读博的,可以交流想法,携手合作。
扫码添加阿蓝,选择想要加入的交流群即可
(按照提交顺序邀请,请尽早选择)
?
