顶会最佳论文! ICRA 2026 “夯”作给全球机器人研发指明三大技术演进方向

640.webp

9篇获奖论文,三大技术演进趋势。

——全球科研风向

ICRA 作为机器人领域的顶会,与 IROS 并称全球两大标杆。
本届ICRA 2026共收到来自全球的4947篇投稿,最终1882篇论文被选中进行口头或海报展示,整体接收率为38.04%(与上届的接受率基本持平)
所以,我们围绕其中的两大奖项的获奖论文(共9篇)展开系统性盘点:
从相机几何条件化策略、扩散轨迹优化、3D 基础模型到人形全身运动生成、双臂 VLA 灵巧操控、隐式 MPC 接触控制等研究逐一拆解,梳理本届 ICRA 具身智能赛道三大技术演进趋势。
01.webp

Best Paper Award on Robot Learning

关键词:扩散策略、3D基础模型、相机条件化、VLM+RL分层、溅洒感知

你知道你的相机在哪吗?基于相机条件化的视角不变策略学习

🏆 Best Paper Award on Robot Learning 获奖论文

  • 发文团队芝加哥丰田技术研究所(TTIC)、Waymo、约翰霍普金斯大学、丰田研究中心(TRI)

  • 研究内容:

研究提出利用每像素 Plücker 射线图(6D 表示:方向向量 d + 力矩向量 m)编码相机几何信息,直接作为策略的条件输入。

针对预训练视觉编码器的兼容性问题,提出两种融合策略:

  1. 无预训练编码器将 Plücker 图与图像通道级拼接(9 通道输入)

  2. 有预训练编码器用小型 CNN 编码 Plücker 图到与图像潜表示相同维度,再通道级拼接(Late Fusion)

在 RoboSuite 和 ManiSkill 中构建 6 个操作任务,配对"固定"与"随机化"场景变体,解耦背景线索与相机姿态。

640.gif

GRITS:面向机器人食物舀取的溅洒感知引导扩散策略

  • 发文团队:国立阳明交通大学、星猿哲机器人、英伟达

  • 研究内容

研究提出GRITS框架,设计溅洒预测器,在模拟数据集上训练(包含由球体、立方体、圆锥体和圆柱体四种基本形状构成的食物溅洒场景,涵盖不同质量、摩擦力和颗粒大小等物理特性)。

640.png

GRITS架构图©【深蓝具身智能】编译

推理时,预测器提供可微分引导信号,引导扩散策略生成溅洒概率更低的轨迹,同时保持任务成功。在 6 个食物类别上训练,在 10 个未见类别上评估。

论文链接:https://arxiv.org/abs/2510.00573

分层可变形线性物体路由:强化学习与上下文视觉语言模型

  • 发文团队:普林斯顿大学等

  • 研究内容

研究采用分层框架:

高层使用 VLM(视觉语言模型)进行上下文推理,将隐式或显式路由目标分解为可行的多步计划;

低层使用强化学习训练的技能执行具体操作。

640 (1).png

分层式DLO路径规划整体算法框架©【深蓝具身智能】编译

此外,引入失败恢复机制,当执行出错时将 DLO 重新定向到可恢复的状态,增强长期鲁棒性。

FP3:面向机器人操作的 3D 基础策略模型

  • 发文团队:清华大学、上海人工智能实验室、加州大学圣地亚哥分校、上海期智研究院

  • 研究内容

基于 DROID 数据集的大规模多任务点云轨迹预训练。模型架构采用扩散变换器(Diffusion Transformer),以 3D 点云为观测输入,取代传统 2D 图像观测。

640 (2).png

3D Foundation Policy (FP3)©【深蓝具身智能】编译

通过在大规模多样化操作数据上的预训练,FP3 学习到通用的 3D 操作表征,可在少量下游演示下高效微调。

640 (1).gif
02.webp

Best Paper Award on Robot Manipulation and Locomotion

关键词:人形全身运动、双臂灵巧VLA、交互保持、接触隐式MPC、摩擦调制

OmniRetarget:面向人形机器人全身运动与操作及场景交互的交互保持型数据生成

🏆 双料获奖:Best Conference Paper Award + Best Paper Award on Robot Manipulation and Locomotion 

  • 发文团队:亚马逊FAR(前沿人工智能与机器人)、麻省理工学院、加州大学伯克利分校、斯坦福大学、康奈尔大学

  • 研究内容

研究的核心是基于交互网格(Interaction Mesh)的数据生成引擎:

  1. 显式建模智能体-地形-物体之间的空间与接触关系

  2. 最小化人类与机器人网格之间的拉普拉斯形变(Laplacian Deformation),同时施加运动学约束,生成运动学可行轨迹

  3. 保留任务相关的交互信息,实现高效数据增强——一次示范即可生成适用于不同机器人本体、地形、物体配置的多样化数据

640 (3).png

OMNIRETARGET总览©【深蓝具身智能】编译

重定向 OMOMO、LAFAN1 及自建 MoCap 数据集,生成 8+ 小时轨迹。强化学习训练仅需 5 个共享奖励项 + 简单域随机化,无需学习课程设计。

Dexora:面向高自由度双臂灵巧操作的开源 VLA

  • 发文团队:清华大学 · 北京大学 · 上海交通大学 · 中科院自动化所 等(25 位作者联合)

  • 研究内容

640 (4).png

Dexora总览©【深蓝具身智能】编译

研究提出了混合遥操作管道:

定制外骨骼背包捕获粗臂运动学 + Apple Vision Pro 捕获精细手指运动(无标记手部跟踪),驱动物理平台和 MuJoCo 数字孪生。

训练语料包含具身匹配的合成数据(100K 模拟轨迹,650 万帧)和真实世界数据(10K 遥操作剧集,292 万帧)

提出数据质量感知训练方案——离线判别器评估演示质量,为扩散变压器策略训练提供剪辑级权重,降低低质量演示权重。

640 (2).gif

通过被动滚轮实现各向异性摩擦调制的灵巧操作

  • 发文团队美国东北大学、美国 RAI Institute

  • 研究内容

在商用平行夹爪(Robotiq 2F-85)每个指尖上安装可互换的滚轮模块,提供两个主动自由度:

整体旋转改变滚轮方向 + 刹车锁定所有滚轮。

640 (5).png

带有可旋转、可制动滚轮的原型指尖,安装在Robotiq2F-85自适应夹爪上©【深蓝具身智能】编译

未刹车时,滚轮自由旋转,允许物体沿轴向几乎无约束滑动;

刹车时,滚轮表现为高摩擦表面,抵抗所有方向运动。

三个被动滚轮近似圆形接触轮廓,由 N20 齿轮电机驱动旋转,紧凑刹车机构作用于滚轮背面。

Bi-Adapt:基于语义对应的 3D 物体新类别少样本双臂适配

  • 发文团队:新加坡国立大学、上海期智学院、北京大学、香港大学

  • 研究内容

研究提出的Bi-Adapt利用视觉基础模型(Visual Foundation Models)的语义理解能力,建立跨物体类别的语义对应关系,实现可操作性映射(Affordance Mapping)的迁移。

640 (3).gif

在新类别物体上仅需少量样本微调,即可获得有效的双臂操纵策略。关键在于将语义对应作为桥梁,将已知类别的操作知识迁移到未知类别。

640 (6).png

Bi-Adapt框架©【深蓝具身智能】编译

Push Anything:基于接触隐式 MPC 的首次视觉单/多物体推动

  • 文团队:宾夕法尼亚大学

  • 研究内容

640 (1).webp

Push Anything框架的系统图©【深蓝具身智能】编译

研究提出了Push Anything机器人平面推送系统,将接触推理直接嵌入轨迹优化的接触隐式模型预测控制(CI-MPC)。完整管道包括:物体扫描 → 网格重建 → C3+ 求解 → 硬件执行。

C3+(共识互补性控制增强版)是 CI-MPC 的改进算法,实现显著更快的求解时间,支持多物体推动任务的实时性能。

640 (4).gif
03.webp

2026机器人技术核心趋势

如果要用几个关键词概括 2026 年的研究焦点,它们大概会是——

  • 数据效率革命

从 OmniRetarget 的"一次示范→多本体增强"到 FP3 的"80 演示→90% 成功率",再到 Bi-Adapt 的少样本泛化。

如何用更少数据做更多事,仍是 2026 年的核心命题之一。

  • 3D / 几何信息回归

FP3 用点云取代 2D 图像,Do You Know Where Your Camera Is 用 Plücker 射线注入相机几何。

纯粹的 2D 视觉正在触及天花板,3D 几何先验成为破局关键。

  • 人形机器人突破临界点

OmniRetarget 的双料大奖标志着人形机器人全身运动操控从学术探索走向工程验证,Unitree G1 的 30 秒跑酷 + zero-shot 迁移是里程碑式成果。

获奖无疑是对研究质量的高度认可,但它并不等同于“终极答案”。

它们代表了当前具身智能在数据效率、3D表征、全身控制等方向上的阶段性最优解,但不容忽视的是大多技术仍存在场景适配局限、落地成本偏高、泛化能力待验证等问题。

这些未尽之问,恰恰为后续研究指明了方向。

奖项是一种确认,更是一次起跑。

Ref

1.Do You Know Where Your Camera Is? View-Invariant Policy Learning with Camera Conditioning(https://arxiv.org/abs/2510.02268)

2. GRITS: A Spillage-Aware Guided Diffusion Policy for Robot Food Scooping Tasks(https://arxiv.org/abs/2510.00573)

3. Hierarchical DLO Routing with Reinforcement Learning and In-Context Vision-language Models(https://arxiv.org/pdf/2510.19268)

4. FP3: A 3D Foundation Policy for Robotic Manipulation(https://arxiv.org/abs/2503.08950)

5. OmniRetarget: Interaction-Preserving Data Generation for Humanoid Whole-Body Loco-Manipulation and Scene Interaction(https://arxiv.org/pdf/2509.26633)

6. Dexora: Open-source VLA for High-DoF Bimanual Dexterity(https://arxiv.org/pdf/2605.18722)。详细阅读ICRA 2026 | 首个 36 自由度双臂灵巧操作 VLA 模型,开源!

7. Robotic Dexterous Manipulation via Anisotropic Friction Modulation using Passive Rollers(https://arxiv.org/pdf/2603.27452)

8. Bi-Adapt: Few-shot Bimanual Adaptation for Novel Categories of 3D Objects via Semantic Correspondence(https://arxiv.org/pdf/2602.08425)

9. Push Anything: Single- and Multi-Object Pushing From First Sight with Contact-Implicit MPC(https://arxiv.org/pdf/2510.19974)

【深蓝学院】技术交流群

 

💪致力于帮助各位朋友「打破隐形的墙」,共建一个更自由、更有深度、更有价值的交流生态社区!在各大企业工作的,可以相互内推,互通有无;在学校读研读博的,可以交流想法,携手合作。

扫码添加阿蓝,选择想要加入的交流群即可

(按照提交顺序邀请,请尽早选择)

👇

image.png