
「RL+扩散模型+视频生成...」
回顾2026年上半年,浙江大学高飞老师团队在空中机器人领域延续了高产节奏,研究方向也呈现出清晰的演进脉络。
-
感知模态从纯视觉走向触觉力感知与视频生成模型辅助导航; -
任务类型从纯飞行走向空中抓取、力感知操作等物理交互;应用场景从单一无人机走向移动机械臂等复合系统; -
数据来源从真实采集走向生成式世界模型自动化生成。

论文标题:Precise Aggressive Aerial Maneuvers with Sensorimotor Policies(Science Robotics 2026)
论文介绍:穿越狭窄缝隙时,四旋翼需要在SE(3)约束下完成大角度倾斜——机身倾斜角越大,穿越越危险,对感知和控制的精度要求也越高。传统方法通常依赖外部定位系统获取精确的状态估计,再生成参考轨迹来引导控制器执行。这套流程在实验室环境下表现尚可,但一旦定位信号不稳定,整个链条就会失效。
这项发表于《Science Robotics》的研究提出了一种端到端的感知运动策略(Sensorimotor Policy),直接将机载视觉和本体感知信号映射为底层控制指令,绕过了显式状态估计和轨迹生成环节。策略的训练采用强化学习结合端到端策略蒸馏,并借助基于模型的规划器生成的轨迹来初始化探索,缓解了无模型RL在受限解空间中的探索难题。
实验结果表明,该策略能够让四旋翼在仅凭机载感知的情况下,以高重复性穿越间隙仅5厘米、倾斜角最高90度的矩形窄缝,且无需提前知道缝隙的位置或方向。在未经专门训练的情况下,策略还能响应式地跟踪移动缝隙完成穿越。
延展解读:Science 子刊|浙大高飞团队:“盲穿”5cm窄缝,90度侧飞,刷新无人机窄缝穿越纪录!

论文标题:High-Speed Vision-Based Flight in Clutter with Safety-Shielded Reinforcement Learning(IEEE RAL 2026)
论文介绍:在杂乱环境中实现高速自主飞行,面临两个相互矛盾的目标:一方面需要足够快的反应速度来应对突发障碍,另一方面需要形式化的安全保障来避免碰撞。传统模块化流程(感知→规划→控制)的累积延迟在高速场景下会成为瓶颈,而纯强化学习方法又缺乏理论上的安全保证。
这项发表于IEEE RA-L的工作提出了一种混合框架:在训练阶段,引入物理先验设计奖励函数,为策略提供全局导航引导;在部署阶段,集成一个基于高阶控制障碍函数(HOCBF)的实时安全过滤器,将策略输出投影到可证明安全的集合中,从而在不牺牲机动性的前提下强制执行碰撞避免约束。
在仿真基准测试中,该方法优于传统规划器和基于可微物理的端到端避障方法。真机实验验证了在密集杂乱环境和户外森林中以最高7.5 m/s速度稳健飞行的能力,并展现出较强的泛化性。
延展解读:高飞团队新作!基于高阶CBF的端到端无人机,实现7.5m/s丛林穿越,突破RL安全瓶颈

论文介绍:无人机视觉-语言导航模型训练长期受限于真实数据采集成本高、仿真数据视觉保真度不足且轨迹不可执行的困境。
高飞团队提出的FlyMirage是一套全自动的无人机飞行数据生成流水线,将大语言模型、3D高斯溅射技术与动力学可行规划器深度结合,实现了从场景生成到轨迹采集的端到端自动化。
系统通过LLM生成多样化场景描述与参考图像,再由Marble 1.1 Plus输出高保真3DGS场景,配合迭代式自动标注与EGO-Planner动力学可行轨迹生成,最终构建了包含500个场景和5万条轨迹的大规模数据集,覆盖六大场景类别,每个场景生成成本仅约2美元。该方法有效解决了传统仿真数据视觉保真度不足、图搜索轨迹不可执行的行业痛点。
延展解读:仅2美元?浙大高飞团队用生成式世界模型造出500场景无人机训练数据集

论文标题:Rotor-Failure-Aware Quadrotors Flight in Unknown Environments
论文介绍:四旋翼在未知环境中飞行时,转子故障难以完全避免。
NASA机智号火星直升机的任务终结就是典型案例。高飞团队提出的转子故障感知自主导航系统,是首个在未知复杂环境中实现故障无人机自主飞行的方案。
系统通过复合FDD-NMPC控制器在20ms内完成故障检测与诊断,检测到故障后以200Hz频率实时优化控制策略,同时设计了抗自旋机械结构与Fast-LIO2激光雷达感知方案。在杂乱房间和未知森林中的实验验证了系统的有效性。
延展解读:浙大高飞团队:多旋翼无人机动力失效,仍可在未知环境中自主避障导航!

论文标题:Hand-like autonomous flying robot for airborne grasping and interaction(Nature Communications)
论文介绍:现有空中操作机器人长期面临两难困境:加装机械臂虽能抓取,却因体积庞大、重量超标而丧失灵活性;简化末端执行器虽轻巧,却难以应对多变物体。受人类手掌的生物结构与致动特征启发,高飞团队推出了全球首款手形飞行操作机器人HI-ARM(Hand-like compact Aerial Robot for Manipulation)。
系统摒弃传统“飞行平台+外挂机械臂”架构,将抓取功能深度融入飞行本体:C形开放式抓取轮廓模拟手掌包裹感,5自由度手指融合伸缩与扭转机制,配合单电机肌腱驱动,整机仅重556克。团队构建了毫秒级飞行轨迹规划与微秒级形变控制的解耦框架,使机器人能在飞行中实时变形抓取。实验证明HI-ARM能够完成多模态抓取、树干栖息(电机停转节能99%)、推门通行等任务,并在野外验证了穿越22厘米岩缝、跨河运输等能力。
这项成果标志着空中机器人从“会飞的眼睛”进化为“会飞的手”,为灾难救援、家庭服务、野外作业等场景开辟了全新可能。
延展解读:Nature子刊|浙大高飞团队连发两篇重磅!15Hz端侧大模型导航 + 空中灵巧手

论文标题:USS-Nav: Unified Spatio-Semantic Scene Graph for Lightweight UAV Zero-Shot Object Navigation
论文介绍:无人机在未知环境中执行零样本目标导航任务时,面临一个根本矛盾:高层语义推理需要强大的计算能力,而机载算力极其有限。过去的工作要么依赖地面站传输语义地图,要么只能做无目标的探索式飞行。
高飞团队提出的USS-Nav是一个轻量级框架,通过在飞行过程中增量构建统一的时空语义场景图,将高层语义信息与底层空间几何结构融合,使无人机能够理解“目标可能在哪里”和“怎么飞过去”。在此基础上,系统调用轻量化大语言模型进行语义推理,实现未知环境下的零样本目标导航。整个框架在机载端侧实时运行,无需依赖外部算力。
延展解读:Nature子刊|浙大高飞团队连发两篇重磅!15Hz端侧大模型导航 + 空中灵巧手

论文标题:A Precise Real-Time Force-Aware Grasping System for Robust Aerial Manipulation
论文介绍:空中操作要求机器人在飞行状态下完成精细的物体抓取和物理交互。然而,现有方法要么依赖昂贵且笨重的力矩传感器,要么完全忽略力反馈,导致对易碎物体的操作存在较大风险。
这项工作提出了一种集成六个低成本磁性软触觉传感器的力感知抓取框架。传感器基于磁场变化原理实现三维力测量,成本约10美元,重量仅8克,无需机器学习训练即可使用。针对飞行时地磁场对传感器信号的干扰问题,研究团队引入了一个参考霍尔传感器专门监测地磁场变化,从而将接触力信号从环境噪声中解耦出来。
系统在气球抓取、动态负载变化测试和消融实验中进行了验证,实现了完全机载运行,无需外部动作捕捉系统。这一特性显著提升了空中操作的实用性。

论文标题:NavDreamer: Video Models as Zero-Shot 3D Navigators
论文介绍:在具身导航领域,现有方法通常面临两个现实困境:一是标注导航数据的成本极高,场景和任务的多样性难以覆盖;二是基于静态图像的表征方式无法有效建模时序动态和物理规律,导致在新场景下泛化能力有限。
NavDreamer 的出发点是:视频天然包含时空信息和物理动力学,而互联网上存在海量的视频数据。如果能将视频生成模型作为语言指令与导航轨迹之间的接口,就有可能在不收集专门导航数据的情况下实现零样本泛化。
具体来说,系统接收自然语言指令后,调用视频生成模型生成一段"未来导航视频",再通过基于采样的优化方法,利用视觉语言模型(VLM)对候选轨迹视频进行打分和筛选,最后通过逆动力学模型将视频计划解码为可执行的路径点。
研究团队在一个涵盖物体导航、精确导航、空间定位、语言控制和场景推理的综合基准上进行了评测,NavDreamer 在面对未见过的物体和环境时展现出了较强的泛化能力。

论文标题:Agile Fall Recovery for Quadrotors with Bidirectional Thrust via Reinforcement Learning
论文介绍:无人机在真实环境中运行时,碰撞或系统故障导致的跌落是难以完全避免的。跌落后,无人机可能以任意姿态停留在地面,此时需要在有限的自由空间内、仅凭机载传感器完成自主恢复,这是一个具有严重局部可观测性和传感器间歇性失效的控制问题。
这项工作提出了一种基于强化学习的自主跌落恢复框架,专为配备双向推力的四旋翼设计。研究人员在非对称的Actor-Critic架构中训练了一个循环策略网络(Recurrent Policy),以应对传感器信息不完整的情况,并采用增量非线性动态逆(INDI)控制器来跟踪策略输出。训练过程中,对电机响应和光流进行了高保真建模,以缩小仿真与现实之间的差距。
真机实验验证了零样本迁移的可行性:在不同初始跌落姿态、阵风干扰和额外负载条件下,无人机均能稳健完成恢复。这一结果说明,在不依赖显式状态估计的前提下,循环策略网络有能力从有限的传感器数据中提取足够的信息来完成敏捷机动。

论文标题:PathPainter: Transferring the Generalization Ability of Image Generation Models to Embodied Navigation
论文介绍:鸟瞰图(BEV)能够为机器人提供全局的环境先验,但如何将人类的自然语言意图转化为BEV上的可通行区域,并在执行过程中保持定位精度,一直是个难题。
PathPainter 的思路是借用图像生成模型的语义理解能力。系统接收自然语言指令后,利用图像生成模型在BEV地图上直接生成可通行区域的掩码(Traversability Masks),明确标出目标目的地和行驶路径。在执行阶段,系统引入了跨视图定位(Cross-view Localization)技术,将机器人的实时里程计与BEV地图对齐,缓解长距离导航中的里程计漂移问题。
在无人机平台上的实地测试中,仅使用传统的局部运动规划器,无人机成功完成了一次160米的户外长距离导航任务。这一结果表明,图像生成模型对语义和空间关系的理解能力,确实可以有效迁移到具身导航任务中。
延展解读:浙大高飞团队提出PathPainter:用生成式模型重新定义了BEV导航,域外成功率94.9%!

论文标题:Primitive-based Truncated Diffusion for Efficient Trajectory Generation of Differential Drive Mobile Manipulators
论文介绍:差分驱动的移动机械臂在杂乱环境中的运动规划面临多重挑战:机械臂的高自由度、底盘的非完整约束、以及复杂障碍物分布,使得传统的轨迹规划方法在成功率和计算效率上都难以兼顾。
这项工作提出了一种学习增强的运动规划器,核心创新在于基元驱动的截断扩散模型(Primitive-based Truncated Diffusion Model)。与从纯噪声开始去噪的标准扩散模型不同,该模型从一个由运动基元构成的有偏分布出发进行采样,从而大幅缩短了去噪路径,提高了轨迹生成的效率和解的多样性。
在任务表征方面,研究团队设计了一个关键点序列提取模块,通过可微的正向运动学将边界状态映射到3D空间,并利用注意力机制融合点云和关键点信息。去噪后的路径经过轨迹优化,以满足动力学可行性和任务特定的最优性要求。
在杂乱3D仿真环境的基准测试中,该方法相比标准扩散模型和经典规划基线,在成功率、轨迹多样性和运行时间上均取得了较好的综合表现。
高飞团队2026年上半年的11篇工作呈现出一条清晰的演进脉络:空中机器人正在从“看得见、飞得稳”走向“摸得着、会操作、能自己生成训练数据”。
扫码添加阿蓝,选择想要加入的交流群即可
(按照提交顺序邀请,请尽早选择)
👇
