浙大高飞团队两篇新作:死胡同规避与追逃自博弈,两种无人机技术演进方向

640.webp

拓展无人机自主飞行的能力边界

浙江大学高飞团队近期发布两篇工作:

  • DPNet面向静态复杂环境,通过轻量网络预判视场外的死胡同结构,生成虚拟障碍屏障,让规划器主动绕开陷阱,机载50Hz高频重规划;

  • AgilePE面向动态对抗场景,基于优先虚拟自博弈PFSP完成端到端追逃强化学习,直接输出底层总推力+机体角速度指令,仿真训练完零样本迁移真实无人机,涌现出侧翼包抄、侧向震荡躲闪等博弈战术。

两篇工作分别覆盖「环境驱动的安全导航」和「对手驱动的对抗博弈」,均不依赖实机标注微调,把感知预测、规划、仿真‑实机迁移完整打通,代表小型自主无人机两套不同的技术演进路线。

 

 

深蓝AI

 

 

1
DPNet:预判看不见的死胡同,实现主动规避而非事后补救
 

行业固有路线的短板

传统应对死胡同的方案分为两类,但都属于事后反应式处理

  • 一类是被困之后执行后退、旋转等恢复机动,飞行轨迹被打断,任务连续性被破坏;

  • 另一类维护高精度全局拓扑地图寻找备选路径,但建图计算开销巨大,还会累积位姿漂移,不适合算力有限的微型无人机。

640 (1).webp

图| DPNet解决的问题:有限局部感知下的死胡同失效问题©【深蓝 AI】编译

也有部分工作学习预测未知区域占据、前沿边界,但大多目标是稠密重建探索,计算开销高,不会专门针对死胡同这种凹形危险结构做定向处理。

死胡同不需要完整重建整个未知空间,只需要拿到三件极简信息:死胡同是否存在、相对距离、方位角,就足够约束规划器。

DPNet 沿着"任务导向最小预测"这个思路,不做全场景重建,只聚焦死胡同 hazard 预测。论文在贡献声明中明确写道:"据我们所知,这是首个针对视觉无人机导航显式处理主动死胡同规避的工作。"

整套系统由三部分构成:双分支死胡同预测网络、虚拟障碍屏障生成、死胡同感知的轨迹库碰撞检测。

1)双分支轻量预测网络

RGB分支、深度分支两套编码器,分别提取语义特征和几何结构特征,特征拼接融合之后分两个输出头:掩码头输出二值掩码标记死胡同像素区域,深度头回归对应区域距离;逐像素相乘之后只保留死胡同区域的有效深度。

网络训练完全依靠仿真自动标注数据集,不需要人工打标签。算法依据内角点、外角点的可见几何规则自动生成真值掩码,区分“可推断”和“歧义不可推断”样本,规避标签噪声。RGB编码器复用DINOv3预训练权重并冻结权重,只微调深度分支,这一非对称微调策略是实现sim‑zero‑shot的关键,防止网络过拟合仿真纹理。

640 (2).webp

图| DPNet系统整体框架总览©【深蓝 AI】编译

2)虚拟障碍屏障生成

网络输出的死胡同像素投影到三维空间,取最小预测深度构建平行于图像平面的平面虚拟障碍,再通过MLS点云上采样,生成致密点云,和原始深度点云融合成统一的局部障碍物点云。这个虚拟屏障并不是真实物理物体,是给规划器的“警示墙”,阻止轨迹驶入死胡同入口。

3)死胡同感知的轨迹筛选与重进入抑制

DPNet基于预计算运动基元轨迹库做碰撞检测,融合虚拟障碍后的点云做碰撞校验,把所有会撞上虚拟屏障的轨迹直接剪枝。

这里存在一个特殊工程问题:无人机飞过去之后死胡同离开视场,虚拟屏障消失,贪心规划器会又选一条折返冲回死胡同的轨迹。论文新增平滑一致性代价项,惩罚航向角突变,抑制“二次闯入”陷阱。

640 (3).webp

图| 普通碰撞检测与死胡同感知碰撞检测对比©【深蓝 AI】编译

仿真设置简单分为简单、困难两个等级,对比EGO‑Planner、Primitive‑Planner、Faster三套主流本地规划器。

  • 简单场景DPNet成功率100%;困难场景依然保持99%成功率;对比基线Faster,平均飞行时间缩短25%左右。基线方案要么撞毁,要么触发后退恢复机动,飞行距离和耗时显著增加。

  • 机载Jetson Orin NX完整流水线稳定50Hz运行,网络推理仅9.2ms,点云后处理2.4ms,轨迹规划5.1ms,完全满足微型无人机高速导航实时约束。

640 (4).webp

图| 有限局部感知条件下的算法基准对比©【深蓝 AI】编译

真实室内实验表明:DPNet可以区分真正死胡同,和中间存在可通行缺口的“形似死胡同”,不会错误设置虚拟屏障,允许无人机正常穿过开口通道。

640 (5).webp

图| 真实世界导航实验©【深蓝 AI】编译

 

 

深蓝AI

 

 

2
AgilePE:自博弈强化学习,端到端无人机追逃对抗

如果说DPNet要对抗的是静态环境陷阱,AgilePE要面对的是会主动博弈的智能对手

追逃对抗是零和博弈:追踪方需要把目标保持在机载视锥内并且缩短距离;逃逸方要飞出对方视场,拉大战术距离。

传统方案的痛点:

  1. 微分博弈HJI方程,高自由度四旋翼动力学下面临维度爆炸,很难用于真实敏捷机动;

  2. MPC模型预测控制极度依赖对手运动的精准预测,对手战术变化则性能暴跌;

  3. 现有强化学习追逃大多输出航路点、速度这类中间指令,受中间规划层限制,无法释放无人机全部机动能力;朴素自博弈训练存在严重策略震荡、灾难性遗忘,对抗策略不断循环,无法沉淀稳健战术;

  4. 仿真到真机鸿沟:推力延迟、机体速率滞后、传感器噪声,仿真训练策略经常真机直接失控。

AgilePE完整框架分为三块:端到端敏捷控制子系统、双边对抗训练子系统、硬件对齐仿真部署子系统。

640 (6).webp

图| AgilePE整体框架,包含三大子系统©【深蓝 AI】编译

1)端到端CTBR底层指令输出

策略网络直接把观测映射到底层控制指令:总推力+三轴机体角速度(CTBR),抛弃航路点、中间轨迹规划模块,神经网络可以直接调用飞行器完整机动包络。奖励函数综合追踪博弈目标、超速惩罚、边界惩罚、防撞惩罚、指令平滑项。平滑奖励是真机零样本部署的关键,抑制高频抖动指令。

640 (7).webp

 图| 1v1无人机追逃博弈任务定义©【深蓝 AI】编译

2)层级化对抗自博弈训练(Naive‑SP → FSP → PFSP)

论文对比了三级自博弈训练范式:

  • 朴素自博弈Naive‑SP:最新追踪者和最新逃逸者互相对抗。缺点:非平稳环境,训练后期容易出现策略单边崩塌,逃逸方学不出有效防御战术。

  • FSP虚拟自博弈:维护历史对手策略池,训练的时候均匀采样历史对手,缓解震荡,但采样没有区分对手难度。

  • PFSP优先虚拟自博弈(本文核心创新):采样概率和历史对抗失败率挂钩,训练优先选择最难对付的历史对手,相当于自动课程学习,加速高级战术涌现,同时保留历史策略池防止灾难性遗忘。

640 (8).webp

图| FSP与PFSP的交叉评估收益矩阵©【深蓝 AI】编译

交叉评估收益:PFSP训练出来的追踪者,对全部历史版本逃逸者保持82%以上视场内捕获率;会自发涌现dash‑and‑flank侧翼包抄、距离管控、侧向震荡躲闪这类人类可理解的博弈战术。

权衡:优先采样困难对手会带来战术特化,面对简单脚本对手性能会轻微下降,但对演化对抗对手鲁棒性大幅提升。

3)硬件对齐仿真‑实机迁移管线

不使用普通物理引擎接触求解器,采用RK4四阶积分直接积分机体位姿;显式建模推力45ms延迟、机体角速度30ms延迟,叠加推力、机体速率乘性噪声;大量域随机化质量、气动、延迟参数,让策略在训练阶段就适应硬件带来的非理想特性,做到零样本迁移,真机不需要微调。

真实飞行动捕环境下,部署在Jetson Orin NX,策略推理运行60Hz,复现仿真里的包抄、侧向躲闪战术。

640 (9).webp

图| 真实追逃实验长曝光光轨图,红蓝分别代表追踪机、逃逸机轨迹©【深蓝 AI】编译

 

 

深蓝AI

 

 

3
两套系统定位、边界与行业位置

在整个微型无人机自主智能的技术谱系上:

DPNet属于感知‑预测‑规划路线的延伸,不去做完整稠密重建,坚持“任务导向最小预测”,给传统本地规划增加预判能力,兼容现有运动基元规划栈,工程落地门槛相对低。它解决的是传统局部规划“近视”问题:规划器只能看到眼前几米,DPNet帮它“多看一眼拐角后面的危险”,但是只针对凹形死胡同这一类特定危险结构。

AgilePE属于端到端强化学习对抗智能路线,绕开传统规划、微分博弈,让战术机动从对抗交互中涌现;代价是当前依赖完整状态观测,如果要完全脱离动捕,后续需要接入视觉感知模块。

640 (10).webp

两篇工作共同的亮点:训练全部可以在仿真完成,真机不需要重新采集数据和微调,这对于小型无人机非常关键——真机高速机动实验炸机风险高,硬件损耗成本昂贵。

 

 

深蓝AI

 

 

4
写在最后

DPNet和AgilePE代表小型自主无人机两个重要的技术方向:

  • 一个面向环境带来的危险,用轻量感知预测弥补传感器视场的局限性,改良传统规划系统,追求安全可靠的A‑B点导航;

  • 另一个面向对手带来的博弈,用对抗强化学习挖掘飞行器机动极限,让无人机学会复杂战术对抗。

两者都贯彻了“仿真大规模生成数据,真机零样本部署”的思路,降低高风险真机试飞的依赖。

但也留下共同的待解命题:把两套能力融合——在充满障碍物的真实物理世界,无人机既要预判环境死胡同,又要和动态对手开展博弈,这也是未来空中具身智能值得探索的方向。

 

编辑|小小怪博士

审核|阿蓝

参考文献

1、DPNet: Efficient Dead‑End Prediction and Avoidance for Vision‑Based UAV Navigation (arXiv:2608.16640)

2、AgilePE: Autonomous UAV Pursuit‑Evasion via Self‑Play Reinforcement Learning (arXiv:2608.14135)

【深蓝学院】技术交流群

 

💪致力于帮助各位朋友「打破隐形的墙」,共建一个更自由、更有深度、更有价值的交流生态社区!在各大企业工作的,可以相互内推,互通有无;在学校读研读博的,可以交流想法,携手合作。

扫码添加阿蓝,选择想要加入的交流群即可

(按照提交顺序邀请,请尽早选择)

👇

image.png