不用真机微调直接部署!MIT实现6架无人机协同吊运与双机群动态避障

640.png

补齐多无人机协同运输最后一环

多无人机缆载协同运输是低空物流、灾后救援、工地建材转运的核心技术路线,但现有方案长期卡在规模、安全、虚实迁移三重瓶颈。

传统集中式控制依赖全局通信,超过3架无人机就极易算力过载;去中心化强化学习方案大多缺少硬性安全约束,真机碰撞风险高;绝大多数算法仅能在仿真内运行,真机部署必须重新微调模型,无法适配动态障碍物场景。

MIT可靠自主系统实验室(REALM)给出完整落地解法:基于离散图控制屏障函数近端策略优化(DGPPO)搭建分布式安全强化学习框架,仅用轻量化二维动力学抽象完成仿真训练,无需任何真机微调,就能直接部署3-6架Crazyflie微型无人机

更关键的是,两套独立吊运无人机群可互相识别并主动避让,首次完成多机群动态障碍物真机验证。整套方案不依赖全局状态,单模型兼容不同编队规模,补齐集群吊运从仿真走向真实复杂环境的最后一环。

该工作收录于RAL 2026。

640.webp

 

 

深蓝AI

 

 

1
四大核心设计

640 (1).png

图 | 分布式安全多无人机运输完整框架©【深蓝 AI】编译

 

1. 轻量化2D动力学抽象,大幅降低训练算力开销

完整三维缆绳-无人机-载荷耦合模型包含悬摆、绳松弛、气动干扰海量非线性项,仿真训练速度极慢,很难做大尺度集群泛化。论文设计任务保留型二维抽象模型,仅保留对协同、安全至关重要的平面耦合动力学,忽略高度方向小幅扰动。

核心简化逻辑:假设无人机高度由底层PID稳控,缆绳张力等效为虚拟弹簧,载荷仅考虑平面平移与偏航旋转,省略滚俯仰扰动。对应载荷动力学公式简化为:

公式解读:分别是载荷质量、转动惯量,为单架无人机缆绳平面拉力,仅保留平面合力、合力矩,彻底砍掉三维复杂耦合项。虚拟弹簧张力简化计算,无需迭代求解绳松弛状态,JAX向量化仿真可并行128个环境,单工作站12小时完成百万级训练步。

这种抽象不会丢失避障、协同核心信息,又把训练算力需求压缩一个量级,是实现多规模集群泛化的基础。

 

2. DGPPO安全分布式强化学习算法

普通PPO仅优化任务收益,本文提出离散图控制屏障函数(DGCBF) 嵌入PPO,实现“决策优化+硬性安全约束”一体化,也是全文核心创新。

(1)分布式局部观测机制

每架无人机仅依靠自身LiDAR雷达、邻近无人机局部信息、载荷相对位姿做观测,不接收全局集群数据,观测公式:

代表雷达半径内邻近无人机,是激光雷达障碍物观测,全程点对点局部通信,不存在中央单点故障。网络共享权重,3/4/5/6架无人机共用一套策略,无需分模型训练。

(2)DGCBF安全硬约束

传统CBF需要全局状态,DGCBF直接在局部观测空间构建安全判据,每条约束代表无碰撞、不越界。训练时同步学习策略网络与约束价值网络,一旦动作会触发安全违规,直接过滤修正,而非仅靠奖励扣分。

640 (1).webp

图 | 各算法奖励-安全率仿真对比图©【深蓝 AI】编译

简单理解:普通RL是“撞了扣分”,DGPPO是“提前预判危险,直接禁止危险动作”,安全具备数学理论保证,而非概率性规避。

从仿真对比图能直观看到,InforMARL、拉格朗日MAPPO等基线,无人机数量提升后安全率大幅跳水;DGPPO在3-8架全区间维持高安全率,同时任务平均奖励保持领先,安全与运输效率实现平衡。

(3)全域域随机化训练策略

训练时随机调整三类参数:

  1. 编队规模:随机选取3、4、5架无人机训练;

  2. 虚拟弹簧刚度:0.05~0.30 N/m均匀采样,模拟不同缆绳、载荷耦合特性;

  3. 观测噪声:位姿±5%、速度±30%随机扰动,模拟真机传感误差。

域随机的核心作用是抹平仿真与真机动力学间隙,为零样本迁移提供数据基础。

 

3. 离散-连续时间安全桥接(解决仿真到真机鸿沟)

一个关键工程难题:训练是10Hz离散决策,真机底层PID控制器是高频连续控制,仿真安全保证不能直接套用实机,跟踪误差会破坏安全边界。

640 (2).png

图 | 3-6架无人机真机轨迹图©【深蓝 AI】编译

论文提出约束收紧理论,核心逻辑:

  1. 真机定位存在有界跟踪误差

  2. 原始安全约束叠加误差补偿项,生成收紧约束

  3. 仿真训练时满足收紧约束,真机连续运行时天然满足原始安全条件。

这套理论搭建了仿真理论安全到真机连续控制的数学桥梁,不需要修改底层控制器,直接复用Crazyflie原生PID,大幅降低真机适配工作量,也是该工作能做到零样本部署的关键理论支撑。

整体分层架构分为两层:

  • 离散决策层(10Hz DGPPO策略):输出安全可行期望加速度;

  • 连续执行层:双积分器生成目标航点,机载级联PID高频跟踪,跟踪误差被理论纳入安全余量。

 

4. 真机多场景硬件验证方案

硬件平台统一采用Crazyflie 2.1微型四旋翼,缆长0.5m,载荷约27g,分三类真机实验完整验证泛化能力:

(1)单编队规模泛化实验

训练仅用3-5架无人机,真机直接测试6架未见过的编队构型。

分为简易障碍、强遮挡复杂场景两类:简易场景障碍物不遮挡直达路线,复杂场景障碍物横亘起点终点,需要大范围绕行。6机复杂场景仅出现1次末端定位偏差(0.5m),无任何机间、机物碰撞,仅任务收敛存在小幅瑕疵,不存在安全失效问题。

(2)多机群动态避障实验(行业首次真机验证)

两组独立吊运编队(5架+3架)同步执行运输任务,对方无人机直接被LiDAR识别为动态移动障碍物。

640 (2).webp

图 | 双机群动态避障时序快照©【深蓝 AI】编译

从时序快照可见两编队交汇时主动调整轨迹避让,全程无近距离接触,两组载荷均顺利抵达目标位姿,证明策略无需动态目标专属训练,仅依靠原生激光观测即可处理动态移动障碍,适配园区多机组并行作业场景。

(3)传感/通信鲁棒测试

仿真中模拟2%、5%通信丢包,0.03/0.045米雷达噪声:基准安全率76.2%,5%高丢包+强噪声下仍维持52.6%安全率,相比同类去中心化算法抗干扰能力更强,适配室内弱通信环境。

 

 

深蓝AI

 

 

2
实验数据
  1. 安全率指标:代表全程无违规样本占比,是该工作核心优势。同类无CBF强化学习8机场景安全率不足30%,DGPPO稳定80%以上。但该指标仅针对静态/低速动态障碍,高速移动物体未测试,不能代表全动态环境安全性能。

  2. 跨编队泛化效果:训练3-5架,真机6架稳定运行,证明域随机+共享权重策略有效,但6机复杂场景末端收敛变差,说明模型对超大编队末端精细化调整能力仍有欠缺。

  3. 零样本迁移表现:仿真策略直接上真机,跟踪误差均值小于5.8cm,省去真机迭代调参成本。但该迁移效果依赖室内低扰动环境,室外气流干扰下虚实间隙会扩大,无法直接户外部署。

  4. 多机群避障定性结果仅做室内低速实验,未测试高速交叉、密集机群交汇,动态场景鲁棒性还有提升空间。

 

 

深蓝AI

 

 

3
总结

该工作解决了多无人机缆载协同领域分布式安全强化学习、仿真轻量化建模、零样本虚实迁移、动态集群避障四大工程痛点,首次把带安全理论保证的分布式RL完整落地到6架真机与双机群动态场景。

DGPPO把控制屏障函数嵌入多智能体优化,搭配极简二维动力学抽象搭建高效训练管线,离散-连续安全理论填补仿真与真机的理论断层,为室内小规模集群吊运提供一套开箱即用的完整方案。

同时方案边界清晰,仅适用于近平面、对称载荷、室内低扰动环境,后续可拓展三维动力学建模、视觉融合感知、室外大风鲁棒性优化,进一步拓宽落地场景。

编辑|小小怪博士

审核|阿蓝

Ref

论文标题:Safe and Scalable Multi-Drone Payload Transport via CBF-based Reinforcement Learning with Zero-Shot Sim-to-Real Transfer

论文链接:https://arxiv.org/pdf/2607.20665

【深蓝学院】技术交流群

 

💪致力于帮助各位朋友「打破隐形的墙」,共建一个更自由、更有深度、更有价值的交流生态社区!在各大企业工作的,可以相互内推,互通有无;在学校读研读博的,可以交流想法,携手合作。

扫码添加阿蓝,选择想要加入的交流群即可

(按照提交顺序邀请,请尽早选择)

👇

image.png