从卖硬件到做AI平台,大疆正在悄悄完成一次战略转身

640.webp

大疆,不只是卖硬件的公司

近两年,大疆最近动作很密集且极具前瞻性。

2025年5月发布消费旗舰Mavic 4 Pro,同年2月推出首款支持车载移动部署的自动机巢Dock 3,随后又上线了FlightHub 2的原生AI智能体Copilot,2026年还配套推出了100 TOPS算力的Manifold 3机载计算模块,并举办"机载AI行业应用创新挑战赛"。

将这些产品线串联起来,大疆的战略意图清晰可见:从单纯的硬件制造商,向构建“硬件+AI平台”的生态系统转型。

这一趋势并非大疆独有。学术界同样涌现出引人注目的研究成果:

清华大学的DynFly和WorldFly框架,旨在解决无人机在复杂城市环境中的导航难题;宾夕法尼亚大学GRASP实验室的SPINE系统,首次将端侧语言模型部署到无人机上,实现数公里级别的自然语言驱动自主探索。

工业界与学术界的方向高度契合,共同指向“无人机+AI”的未来。
那么,这场技术演进究竟进展到何种程度?无人机AI化的三大核心技术维度:视觉感知、自主导航、群体协同,各自的成熟度如何?大疆深厚的硬件制造护城河,在算法能力日益精进的AI时代,是否正面临被竞争对手追赶的挑战?
 
 
深蓝AI
 
 
1
无人机AI化的三大核心技术维度
 

一、视觉感知:从"看得见"到"看得懂"

视觉感知是无人机理解物理世界的基础,也是三个维度中商业化落地最为成熟的一个。

传统局限:过去的无人机视觉依赖预设的目标检测模型,只能识别固定类别的物体,比如人、车、船。这种"封闭词汇"的检测方式,在面对复杂多变的真实场景时局限性明显——一旦遇到训练数据里没有的目标,系统就无能为力。

大疆Matrice 4系列是目前工业界视觉感知能力的代表性产品。

其搭载的智能检测系统单张照片可识别高达1000个目标,能够在电力巡检、应急救援和公共安全场景中实现高密度的目标统计与定位。

更重要的变化发生在FlightHub 2的最新版本上:大疆引入了视觉语言模型(VLM)集成,打破了预设类别的限制,使得无人机在巡逻路线中能够识别常规类别之外的复杂场景和对象,无需为每个使用场景单独训练算法。

640 (1).webp

图1 | 大疆Matrice 4系列企业级无人机,搭载AI计算平台与多传感器系统,支持单张照片识别高达1000个目标,并在FlightHub 2中引入VLM集成,实现开放词汇的视觉感知©【深蓝 AI】编译

这一变化的实际意义在于:过去,工业客户需要向大疆或第三方算法供应商定制专属的检测模型,周期长、成本高。VLM的引入,意味着操作员可以用自然语言描述需要识别的目标,系统自动完成识别,大幅降低了AI视觉能力的使用门槛。

在学术界,视觉感知正在向更深层次的语义理解发展。研究人员探索的方向不再局限于"这是什么物体",而是延伸到"这些物体之间是什么关系"以及"这个场景意味着什么",从而在未知的、非结构化的环境中支撑更复杂的决策。视觉感知是三个维度中最接近大规模商业落地的一个,大疆已经在产品层面完成了从"能识别"到"能理解"的初步跨越。

 

二、自主导航:从"按图索骥"到"具身探索"

自主导航决定了无人机在复杂环境中的实际执行能力。

过去的无人机主要依赖GPS航点规划或简单的几何避障,一旦进入GPS拒止环境或动态障碍物密集的区域,往往无法有效应对。如今,端到端的具身智能和基础模型技术正在重塑这一领域,而这里的进展与大疆的产品方向直接相关。

大疆Dock 3 + Matrice 4D的组合,代表了大疆在自主导航商业化上的当前水位:无人机能够自动起飞、执行预设航线、自动检测目标并返航充电,实现7×24小时无人值守作业。

这是一种"规则驱动"的自主性——飞行路径是预先规划好的,无人机的"自主"更多体现在自动化执行层面,而非真正意义上的动态决策。

640 (2).webp

图2 | 大疆Dock 3自动机巢,首次支持车载移动部署,配备Matrice 4D系列无人机,实现全天候无人值守作业,是大疆当前自主导航商业化落地的代表性产品©【深蓝 AI】编译

学术界正在解决的,是更高层次的自主性问题:让无人机能够理解语言指令、感知动态环境并实时规划路径。

清华大学最新提出的DynFly框架,针对的是无人机在动态城市环境中视觉语言导航(VLN)的核心痛点。

  • 传统的VLN方法往往输出离散的动作或稀疏的航点,这导致无人机飞行轨迹不连贯,在速度突变或急转弯时容易失稳。DynFly引入了动态感知的连续轨迹生成机制,将高层导航意图转化为B样条控制点空间中的连续3D轨迹,并施加了位置、速度、加速度和航向一致性等物理约束,从而生成了更平滑、更符合飞行动力学的路径。在OpenUAV基准测试的未见场景(Test Unseen Full)上,DynFly相比最强基线提升了4.69 NDTW(归一化动态时间规整)、2.40 SDTW和2.14 SR(成功率),同时将导航误差降低了4.51米。

640 (3).webp

图3 | DynFly框架:传统VLN方法在急转弯和速度突变处产生轨迹不连续问题(左),DynFly通过连续B样条轨迹生成实现平滑的动态感知飞行路径(右)©【深蓝 AI】编译

  • 同一团队还提出了WorldFly,将世界模型引入无人机VLA任务。WorldFly采用双分支耦合流匹配机制,同时生成未来视频预测和导航动作,通过对未来场景的"预判"来指导当前决策。这在遮挡严重、视角剧变的"城市峡谷"场景中尤为关键——传统方法在这类场景中往往因为视觉信息突变而导航失败,WorldFly通过对未来状态的建模,能够更稳健地应对这种部分可观测性问题。

640.png

图4 | WorldFly框架架构:通过双分支耦合机制同时生成未来视频预测(World Model分支)和导航动作(Action Expert分支),两个分支的信息相互约束,提升了在视角剧变场景下的导航鲁棒性©【深蓝 AI】编译

宾夕法尼亚大学GRASP实验室(Vijay Kumar组)的SPINE系统则走了另一条路:用大语言模型驱动机器人在野外环境中的自主探索。

  • SPINE能够让机器人根据自然语言的宏观指令,自主进行逻辑推理、任务拆解,并结合实时构建的语义地图进行在线规划。SPINE对特定LLM不存在依赖,研究人员可以通过模型蒸馏,将小型语言模型部署到受体积、重量和功耗(SWaP)限制的机载平台上。在地面机器人(UGV)上,SPINE已完成了累计数公里的无干预自主探索任务;在无人机上,研究团队完成了初步实验,将蒸馏后的Llama 3.2 3B模型部署到Falcon 4无人机的Jetson Orin NX机载平台上,成功执行了4个城市场景任务(包括停车场巡查、公园侦察等),任务成功率达到72.7%。这是首次在机载端侧语言模型驱动下完成的无人机自主规划演示。

640 (4).webp

图5 | SPINE系统任务执行示例:上半部分展示UGV执行"调查桥梁堵塞"任务的推理-规划-执行全过程,下半部分展示UAV执行"巡查南北停车场"任务的自主规划与飞行轨迹,每步均附有LLM推理过程(Reasoning)和执行计划(Plan)©【深蓝 AI】编译

自主导航是三个维度中进展最快、也最受工业界关注的方向。

大疆的Dock 3体系已经实现了规则驱动的自主化,而DynFly、WorldFly、SPINE等学术工作展示的,是下一阶段真正意义上的语言驱动、动态感知的自主飞行能力。两者之间的距离,正在被快速缩短。

 

三、群体协同:从"机械编队"到"分布式智能"

群体协同是指多架无人机通过信息交互和任务分配,共同完成复杂目标。

传统的无人机编队依赖中心化的地面站控制,个体之间缺乏自主协商能力,一旦通信中断,整个编队就会陷入混乱。AI的加入,使得无人机集群开始具备去中心化的分布式决策能力。

目前的群体协同技术正在从集中式向分布式演进。通过多智能体强化学习(MARL),无人机集群可以在没有全局通信的情况下,通过局部感知和局部通信实现复杂的队形变换、区域覆盖和协同避障。

近年来,多智能体强化学习已经成为无人机群体协同领域的主流技术路线,相关研究成果正在逐步向工业应用转化。

然而,群体协同的广泛落地仍面临一个核心瓶颈:端侧算力。

在复杂的动态环境中,无人机需要实时处理海量的传感器数据,并在毫秒级内做出协同决策。受限于机载设备的体积、重量和功耗,当前的边缘计算芯片很难完全满足这种高强度的计算需求。

大疆推出的Manifold 3机载计算平台,提供高达100 TOPS的算力,重量仅约120克,兼容PSDK V3,可无缝接入Matrice 400和Matrice 4系列飞行平台,正是为了缓解这一瓶颈,将AI推理能力直接部署到无人机端侧。Manifold 3还支持Smart 3D Explore for Modeling功能——与Matrice 4E集成后,无人机可以在未知环境中实时构建空间地图并规划飞行路线,为群体协同提供了实时语义感知的算力底座。

640 (1).png

图6 | SPINE自主框架系统架构图:用户通过自然语言下达任务指令,LLM驱动的Plan Generation模块生成任务序列,Plan Validation模块进行在线验证,Controller分解为点导航、探索等原子行为,Semantic Mapper实时构建开放词汇语义地图并反馈给规划器,形成完整的闭环自主决策流程©【深蓝 AI】编译

在工业界,道通(Autel)的EVO Ⅲ系列通过Autel OmniLink图传系统支持Mesh自组网,可实现无人机、无人车及地面终端的深度互联,支持多机自主任务执行、信息共享、协同避障与集群起降,构建了跨空地一体化的智能协同网络。用户仅需一次操作,即可让多架无人机同时起飞或返航,系统还能自动将任务区域划分并分配给不同无人机执行。

群体协同是三个维度中距离大规模商业落地最远的一个,但也是一旦突破后潜力最大的方向。Manifold 3的推出,是大疆在这个方向上迈出的重要一步——把算力下沉到机端,是群体协同从"有线控制"走向"真正自主"的前提条件。

 
 
深蓝AI
 
 
2
竞争格局:算法能力正在重塑行业版图

大疆之所以能长期主导全球无人机市场,核心护城河在于强大的硬件制造能力、供应链整合能力以及成本控制能力。

根据多家市场研究机构的数据,大疆在全球消费级无人机市场的份额长期维持在70%至85%之间,在工业级领域的市占率也超过50%。

然而,在无人机向"飞行机器人"演进的AI时代,软件和算法的价值正在被重新评估,这给了Skydio、道通等竞争对手在特定细分市场中突围的机会。

 

Skydio:以"自主飞行"为核心差异化

美国无人机企业Skydio从诞生之初,就将"自主飞行"作为其最核心的技术卖点,而非硬件规格。其旗舰机型Skydio X10搭载了强大的机载AI计算平台和六个高分辨率导航摄像头,实现了360度无死角的视觉感知。

Skydio的Autonomy引擎能够实时构建周围环境的3D模型,并在复杂障碍物(如密集的树林、狭窄的桥底、电力线缆)中进行安全的自主穿梭,甚至能在完全无GPS和夜间无光环境下实现自主飞行。这种将"专家级飞行员的技能"固化在算法中的策略,使得Skydio在工业巡检、国防安防等对飞行门槛要求极高的专业领域,形成了独特的竞争优势。

640 (2).png

图7 | Skydio X10无人机,以其360度视觉感知和Autonomy引擎,在复杂障碍物环境和夜间无光条件下的自主飞行能力上具有显著优势,在北美工业巡检和国防安防市场占据重要地位©【深蓝 AI】编译

值得注意的是,Skydio的市场定位与大疆并非完全正面竞争。Skydio主要聚焦于北美政府、军事和大型企业客户,这些客户对数据安全有严格要求,同时愿意为更高的自主飞行能力支付溢价。在这一细分市场,Skydio的算法优势确实在一定程度上弥补了其在硬件成本和产品线丰富度上与大疆的差距。

 

道通(Autel):AI智能体架构与开放生态

作为大疆在工业无人机领域最具代表性的竞争对手之一,道通智能选择了"AI智能体(AI Agent)架构"作为其核心差异化方向。其最新的EVO Ⅲ系列无人机直接基于AI智能体架构打造,融合了多模态交互、智能规划与自主执行能力。

道通EVO Ⅲ系列支持通过AGX Station遥控器进行语音或文本指令交互,无人机能够自主完成任务规划、态势感知、目标追踪与智能取证等功能,并通过数据闭环不断学习与优化。

这种让无人机"能听懂、会决策、可执行"的交互方式,极大地降低了工业无人机的操作门槛,使得非专业飞手也能完成复杂的巡检任务。道通的另一张牌是开放生态——通过Mobile SDK/Payload SDK,道通为开发者提供了较为开放的二次开发接口,吸引了大量行业应用开发者参与其产品生态建设。

 

大疆的反击:"软硬一体"平台化战略

面对竞争对手在算法层面的步步紧逼,大疆在2025-2026年打出了一套"软硬一体"的组合拳,试图在AI时代重新定义游戏规则。

在软件平台层面,大疆在FlightHub 2中引入了原生AI智能体Copilot。操作员只需通过自然语言(语音或文字)下达指令,Copilot就能自动解析意图、读取项目航点、拆解任务步骤并指挥无人机执行。

在公共安全场景中,操作员可以说"飞到3号航点悬停进行视觉巡检";在能源巡检场景中,可以说"返回机巢并生成飞行摘要"——这些自然语言指令都能被Copilot准确理解并执行。

与此同时,FlightHub 2还引入了500兆像素超清全景图、Change Detection Pro变化检测等AI增强功能,进一步提升了数据分析的自动化程度。

640 (5).webp

图8 | 大疆FlightHub 2云平台的Copilot原生AI智能体,允许操作员通过自然语言语音或文字指令直接指挥无人机执行复杂任务,标志着大疆的人机交互方式从"菜单点击"向"自然语言对话"演进©【深蓝 AI】编译

在硬件生态层面,大疆正在全面开放其机载算力。通过举办"大疆机载AI行业应用创新挑战赛",大疆鼓励全球开发者将自定义的AI模型(如特定的缺陷检测、行为识别算法)直接部署到Matrice 4等飞行平台上,并配套提供了Manifold 3机载计算模块作为算力底座。

大疆的战略逻辑清晰:既然拥有世界上最可靠、最具性价比的飞行平台,就把这个平台开放出来,让全球的AI算法都在大疆的硬件上运行。通过构建"硬件+算力+云平台+开发者生态"的完整闭环,大疆试图将自己的护城河从"硬件制造"延伸到"AI平台"。

 
 
深蓝AI
 
 
3
无人机+AI,真的到时候了吗?

从技术成熟度来看,三个核心维度的发展并不均衡。

  • 视觉感知已经高度成熟,VLM的引入正在打破预设类别的限制,大疆已经在产品层面完成了初步落地;

  • 自主导航正处于快速突破期,DynFly、WorldFly、SPINE等学术工作展示了端到端具身智能的巨大潜力,但从实验室到大规模商业部署仍有距离;

  • 群体协同则处于突破前夜,边缘计算能力是制约其大规模落地的关键瓶颈,Manifold 3的推出是一个积极信号。

尽管大疆的硬件优势深厚,但Skydio和道通等竞争者正通过算法创新在特定场景建立差异化优势。AI时代的竞争维度已转向自主决策能力、任务理解深度和生态丰富度。大疆的平台化战略正是对这一竞争逻辑转变的积极回应。

现实制约: 监管环境(如BVLOS超视距飞行法规)和技术鲁棒性(应对长尾场景的稳定性)仍是制约AI无人机全面爆发的现实约束。

然而,大疆产品矩阵的AI化,标志着其战略已完成深刻转型。学术界的尖端研究(如DynFly、SPINE)则持续拓宽着这场技术革命的边界。

无人机+AI的时代,已经拉开序幕。

编辑|阿豹
审核阿蓝

参考资料:

[1] DJI. (2025). DJI Matrice 4 Series - The Age of Intelligent Flight.

[2] DJI Enterprise Insights. (2026 ). DJI FlightHub 2 Update: AI Copilot, Safesky Airspace Integration, and New Enhancements.

[3] Jiang, W., et al. (2026 ). DynFly: Dynamic-Aware Continuous Trajectory Generation for UAV Vision-Language Navigation in Urban Environments. arXiv:2606.31654.

[4] Wang, X., et al. (2026 ). WorldFly: A World-Model-Based Vision-Language-Action Model for UAV Navigation. arXiv:2606.06147.

[5] Ravichandran, Z., Cladera, F., et al. (2025 ). Deploying Foundation Model-Enabled Air and Ground Robots in the Field: Challenges and Opportunities. GRASP Laboratory, University of Pennsylvania. arXiv:2505.09477.

[6] DJI Enterprise. (2026 ). Manifold 3 - Ignite the Future of Computing.

[7] DJI. (2025 ). DJI Dock 3 Delivers "Drone in a Box" Enterprise Solution For 24/7 Autonomous Operations.

[8] Autel Robotics. (2026 ). Autel EVO Ⅲ 系列.

[9] Connected Commercial Drones Report 2025. (2025 ). Asia-Pacific Leads in Drone Adoption with DJI Holding a Dominant 70% Global Market Share. GlobeNewswire.

【深蓝学院】技术交流群

 

💪致力于帮助各位朋友「打破隐形的墙」,共建一个更自由、更有深度、更有价值的交流生态社区!在各大企业工作的,可以相互内推,互通有无;在学校读研读博的,可以交流想法,携手合作。

扫码添加阿蓝,选择想要加入的交流群即可

(按照提交顺序邀请,请尽早选择)

👇

image.png