✨导读: 无人机正在从专用任务控制迈向通用具身智能!本篇综述提出5+5分析框架,区分能力集合与实体系统,完整梳理形态、感知、世界模型、规划导航协同,指明四大核心挑战,提出物理‑数字AI智能体系统实现新思路。
  • 作者:Yonglin Tian , Weiyi Wang , Houhua Lu , Xinyi Li , Yihao Wu , Jingyang Chen , Jianli Sun , Chengxiang Li , Yinuo Chen , Fei Lin , Tengchao Zhang , Jing Yang , Deyi Ji , Jian Di , Naiqi Wu , Yisheng Lv

  • 单位: 中国科学院自动化研究所, 北京航空航天大学, 山西大同大学, 约翰斯·霍普金斯大学, 三亚学院, 温州肯恩大学, 澳门科技大学, 中国人民公安大学, 魔芯科技KOKONI 3D, 中国科学技术大学

  • 论文标题:UAVs Meet Embodied Intelligence: Bridging Human Intents and Flying Dynamics Via Harnessing Physical‑Digital AI Agents

  • 论文链接:https://arxiv.org/abs/2609.18326v1

  • 项目主页:https://hub-tian.github.io/UAVs_Meet_Embodied-Intelligence/

  • github链接:https://github.com/Hub-Tian/UAVs_Meet_Embodied-Intelligence

研究背景
打开网易新闻 查看精彩图片

无人机将机器人智能从二维地面拓展到连续的三维空间。无人机可以灵活改变位置、高度、姿态、观测视角,抵达很多地面机器人无法到达的位置。无人机自身的运动不只是改变飞行位置,还会直接改变传感器看到的画面,这也让无人机成为一类非常典型的具身智能载体。

过去传统无人机自主方案,大多为特定任务定制开发❗。研究重心集中在飞行稳控、轨迹跟踪、定点导航。系统高度依赖预定义目标、闭集观测、固定任务接口。 在这类体系下:无人机本体、环境变化、任务需求,都被当成预先给定的外部条件,而不是智能行为里互相耦合的一部分。

因此传统系统很难做到:理解开放式的人类自然语言指令、主动采集任务所需要的信息、任务发生变化时灵活调整整套行为策略。

随着基础大模型、世界模型、AI智能体快速发展,带来新的可能性✨。自然语言可以承载高层语义目标和隐含约束;多模态基础模型提升跨场景理解迁移能力;记忆、推理、世界模型、智能体规划,支持长时序任务拆解、主动获取信息、预判动作后果、自适应决策。

重点:这些技术的价值,不只是单独优化某一个算法模块,而是把人类意图、无人机本体状态、环境理解、任务推理、物理飞行行为形成完整闭环耦合。

本文引出核心概念无人机具身智能(UAV‑EI):智能需要持续锚定无人机的具身属性——无人机能看到什么、可以如何运动交互、物理世界会如何响应它的动作。 对应的物理‑数字AI智能体(PD‑AI Agents)就是这套范式的载体:

  • 数字智能体:负责语义理解、记忆、世界建模、任务组织推理

  • 物理智能体:负责感知采集、飞行控制、真实物理交互 物理端执行产生的真实结果持续反馈给数字端,再接入人类指令,共同构成人‑机‑环境的信息‑物理‑社会系统(CPSS)。

目前该领域研究分散在各个子方向,缺少一套统一的分析框架,这就是本篇综述的写作动机。

主要贡献

  1. 提出5+5分析框架,清晰区分「无人机具身智能UAV‑EI(需要具备的能力集合)」与「具身智能无人机EI‑UAV(软硬件实体系统)」,一套讲能力,一套讲系统落地架构。

  2. 依托5+5框架,系统性梳理完整技术栈:具身形态、具身感知、世界模型、具身规划、具身导航与空中操作、多机具身协同;着重强调感知‑推理‑动作闭环耦合的重要性。

  3. 提出物理‑数字AI智能体(PD‑AI Agents),作为实现无人机具身智能的系统级实现思路。

  4. ⚠️归纳四大根本性开放挑战:长时序空中自主、飞行锚定物理推理、动态飞行条件自适应、经验驱动的能力演进,指明未来研究方向。

无人机具身智能与具身智能无人机
打开网易新闻 查看精彩图片
  • UAV‑EI:定义“系统应该具备哪些能力”,属于能力集合;

  • EI‑UAV:定义“系统如何实现这些能力”,属于实体软硬件架构。

✨UAV‑EI|5大能力维度(能力集合)

五大能力需要联合生效,不是互相独立的模块。

  1. 人类意图理解️:解析自然语言指令、语义目标、偏好与约束,转化为可执行的任务表达。用户只需要描述“要做什么”,不需要一步步规定机器人怎么执行。

  2. 具身自我认知:决策必须贴合无人机真实物理状态与硬件极限。包含机体形态、位姿、运动状态、传感器配置、载荷、电量、执行器上限,搞清楚自己“能做什么、不能做什么”。

  3. 通用环境理解:跳出任务专用识别,追求可迁移的语义、空间、几何、动态事件理解。属于主动感知:无人机可以主动调整位置、视角、传感器配置,主动搜集任务需要的信息。

  4. 复杂任务规划:把高层大目标,拆解为物理上可执行的感知+动作序列。同时综合任务需求、环境状态、本体约束、动作带来的后果、现有资源;任务发生变化时,中间目标、策略也可以动态调整。

  5. 闭环执行:将高层决策锚定在真实物理观测与执行反馈。利用环境反馈更新内部状态,迭代后续动作。打通感知、推理、规划、具身执行,而不是仅仅局限底层飞控小回路。

✨EI‑UAV|5层系统架构(实体实现)
⚠️五层架构不是串行流水线,是高度互相耦合!
  1. 具身层️:物理硬件底座。无人机机体、传感器、控制器、执行器、机载计算单元、载荷、操作臂。机体形态、传感几何、飞行动力学、能量、执行机构决定整套系统物理边界与约束。

  2. 大脑层:通用语义、预测、审慎推理。核心组件:多模态大模型MLLM、世界模型。负责语义接地、任务推理、状态表征、预测未来行为后果,为具身感知、规划提供认知支撑。

  3. 小脑层:把高层抽象决策,翻译为无人机专属具身技能,以导航、物理交互操作为主。在几何、动力学、控制、时间约束下,完成空中移动与物理接触交互。

  4. 交互层:实现与人、其他无人机、地面机器人等异构智能体协同。互相交换观测、任务意图、任务状态、规划、动作,把单机能力拓展到分布式协同作业。

  5. 调度层⚙️(Harness Layer):运行时核心基础设施。负责协调模型、记忆、知识、工具、技能、上下文与物理资源。包含智能体运行编排、上下文维护、执行监控、安全护栏;处理反馈与故障恢复,把分散模块整合为一套完整可运行系统。

无人机具身形态
打开网易新闻 查看精彩图片

具身形态直接决定无人机如何感知、移动、和现实世界交互。论文把形态体系划分为四大模块:机体本体、空中机械臂(手臂)、末端执行器(手部)、本体‑臂‑手协同设计。形态不只是硬件选型,硬件本身就会约束感知边界、可交互行为,进一步向上影响算法设计。

1|空中机体本体

  • 基础机体:多旋翼、固定翼、垂直起降VTOL、扑翼飞行器,在悬停能力、续航、机动性、载荷之间做取舍。

  • 可重构机体:可以动态改变几何、驱动结构。典型如Dodecacopter、ATMO、MorphQuad;可以适配多种任务,但会改变质量分布,动力学特性随之变化。

  • 多模态移动机体:不止会飞,还可以地面爬行、滚动。例如M4、FlyOrb、RAVEN。

  • 仿生机体:借鉴自然界飞行动物设计。亚克级微型扑翼、鸟型变形尾翼、槭树种子被动自转无人机。

  • 软体机体:碰撞时结构发生形变,提升狭窄环境生存能力,但动力学更加复杂,控制难度提升。

2|空中机械臂(手臂)

空中机械臂一动,就会改变无人机质心、转动惯量,直接扰动飞行稳定性。

主要分为串联机械臂、耦合连杆臂、连续体柔性臂;代表作品Flying Hand、Aerial Elephant Trunk。

3|空中末端执行器(手部)

无人机与物体、载荷、工具交互的物理接口。受浮基动力学、载荷上限限制,需要同时平衡抓取可靠性、稳定性、对不确定性的容忍度。

包含:刚性夹爪、柔顺夹爪、包裹承载机构、锚固驻停足、工具对接耦合器。

4|本体‑臂‑手协同设计

机体、机械臂、末端执行器强耦合,载荷摆放、臂运动、接触力都会改变飞行器动力学。

分为本体‑手一体化、臂‑手一体化、飞行‑抓取‑驻停一体化、多无人机本体‑手‑工具协同。

打开网易新闻 查看精彩图片

具身感知≠传统被动感知

  • 传统感知:拿到图像再做识别;

  • 具身感知:无人机可以主动改变位置、视角、传感器配置,主动运动去拿到任务需要的信息。

本章节分为主动感知、具身视觉跟踪两大方向,同时梳理对应的数据集与仿真基准。

1|主动感知

通过选择合适的传感动作获取任务信息,分为三类目标:

  1. 环境与本体状态理解:自适应信息路径规划,优化相机朝向与机体运动,提升环境覆盖、定位可靠性。

  2. 目标搜索获取:在有限观测、运动约束条件下,搜寻未知目标。代表工作:GOMAA‑Geo、UAST。

  3. 观测质量调控:主动调整视角、距离,规避糟糕观测角度;条件允许时引入接触传感弥补视觉缺陷。代表工作:ATRNet‑LUDO、CityEQA、ScoutVLA。

2|具身视觉跟踪

无人机一边飞,一边调整自身运动,持续维持对动态目标的有效观测。闭环融合目标识别、时序估计、运动预测、飞行控制。分为三类实现路线:

  1. 任务专用策略:观测直接映射跟踪动作,例如D‑VAT、GC‑VAT、CEL。

  2. 视觉‑语言‑动作(VLA)方法:复用预训练多模态表征,同时理解目标描述,输出飞行动作,例如UAV‑Track VLA、CosFly‑VLA。

  3. 大模型增强模块化流水线:感知推理、控制保留显式接口;大模型提供迁移理解能力,专用规划控制器负责执行。代表OA‑VAT。

3|基准与数据集
注意:离线轨迹数据集只能评测推理能力,不能验证感知‑运动闭环交互效果。
  • 仿真平台:Gym‑UnrealCV、CARLA‑Air

  • 跟踪类基准:EVT‑Bench、DeTrack

  • 搜索与视角优化基准:ATRNet‑LUDO、ActiveFly‑Bench

  • 离线轨迹数据集:CosFly‑Track

评测不能只看识别精度,还要评估无人机能不能靠自身运动改善观测质量。

打开网易新闻 查看精彩图片

无人机如果只依靠原始图像直接输出动作,容易做出短视、反应式行为。

世界模型+多模态大模型,可以赋予无人机推演时空演化、仿真飞行动力学后果、开展复杂任务推理的能力。论文划分五大研究方向。

  1. 多模态大模型时空智能:通用大模型普遍存在地面视角偏见,低空无人机场景性能会明显下滑。解决方案:

  • 使用AeroVerse、AirZoo、UAVIT‑1M这类面向无人机的几何专项数据集微调;

  • 架构层面增加光流运动编码器(SIS‑Motion);

  • 分层智能体(PMA)构建以物体为中心的认知地图,缓解空间歧义。

预测式空间表征️:不去直接预测原始像素画面,改用占据栅格、可见性网格、3D几何表征。

  • MAD:使用占据与可见性网格;

  • Aerial World Model:引入未来帧投影,注入3D先验;

  • WorldVLN:用真实观测截断想象隐状态,缓解长时序语义漂移。

生成式仿真与数据合成️:真实动态无人机数据获取难度很高,受物理风险、空域法规限制。世界模型可以生成物理可行的交互数据。

  • FlyMirage:结合大模型+3D高斯溅射,自动生成可导航仿真环境;

  • Motionscape数据集:揭示现有生成模型普遍存在时序退化问题。

基于世界模型的强化学习(MBRL)用于飞行控制✈️:在想象的隐空间环境优化敏捷飞行策略,降低真实真机交互样本消耗。

  • Dream to Fly:从原始图像端到端学习飞行;

  • AirDreamer:依靠世界模型空间记忆实现稀疏奖励导航,达成仿真到真实环境零迁移。

世界‑动作模型与视觉‑语言‑动作系统:把环境预测与动作生成耦合在一起,打通语义指令、环境预测、可执行飞行轨迹。

  • FlowPilot、WorldFly、ImagineUAV,可以在边缘机载设备完成低时延推演,直接输出控制器可跟踪的飞行参考轨迹。

⚠️现实痛点:无人机6自由度高速运动,对世界模型的推理时延、几何一致性、动力学保真度提出非常严苛的约束。
无人机具身规划
打开网易新闻 查看精彩图片

具身规划,就是在持续和环境交互的过程中,把观测、任务条件、平台状态转化为可执行动作。

无人机规划的现实约束:观测信息不完备、飞行动力学动态变化、机载算力有限、执行反馈持续改变环境。

各类规划范式之间不是互斥关系,真实工程系统经常会组合多种范式。
  1. 显式基于模型规划:直接对几何、动力学、约束做搜索优化,生成动力学可行轨迹。属于经典方案,但要求把观测、高层意图转化为结构化地图、代价函数。

  2. 以策略为中心规划:把大部分计算前置放在训练阶段;运行时直接从观测输出决策、航点、速度指令;依靠演示、奖励、训练分布编码规划知识。

  3. 结构化混合规划:学习模块处理感知、语义、难以解析的部分;几何规划、轨迹执行、安全过滤器保留显式物理结构。大模型输出语义引导,下游模块做几何轨迹求精校验。

  4. 世界模型规划:引入内部预测表征,推演不同动作带来的未来状态变化。不只基于当前观测选动作,同时思考多种未来可能性。

  5. 基础大模型规划:规划输入从固定几何目标,拓展到开放式视觉、语言意图;大模型负责语义推理,交由几何模块校验方案可行性。

  6. 智能体规划、角色专业化多智能体规划:依靠智能体循环完成任务拆解、可行性校验、反思协商;为不同智能体分配专门子任务角色,并处理执行反馈。

典型任务:无人机竞速飞行、障碍规避、意图引导飞行。选型需要权衡:规划时延、显式物理结构、接近飞行极限条件下系统鲁棒性。

打开网易新闻 查看精彩图片

无人机具身导航,将人类或者任务意图,转化为面向目标的三维飞行运动。导航紧密耦合感知、空间记忆、飞行动力学。分为任务形式、实现方法、基准数据集、空中抓取与无人机操作四大部分。

1|任务形式

  1. 航路跟随导航:依靠语言描述地标、空间关系、视角变化,代表AerialVLN。难点:高度、姿态变化会剧烈改变地标外观。

  2. 对话辅助导航:多轮交互消除指令模糊、信息缺失,代表AVDN。

  3. 语义目标导航:只描述要找的物体、区域、抽象概念,不给坐标,需要主动探索搜索。代表UAV‑ON。

  4. 地理条件导航️:利用卫星图、地理坐标、俯视鸟瞰图做跨视角对齐,代表UAV‑VLA、CityNav。

2|导航实现方法
  1. 任务专用策略:针对固定任务接口,学习观测‑动作映射;泛化能力受训练词汇、训练环境限制。

  2. 分层方法:高层处理长距离任务、语义记忆、子目标规划;底层负责局部运动,响应观测变化。代表APEX、CityNavAgent。

  3. AI智能体方法:大模型在推理循环调用记忆、工具,输出中间导航决策,再转化为飞行动作。代表See, Point, Fly。

  4. VLA方法:多模态预训练模型直接输出航点、速度、飞行指令。代表AutoFly。

  5. 世界模型方法:利用预测表征做前瞻导航,预判未来观测与任务结果。代表WorldFly、ImagineUAV。

3|基准与评估
✅重要原则:闭环评测(每一步动作都会改变观测)优先级高于离线轨迹评测。评估不只看终点是否抵达,还要综合任务完成度、路径效率、碰撞情况、任务进度。

代表性资源:AerialVLN、AVDN、UAV‑ON、HUGE‑Bench、LinkS2Bench、OpenFly、UnrealZoo、CARLA‑Air。

打开网易新闻 查看精彩图片

浮基无人机操作和地面机械臂差异巨大:飞行器与机械臂动力学强耦合。分为4条技术路线:

  1. VLA基础模型迁移:解决载荷变化、高度跌落、惯量改变带来的干扰。代表AIR‑VLA、AirVLA。

  2. 运动动力学建模与一体化规划:AERMANI‑Diffusion、全身一体化运动规划;处理自由飞行、抓取、投放多阶段动力学切换。

  3. 学习式自适应控制交互:强化学习应对接触带来的力矩扰动、质心突变。

  4. 面向任务的专用执行与高速抓取:面向农业采摘、高速动态物体捕捉。代表Flying Hand、Swooper。

现实难点:真实世界空中交互高质量数据稀缺,仿真‑真机迁移鸿沟显著。
无人机具身协同
打开网易新闻 查看精彩图片

无人机具身协同,把能力从单机拓展到多智能体协同感知、推理、物理执行。

利用不同平台差异化的视角、传感器、运动能力,完成单架无人机难以实现的复杂任务。领域已经从简单信息共享,走向异构机具身团队协同作业。

协同任务分类

  1. 协同感知:多机融合观测,缓解遮挡,做大场景感知。代表CoCa3D、OpenCOOD‑Air、VLUniTrack。不只是简单拼接图像,更要主动采集互补信息。

  2. 协同导航:多机分工承担视角采集、搜索、引导任务。代表AeroDuo、CoNav‑UAV、AGC‑VLN空地协同导航。

  3. 协同任务规划:异构智能体开展任务拆解、能力评估、任务分配。代表COHERENT、EMOS;充分考虑每台机器人硬件能力与执行反馈。

  4. 协同运动协调:在空间、动力学、通信约束下生成群体运动。代表Swarm‑GPT、FlockGPT、DGPPO;支持集群运动、线缆载荷运输这类物理强耦合场景。

  5. 协同空中操作:多机对接、工具交换、协同建造。代表Aerial‑AM、Flying Toolbox,涉及实体物理接触耦合。

方法论要点
  1. 当前主流实现中,大模型主要承担高层认知推理;底层物理执行依旧依赖专用规划器、控制器。

  2. 信息共享两条路线:特征空间对齐 / 统一表征两种路线,权衡通信开销、信息损失;

  3. 安全保障:安全机制必须嵌入协同架构内部,不能后置作为独立过滤模块。

基准与仿真平台
  • 协同感知数据集:AirCopBench、V2U4Real;

  • 任务级协同基准:COHERENT‑Bench、AGOS‑Bench;

  • 仿真平台:AirSim‑AG、CARLA‑Air、HERCULES。

  • 评测趋势:从单独模块测试走向完整感知‑推理‑动作闭环任务评测。

⚠️挑战与未来研究方向

论文总结四大根本性挑战,同时提出物理‑数字AI智能体(PD‑AI Agents)作为系统级解决思路。

四大核心挑战

  1. 长时序空中自主⏳:无人机运行空间范围大、时间跨度长,视角、尺度持续变化。并不是仅仅依靠单纯扩大大模型上下文窗口来解决;需要选择性保留关键信息,跨时空关联历史观测,建立当前决策和历史任务状态的联系;亟需高效记忆与时序推理机制。

  2. 飞行锚定的物理推理⚙️:不光要理解外部环境,还要理解无人机本体、动力学、载荷、物理交互之间耦合。动作会改变观测和物理状态,扰动和物体属性约束可行行为。需要面向空中系统的物理AI,超越纯语义理解,实现对交互后果的预测。

  3. 变化飞行条件下自适应能力️:真实世界非稳态:光照、天气、传感器质量、载荷、电池、机体配置持续变化。需要在有限经验下快速在线自适应,同时保证稳定性、安全性、物理可行性,不能重度依赖重新训练。

  4. 经验驱动的能力演进:不止于适配现有行为;希望无人机从长期运行积累经验,自动提炼可复用技能、工作流、决策策略;在获取新知识同时保留旧能力,实现能力持续迭代。

✨PD‑AI物理‑数字AI智能体架构思路
打开网易新闻 查看精彩图片

整体由数字无人机智能体、调度层Harness、物理无人机智能体组成,形成两大闭环:

  1. 行动闭环:调度层运行时编排工具、技能、记忆;生成候选动作经过沙盒校验下发物理端;收集真实反馈,更新任务状态。

  2. 演进闭环♻️:把成功、失败交互经验沉淀到记忆、技能库,后续任务可以复用、迭代优化。

调度层Harness是关键中间层,负责打通高层推理和真实物理执行,支撑持续交互与能力演进。
总结

无人机具身智能,正在从任务专用感知控制,向着语义理解、记忆、物理推理、规划、闭环执行一体化系统演进。

本文使用5+5框架区分能力定义(UAV‑EI五大能力维度)与系统实现(EI‑UAV五大架构层),系统梳理具身形态、具身感知、无人机世界模型、具身规划、导航操作、多机协同全链路技术。

未来的通用空中自主,不能只依靠单独改进某一个算法模块。物理‑数字AI智能体提供一套系统级路径:把数字侧推理记忆,和物理侧传感、动力学、控制、真实反馈持续耦合,支撑自适应、可以持续演进的无人机自主能力。

未来研究重点:应当更加关注物理‑数字耦合下的闭环物理执行性能,而不是仅仅停留在仿真环境内的语义推演。

Mbot具身智能实验室

让尖端科技触手可及,人人皆可探索未来

打开网易新闻 查看精彩图片

Mbot基础交流群等你加入,下方扫码联系

具身-杰西

Mbot具身-小助手

Mbot-视频号

Mbot-公众号

复制