UAV-VLN 旨在使无人机能够理解高级人类指令并在复杂 3D 环境中执行长期任务。本文从任务定义到当前技术现状进行了全面综述,并建立了方法论分类法,涵盖了从早期的模块化和深度学习方法到当代由大型基础模型驱动的智能系统(包括视觉语言模型 VLM、视觉语言行动模型 VLA 以及生成式世界模型与 VLA 架构的融合)。该综述系统地回顾了支持标准化研究的必要资源生态系统:模拟器、数据集和评估指标。此外,本文还对阻碍现实世界部署的主要挑战进行了批判性分析:模拟与现实之间的差距、动态户外环境中的鲁棒感知、语言歧义推理以及资源受限硬件上的高效部署。通过综合当前基准和局限性,该综述提出了一个面向未来的研究路线图,以指导对多智能体集群协调和空地协同机器人等关键前沿的探究。
UAV-VLN 问题被形式化为一个部分可观察的马尔可夫决策过程 (POMDP),其中智能体的真实状态永远不会完全已知,必须从一系列不完整和嘈杂的感官数据中推断其状态。UAV-VLN 的主要方法分类法包括:模块化和早期学习方法,长时序时空理解架构,以及由基础模型驱动的智能体系统。该综述还概述了必要的模拟器、数据集和评估协议,并深入探讨了主要挑战,重点关注模拟与现实之间的差距以及鲁棒性、安全性和效率问题。最后,本文概述了一个研究路线图,朝着多智能体系统(UAV 集群协调)和空地协同机器人等未来前沿发展。