北邮等高校联合研究团队揭开AI空中导航的关键短板

发布时间:2026/7/27 21:59:14
北邮等高校联合研究团队揭开AI空中导航的关键短板 这项由北京邮电大学牵头联合湖南师范大学与清华大学的研究团队共同完成的工作以预印本形式发布于2026年7月编号为arXiv:2607.12477感兴趣的读者可通过该编号查阅完整论文。当你用手机地图导航时地图不仅需要知道路上有什么还需要知道你在哪里、你在朝哪个方向走、你刚才转了几个弯。这两件事缺一不可。然而当我们把这套逻辑搬到无人机身上目前市面上几乎所有顶尖的AI大模型都只做好了前半件事——认识周围的世界却几乎完全忽略了后半件事——理解无人机自身在做什么。这个盲区正是本研究想要正面解决的问题。研究团队将这一核心命题称为自我与空间Self in Space一架真正智能的无人机不仅要看懂它飞过的城市还要清楚地知道自己正在做什么、刚才做了什么、接下来该怎么做。为此他们构建了一套名为SIS-Bench的评测基准并专门设计了一种结合光流信息的运动感知模型SIS-Motion用严格的实验数据揭示了当前AI的核心短板同时也验证了改进方向的可行性。一、无人机的导航难题只认识世界却不认识自己以一位经验丰富的快递骑手为例。他骑着电动车穿梭在城市里不仅需要认出路口的便利店和医院还需要时刻清楚自己刚才是向左转了弯、还是直行穿过了一条隧道以及如果接下来再右转会到哪里。前者是认识世界的能力后者是认识自己的能力两者缺一不可才能安全送达。现实中的无人机AI面临的正是这个困境。过去几年多模态大语言模型简单理解为能同时看图、看视频和理解文字的超级AI被广泛引入无人机系统让无人机拥有了识别地面建筑、判断目标位置、理解飞行指令的能力。然而研究人员发现几乎所有已有的研究和评测系统都只关注无人机对外部世界的理解对于无人机自身的飞行状态、运动历史和行为预测却少有系统性的考量。这不是小问题。在实际飞行中无人机的每一次姿态变化都会改变它看到的画面——向左偏转时右边的建筑会慢慢进入视野向下俯冲时地面会快速放大。如果AI不理解这些变化是自己在动造成的而不是世界在动就会产生严重的认知混乱导致判断失误。正因如此研究团队认为无人机智能的真正瓶颈在于如何同时理解外部世界与自身状态也就是自我与空间的统一建模。二、SIS-Bench给无人机AI设计的驾照考试为了系统地衡量AI在这两方面的能力研究团队从零开始设计了SIS-Bench这套评测基准。它就像是一套专门为无人机AI设计的驾照考试题库考题不仅测试你认不认识路还要测试你记不记得自己刚才怎么走的、能不能规划下一步怎么走。整个题库从两个维度展开。第一个维度是空间认知考查AI对外部环境的理解能力包括识别地面上的物体、判断建筑物的颜色属性、辨别两个地标的相对位置关系等。第二个维度是自我感知考查AI对无人机自身行为的理解能力包括识别无人机当前正在执行的飞行动作、记住一段飞行过程中的动作顺序、预测执行某个动作后会到达哪里等。在这两个维度内部研究团队还按照认知难度设计了三个递进层次。第一层叫感知对应的是最直接的即时观察就像你看一眼窗外就能判断今天是晴天还是阴天不需要任何回忆或推理。第二层叫记忆要求AI能够在时间轴上保存和提取信息就像你需要回想起刚才经过的那个路口旁边有一家蓝色招牌的药店。第三层叫推理是难度最高的层次需要AI把对空间的理解和对自身行为的理解整合在一起做出复杂的判断就像你能在脑海中构建一张地图然后规划从A点到B点的最优路线。在题目类型上SIS-Bench共覆盖13种具体任务。空间认知方面感知层包含物体存在性判断这段视频里有没有蓝色自行车、物体属性识别停在电线杆下的车是什么颜色和相对方向判断停车标志的后方是什么物体三类题目记忆层包含地标顺序回忆这几个地标按什么顺序出现、地标回溯玻璃幕墙大楼的前一个地标是什么和位置关系记忆第四段视频里白色高层右侧是什么三类题目推理层则包含空间一致性假设我悬停在红顶亭子上方面向圆形蓝色喷泉我的右手边是什么和时空一致性从游泳池出发正确的地标经过顺序是什么两类题目。自我感知方面感知层对应动作识别无人机当前在执行什么飞行动作记忆层对应动作序列回忆这段拼接视频中无人机依次执行了哪些动作和动作回溯第二段视频里无人机在做什么推理层则包含动作预测从红色网球场上方出发执行这串动作序列后会到哪里和路径规划从红色网球场出发要到达蓝色地板的篮球场应该执行怎样的动作序列两类最高难度的题目。为了让这些题目尽可能接近真实飞行场景研究团队对视频素材也做了精心设计定义了四种不同的视频格式。单段视频保留一个完整的短片段用于感知层测试拼接视频将2到4个短片段连接在一起用于记忆层测试长视频保留完整的长时飞行轨迹用于推理层测试打乱视频则将一段长视频切成若干片段后随机重排强迫AI从混乱的时间顺序中还原出真实的空间结构这也是难度最高的推理场景。SIS-Bench的数据来源于三个公开的无人机数据集AirScape、UrbanVideo-Bench和VisDrone覆盖城市街道、住宅小区、工业园区、自然景观等多种环境总计1646段真实无人机视频累计时长约14.9小时。所有题目均由两位专家独立审核只有双方都认可的题目才能进入最终题库。最终SIS-Bench共包含4856道多项选择题其中感知层占36.3%记忆层占43.7%推理层占20.0%。三、AI现在的真实成绩人类91.7%最强AI模型71.6%有了考卷接下来就是摸底考试。研究团队将当前业界最强的26个视频多模态大模型一一送上考场其中包括6个闭源商业模型Gemini 3 Flash、GPT-5.4、Kimi-2.5、Doubao-Seed-1.8、Doubao-Seed-1.6-Vision、Qwen3.5-Plus和20个开源模型。同时他们还招募了6位具有硕士学历的人类专家参加同样的考试作为成绩上限的参照。结果出人意料却又在情理之中。人类专家的平均正确率达到91.7%而表现最好的AI模型Gemini 3 Flash仅取得71.6%的正确率两者之间相差超过20个百分点。这说明SIS-Bench并不是一套过于容易的题目当前的AI距离人类水平还有相当大的差距。更值得关注的是成绩背后的结构性规律。研究人员发现了两个非常一致、跨越所有模型都成立的现象。第一个现象是重空间、轻自我的系统性偏差。几乎所有被测试的模型在空间认知类题目上的得分都明显高于在自我感知类题目上的得分。换句话说这些AI更擅长理解无人机看到的外部世界却不擅长理解无人机自身在做什么。以Gemini 3 Flash为例它的空间认知平均分为83.7%而自我感知平均分仅为58.6%差距超过25个百分点。这种系统性偏差在所有26个模型中几乎无一例外。第二个现象是感知好、记忆差、推理更差的认知层次衰减。随着题目从感知层上升到记忆层再上升到推理层几乎所有模型的成绩都呈现出明显的下降趋势。这种衰减在闭源商业模型和开源模型中都同样存在。直接看一眼就能回答的题目AI表现尚可但需要在时间轴上保存信息再提取的题目成绩就开始下滑而需要整合空间知识与动作历史才能完成的复杂推理题成绩下降得最为明显。研究团队还专门做了一系列对照实验验证这些规律不是由题目设计本身造成的。他们测试了不同的视频采样策略发现结果几乎没有变化他们对打乱视频重复三次随机排列取平均结论也依然稳定他们给模型加上思维链提示让AI在回答之前先把推理过程写出来和思维树提示让AI探索多条推理路径发现这些技巧对整体结论影响甚微有的任务甚至会因为提示词变化而成绩下降而人类专家在面对相同的拼接视频、长视频和打乱视频时依然能保持接近90%的准确率。这些控制实验共同说明观察到的模型短板是真实存在的能力缺陷而非题目设计的偏差。在更细致的错误分析中研究团队对4个代表性模型的7987条错误回答进行了逐一标注将错误分为8个类别。结果显示动作理解错误占所有错误的33.0%空间推理错误占18.2%是两个最主要的失败原因。这意味着AI的错误并不主要来自没看清楚而更多来自不理解无人机自己在动以及无法在脑海中构建稳定的空间关系图。四、三个具体失败案例AI的盲区藏在哪里为了让读者更直观地感受到这些局限研究团队展示了三类典型的错误场景每一类都揭示了不同层面的认知盲区。第一类错误发生在夜间飞行的动作识别任务中。画面中路灯稀少背景昏暗只有零星的车灯轨迹可见。正确答案是无人机垂直下降同时向右偏转但包括Gemini 3 Flash、GPT-5.4、Doubao-Seed-1.8和Qwen3.5-Plus在内的所有主流模型都错误地选择了沿弧线向前飞行同时向右偏转。原因在于这些模型过于依赖视觉中最显眼的亮点车灯轨迹把亮点的移动方向理解成了自身的前进方向而没有从整体画面变化的模式中感知到真实的下降动作。这就像你坐在一辆向后移动的火车上看到窗外的树木向前移动就以为自己在向前走——错误的原因不是视力问题而是对自己在动这件事缺乏感知。第二类错误发生在拼接视频的动作序列记忆任务中。视频由三段短片段拼接而成正确的动作序列是缓慢下降同时俯仰角下压 → 保持稳定向前飞行 → 缓慢下降同时俯仰角下压。部分模型能正确识别前两个动作却在第三段上判断失误误以为最后一段是继续向前飞行。另一些模型则更早就出错把第一段也认成了向前飞行导致整条序列完全错误。这类错误的本质不是单段视频看不懂而是无法在多个片段之间建立稳定的时间界限一旦某段的判断偏差就会连带影响整条序列的理解。这与人类在长时间工作后容易混淆事件顺序的情况有些相似只不过AI的这种混乱即便在很短的视频里也会出现。第三类错误发生在拼接视频的动作回溯任务中。题目要求模型识别第三段视频里无人机在做什么正确答案是顺时针旋转但几乎所有被测模型都错误地选择了俯冲同时向前飞行或缓慢向前飞行。视频中第三段的视角确实发生了明显变化但这种变化是机身在原地旋转导致的而不是向前推进造成的。由于这两种运动在视觉上都会产生场景在移动的效果区分它们需要精细地感知背景整体结构的变化方式而不是简单地注意到画面在变。现有模型倾向于把任何明显的视角变化都解读为向前移动或俯仰变化对原地旋转这种更微妙的自我运动模式缺乏有效的识别能力。五、SIS-Motion给无人机AI装上运动感知器发现问题之后研究团队没有止步于诊断而是进一步探索了一条改进路径。他们的核心思路是既然AI对自身运动不够敏感能不能专门给它加一套感知运动的传感器这个传感器的技术名称叫光流Optical Flow。光流的原理很直观对于视频中相邻的两帧画面你可以计算每一个像素从第一帧到第二帧移动了多少距离、朝哪个方向移动。当无人机向前飞时画面中所有元素都会向外扩散当无人机向右偏转时画面整体会向左平移当无人机原地旋转时画面会产生一种特殊的旋转流场。这些运动模式用人眼观察非常微妙但用数学方法计算出来之后会变成非常清晰的结构化信息可以直接告诉AI机身在以什么方式运动。研究团队将这套光流信息封装成一套与原有视觉特征并行的运动编码器嵌入到标准的视频多模态大模型中构成了SIS-Motion框架。具体来说原有模型会提取视频帧的视觉特征描述场景里有什么、长什么样新增的运动编码器则同步提取光流信息描述每一帧到下一帧之间画面如何变化。两路信息通过一个轻量级的连接模块融合在一起共同送入语言模型进行最终的推理和回答。为了训练这个升级版模型研究团队从AirScape数据集的训练集中构建了一个专门的训练语料库命名为SIS-Motion-54K包含54000条样本。这些样本覆盖三种形式多项选择题格式覆盖9个感知和记忆类任务让模型在训练阶段就熟悉与评测相同的题目类型开放问答格式去掉选项让模型直接从视频中生成回答避免模型仅靠选项匹配取巧描述格式包含运动意图描述和场景内容描述两类让模型学会同时用语言表达运动信息和环境信息。特别值得一提的是这批训练数据严格只涵盖感知和记忆任务没有包含任何推理类任务的样本。这样的设计是刻意为之——如果事后在推理任务上也出现了成绩提升就能说明这种提升来自模型对底层运动信息的更好理解而不是靠记住了推理题的答案模式。六、实验结果运动感知带来了什么又没带来什么实验结果清晰地展示了SIS-Motion的实际效果。与同等配置下只使用视觉信息的基础微调模型相比加入运动感知之后空间认知的平均得分从72.0%提升到74.2%自我感知的平均得分从60.3%提升到63.7%。这个结果很有意思运动信息不仅帮助了自我感知这是预期之内的同时也帮助了空间认知这稍微出乎意料。原因在于无人机的运动与它看到的环境本来就是不可分割的——当你知道无人机在向右偏转你就更容易理解为什么画面左侧的建筑在变大、右侧的建筑在缩小从而更准确地判断地标之间的位置关系。这正是自我与空间统一建模的价值体现。具体到任务层面提升最为明显的包括物体属性识别、地标回溯、位置关系记忆、动作识别、动作序列回溯和动作记忆等感知和记忆类任务。而在推理层的4个任务上成绩的提升有限且不够稳定——路径规划任务有所改善但动作预测任务没有变化。这与训练数据的设计完全吻合模型在没有接触过推理训练数据的情况下从改进的底层感知能力中获得了部分泛化但高层次的复杂推理仍然是尚未攻克的难关。研究团队还测试了四种不同的光流估计算法RAFT、Sea-RAFT、MemFlow、MOFNet发现所有四种算法搭配后的模型都优于纯视觉基础线说明这套改进方案对具体光流算法的选择并不敏感具有较强的通用性。其中MOFNet算法的光流质量最高最终取得了最好的综合成绩总体正确率达到69.1%。七、在真实导航任务中的迁移验证为了确认这套改进不是仅在题库里有效研究团队还在一个完全独立的下游任务上进行了验证。他们基于OpenUAV数据集构建了一个无人机路径规划测试集包含来自22个模拟场景的3895道题目覆盖城市街道、沙漠、森林、港口和海岛等多种地形。在这个测试中所有模型都采用零样本方式评测即没有任何针对这批题目的额外训练。结果显示SIS-Motion的正确率达到92.2%远高于同等底座模型Qwen2.5-VL 3B在零样本状态下的71.2%提升超过20个百分点。这说明在SIS-Motion-54K上学到的运动感知能力确实能够迁移到完全不同的下游飞行决策场景中而不仅仅是在题库分布内有效。归根结底这项研究做了两件重要的事。第一件是照镜子——用SIS-Bench这套精心设计的评测体系清楚地照出了当前顶尖AI模型的真实短板它们对外部世界理解得不错但对自身行为的感知严重不足而且随着任务从即时感知升级到时间记忆、再升级到复杂推理成绩会持续走低。第二件是试着补救——用SIS-Motion验证了一种思路把光流这种能够直接描述运动的信息注入模型可以在不大幅改动模型结构的前提下系统性地改善感知和记忆层面的表现并且这种改善能够迁移到实际的飞行导航决策中。当然研究团队也坦诚地指出了这项工作的局限。SIS-Motion在推理层任务上的改进有限路径规划这类高层次决策任务需要更复杂的目标导向推理能力仅靠局部运动信息并不够。此外SIS-Bench本身的评测形式是多项选择题更接近于对模型理解能力的间接测量而不是对无人机真实飞行决策的直接考查。如何将这套对自我与空间的理解转化为可靠的闭环飞行控制依然是一个需要进一步探索的开放问题。对于研究人员来说这项工作提出了一个值得深思的方向我们是否在构建无人机AI时太过于关注认识世界而忽视了认识自己这同样重要的能力而对于普通大众来说这项研究意味着未来真正能够安全、可靠地在城市上空自主飞行的无人机除了需要一双看懂世界的眼睛还需要一套感知自身行为的内感觉。两者缺一不可这或许才是无人机真正走向智能化的关键一步。有兴趣深入了解这项研究的读者可以通过arXiv编号2607.12477查阅完整论文原文。QAQ1SIS-Bench是什么它和普通的无人机测试有什么区别ASIS-Bench是一套专门用来测评无人机AI能力的题库包含4856道多项选择题覆盖13种任务类型。与以往只测试无人机能否识别地面环境的评测不同SIS-Bench同时测试两件事一是无人机对外部世界的理解比如识别建筑颜色、判断地标顺序二是无人机对自身行为的理解比如识别当前飞行动作、记忆飞行轨迹。这种内外兼顾的设计是SIS-Bench区别于以往评测的核心特点。Q2当前最强的AI模型在SIS-Bench上表现怎么样A表现最好的商业模型Gemini 3 Flash总体正确率为71.6%而人类专家的正确率为91.7%差距超过20个百分点。更值得注意的是所有模型在自我感知类题目上的得分都系统性地低于空间认知类题目说明现有AI普遍存在认识世界强、认识自己弱的结构性短板。Q3SIS-Motion是怎么改善无人机AI对自身运动的理解的ASIS-Motion通过在原有视觉模型之外增加一套光流分析模块来实现改善。光流能计算出视频相邻帧之间每个像素的移动方向和距离把无人机的飞行动作转化为结构化的运动信息让AI不再只依赖画面外观来猜测自身在做什么。加入这套模块后自我感知平均得分从60.3%提升到63.7%空间认知也同步提升且效果可以迁移到真实无人机导航决策任务中。

相关新闻

最新新闻

日新闻

周新闻

月新闻