AI 快讯Drone-Bench把大模型送上天
模型上新

Drone-Bench把大模型送上天

2026-07-24T22:03:14.451Z
Drone-Bench把大模型送上天

Andon Labs 发布 Drone-Bench,用闭环无人机监控任务持续评测前沿模型。它测的不是看图答题,而是模型能否连续观察、决策、飞行并完成搜索。

Andon Labs 近日发布 Drone-Bench,开始用可重复的无人机监控任务,持续追踪前沿 AI 模型的自主行动能力。截至 2026 年 7 月 24 日,这项基准最值得关注的地方并不是又多了一张模型排行榜,而是它把评测从静态图片和文字推理,推进到了一个有空间、有时间压力、会因错误操作而改变状态的闭环环境。

**Drone-Bench 是一个用于评估前沿模型执行基础无人机自主监控任务能力的基准。**模型需要根据无人机视角获得环境信息,判断下一步该做什么,再通过可用控制工具调整飞行状态,并在连续交互中完成搜索或监控目标。

这与常见的视觉问答不是一回事。看懂一帧画面只说明模型具备视觉识别能力;让无人机在未知环境中持续搜索,则要求模型同时处理定位、记忆、路径规划、目标确认和风险控制。前者像是在监控室里看截图,后者更接近真的坐到操作台前。

Drone-Bench 中前沿模型观察无人机画面、规划航线并执行监控任务的闭环流程示意图

Drone-Bench测的不是“会不会看图”

**闭环评测是让模型的每次输出直接改变环境,并让模型继续面对变化后状态的评测方式。**在这类任务中,模型通常经历“观察画面—理解位置—选择动作—环境更新—再次观察”的循环,任何一次错误判断都可能积累到后续步骤。

传统多模态评测大多是开环的:给模型一张图,问它前方有没有车辆,模型回答后任务就结束了。即使答案错误,也不会改变下一道题。Drone-Bench 所代表的闭环路线则不同,模型如果在转向时错过目标,之后看到的画面、所在的位置和剩余搜索时间都会随之变化。

**无人机自主监控是模型在授权场景中控制飞行平台搜索、发现、确认并持续观察指定目标的能力。**这里的“监控”首先是一项感知与导航任务,可以对应设施巡检、灾害搜救、园区安防和环境观察,并不等同于武器控制或攻击决策。

基础任务听起来并不复杂,但它会集中暴露当前智能体模型的几个短板:

  • 模型是否记得已经搜索过哪些区域;
  • 模型能否把二维画面对应到三维空间;
  • 模型会不会在目标暂时离开视野后重新找到它;
  • 模型能否区分“疑似目标”和“已确认目标”;
  • 模型是否会因为反复修正而陷入原地打转;
  • 模型能否在飞行效率、观察质量和安全边界之间取舍。

**长程任务的难点是错误会复利,而不是单步问题特别难。**模型连续做对十次并不代表能够完成任务,因为第十一次错误转向可能让前面的探索全部失去价值。对无人机来说,偏航、重复巡航和高度控制不当还会消耗真实世界中最稀缺的资源——电量与飞行时间。

这也是 Drone-Bench 比“识别画面里有什么”更接近真实智能体能力的原因。一个模型可以在单帧目标识别上表现出色,却未必能够设计一条覆盖完整区域、避免重复搜索且能及时回访疑似目标的航线。

一套简单任务,实际拆出了五层能力

**Drone-Bench 的核心价值是把感知、推理和行动放进同一条任务链,而不是分别给出互不相干的分数。**从模型视角看,一次基础无人机监控任务至少包含五层能力。

1. 视觉感知

**视觉感知决定模型能否从无人机画面中提取可行动的信息。**航拍目标通常尺寸更小、角度更特殊,还会受到遮挡、阴影、逆光和运动模糊影响。模型不仅要回答“看到了什么”,还要判断目标在画面的哪个方向,以及是否值得靠近确认。

高空画面中的一个人可能只占几十个像素,车辆也可能被树冠或建筑边缘遮住。模型如果把低置信度识别直接当成事实,就容易提前结束搜索;如果对所有疑似物都反复靠近,又会浪费大量步骤。

2. 空间理解

**空间理解决定模型能否把画面变化转换为自身位置和运动方向。**无人机向右转后,画面中的目标向左移动并不意味着目标本身移动;上升导致视野扩大,也会让物体显得更小。模型必须理解这些由相机和载体运动引起的视觉变化。

这一层尤其容易暴露视觉语言模型“能描述、不会定位”的问题。它可能准确描述建筑、道路和树木,却无法稳定回答自己刚才从哪个方向飞来,也无法利用地标建立可靠的局部地图。

3. 路径规划

**路径规划决定模型能否以有限动作覆盖足够大的搜索区域。**随机飞行有时也能撞见目标,但它不能被称为自主能力。更合理的策略是根据场景采用网格搜索、边界扫描、由高到低观察或围绕遮挡物改变视角。

真正有区分度的问题不是模型能不能发出“前进”指令,而是它是否知道什么时候该继续扩大搜索,什么时候该降低高度确认,以及什么时候该停止重复访问同一区域。

4. 工作记忆

**工作记忆决定模型能否在多轮交互中保留已经观察到的事实。**无人机任务天然依赖轨迹历史:哪些方向已经飞过、哪里出现过疑似目标、上一次转向角度多大,这些信息如果丢失,模型就会不断重新探索。

大上下文窗口并不会自动解决这个问题。画面、工具反馈和推理记录都能放进上下文,只说明模型“有地方存”;模型能否提取关键状态、压缩历史并维持一致的内部地图,才决定这些上下文是否真正有用。

5. 动作控制

**动作控制决定模型的计划能否稳定转换成飞行行为。**高层语言模型通常不是传统飞控系统,它更适合给出目标方向、相对位移或观察策略,再由底层控制器执行姿态稳定和基础避障。

这条边界很重要。模型在基准中完成一次转向,不等于它已经学会了电机控制、抗风补偿和紧急降落;它更像一名通过有限控制面板下达指令的任务操作员,而不是替代全部飞控软件。

它与UAVBench、MM-UAVBench有什么不同

**Drone-Bench 更强调模型在可交互环境中的连续行为,而 UAVBench 和 MM-UAVBench 更偏向建立覆盖无人机场景的综合能力框架。**三者名称相似,但回答的问题并不完全一样。

| 基准 | 主要定位 | 评测形态 | 重点能力 | 更适合回答的问题 | |---|---|---|---|---| | Drone-Bench | 追踪前沿模型的基础无人机监控能力 | 连续观察与动作构成的闭环任务 | 搜索、记忆、规划、控制与任务完成 | 模型能否真正把无人机任务做完 | | UAVBench | 面向 LLM 驱动飞行场景的开放、统一评测框架 | 数据集与多类无人机任务结合 | 感知、策略、物理与代理能力 | 模型在无人机自主智能各环节处于什么水平 | | MM-UAVBench | 面向低空无人机场景的多模态模型综合评测 | 19 个子任务组成的能力测试 | 感知、认知与规划 | 多模态模型对低空场景理解得是否全面 |

**静态基准和闭环基准并不是替代关系,而是分别测量能力组件与系统行为。**UAVBench、MM-UAVBench 可以细分模型在哪一种感知或推理任务上失分,Drone-Bench 则更容易发现多个组件拼起来之后为什么仍然完成不了任务。

一个模型可能在目标识别、空间问答和路线选择三个单项上都拿到不错成绩,但进入闭环环境后仍然失败。原因可能是它没有持续更新位置,也可能是它在发现疑似目标后忘记返回确认。单项测试告诉开发者“零件怎么样”,闭环测试则告诉开发者“整机能不能跑起来”。

看Drone-Bench榜单,不能只盯成功率

**任务成功率是最直观的指标,但它不足以单独评价无人机智能体。**如果模型通过极长轨迹、频繁试错才完成任务,它在模拟环境中可能算成功,在真实部署中却可能因为电量、延迟和成本而不可用。

理解这类榜单时,至少需要同时观察以下指标:

| 指标 | 反映的能力 | 单独使用的风险 | |---|---|---| | 任务成功率 | 最终是否找到并确认目标 | 无法区分快速完成与偶然撞见 | | 平均动作步数 | 搜索和规划效率 | 步数少也可能来自过早结束 | | 重复区域比例 | 空间记忆与覆盖策略 | 需要结合场景复杂度解释 | | 碰撞或越界次数 | 安全约束遵守情况 | 模拟器安全不等于真实安全 | | 误报与漏报 | 目标判断可靠性 | 受目标尺寸和标注标准影响 | | 推理延迟 | 是否能够及时响应环境 | 云端延迟会受到网络条件影响 | | 单次任务成本 | 部署规模的经济可行性 | 不同模型计费和上下文策略不同 | | 多次运行方差 | 策略是否稳定 | 单次最佳结果可能掩盖随机性 |

**重复运行比单次演示更重要,因为生成式模型的动作具有随机性。**一个视频里顺利找到目标只能证明模型“有一次做到了”,不能证明它形成了可靠能力。真正有参考价值的结果应当报告多次运行的均值、成功率、方差和失败类型,并固定模型版本、提示词、环境种子及工具权限。

**模型名称也不足以唯一确定评测对象,因为前沿服务会持续更新。**同一产品名下的模型快照、系统提示、视觉分辨率、推理预算和工具调用策略都可能变化。Drone-Bench 使用“tracking”而不是一次性“testing”的定位是合理的:它更像一条能力时间序列,而不是刻在石头上的永久名次。

这项评测真正打到了智能体的软肋

**当前前沿模型最常见的问题不是完全不会规划,而是无法长时间维持一个一致、可执行的计划。**模型往往能在每一步给出听起来合理的解释,但把连续几十步放在一起看,轨迹可能充满重复、犹豫和自相矛盾。

语言模型尤其容易产生一种“局部合理、全局失控”的行为。它看到左侧有建筑,于是决定左转观察;下一帧又因为右侧出现道路而改向;再下一帧忘记最初任务,转而描述风景。每一步都能找到理由,整段轨迹却没有覆盖策略。

**无人机环境会放大模型缺少世界状态的缺陷。**网页智能体点击错一次按钮,通常还能返回上一页;无人机飞错一个方向后,位置、视角、时间和能耗都已经变化。环境不会因为模型意识到自己错了就自动复原。

这使 Drone-Bench 对智能体开发很有现实价值。它迫使开发者从“换一个更强模型”转向更具体的系统问题:是否需要显式地图、轨迹摘要、目标置信度表、搜索区域划分、动作验证器和安全控制层。

距离真实无人机自主巡检,仍隔着一整套工程系统

**Drone-Bench 的高分不能直接等同于真实世界可部署能力。**模拟环境可以控制光照、障碍物和目标分布,也不会完整复现阵风、GPS 漂移、通信中断、镜头污损、电池衰减与传感器噪声。

从基准走向真实部署,至少还需要补齐四类验证:

  1. **仿真到现实迁移。**模型需要面对不同天气、季节、建筑风格和摄像头参数,而不是记住固定环境的视觉模式。
  2. **实时性验证。**无人机不会无限等待模型思考,端到端延迟必须与飞行速度和避障距离匹配。
  3. **失效保护。**通信中断、模型拒答或输出非法动作时,底层系统必须能够悬停、返航或降落。
  4. **合规与授权。**真实监控涉及空域、隐私、数据保存和操作责任,模型能力并不会自动提供合法使用依据。

**大模型更适合担任任务级决策层,而不是直接接管毫秒级飞控回路。**现实可用的架构通常会把职责拆开:传统飞控负责姿态稳定和紧急响应,感知模块处理检测与定位,大模型负责理解任务、调整搜索策略并解释异常情况。

这种分层架构看起来没有“一个模型端到端控制一切”那么炫,但更符合工程常识。无人机需要确定性的安全底座,大模型的优势则在于处理开放指令、复杂场景和临时目标,两者不应该互相取代。

Drone-Bench为什么值得持续关注

**Drone-Bench 的意义在于给“模型会操作物理设备”提供了一种比演示视频更可检验的证据。**过去的无人机智能演示经常展示一次成功飞行,却很少说明失败率、重复次数、模型版本和人工介入程度;基准化评测至少要求不同模型在相近条件下接受同一类任务。

**自主无人机正在从单一飞控产品变成由模型、传感器、任务软件和安全系统共同组成的平台。**第三方市场研究预计,全球自主无人机系统市场规模将从 2025 年的 124.6 亿美元增长至 2034 年的 420.6 亿美元,2026—2034 年复合年增长率为 14.6%。工业检查、公共安全、测绘和基础设施监控,都是模型能力最容易转化为产品价值的方向。

市场增长不意味着大模型已经准备好独立飞行。相反,越接近现实部署,评测就越不能只看语言表达和静态识别,而必须考察任务成功率、稳定性、成本、安全边界和失败后的恢复能力。

**现阶段对 Drone-Bench 最准确的评价是:它测到了真正重要的问题,但还没有证明问题已经解决。**前沿模型开始具备用自然语言理解监控目标、分析航拍画面并连续调用控制工具的能力,这已经比单帧视觉问答前进了一步;但从偶尔完成基础搜索,到稳定承担真实巡检任务,中间仍有明显距离。

对于模型厂商,Drone-Bench 是一次长程智能体能力体检;对于无人机开发者,它是一套观察模型是否值得接入任务层的筛选工具;对于普通用户,它则提醒了一件事:看起来会飞的模型,不一定真的知道自己飞过哪里,也不一定知道下一步为什么要飞过去。

参考来源

本文对 Drone-Bench 发布定位的描述,以 Andon Labs 官方评测页面截至 2026 年 7 月 24 日公开的信息为准。

相关推荐

查看全部