办公室里,一架市售无人机自主穿梭,不需人工操控就能找到并跟随特定人员——这不是科幻电影,而是一个新基准测试的演示场景。Drone‑Bench 刚刚发布,旨在衡量前沿 AI 模型在低成本无人机硬件上编写监视代码的能力。你看到的自主飞行,正是人类开发者借助编码助手写出的演示代码,而如今模型只需写出类似的程序就能复现这一切。

这个基准围绕一个看似简单却环环相扣的流程展开:先用无人机拍摄的办公室视频进行三维重建,生成二维障碍地图和每一帧的位姿;接着把一张查询帧映射到已重建的坐标系,实现无人机的实时定位;然后基于障碍地图规划从一个房间到另一个房间的飞行路径;再利用参考人脸照片训练出检测器,在视频流中框出目标;最后,让无人机根据检测框持续跟随目标,不让对方离开画面。这五个任务分别对应重建、定位、导航、检测和跟随,越往后越考验模型把代码串联成物理行动链的能力。

打开网易新闻 查看精彩图片

Drone‑Bench 以团队编写的演示代码作为人类基线,衡量模型在每一项任务上的运行得分。从 2024 年 7 月到 2025 年 7 月的跟踪曲线显示,GPT‑4o、o1、o3、Gemini 3.1 等模型陆续参与测试,单次运行的平均得分缓慢却稳定地向上爬升。到了最新发布的 fable‑5,整体进度已达人类基线的 84%——这意味着,AI 已经能自主写出足够可靠的监视程序,再用一架几百元成本的无人机把它变成物理世界的“眼睛”。

这并不是一个只停留在聊天窗口里的能力。模型已经在运营店铺、咖啡馆甚至小型生意的现场环境中运行,物理自主性只会加速提升。能力越强,被滥用的门槛就越低。报告中特别提醒,AI 已不再只是对话框里的工具,它正在获得介入真实世界的手段,而如何应对这种蔓延和可能的恶意使用,不该只由 AI 实验室来决定,公众现在就应该参与讨论。

为防止数据污染,任何 AI 实验室都无法用这份基准进行训练。Drone‑Bench 展示的不仅是代码生成和实时控制的融合速度,更是一面镜子:当模型能替人操控摄像头去跟踪目标时,监控技术的平民化就不再只是一个遥远的假设。