把大模型放进一座用真实三维数据搭建的香港城市沙盒里,让它像玩开放世界游戏一样上街找路,结果会怎样?上海交通大学、新加坡国立大学、美团、香港中文大学、上海大学和牛津大学的研究团队,用一套名为 UrbanGround 的评测系统给出了一个相当反差的答案:模型能认出街景里的地标,却很难把一条长路走完。
短程导航中,表现最好的模型能完成 75.0% 的任务。可一旦路线拉长,10 个模型的成功率全部跌到 0% 到 3.8% 之间。研究团队用一句话概括了这种反差——「走两步,就忘了路」:眼前几步能走对,转过几个路口,前面的判断就接不上了。
从「看懂一张图」到「走完一条路」
过去不少城市空间智能评测,停留在单张街景或航拍图上。模型只需回答眼前的问题,不用真的走出下一步。即使是导航任务,视角也常沿着预设节点切换,模型并没有在一座连续的城市里一步步找路。
UrbanGround 想改变这一点。它由地理层、仿真层和智能体层组成。地理层以香港地政总署公开的 3D Visualisation Map 和 3D Pedestrian Network 为底图,把地理坐标、三维网格和步行网络对齐到同一套沙盒坐标中。仿真层把地图变成一座可以走进去的城市——建筑、墙体、坡道和地形起伏都会影响行动,同一地点可以切换昼夜和天气,道路也能在途中封闭,行人会沿步行网络移动。智能体层则规定了模型每一步能看到什么、能做什么:它只能看到当前的第一人称画面和任务说明,需要时可以打开地图,再选择移动、转向、跳跃或操作地图。地图标出当前位置和目标,却不替它规划路线。
研究团队最终整理出 810 个经过人工检查的任务实例,覆盖香港多个城区,并用同一套动作接口测试了 10 个多模态模型。任务从短到长:先看懂眼前,再把判断带进更长的路线,最后还要应付途中变化。
认得出地标,却分不清方向
第一组实验只看最短的一段行动。视觉识别测试模型能否认出周围目标,方向理解要求它判断地标相对自己的方位,主动探索则允许它走上几步,补看初始视角里没有的线索。
认东西不算难。10 个模型的视觉识别准确率为 75.0% 到 93.8%,主动探索准确率也达到 46.3% 到 82.5%。只要线索在附近,模型往往能一边看、一边走,完成这段任务。
方向却难得多。10 个模型的方向理解准确率只有 23.3% 到 58.3%。论文里有个很直观的例子:Gemini-3.1-Pro 的视觉识别准确率达到 82.5%,方向理解却只有 23.3%,甚至低于随机猜测。它能认出地标,却不容易在视角转动后判断地标究竟在左边还是右边。还没走远,方向已经可能错了。
答对了,也不等于走得对。有些模型找到了正确线索,轨迹却离开了行人网络。GPT-5.5 需要回答北京同仁堂旁边是哪家银行,它找到了药房旁的东亚银行,答案没错,探索时却直接横穿马路,离开了步行区域。答案虽对,走法却是现实里不允许的。
走两步,就忘了路
第二组实验把路拉长,还加入语言指令、路径限制、地点搜索和多地点规划等任务。形式不同,难点却一样:地标离开视野后,模型还能不能接着判断自己在哪、要往哪走?
短途还走得不错。GPT-5.5 和 Claude-Opus-4.6 的成功率都为 75.0%。一到长路线,10 个模型的成功率只剩 0% 到 3.8%。GPT-5.5 从 75.0% 跌到 0%,Claude-Opus-4.6 从 75.0% 跌到 1.3%。眼前几步会走,不代表整条路走得完。
问题不只是路更长、步骤更多。每次转弯、过街或开关地图,模型都要重新判断自己在哪、目标在哪。它可能连续几步都走对,也可能在一个路口走偏后仍按原方向前进。小偏差一路累积,最后就很难回到正确路线。
按起点到目标的距离分组,趋势也很清楚:距离越长,短程导航和指令导航的成功率总体越低。个别模型的曲线会有起伏,所以不能说每多走一步,性能就一定下降。但总体上,路线越长,走偏后没能纠正的情况就越多。
找对了大方向,还是卡在半路
如果只看是否到达终点,很容易以为模型一开始就走错了。轨迹却不是这样。长程任务结束时,各模型仍有 52.5% 到 81.3% 的轨迹比起点更靠近目标,可完整成功率只有 0% 到 3.8%。它们往往找对了大方向,也走对了一段,最后还是卡在半路。
论文从空间定位、持续记忆和动态调整三个方面来测。空间定位先问模型有没有弄清眼前的空间关系——认出地标只是第一步,它还得知道地标在自己的哪个方向,才能决定往哪走;持续记忆把路拉长——当地标离开视野,模型要把先前看到的线索、眼前街景和地图重新对上,不能每过一个路口就从头找方向;动态演化再把路况改掉——前方突然封路、行人挡在路上,模型能不能看出原路已经走不通,并及时换路?
其中一段 GPT-5.5 轨迹很有代表性。绿篱挡住直行路线后,模型找到了正式坡道,走上结构复杂的天桥,继续朝目标前进。它没有在第一个障碍前放弃,但最终能否走完,仍是另一回事。
这项研究把「会看街景」和「会走城市」之间的差距,量化成了一张张表格。对做具身智能、机器人导航和空间 AI 的团队来说,UrbanGround 提供了一个更接近真实世界的测试场:模型不只要答对问题,还得把路走完。
热门跟贴