一条推文,把AI代理的"动手能力"摆到了台面上。Aravind Srinivas 展示了 Perplexity Computer 的一次实际运行:AI 代理以 Astra 作为协调器,成功玩起了浏览器游戏。

这不是跑分,也不是演示视频里的剪辑片段,而是一个可复现的交互场景。素材里提到的关键动作有两个:创建一个浏览器游戏,以及用游戏内画面生成预告片。

协调器在做什么

浏览器游戏对AI来说是个麻烦环境。画面在变,操作有反馈,每一步都要根据当前状态决定下一步。Astra 在这里扮演的是协调角色,把任务拆开、把动作串起来。

素材给出的信息很克制:代理完成了游戏,并且用游戏内画面产出了预告片。前者考验的是实时交互,后者考验的是对已有画面的再加工。

78分意味着什么

这条内容附带了一个 AI Screening 分数:78。它来自对这条推文的筛选评估,不是模型跑分,也不是产品评分。

真正值得看的是场景本身。Perplexity Computer 被放进了浏览器这个真实交互环境里,而不是停留在问答框里。素材把它归为"实际代理能力"的体现,标签里也出现了 AI 代理、模型训练与推理。

从"能聊"到"能操作",中间隔着的就是这类具体任务。玩一局浏览器游戏听起来轻松,但它要求系统在动态画面中持续做判断——这正是代理能力最难糊弄的部分。