“这个中秋,我让 GPT-6 接管了我的微信。”傅盛在分享中这样开头。他让模型通过视觉交互连续执行了数千步操作,完成了两项任务:为 50 位同事撰写并发送个性化祝福,以及逐条回复收到的 70 多条祝福。

整个过程涉及 120 多条消息,没有出现失误。这个数字放在半年前几乎不可想象——那时 AI 操作电脑极易出错,点错按钮、中断流程是常态。

没有接口,只能靠“看”和“点”

这次操作最值得注意的地方在于:GPT-6 并没有微信的 API 接口可用。它依靠的是视觉反馈(截图)和动作执行(点击),一步步推进任务。

也就是说,模型需要自己看懂屏幕上的内容,判断下一步该点哪里,执行后再通过新的截图校验结果。这套感知、决策、执行、校验的闭环,正是以往 Agent 最容易断链的环节。

傅盛提到,这次连续运行了数千步。长程任务执行中,任何一步出错都可能导致后续全盘偏移,而这次没有出现以往那种中断或点错的问题。

个性化祝福背后的社交语境

任务本身也不只是机械操作。为 50 位同事逐一撰写个性化祝福,意味着模型要处理具体的社交语境,而不是套用同一句话群发。

傅盛在分享中提到,接近一半同事回复说感动。这个反馈说明,接收方感受到的是针对自己的表达,而非模板化的节日问候。

从生成文本到独立执行,这次尝试完成的不只是“写出来”,而是把感知、决策、执行、校验串成了一个完整闭环。AI 从辅助工具向独立执行者的转变,在这个场景里有了具体的样本。