屏幕上的鼠标在动,坐在电脑前的夕小瑶却没碰它。它点错过一次,退回去,又点对了。“和我自己找文件的样子几乎一样,只是慢一点。”这是她测试豆包工作(字节跳动的AI应用)升级后的第一感受。
这次升级带来两个核心能力:多Agent并行和工作流直接操作电脑。她以更换Mac mini为真实场景,把硬件配置调研任务拆给四个子Agent,分别负责配置查询、性能评估、配件方案和价格对比。四路调研在同一时间并行推进,主Agent汇总时识别出三条信息矛盾:M4是否在售、方案依赖价格是否成立、M6未发售无实测数据。它没有直接拼接,而是以苹果官网为准给出裁决,最终生成一套11596元的完整预算方案。
跨软件操作:一次完成三处系统设置
第二部分测试的是为老人配置Mac的跨软件操作。调整显示分辨率、放大指针、设置Safari主页——这三项改动分散在系统设置和辅助功能的不同层级里。豆包工作通过屏幕视觉识别,在飞书邮箱里直接写入收件人、主题和正文,插入截图附件存为草稿;随后又完成系统设置里的多项调整,全程不需要人工介入。
作者评价,以前对AI干活的想象,是把东西喂进对话框,它把结果吐回来。中间那段真正花时间的动手操作——翻网页、切窗口、改设置、一条条填表——还是得自己来。现在这一整条链路由AI接手,效率翻倍。
脚本路径受阻,GUI路线反而顺畅
最后一部分测试自动定时发布南亚新闻日报微博。七条微博全链路完成,但中间图片上传遇阻。一开始采用脚本路径失败后,切换到原生GUI(图形用户界面)路径顺利解决。作者认为,“这要是只拿写好的网页脚本来跑,逻辑真要复杂很多。”
这个对比值得注意:多Agent并行适合多维并行调研,但在单步执行任务上,不一定胜过原生GUI路径。两种路径各有适用场景,取决于任务本身是“多路信息收集”还是“单线操作执行”。
从对话助手到流程接管者
这次实测最深的印象,是屏幕上的鼠标在动而自己没碰它。产品定位正在从对话式助手转向流程接管型工作流助手——AI不再只是把结果吐回对话框,而是把中间找资料、切窗口、改设置这些动手活儿一并接手。四路调研并行时,作者不用干等,也不用盯着谁先谁后。
当然,这仍是产品功能体验层面的验证,不涉及技术原理解读。豆包工作能否在更复杂的办公流程中稳定接管,还需要更多场景检验。但至少在这个测试里,AI Agent在实际办公流程中的可用性,已经迈过了“能看不能用”的门槛。
热门跟贴