年初,我让AI助理“三万”给611位同事拜年,4分钟发完。那篇文章,很多人看过。

打开网易新闻 查看精彩图片

这个中秋,我又干了一次。

这次,我给50位公司骨干发了祝福,还把收到的70多条中秋祝福,一条条都回了。

人数比年初少,我却觉得,这次更值得写。

因为这次,AI直接操作了我的微信。

年初那套办法,放到微信上根本走不通。半年过去,它走通了。

它在电脑上找人、看聊天、问我背景、写好祝福让我确认,我说“发”,它才发。

一个下午,GPT-6连续干了好几个小时,这一百多条祝福和回复,全部弄完。

打开网易新闻 查看精彩图片

能一口气干好几个小时不掉线,这件事本身,就是大模型最重要的进步之一。

后来,一位同事回复我:“感谢老板的认可,感动老板的文艺。”

我看着这句话,觉得挺有意思。

文艺可能是AI帮的忙。但认可,是我的。

每到过节,微信就是一场“债”

先说一个很多人都有的痛点。

每到中秋、春节,早上一打开微信,几十上百条祝福涌进来。有同事,有合作伙伴,有老朋友,也有很久没联系的人。

人家认认真真发来一段话,你总不能不回。可一条条回,根本回不过来。

回个“同乐同乐”,自己都觉得敷衍。想认真回几句,每条打几十个字,回到第十条就累了。

打开网易新闻 查看精彩图片

更尴尬的是反过来。

我心里有一些人,特别想在节日跟他们说几句。可消息一多,一忙,一乱,想发的人就忘了发。等想起来,节已经过完了。

一边是回不过来,一边是想发的忘了发。

我的微信联系人有一万人,很多工作、合作,还有这么多年积累的关系,都在里面。节日本来是一个说说心里话的机会,结果每次都变成了一场还不完的债。

这个中秋,我想让AI帮我把这笔债还上。

微信到底难在哪

用过飞书、钉钉这类办公软件的人可能没感觉,但微信是出了名的封闭。

年初那次拜年,三万走的是飞书API。API可以理解成软件留给程序的办事窗口:告诉它发给谁、发什么,它按规则执行。拉通讯录、发消息,都有正门可走。

至少有三道墙。

打开网易新闻 查看精彩图片

第一道墙:没有接口。

企业微信有开放接口,公众号有开放接口,但个人微信没有。你想让程序帮你发一条消息,没有正门。

第二道墙:聊天记录读不了。

你电脑上的微信聊天记录,存在本地,但是加密的。文件就在你自己硬盘上,你却打不开。

第三道墙:屏幕不让看。

这是这次让我最意外的一道。

你眼睛明明能看到微信,系统截图却抓不到主窗口,截出来一片空白。换一种读取界面的方式,也只能拿到几个窗口按钮,读不到聊天正文。

微信连系统截屏都防上了。

没有接口,读不了记录,还看不了屏幕。一个外部程序想碰微信,基本三条路全堵死了。

微信为什么这么做

说实话,我能理解微信为什么这么做。

十几亿人的社交网络,一旦对自动化工具门户大开,最先涌进来的不会是给同事写中秋祝福的人,而是营销号、群发机器人、诈骗脚本。封闭,是在保护用户,也是在保护它的生态。

做了这么多年互联网,我太明白一个平台守住边界的价值。

但换到用户这一边,感受就完全是另一回事了。

关系是我的,聊天是我的,多年积累的人脉也是我的。可我想整理一下,想给重要的人认真写几句话,想把收到的祝福好好回一遍,全都只能自己手动点。

打开网易新闻 查看精彩图片

一个个搜索,一个个点开,一个个翻聊天记录,一个个打字。

在一个AI已经能写代码、做分析、管日程的时代,我在微信里做的,还是十年前的手工活。

生态保护得越好,用户的手就越累。

这不是谁对谁错,而是一个真实的矛盾。这次,我想看看AI能不能在不破坏规则的前提下,帮我把这些手工活接过去。

AI是怎么“看见”的

这次用的是GPT-6,跑在Codex这个Agent工作环境里,调用电脑操作工具和本地脚本。可以理解成“三万”这个私人助理方向的一次升级尝试。

最先卡住的,就是那道屏幕的墙。AI看不见,后面的事就都无从谈起。

它试了好几种办法,都被挡了回来。

最后,它自己摸索出一条路:用微信自带的截图功能。

微信防的是外部工具,不会防自己。AI调起微信截图,像人一样框选、查看,再配合系统的窗口捕获,终于拿到了可读的画面。方法跑通之后,存成技能,下次直接用。

打开网易新闻 查看精彩图片

这个办法我没教过它,也没有现成的教程,是它自己一步步试出来的。

我觉得这一幕特别能说明问题。

它没有去解密聊天记录,没有去破解什么协议,也没有调用什么灰色接口。它做的事,和我坐在电脑前做的一模一样:打开微信,截个图,看一眼,点一下。

一个软件专门设了门槛防机器,AI最后过去的办法,恰恰是像人一样用这个软件。

用的是我自己的账号,发的是我认可的话。这和群发机器人,完全是两回事。

看清画面只是第一步

搜一个名字,结果里可能同时有联系人、群和聊天记录。有的人还不止一个账号。它得选对结果,打开以后核对身份,不能看到名字相似就发。

还有个很烦的细节:截图时看到了搜索结果,退出截图,那个浮层可能收起来了。按刚才的位置点下去,点到的已经是别的东西。

它必须知道界面变了,恢复搜索,再继续。

打开网易新闻 查看精彩图片

发消息也一样。文字放进输入框,要核对正文;发出去以后,要检查消息气泡和失败标记;做完一个人,还得留下记录,避免中断恢复后重复发送。

这些都是人做起来不用过脑子、机器做起来步步是坑的事。

给同事:一人一段,我点头才发

给同事发祝福,我先定了一个机制。

目的只有一个:每个人收到的祝福,都不一样。

我给了它一个群名:Weekly Meeting。里面是猎豹及子公司的中层和高管。

然后它就一个个来:找到一个人,先问我,这个人现在做什么?我对他有什么期待?我讲完,它帮我写好,把完整的文字发给我看。我确认了,说“发”,它才发送。

发完核对,存档,再找下一个。

打开网易新闻 查看精彩图片

我的输入,通常很口语化。

这个人跟了我十几年。当年公司要去一个新城市建研发中心,他主动站出来。现在做AI,我希望他敢想敢拼,再焕发一次战斗力。

那个人最初做的只是一个普通岗位,后来一步步成长起来,成了能帮我管好一大摊事的“大管家”。我最想感谢的是他的踏实和勤勉。

还有年轻同事,从基础工作做起,慢慢能独当一面。别人看到的我发的视频,我知道背后有他很大的付出。

给一位最早和我创业的伙伴,我讲了很多年前的事。那时他不太会做界面,但能写解决具体问题的专杀工具。我说,那就先把有用的东西做出来,发出去。这么多年过去,他又回来和我一起做机器人。

有时前面说完,后面我又补一句:对了,我们平时不这么叫他,要用这个昵称。语音输入法还经常把人名、公司名转错,我也会着急:结合前后文理解一下,别每个错别字都重新问我。

AI要做的,就是把这些零散的话理清楚:感谢说到哪里,期待怎么表达,哪些适合写进节日祝福,哪些不适合。

真正的个性化,不是换几个形容词。同一个中秋,有人在家团圆,有人在海外打拼;同一个名字,通讯录知道,但只有我知道平时怎么叫他。这些,只能由我来讲。

我提供真实的经历、感情和判断。AI负责组织语言、操作软件、保存资料。

整个过程,它问,我讲;它写,我看;我点头,它发。我不用坐在电脑前。

一个下午,几十条就发完了。

要是我自己一条条去找人、翻记录、想开头、敲字,这几十条可能得搭进去好几天,而且大概率写到一半就被别的事打断了。

这次省下来的,不只是时间,还有那份最耗人的精力。

收到的祝福:一条一条,都回了

给同事发完,我又让它干了另一件事:

把我收到的70多条中秋祝福,全部回一遍。

这件事,以前我是真做不到。

祝福太多,回不过来,很多就那么搁着了。心里其实挺过意不去的,人家专门发来的,我连一句像样的话都没回。

这次,它一条条打开,看对方发来的是什么,也看看我们之前聊过什么,再根据上下文,给每个人写一条回复。

打开网易新闻 查看精彩图片

合作伙伴发来的,回复里带上我们正在做的事;老朋友发来的,语气就随意一点;人家写了一大段真心话,回复也不能只有四个字。

这些回复,我就放手让它自己写了。

它看得见对方说了什么,也知道我们是什么关系。以前那些“回不过来、没法回”的祝福,这次70多个人,每个人都收到了一条专门写给他的回复。

每条打几个字,放在以前,光这件事就能把人累死。现在,我不用守着电脑。

AI写的祝福,有没有诚意

我觉得应该先问:这段话,到底是不是你想对这个人说的?

如果我只给AI一句“写五十条中秋祝福”,它输出五十段漂亮的套话,那当然很难让人感动。

但这次,每个同事背后的故事是我讲的。我记得他的付出,知道他的压力,对他的未来有期待。我逐条看过,觉得说到了心里,才让它发。

最后这些字是我亲手敲的,还是AI帮我组织的,真的有那么重要吗?

那位回复“感动老板的文艺”的同事,我在祝福里提到,遇到事情时他愿意为公司站出来、扛起责任。这是我确实想感谢他的地方。

这条回复至少让我看到,他接收到了这份认可。

打开网易新闻 查看精彩图片

发完这些祝福,我在朋友圈记下了当时的感受:接近一半人回复说感动。

我还专门解释了一句:

我坦诚地说不是我一个字一个字敲的,但的确是我一点一点描述的。大家都很理解,依然感动。

这其实回答了那个最直接的质疑:对方知道是AI帮忙写的,还会感动吗?

至少这次,我看到的是理解。大家在意的,是那些具体的付出有没有被看见,是我想说的话里有没有他。

所以那条朋友圈最后,我写了两句:

所以AI只是手段, 和键盘一样。

打开网易新闻 查看精彩图片

键盘替我们把话打出来,AI还能帮我们把话理好。这段话有没有意义,取决于我到底想对这个人说什么。

很多人心里有真实的感情,却因为忙、因为不擅长表达,一直没说出口。现在AI降低了表达的成本,这些话终于有机会送到对方那里。

大半年过去,模型到底进步在哪

拿年初那次拜年做个对照,就很清楚。

年初给611人发消息,我们定过一条铁律:所有批量操作必须写成脚本执行,不能让大模型“想着发”。

因为测试过,它有时跟你说发了,其实没发。任务一长,讲到后面就忘了前面。

所以那次,模型负责写文案、写脚本,真正干活的是脚本。飞书接口很规矩:给名单、给内容,按顺序跑完。模型更像一个会写代码的秘书。

这次,微信没有接口,没法把活全甩给一段脚本。每一步都得模型自己盯着。

我感受最深的,是三个变化。

第一,也是进步最大的:长程任务里的电脑操作能力。

先说说AI操作电脑,到底在干什么。

人用电脑,看一眼、想一下、点一下,根本不过脑子。AI不一样,每一步都得完整走一遍:

1.截图:先把屏幕拍下来;

2.看懂:从画面里认出文字、按钮、联系人、聊天内容;

3.判断:现在在哪个界面?刚才那一步做成了没有?

4.规划:下一步该点哪里、输入什么;

5.执行:点下去,然后回到第一步,再截图确认。

业内把这叫Computer Use,电脑操作能力。看、想、做、再看,一圈接一圈,形成一个闭环。

而把这个闭环连续跑几个小时、几千圈不出错,就是现在大家最看重的长程任务能力(Long-horizon Task)。

打开网易新闻 查看精彩图片

这两个能力,我觉得是今天顶级大模型之间真正拉开差距的地方。

回答一个问题、写一段文字,现在很多模型都做得不错。难的是,给它一件要干几个小时、中间有几百个意外的活,它能不能从头干到尾,而且干对。

半年前,让AI操作电脑,两三步就会停下来,或者点错地方。

它可能截完图看错了按钮,可能忘了自己刚才做到哪,也可能干到一半说一句“已完成”,其实根本没做完。所以年初给611人拜年,我们才定下那条铁律:长任务必须交给代码,不能让模型自己“想着发”。

这次,它操作了几十个人,没有一个出错。

50位同事,每一位都要搜索、选对结果、核对身份、翻聊天、问我背景、写稿、等我确认、输入、发送、检查气泡、存档;70多条收到的祝福,每一条都要打开、读懂、结合上下文回复。加起来一百多个人,几千个操作步骤。

截图时看到了搜索结果,退出截图浮层就没了,它知道界面变了,重新搜;同名的人不止一个,它会点进去核对,不会看到名字像就发;每发一条,它都去看消息气泡和失败标记,确认真发出去了才记一笔。

前后持续了好几个小时。中间被我打断、被我改要求、被电脑锁屏打断,回来都能接着往下做。哪些人已确认,哪些等我看稿,哪些已经发了,哪些不是好友没法发,它心里一直有一本账。

从“两三步就停”,到“几千步不错”,这是半年里我感受最直观的进步。

这就像招人。面试时聊得好的人很多,能独立把一个项目从头扛到尾的人,才是真正的骨干。

第二,碰到专门设的门槛,它自己找路。

微信防系统截屏,截出来一片空白。它换了几种办法都不行,最后想到用微信自带的截图:防外部工具的门,挡不住软件自己的功能。

打开网易新闻 查看精彩图片

年初,飞书权限不够时,它也会调整策略。但那是在规则清楚的接口里找路。

这次,是在一个故意不让机器进来的环境里,自己试出一条“人走的路”。

第三,它更听得懂人话,也读得懂上下文。

打开网易新闻 查看精彩图片

年初,25位骨干的背景,是我挨个整理好告诉它的。

这次我想到哪说到哪,前面讲完,后面又跳回来补一句昵称;语音转错了人名,它结合上下文自己猜对;我中途加的要求,它会落实到后面每一个人。

回复收到的祝福,更是全靠它自己读上下文:对方是谁,说了什么,我们之前聊过什么,该用什么语气。

用一句话总结:

年初,模型写脚本,脚本干活。这次,模型自己上手,连续干了几个小时,脚本成了它手里的工具。

模型聪明只是一半

另一半,是Agent能不能长期用。

我反复催它:等我确认这一位时,继续准备后面的人,别干等。已经打开的聊天接着用,别每次重新搜。解决过的截图问题存下来,别反复从头研究。

打开网易新闻 查看精彩图片

电脑操作要花时间,模型看画面、读上下文也要消耗token。每处理一个人都重新加载全部历史、反复截同样的图,再聪明也会慢,也会贵。

所以我们的方向是:常规查找和去重交给本地程序,每次只读相关档案;模型把精力放在理解新信息、判断和表达上。用过的方法留下来,下次复用。

原来必须我守在电脑前一个个做的事,现在我只需要讲背景、做判断,剩下的交给Agent。

收比这几十条消息更值得期待的

以前过完节,祝福发完,这件事就结束了。下个节日再来一遍,还得从头回忆。

这次我专门要求:我告诉你的这些背景,要认真存下来。别只存一个职位,下次又让我重新讲。

于是,称呼、职责、共同经历、我确认过的信息、这次的交流和发送状态,开始形成一个个本地联系人档案。

你看,微信的聊天记录是加密的,我读不了。但我讲给AI的这些故事,存在我自己手里。

我想做的微信助手,就从这里开始。

一万人的分类,不必先变成一个浩大的整理工程。每次真要跟一个人沟通,就多了解一点、多记住一点。每用一次,下一次就更省事。

下一个节日,想发的人不会再忘;收到的祝福,也不会再搁着。

以后准备去一个城市,可以先找出有相关背景、适合约见的人。遇到一个业务问题,可以问问我认识的人里谁做过类似的事。到了重要的日子,能根据已经确认的经历,写一段真正合适的话。

我越来越觉得,私人AI助理的价值,是在这样的持续使用里攒出来的。

打开网易新闻 查看精彩图片

它慢慢了解你的工作,也了解你的表达习惯。你纠正过的称呼,下次不用再纠正;你讲过的故事,下次沟通时能找回来。

年初,611条飞书拜年消息,让我看到AI助理能把一个项目做完。

这个中秋,50条祝福、70多条回复、几个小时不间断的工作,让我看到它开始走进我的日常:那些没有接口、甚至专门防着机器的软件,那些零散的操作,那些只有我自己知道的关系和经历。

平台的墙还在。但AI学会了像人一样,从门口走进去。

我说起一个人。AI把这段话整理好,等我点头,再送到他那里。

我心里记着的人,终于有更多机会知道:我一直记着。