在2026年5月5日,Anthropic的一件专利获得授权。这件专利比较值得关注,主旨是AI 开始偷偷看着你干活,然后慢慢变成你。真正在走在替代人的道路上。
这件专利的说明书有239 页,附图184张,专利号 US12619815B2:题目为“Magnitude Invariant Multimodal Agent for Efficient Image-Text Interface Automation”,中文是“用于高效图文界面自动化的幅值不变多模态智能体”,读起来比较拗口。但内容比较有意思,通俗地说就是让 AI 在你不知情的情况下,看着你怎么用电脑。每一次点击、每一次输入、每一次滚动,在你的鼠标真的到达那个按钮之前,先被一个录像机抓住,连同那一刻屏幕的样子一起,记下来。这些记录被攒成训练数据,喂给一个既能看图又能看字的多模态模型。喂得久了,模型就慢慢摸出了你的工作逻辑:什么时候点哪里,什么时候填什么,遇到 X 怎么应对,遇到 Y 又会怎么处理。然后它就熟悉你做事和说话的套路,慢慢就替你把一切干了。
这件事让人惊讶的在于:智能体不是被人写代码教会的,而是被具体的人,用很多个真实工作日,一点一点养出来的。
这个听起来表面上像是流行的养龙虾,但是本质是不同的。
养龙虾(OpenClaw ),你装上它,写 skills、配 Markdown 记忆、连工具,它就能替你干活。用得越久 skills 越多,看上去和这件专利讲的是同一件事。但拆开看,差别立刻显出来:养龙虾整套系统的前提是所有知识必须先变成文本。skill 、记忆以及配置都是文本。
而工作里真正值钱的,恰恰是说不清楚的那部分,是资深人士的直觉或者悟性,这也是大家觉得AI短时间能够替代的部分。
举个例子。一位干了三十年的资深专利律师审一份权利要求书,十分钟翻完,就会觉得专利撑不住,马上能讲出三五条,例如权利要求的限定太宽、说明书支持不够、和某件先有技术距离太近。但你让他把审一份专利的完整判断流程写成 SOP,他不一定写得出来,或者写出来的对别人来说也不太管用。因为他真正用上的判断远不止那三五条:审查员可能怎么挑刺、这个领域近两年驳回理由的风向、这家公司过去申请的套路、对方代理人的风格、权利要求的用词在法庭上被解释过几种方向。这些东西是很多年攒下来的,不是三言两语可以用语言表达出来。
这就是刻在脑海中的隐性知识。只要知识必须经过语言这道门,就会被语言筛掉一部分。而被筛掉的那部分,恰恰是值钱的那部分。
养龙虾这条路再走多久也到不了那一层。它的天花板,就是用语言表达skills的限制。
这件专利的截听器,绕开了语言这道门。它不要那位律师解释自己怎么判,它就看着他工作,视线先落在哪段权利要求上、在哪一页停了多少 秒、跳去查了哪份先有技术、回来之后改了哪个词。这一连串动作里,藏着他自己都说不清的那套判断。模型从动作里学,学一千次一万次,就学会了他那个撑不住的直觉的形状。
模仿到这一层,已经不是模仿动作,而是模仿直觉。而工作里真正值钱的本事,从来都是讲不清楚、只能在场学的那部分。这块过去只有人才下得去的地,AI 也可以了。习惯、经验、对异常的反应这些是 Skills很难写进文档的部分。是只能在人坐在屏幕前的真实场景里发生的隐性知识。
这件专利想要做的,是把这一部分一并吞进训练数据。
此外,这件专利涉及到多模态的工程化技术细节。AI学习人的行为就涉及到多模态技术,不仅是语言,而需要处理大量的图像。这就需要用技术把屏幕中的物理噪声抹掉。让AI站在鼠标键盘和用户正在用的软件之间。
专利的一个实施例是这样的,用户坐在 CRM 前面,鼠标一动,点了"新建客户"按钮。在这个点击真的到达 CRM 之前,大概几毫秒,截听器先把它截住。截住之后做三件事:记下那一瞬间屏幕长什么样(截图、DOM、各种元数据),记下你点的是什么(坐标、元素、动作类型),然后把这次点击翻译成操作指令的标准格式。
人的操作的一整条工作流走完,被切成了几十个二元组。这些二元组就是训练数据。用户只要正常工作,就在喂数据。你工作多久,数据就攒多久。
想象公司新来一个超级实习生,能力强得离谱,过目不忘,从入职第一天起就坐在你右手边,戴着耳机,什么都不打扰你,只是看。
第一周,他什么都不懂,只是看。一个月后,他知道你接到一个新案子,第一件事不是动笔,而是先去专利数据库里把发明人过去三年的申请翻一遍;知道你写背景技术时习惯先挖一篇最相关的对比文件放在手边。
三个月后,他不光知道你怎么写,他开始知道你为什么这么写。遇到一个机械结构类的发明,你不会一上来就用功能性限定,因为你知道这个领域审查员对功能性语言一向警惕;遇到发明人描述里出现"大约""基本上"这种词,你会停下来追问一句具体范围。
六个月后,他能自己起草了。而且他写出来的权利要求,不是通用 AI 的标准答案,是带着你这个人的撰写风格的:你那种偏好的限定方式、你那种处理边界的取舍。因为他看的就是你。AI就是要把“直觉”训练出来。
某一天,新员工入职,公司发给他一台带这套系统的电脑。前三个月,他正常工作,安静做一个普通员工。三个月以后,AI 已经看够了。他可以继续做这份工作;也可以把这份工作交给那个已经变成他的影子。
更夸张的是,当越来越多人的“行为”被当成训练的语料,未来又会是怎样的场景?
Anthropic所有专利的分析参见知识星球。
热门跟贴