最近是不是被各种AI Agent搞到头晕?
刚摸明白cursor、try这些编程Agent,转眼Codes、Defy这类工作流产品又冒了出来,还没等搞懂玩法,CodeX、Workbody、小龙虾、DeepseekHoney各种本地Agent又开始轮番刷屏。
现在打开微信、飞书,甚至手机系统,都在弹Agent相关的推送,个个都喊着自己升级了智能能力。
好用是真好用,但每次面对一堆新工具、新名词,那种被技术赶着跑的压迫感,确实让人焦虑。
我把市面上所有主流Agent的能力扒了个底朝天,剥掉所有花里胡哨的包装,总结出一套极简单的3+6万能公式。
只要把这个公式记牢,以后不管出什么新型Agent产品,你一眼就能看穿它的底层逻辑,再也不会被各种技术名词牵着鼻子走。
我是楼兰,关注我,IT路上一起进步。
聊公式之前,先搞懂两个最基础的概念,什么是大模型,什么是Agent。
平时大家常听到的Deepseek V4跑了多少分、Kimi K3能力有多强,这些卷参数卷跑分的产品就是大模型。
但不管大模型能力多强,本质上就是个死板甚至有点死脑筋的文本处理机器,它认识世界的通道永远只有三个,这就是公式里的“3”。
第一个是系统提示词,通常用来给大模型交代聊天背景,比如你要扮演什么身份,要遵守什么规则。
第二个是用户提示词,也就是你发给它的具体问题。
第三个是工具,这也是很多人误解最深的部分。对大模型来说,工具只是一个信息列表,它只知道列表上有哪些工具能用,用了之后会返回什么结果。
至于工具具体怎么执行,是读了本地文件还是调用了外部接口,大模型完全不知道,也不关心。
所以大模型本身的运行逻辑非常死板,你给什么它接什么,不会主动做额外处理。
那些你提一句需求,它就能听懂还能主动干活的产品,比如Workflow Body、CodeX,就是Agent。Agent的本质就是架在大模型之上的一套应用程序,它接收你提的问题,优化处理之后转成大模型能懂的三种信息交给大模型,再把大模型返回的结果拆解成你能看懂的内容反馈给你。
整个过程里,大模型只提供基础算力能力,Agent负责把这些能力包装成你能用的功能,相当于大模型的“对外管家”。
至于Agent具体怎么包装大模型的能力,各家玩的花样再多,也逃不过我整理的六个核心方向,这就是公式里的“6”。
第一个是动态提示词优化。
最基础的玩法是给大模型套人设,你要问技术问题,就让它扮演资深架构师,你要问游戏攻略,就让它扮演满级玩家。豆包早期开放的自定义Agent功能,玩的就是这个套路。
后来用户需求越来越复杂,往往需要很长的提示词才能把规则讲清楚。比如你想让AI把文章的AI味去掉,里面涉及几十条调整规则,总不能每次提问都把规则全部输一遍。
Agent会提前把这些复杂的提示词存成固定模板,只要你触发了对应需求,它就直接把模板内容补充到系统提示词里,不用你每次重复输入。
这种模板化的提示词技巧,就是很多厂商宣传的“skill”,有了它大模型能更快get到你的需求,给出更精准的答案。
第二个是记忆优化。
很多Agent用久了你会觉得它越来越懂你,聊的越多给出的答案越贴合你的习惯,但大模型本身是没有记忆的,你每次发的问题对它来说都是全新的,它根本不知道你们之前聊过什么。
Agent的记忆能力分两种,一种是短期记忆,把你当前窗口的所有聊天记录都存下来,每次提问都附在系统提示词里一起发给大模型,这样上下文就能串起来。
另一种是长期记忆,就算你开了新的对话窗口,它也能记住你之前留下的信息,比如你之前说过自己是互联网行业的产品经理,新开窗口问问题,它会默认用互联网产品的逻辑给你解答。
这里最考验厂商技术功底的是上下文压缩技术,你要是跟Agent聊了一年,聊天记录的体量会非常大,全部塞给大模型肯定撑不住,必须对记录做压缩处理。
压缩策略好的Agent越聊越懂你,压缩策略差的,聊不了多久大模型就会开始答非所问,直接降智。
第三个是外挂知识库。
大模型训练数据再多,也不可能知道你们公司的内部规定,更看不到你电脑里的私密文件。你问它公司最新的报销标准是什么,它肯定答不上来。
这时候Agent会先去你指定的本地或者公司知识库检索相关内容,把找到的对应文档悄悄塞进系统提示词里,告诉大模型这是背景资料,要参考这个内容回答。
这种把外部知识喂给大模型的技术,就是RAG检索增强生成,有了这个功能,大模型就从通用的学霸,变成了懂你具体场景的专属百事通。
第四个是任务推演循环。
我们平时提需求往往非常随意,比如老板甩一句“搞定昨天的数据”,大模型听到这种模糊的指令直接就懵了,根本不知道昨天指的是哪天,要的数据是哪个板块的。
合格的Agent绝对不会把这种模糊问题直接扔给大模型,它会先对问题做补充完善,确认清楚模糊的信息点,再把大目标拆解成一个个具体的小步骤,引导大模型一步步完成。
比如第一步先找对应日期的Excel表格,第二步清理无效数据,第三步生成可视化图表。
这个环节最核心的是任务容错循环,也就是行业里说的Agent loop。Agent要协调每一步的执行顺序,要是某一步出错了,比如写的清理数据代码跑报错了,Agent会把报错日志抓回来补充到提示词里,让大模型自己反思纠错。
不同品牌的Agent,任务循环的逻辑完全不一样,对不同场景的适配度差得非常多,这也是为什么有的Agent做数据分析特别好用,有的写代码更顺手的核心原因。
第五个是本地工具调用。
早期的Agent只能调用搜索引擎、访问网页这类通用公共工具,离用户的具体使用场景很远。后来Agent开始进化,支持部署在用户本地电脑,提前写好操作本地资源的函数,能直接读写本地文件、执行Python代码,甚至控制鼠标键盘操作其他软件。
正是有了本地工具调用的能力,才诞生了CodeX、Looker Body这些非常强的本地Agent,相当于把大模型从远在云端的工具,变成了坐在你身边能直接操作你电脑的助理。
第六个是外部服务调用。
本地工具再强,也没法访问企业服务器里的业务数据,更没法直接用其他平台的功能。为了解决远端接口调用的问题,行业里推出了MCP模型上下文协议,现在调用GitHub的代码、用Figma做前端设计、调用高德地图做路线规划,都有非常成熟的MCP服务可以用。
很多人以为MCP只是个连接外部接口的工具,其实它的架构远不止于此。它把和大模型交互的所有重要信息都做了统一打包,比如企业数据有特殊的格式要求,MCP就定义了Resource资源接口,把内部数据格式统一暴露出去,方便大模型识别调用。
要是企业需要标准的提示词规范,MCP也有专门的提示词接口,企业可以直接把标准提示词暴露给用户,大幅提升使用效率。
MCP走的虽然是传统RPC的技术思路,但协议内容完全是按照大模型的使用逻辑做的优化,适配性要高很多。
把这层窗户纸捅破你就会发现,Agent的世界其实非常简单。不管产品叫什么名字,宣传得多么高大上有颠覆性,底层全是大模型的三个信息通道,上面叠加的全是这六个核心能力。
以后再看到什么吹得神乎其神的AI新产品,你直接拿这个3+6的公式去套,马上就能看穿它的底层逻辑,再也不会被那些花里胡哨的技术名词忽悠,也不用焦虑学不过来了。
其实翻过来想,Agent的发展逻辑也不是什么新东西,以前行业是围着数据库、缓存、搜索引擎这些数据处理能力挖产品需求,现在只是把核心底层换成了大模型的三个基础能力,再去挖对应的应用场景。
不管技术怎么变,夯实基础能力,深挖实际需求,永远是行业的核心逻辑,也是我们普通人跟着行业成长的正确方向。
热门跟贴