打开网易新闻 查看精彩图片

作 者 | 罗辑(九卦金融圈专栏作家)

来 源 | 九卦金融圈

打开网易新闻 查看精彩图片

工具离我们越来越近,行业里的体感却始终差着一口气。问题不在买没买卡,而在于:我们是按“上一代 AI”的思路,在部署“这一代 AI”。

打开网易新闻 查看精彩图片

走近了:它终于学着干活了

要说大模型离我们近还是远,得看跟谁比。

跟几年前比,那是真的近了。当年 ChatGPT 引爆热潮的时候,大家的第一反应是惊叹,第二反应是茫然——东西是好东西,可怎么用到自己的活儿里?提示词怎么写、工具怎么接、流程怎么串,每一步都要自己摸索。那时候的大模型像个摆在橱窗里的展品,看得见,摸不着。

现在不一样了。豆包、WorkBuddy 这类成熟应用,把能力打包成了一个个可以直接使唤的“智能体”:写代码的、写材料的、做数据统计分析的、读文件画图的,打开就能用。你不用懂模型,也不用懂提示词,把活儿交代清楚就行。大模型第一次从“一个技术名词“,变成了“一个能接活的工位上的同事“。

光是这一点,就值得说一句:大模型离我们,确实近了。

打开网易新闻 查看精彩图片

可一到行业里,就“叫好不叫座“

近归近,但把它拉到自己单位里干真活,味道就变了。这个问题在金融行业尤其明显。

翻翻最近各家银行的半年报、行业论坛和发布会,数字一个比一个亮眼:用了几十亿、上百亿的词元(token),上线了多少个智能体,落地了多少个场景,替代了多少个人工环节。每次听完都觉得,金融业已经站在 AI 之巅了。

可真到基层问问,体感完全是另一回事。一线的业务人员、基层的管理者,普遍没什么获得感——不是说没用,而是“没宣传的那么好用”。

更耐人寻味的是 AI Coding 的用法:有的团队是在外部先把整体构思和主干代码跑出来,再拿回行内做细化和落地;有的是在内部搭好设计,再拿到外面去检查、优化,然后回来继续细化。来回折腾的背后,说白了就是一句话:内部的这套,还不够撑起整件事。

数字很漂亮,体验很一般。这就是所谓的“叫好不叫座”。

打开网易新闻 查看精彩图片

差在哪:不是“团队不强”,是“配置不对“

要回答这个问题,得先看清现在成熟的用法到底长什么样。

今天跑得通的模式,不是“一个大模型包打天下“,而是“智能体 + 大模型“的组合。打个比方:

大模型,是一个个专业团队——有擅长文字的,有擅长写代码的,有擅长画图的,有处理音频的,有处理视频的。每个团队各管一摊,专业能力越扎实,交出来的活儿质量越高。

智能体,是这个团队的项目经理——它负责把一件事拆开,派给合适的团队;团队交回来的东西,它要判断行不行、要不要返工、要不要再细化一遍;最后所有碎片回来,还得由它整合、串成一件完整的交付物。

这个组合里,两边缺一不可:专业团队不行,项目经理再会调度,也交不出好活;项目经理不行,专业团队再强,最后也是一地鸡毛——任务拆错了,返工没人拦,碎件拼不到一起。

看清这层关系,行业落地的症结就清楚了——不是一头出了问题,是两头都有欠缺:大模型的专业能力不够扎实,智能体的综合能力也跟不上。

打开网易新闻 查看精彩图片

为什么会两头都缺?因为我们还在用老办法养新东西

症结找到了,就得问一句:为什么会这样?

我的看法是,问题出在思路上——我们今天部署大模型,用的还是上一代 AI 的那套路数:封闭部署、自己买算力、拿个基模回来独立训练、自己迭代。

这条路,搁在以前是通的。以前搞 RPA 机器人、搞规则引擎、搞传统的 AI 应用,逻辑清楚、边界明确,自己关起门来就能做明白。但大模型不是这一类东西。大模型的下限,是被三件事钉死的:

  • 参数量——决定了它能装多少知识,容量不够,再训也白搭;

  • 数据量和数据质量——决定了它训出来到底是聪明还是糊涂;

  • 能力项的多少——决定了它能接住多复杂的活儿。

而行业自建的现实是什么呢?算力就那么多,参数量不敢上大;受合规约束、内部数据分散又陈旧,数据样本少、质量也不高,外部数据还不敢随便往里补;训练目标往往只盯着一两项技能,是单向的,不是多项的。三样全都打折,训出来的专业能力自然就缺斤短两。

反过来看看互联网企业是怎么做的:算力规模摆在那儿,一批人日夜做模型迭代,不断增加参数、不断扩充数据、把各类知识持续往里喂。结果是,它们的大模型“能力项”越攒越多。 银行自己训的模型可能只会生成一张报表;而外面成熟的大模型,除了写材料,还能做文字理解、跑代码、画图表、处理音视频。

能力项多,到底重要在哪?因为真实的工作从来不是单一动作。 你说“给我搬个凳子”,这是个单一动作,一个动作就完了;你说“把屋子打扫一下”,这里面有搬桌子、有擦地、有整理物品,是一件复合的事。

而智能体的工作方式,恰恰是把一件复合的工作拆成一串专项任务,再派给大模型去做。这就同时提出了两个要求:一是智能体要把流程拆得准、排得顺;二是大模型的专业能力必须是多项的——少一项,链条就断一环,最后一件事就是办不成。

偏偏行业里这两样都缺:

  • 大模型这边:训练是单向的、参数量上不去、知识储备少、行业数据也不足,通用能力天生偏弱;

  • 智能体这边:一个好“项目经理”是要养的——要有人不断设计任务流程、不断补充场景经验、不断纠偏。可行业内的团队总共就那么些人,自我迭代能力、自我学习能力、记忆能力,全都跟不上。

再说得形象一点:让机器人去跳舞、去打一套武术,它做得很好,因为那是固定动作;可一旦离开预设动作,它就会出现风险和失控。用带着单一性的东西去承接一件综合性的事,出错几乎是必然的。

所以我的态度很明确:如果沿着“什么都要自己关起门来造”这条路继续走下去,很可能投入越多、效果越差。 数据不出域是硬约束,尤其金融行业,这一点没有商量的余地;但不能因为数据不能出去,就把整条技术链都锁死在里面。

打开网易新闻 查看精彩图片

那该怎么走

我不是说行业不该自建,而是说自建要有边界。几个不成熟的想法:

一是分清什么该自己做、什么不该。数据安全、业务逻辑、行业Know-how,这是金融机构必须攥在手里的,谁也替不了;但通用能力——理解意图、多轮推理、工具调用、多模态处理——没必要、也没可能从头再造一遍。更现实的架构是:成熟的通用能力底座 + 自己的专业知识 + 自己的场景编排。

二是别再用“消耗了多少 token”来衡量成败。消耗得多只能说明跑得多,说明不了干成了多少。真正该盯的是三个数:一件事端到端的任务完成率、被打回来的返工率、非要人插手的人工介入率。哪个智能体真好用,这三个数一摆就清楚了。

三是把“能力项”当成一张清单来补。与其继续堆算力、堆数据,不如老老实实盘一盘:我的智能体能调用几种能力?缺的是画图、算数,还是读文件?缺哪补哪,比盲目加训练有用得多。

四是舍得在“项目经理“身上花钱。行业里最缺的往往不是模型专家,而是既懂业务、又会编排智能体的人——能把一件事拆明白、能把拐弯抹角的流程理顺、知道什么时候该让 AI 停下来问一句。这种人才,才是智能体落地真正的瓶颈。

打开网易新闻 查看精彩图片

06 写在最后

回到开头的问题:大模型离我们近了,还是远了?

我的答案是:工具已经很近了,真正的智能还很远;发布会上的数字很近了,工位上的体感还很远。

说到底,大模型不会因为一家机构买了多少卡、训了多少个token,就自动变得好用。它真正走近我们的标志只有一个——基层用的人愿意用、觉得好用、离不开。

在那之前,我们都还在路上。而路上最大的障碍,恰恰不是技术本身,是我们部署它的方式。

文中数据参考了近期多家银行半年报及行业论坛的公开披露。配图由AI制作

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片