几年前,用AI做产品基本只有一种形态:把数据丢给模型,拿回一个预测结果,然后在外面套一层产品壳。那个世界已经显得很旧了。

现在可以给一个AI系统设定目标,把它接到工具上,让它读文档、写代码、查数据库、调接口、检查自己的输出,然后继续往下干,中间不需要人盯着每一步。

打开网易新闻 查看精彩图片

但系统越跑越顺,最难的问题反而越清楚:下一阶段的AI,不取决于谁的模型最大,而取决于谁能把AI做到足够可靠,让它真正变成基础设施。

从聊天框到系统,架构变了

第一代AI产品的路径很短:用户→提示词→模型→回答。

下一代产品的路径长得多:用户→目标→智能体→工具→记忆→接口→其他智能体→验证→结果。

这个差别比看上去大。一旦AI能动手而不只是回答,软件架构就得跟着改。

一个AI编程助手可以检查代码仓库、建分支、改好几个文件、跑测试、发现报错、自己修、然后提交合并请求。一个财务智能体可以分析交易、比对风控规则、生成报告、让另一个模型来校验,再把结果送进已有的工作流。

AI真正变强的地方在这里,开始出问题的地方也在这里。

问题一:可靠性

幻觉经常被当成模型自身的问题来讨论。它正在变成一个系统设计问题。

如果AI只是在聊天里偶尔写错一句话,损失有限。但如果一个自主智能体更新错了数据库、调错了接口、改了生产环境的代码、或者把财务信息理解错了,后果完全是另一回事。

开发者需要系统能回答几个问题:

  • 模型用的是正确的来源吗?
  • 这个动作真的执行成功了吗?
  • 结果被验证过吗?
  • 操作可以回滚吗?
  • 这一步需要人来批准吗?

能赢的AI应用,里面传统工程的比例会比人们预想的高得多:校验层、确定性规则、审计日志、权限、测试、重试、降级、回滚机制。模型可以很聪明,围着它的系统仍然需要纪律。

问题二:记忆

现在的AI经常聪明二十分钟,然后忘性大发。长期记忆会改变这一点。

可以想象一个工程智能体,它不仅懂你的代码仓库,还记得六个月前某个架构决策为什么那么做。或者一个业务智能体,记得之前的谈判、公司偏好、被否掉的方案、客户反馈和运营规律。

但记忆本身带来工程难题:什么该记?什么该过期?旧信息变得不正确了怎么办?怎么防止私有数据泄漏到另一个工作流里?

把所有东西一股脑塞进向量数据库,并不是完整答案。需要更好的记忆架构,把短期上下文、结构化事实、语义检索、权限、置信度和时间感知的信息组合起来。

问题三:评估

这可能会成为AI工程里最重要的领域之一。

传统软件给人一个舒服的假设:输入A应该产出输出B。AI是概率性的,两次运行可能给出不同答案,而且两个看起来都合理。这让测试难得多。

很快,团队需要在CI/CD流水线旁边配上AI评估系统。部署一个智能体之前,可能要跑几百上千个场景:

  • 任务完成了吗?
  • 用对工具了吗?
  • 花了多少步?
  • 成本多高?
  • 有没有暴露敏感信息?
  • 另一个模型能验证结果吗?
  • 它在哪里失败?

未来的AI工程师,花在评估上的时间很可能远远超过写提示词。

问题四:成本与延迟

每一个惊艳的AI演示背后都有另一个现实:得有人为token付钱,还得等结果。

一个复杂的智能体完成一项任务,可能要调用模型20次。再加上检索、推理、浏览器操作、向量化、图像处理和验证,成本涨得很快。

AI架构会越来越混合。小模型处理分类和重复性决策,只有需要更深推理时才调用大模型。有些模型跑在本地,有些跑在云端。系统会缓存之前的工作,复用已经算好的上下文,而不是反复让模型去重新发现同样的信息。

好的AI架构,越来越体现在决定什么时候不去调用最强的模型。

问题五:安全

智能体打开了一个全新的攻击面。提示词注入只是开始。

如果一个智能体能读邮件、访问代码托管平台、查数据库、浏览网页、执行工具,那么每一个外部输入都可能影响一个握有真实权限的系统。

需要专门针对AI的安全边界。不能因为智能体以后可能要用某个工具,就给它无限权限。权限应该是临时的、有上下文的、受限的、可审计的。

这个原则安全工程师很熟悉:只给系统它需要的东西,只在它需要的时候给,多一点都不给。

接下来会发生什么

在AI发展的下一个阶段,进展大致会这样出现:模型在推理和多模态理解上变得更强。

然后,智能体更擅长完成更长的任务。

再然后,多个专门化的智能体开始在工作流里协作。

在那之后,那些难啃的基础设施工作就绕不开了:记忆、评估、身份、权限、可观测性、验证。