来源:市场资讯

(来源:网易科技)

AI智能体正从"工具"演变为能够连续运行数周、独立完成复杂任务的系统,而制约其大规模普及的核心瓶颈,正在从模型能力转向推理硬件效率。Google首席科学家、深度学习先驱Jeff Dean在Y Combinator的访谈中,对AI现状与未来走向作出了一系列研判,并点明了他眼中下一个技术突破口所在。

Dean表示,他去年对"AI已达初级工程师水平"的预测基本得到了验证,且模型在完成更复杂任务方面的进展速度超出了他的预期。他尤其强调,AI智能体在编程之外的领域同样开始展现能力,这将是未来的重要趋势。

在预判下一阶段突破口时,Dean将目光指向推理硬件。他提出,若推理延迟能降低50倍,将从根本上改变AI系统的产品边界,催生出目前难以实现的全新应用形态。与此同时,他对创业者发出明确信号:上下文工程、专用领域模型,以及能够整合推理时计算的多智能体系统,将是小团队实现差异化的主要窗口。

AI智能体能力已超预期,可连续运行数周

Dean在对话中证实,其2025年5月作出的"AI达到初级工程师水平"判断基本准确,并指出实际进展在某些维度上超出了他的预期。"模型完成更复杂任务的能力增长速度比我预想的要快,"他说,"而且在编程之外的领域,这些基于智能体的系统也开始崭露头角。"

他认为,目前市场对AI智能体能力存在一个被普遍低估的认知盲点:基于智能体的系统已经可以不止运行一两个小时,在某些问题领域、配合足够强大的模型,可以连续运行数天甚至数周,完成极为复杂的任务。"有些人已经开始隐约察觉到这一点,但我认为还没有被普遍接受,这将是一件影响很大的事。"

在实际应用层面,Dean举例称,他和同事Sanjay近期在做底层库性能优化时,通过为智能体编写"技能"(skill),教会模型按顺序完成"测量基准—改进代码—测量性能提升—迭代"的完整流程,实现了相当高效的自动化循环。他还提到,目前的模型在将软件从一种编程语言翻译成另一种语言方面已相当高效,因为原始代码本身构成了一份极其清晰的规格说明。

推理硬件:下一个关键战场

Dean将推理硬件效率定义为AI系统下一步大规模普及的核心约束,并类比了他2001年主导的一项历史性决策——将Google搜索索引从硬盘迁移至内存,以此说明硬件架构的跃迁对产品能力的决定性影响。

"大家会看到越来越多高性能、低能耗的推理硬件系统,"他表示,"推理是让基于智能体的系统能够普及给更多人的关键,延迟非常重要,而硬件的专用化正是提升能效、降低延迟的关键途径,比GPU或TPU这类通用计算设备更有效。"

Dean进一步指出,当前AI系统设计中存在一个被多数创业者忽视的底层约束:将数据从加速器的HBM取到处理器进行计算,所消耗的能量是实际执行一次乘法运算的上千倍。这一差距深刻影响了批处理的必要性、系统架构设计乃至产品的延迟表现。"如果没有这上千倍的差距,就不需要做批处理;但正因为有,你必须一次性处理很多样本或很多token,才能把这次数据搬运的开销摊薄。"

在推理硬件的优化方向上,他着重提到两点:尽量减少数据搬运,以及尝试极低精度运算,将所需精度直接内建到硬件中,而非支持冗余的精度选项。

上下文工程崛起,小团队迎来差异化窗口

Dean指出,AI进步的驱动力正在发生结构性转变——从"更大的模型、更多的数据",逐步转向模型之外的系统工程能力,包括检索、工具调用、记忆管理和智能体编排,即业界所称的"上下文工程"(context engineering)。

"模型只是你要构建的整体系统中的一部分,"他说,"这涉及模型如何使用各种工具,如何检索相关信息,可能还要保留过去解决其他问题时检索到的信息,并把这些信息放进模型的上下文中。"

他将上下文工程视为小团队的重要机会入口,原因在于门槛结构的改变:"以前训练一个模型需要海量的资源、GPU和数据,但做上下文工程,你只需要一个类似Gemini的API接口,然后自己搭建检索系统、工具调用之类的东西就行了。"

对于智能体在执行超过三四十步后容易"脱轨"的普遍问题,Dean给出了两类应对策略:一是为模型提供技能和提示,使其尽量停留在熟悉的操作路径上;二是采用多智能体架构,通过推理时计算(inference-time compute)搜索可行解题路径,由另一个模型或智能体对多条路径进行评估和筛选,保留有效方案,剔除偏离轨道的路径。

对创业者的判断框架:找模型成功率接近零的问题

在与创业者直接相关的议题上,Dean提供了一套较为具体的机会识别框架。

他指出,通用模型正在越来越多的领域持续变强,这意味着创业者必须审慎评估自己选择的方向是否具备足够的持续性:"你正在做的事情是不是够'持久'——未来六个月或十二个月,前沿模型会不会就能做到这件事了?"

在识别有效切入点时,他给出了较为清晰的信号:应当寻找当前通用模型成功率接近0%或1%的问题,而非20%。后者往往意味着相关能力正处于萌芽阶段,随训练数据增加或模型规模扩大,通用模型可能很快追平。

他认为两类场景具有较强的结构性优势:其一,产品能够接触到通用模型无法获取的特殊数据,例如用户个人信息;其二,针对极其困难的特定问题,通过训练专用小模型,可以以较低成本获得高精度解法。他以AlphaFold为例——这是一个专用于蛋白质折叠的模型,并非通用系统,在特定领域取得了显著成效。他认为材料科学、芯片设计等领域同样存在类似机会。

自动化科学方法:AI加速AI自身演进

Dean对2027年的大胆预测指向一个更深层的演进方向:机器学习系统本身的自动化程度将大幅提高,形成"用AI优化AI"的闭环。

他描述的路径是:将问题拆解成子问题,在紧密的自动化实验循环中运行,再将结果整合,从而持续迭代出改进后的系统。"这不只适用于机器学习,也适用于其他科学和工程领域——基本上任何有可衡量目标的领域,现在都能取得很大进展。"

Dean还提到,加快这一循环的关键之一,是构建速度更快的验证模型。他以量子化学领域的案例说明:原本需要运行一整夜的密度泛函理论模拟,在用神经网络近似后速度提升了30万倍,使原本需要六个月才能完成的千万种分子构型筛选,在午饭时间内即可完成,从根本上改变了科学研究的节奏。

他同时提出了一个颇具挑战性的思想实验:过去60年,半导体行业默认晶体管必须极度可靠;但若在更高系统层面引入冗余容错机制,是否可以使用每天出错20次的晶体管来构建系统?这类对基础假设的重新审视,正是他认为能够催生下一代突破性系统的思维方式。

未来稀缺能力:判断力,而非执行力

面对"当智能体能完成所有代码编写后,什么才是真正稀缺的"这一问题,Dean给出了明确的答案:判断力(taste)——即知道该让智能体去解决什么问题。

"模型未必擅长做这种判断,"他说,"未来会是人来引导大量的AI辅助计算,从而更快地实现伟大的成果——但那个'你想要模型做什么'的核心,才是你应该专注的关键。"

他提出了一种量化训练判断力的方式:定期写下未来12个月内可能重要的事情清单,一年后回头核验哪些真的变得重要,哪些已被他人完成,哪些尚属空白。此外,他还强调了"第一性原理"思考的价值——不纠结于问题今天是怎么解决的,而是眯着眼睛审视问题的本质,寻找能带来一到两个数量级提升的截然不同的解决思路。