来源:市场资讯

(来源:机器之心)

编辑|Panda

2026 年的 YC Startup School 上,Jeff Dean 的声音有些沙哑。

访谈刚开始,他便解释自己失声了,今天听起来和平时不太一样。但这并没有影响台下听众的注意力。坐在他面前的 YC 合伙人 Diana Hu,一口气列出了一串足以写进计算机史的名字:MapReduce、BigTable、TensorFlow、TPU、Gemini。

打开网易新闻 查看精彩图片

任何一个项目,都足够成为一名工程师职业生涯的代表作。它们却集中出现在 Jeff Dean 和他身边一批 Google 工程师的履历里。

Diana 没有把访谈做成一次功绩回顾。她更关心另一个问题:当生成式 AI 已经席卷软件行业,Jeff Dean 这种最擅长从底层重构系统的人,今天究竟在看什么?

答案并不是更大的模型。

在这场近一小时的对话里,Jeff Dean 反复谈到推理硬件、能量、数据搬运、上下文工程、长时间运行的 Agent、自动化实验系统,以及创业公司如何避开通用模型的正面碾压。他讲的看似分散,背后却有一条非常清楚的主线:AI 的下一阶段,不只是把模型训练得更聪明,而是把模型放进一个能长期工作、持续试错、自动验证、不断积累能力的系统里。

这也意味着,AI 竞争正在从「谁有更大的模型」,转向「谁能更好地组织智能」。

一、AI 已经像初级工程师,但这不是最重要的变化

2025 年 5 月,Jeff Dean 曾做过一个引发广泛讨论的判断:AI 的能力已经接近一名初级工程师。

打开网易新闻 查看精彩图片

一年后,Diana 问他,这个预测实现得怎么样?

Jeff Dean 的回答很直接。他认为,这个判断「相当准确」。模型在 Agent 化、长流程编码和复杂任务上的进步,甚至比他当时预想得更快。

「模型完成越来越复杂任务的能力,增长得比我预期更快。」他说。

更值得注意的是,这种能力不再局限于写代码。越来越多 Agent 系统开始进入科学、工程和其他专业领域。它们不只是回答问题,而是拆任务、用工具、运行实验、读取结果,再根据反馈继续行动。

把 AI 类比成初级工程师,容易让人把注意力放在人力替代上。但 Jeff Dean 更关心的是另一层变化:当一个「初级工程师」可以复制成几十个、几百个,并行工作几天甚至几周,组织生产的方式会发生什么变化?

在传统团队里,初级工程师需要上手业务,需要理解工具,需要不断得到反馈。Agent 也一样。只不过它的培训材料不再只是文档,而是提示词、工具说明、技能文件、测试体系、评估器,以及整个上下文环境。

这使 AI 工程出现了一个新的分工。

过去,工程师主要负责写代码。未来,更多工程师会负责定义问题,搭建环境,编写规范,设计反馈回路,再调度一群 Agent 去完成任务。

Jeff Dean 对 2027 年的预测正是如此。他认为,机器学习系统会越来越多地参与改进机器学习系统本身。它们会把目标拆成子问题,自动运行大量实验,比较结果,再把有效方案组合起来,形成更强的新系统。

「只要一个领域存在可测量的目标,就有机会取得很大进展。」

这句话是整场访谈的第一把钥匙。

AI 自动化最先攻入的,不一定是知识最多的领域,而是反馈最清晰的领域。代码能不能通过测试,芯片布局能不能降低面积,模型结构能不能提高精度,材料性质是否满足要求,这些问题都有相对明确的评价标准。只要评价器足够可靠,机器就能用极高频率反复试验。

所以,AI 时代真正重要的单位,可能不再是一次回答,而是一次完整的闭环:提出方案、执行方案、测量结果、修正方向。

二、改变 Google 搜索的是一道算术题

Jeff Dean 的许多代表性工作,都来自一个非常朴素的起点:先把数量级算清楚。

2001 年,Google 搜索仍大量依赖硬盘。硬盘容量大,但访问速度慢。Jeff Dean 和 Sanjay Ghemawat 做了一次估算,发现 Google 当时的整份搜索索引,已经可以放进所有服务器的内存里。

今天听起来,这只是一次存储介质升级。但在当时,它意味着完全不同的系统设计。

如果索引主要待在硬盘上,查询需要等待机械寻道。只要把索引放入内存,访问延迟就能骤降。两人很快写出新版本,并在几天内把它送进生产环境。Google 搜索由此明显变快。

这个故事最容易被包装成天才灵光一现。Jeff Dean 的讲法却更像一名工程师在陈述常识:系统条件变了,原来不成立的方案突然成立,那就应该重新计算一次。

很多行业创新都发生在这种时刻。

一个旧问题长期存在,人们已经习惯围绕它打补丁。后来,硬件价格、内存容量、网络带宽或模型能力跨过某个临界点,原来的约束消失了。可大多数人仍沿用旧架构,因为旧架构已经变成常识。

Jeff Dean 擅长做的,是把常识重新变成假设。

他会问:为什么一定要这样?今天的数量级还是昨天的数量级吗?如果把最贵的一步换掉,整个系统会不会出现完全不同的形态?

这也是他给创业者的建议。不要只看现有方案哪里不够好,而要从第一性原理重新看问题。能不能把性能提高一个数量级?能不能把成本降低两个数量级?能不能不再沿用行业默认的实现路径?

「有时候,你只需要眯起眼睛看一个问题,不要被今天的解法锚定,而是从第一性原理思考应该怎样解决。」

这句话听起来并不神秘。真正困难的是,多数人进入一个行业后,会迅速学会这个行业的所有默认答案。经验帮助人提高效率,也会让人失去重新提问的能力。

三、三分钟语音,为什么催生了一颗 TPU

2013 年,Google 的深度学习语音识别开始显著超过旧系统。错误率下降了一半,相当于过去二十年语音识别进展在几个月里集中发生。

产品团队当然兴奋。Jeff Dean 却先算了一笔账。

如果语音识别真的变好,用户就会更愿意使用。假设每名 Google 用户每天只使用三分钟语音识别,Google 需要多少服务器才能支撑?

结果并不乐观。按照当时 CPU 的效率,Google 可能需要把服务器规模扩大一倍。

这就是 TPU 的起点。

它不是因为研究团队突然想造芯片,也不是为了证明 Google 有能力做硬件,而是因为一个成功的模型即将制造一个无法承受的服务成本。

这段历史揭示了 AI 产品中一个经常被忽略的规律:模型效果提升,并不总是降低成本。恰恰相反,效果越好,使用量越大,系统压力越重。

当语音识别不好用时,用户很少调用。系统成本不是问题。当错误率大幅下降,需求突然被释放,原本隐藏在后台的算力约束就会浮出水面。

TPU 选择的路径,是为机器学习最核心的计算模式做专用硬件。它不需要运行浏览器,也不需要处理所有通用程序。它主要擅长低精度、稠密线性代数。这类计算恰好位于现代机器学习的中心。

第一代 TPU 最终带来了数量级上的收益。按照 Jeff Dean 的说法,它比当时的 CPU 和 GPU 节能 30 到 80 倍,延迟也低了 20 到 30 倍。

这里还有一个容易被忽略的设计尺度。

TPU 很专用,但没有专用到只能运行某一种固定模型。团队知道机器学习算法还会快速变化,于是把芯片设计成一种较通用的线性代数系统。它牺牲了运行 Chrome 或 Word 的能力,却保留了支持未来算法演进的空间。

这是一种很难把握的平衡。专用得不够,收益不明显。专用得太狠,算法一变,硬件就会过时。

Jeff Dean 对今天推理硬件的判断,和当年的 TPU 有明显呼应。他认为,下一轮重要机会仍然在专用化,但重心会进一步转向低延迟、低能耗推理。

「想象一下,如果延迟能改善 50 倍,你可以做什么。」

当模型回复需要十几秒时,人们会把它当成一个偶尔咨询的工具。当延迟接近即时,它才可能真正进入交互界面、机器人、实时视频、操作系统和连续决策流程。

等待不是一个小体验问题。等待会改变产品形态。

四、AI 的成本中心,不是计算,而是搬运数据

如果要为 2026 年的 AI 工程师更新一版「每个工程师都应该知道的延迟数字」,Jeff Dean 认为,重点应该从硬盘寻道、缓存未命中和跨洲网络延迟,转向芯片内部的数据流。

工程师需要知道:主存到片上内存的带宽是多少,片上内存到乘法单元的带宽是多少,一次乘法需要多少能量,芯片之间如何互连,500 颗芯片扩展到 1 万颗芯片时,网络效率会怎样下降。

这些数字看起来离产品很远,实际却在决定什么产品能成立。

Jeff Dean 给出了一个极具冲击力的比例。完成一次数学乘法,大约只需要一个皮焦耳的能量。把数据从高带宽内存搬到计算单元,能量成本可能高出约 1000 倍。

换句话说,今天 AI 系统中的昂贵动作,常常不是「算」,而是「把要算的东西搬过来」。

这也解释了为什么批处理如此重要。

一组模型权重从内存被搬入计算单元后,如果只处理一个 token,数据搬运成本就全部压在这一个 token 上。如果同时处理更大的批次,同一份权重可以服务更多计算,能量和带宽成本便被摊薄。

但批处理和低延迟天然冲突。为了凑够一批请求,系统往往需要等待。吞吐提高了,单个用户的响应却可能变慢。

因此,许多看似属于模型层的问题,其实是硬件和系统问题。训练为何使用大批次,推理为何需要 KV Cache,模型为何追求低精度,系统为何需要量化,背后都离不开数据搬运和能量约束。

Jeff Dean 近期更关注推理,也正是因为推理对延迟极度敏感。训练任务跑慢一点,往往只是实验结束得晚。推理任务每多等一秒,都会直接影响用户体验和 Agent 的工作效率。

如果一个 Agent 要连续调用模型 1000 次,单次延迟降低 50%,整个任务的完成时间就可能出现巨大差异。更不用说未来 Agent 要运行数天或数周。

因此,AI 的「能源问题」并非一个遥远的环保议题。它直接决定模型能否便宜地服务更多人,决定 Agent 能否持续运行,也决定创业公司的毛利是否健康。

五、模型只是一个零件,上下文才是 Agent 的工作现场

过去几年,AI 行业习惯用参数量、训练数据和基准分数衡量进步。2026 年,Jeff Dean 更强调模型周围的一切。

一个真正有用的 AI 系统,除了模型,还需要检索、工具、记忆、历史信息、执行环境和反馈机制。模型知道有哪些工具,知道何时调用工具,知道如何把复杂问题拆成一串动作,也要能比较多种方案,判断哪一种更可能成功。

这就是「上下文工程」开始走到舞台中央的原因。

Jeff Dean 说,模型在训练阶段见过的信息,最终被「搅拌」进数千亿乃至数万亿参数里。它们像一锅浓汤,知识存在,但未必清晰。真正放进当前上下文的信息,对模型来说更加直接,也更容易被准确使用。

这给小团队留下了一个重要机会。

训练基础模型需要海量资本、数据和算力。上下文工程却可以从一个 API 开始。创业者可以围绕具体业务,把领域知识、工具流程、客户数据和评估标准组织起来,让通用模型在一个窄场景里表现得更可靠。

Jeff Dean 举了一个自己的例子。

他和 Sanjay Ghemawat 经常优化 Google 内部的底层库。这些数据结构可能运行在数百万个进程中,一点点性能差异都会被规模放大。传统做法是工程师先写微基准,测量当前性能,再修改代码,重新运行基准,观察缓存占用和性能变化,然后继续迭代。

两人把这套工作方法写成了一项 Agent 技能。模型学会了如何运行基准、修改代码、比较结果,再根据测量继续优化。

「我们只是把人会采用的方法,以模型可以使用的形式交给了它。」

这句话几乎可以视为上下文工程的朴素定义。

它不是神秘的提示词技巧,也不是堆更多背景材料。它是在回答三个问题:专家会按什么步骤做事,系统有哪些可靠工具,结果应该怎样被验证。

当这些内容被结构化之后,模型获得的不是更多知识,而是一套可重复执行的方法。

这也是为什么「技能(skill)」会成为 Agent 生态中的关键资产。一个优秀技能文件,可能封装了团队多年的隐性经验。它告诉模型遇到某类问题时先做什么,哪些错误最常见,哪些工具值得信任,什么结果才算完成。

未来公司的差异化,很可能不只存在于模型权重里,也存在于这些被编码进工作流的经验里。

六、Agent 为什么走到第 30 步就开始失控

几乎所有真正做过 Agent 的团队,都见过同一种场景。

前几步很顺。模型能读需求,能调工具,能写代码。到了第 30 步或第 50 步,它开始忘记目标,误解状态,重复动作,或者沿着一个错误方向越走越远。

Jeff Dean 把其中一个原因归结为分布外问题。

模型在训练中见过大量常见任务。只要任务仍位于它熟悉的「明亮道路」上,表现通常不错。一旦连续操作把它带到不熟悉的状态,性能就会突然下降。越偏离舒适区,错误越容易累积。

解决方法之一,是提供技能和提示,把模型尽量约束在它熟悉的路径上。另一个方法,是使用多 Agent 系统。

多个 Agent 可以尝试不同方案,再由另一个模型担任评估者,判断哪些方向更有希望。失败的分支被丢弃,成功的分支继续推进。这本质上是在推理阶段进行搜索。

它和人类团队的工作方式并不陌生。面对复杂问题,一个人提出方案,另一个人审查风险,第三个人运行实验。团队不会把全部希望押在第一条思路上,而是通过分工和反馈降低单点失误。

Agent 运行时间越长,系统设计越不能依赖一次正确。

真正可靠的长程 Agent,需要检查点、状态管理、回滚、分支探索、外部评估、权限控制和异常恢复。它更像一个分布式系统,而不是一个超长聊天窗口。

这正是 Jeff Dean 的背景开始重新显得关键的地方。

MapReduce 解决的核心问题之一,就是如何让大量不可靠机器完成可靠计算。今天的 Agent 系统面对相似矛盾:单次模型调用并不完美,工具也会失败,但整个任务仍要尽可能稳定地完成。

未来优秀的 Agent 平台,可能会继承许多分布式系统思想。任务可以拆分,结果可以验证,失败可以重试,状态可以恢复,局部错误不应该摧毁整个流程。

当 Jeff Dean 说 Agent 将运行几天甚至几周时,他不是在描述一个更长的聊天。他在描述一种新的计算基础设施。

七、两三个人如何赢过 Google:寻找模型成功率只有 1% 的问题

在 Startup School 的语境里,最受关注的问题当然是创业机会。

Google 可以联合设计芯片、数据中心、模型和产品。Gemini 这样的通用模型还在快速扩张能力边界。一个两三人的团队,凭什么赢?

Jeff Dean 的回答并不浪漫。

小团队的机会,通常存在于通用模型没有充分关注的具体领域。创业者可以把产品界面、专有数据、工作流和领域技能组合起来,在一个窄场景里提供更高准确率和更好体验。

但他随即给出警告:通用模型正在迅速变强。今天看似独立的产品功能,六个月或十二个月后,可能被基础模型直接覆盖。

因此,创业者需要判断自己的优势是否耐久。

Jeff Dean 给出了一条很具体的筛选标准:寻找那些当前通用模型成功率接近 0% 或 1% 的任务,而不是已经能做到 20% 的任务。

「如果模型完全失败,这可能是一个好迹象。如果它已经能做一部分,只是做得不太好,那反而未必是好迹象。」

原因很简单。20% 意味着能力已经开始出现。更多数据、更大模型和更长推理,很可能快速把它推向可用。0% 或 1% 则说明任务可能缺少关键数据、特殊工具、领域反馈,或者需要一种通用模型短期难以获得的能力。

这可以称为 Jeff Dean 的「1% 法则」。

它并不是建议创业者专挑最难的问题,而是寻找通用模型存在结构性盲区的问题。

这种盲区大致有三类。

第一类是专有数据。通用模型能组织世界信息,却未必能访问某个用户的全部个人资料、某家公司的内部流程、某种设备产生的实时数据。创业产品一旦获得这些数据,就能形成不同于基础模型的视野。

第二类是专业评价。很多行业不是缺少生成能力,而是缺少可靠判断。医疗、材料、芯片、制造和科学研究,都需要高质量验证器。谁能定义「什么是对的」,谁就能让 Agent 持续优化。

第三类是窄而深的模型。AlphaFold 并不是通用聊天模型,它针对蛋白质结构问题建立了高度专业化能力。材料科学、芯片设计和其他专业领域,也可能出现类似机会。

这套判断对创业者并不轻松。它要求团队既理解模型能力边界,也理解行业深处的问题。只懂 AI,容易做出很快被平台吸收的功能。只懂行业,又可能低估模型进步速度。

真正的机会位于两者交界处。

八、当代码不再稀缺,规格、品味和问题选择会更贵

Diana 提出一个假设:如果未来每位创始人都能同时管理 50 个、100 个 Agent,所有代码都由 Agent 写,什么能力会变得稀缺?

Jeff Dean 的回答是「品味」。

更准确地说,是判断应该让 Agent 做什么。

他认为,研究工作的大部分价值不在于把实验执行得多漂亮,而在于是否选择了一个值得研究的问题。一个团队可以用最精湛的方法,完成一项无关紧要的研究。也可以抓住一个关键问题,只要解决,就改变整个领域。

Agent 让执行成本下降之后,问题选择的重要性会进一步上升。

过去,一个模糊想法会因为开发成本太高而自然消失。未来,只要调动足够多 Agent,很多想法都能被迅速做成原型。世界不会因此自动出现更多好产品,只会出现更多产品。

规格也会变得更重要。

Jeff Dean 说,和虚拟 Agent 协作时,目标越清晰,成功率越高。过去,模糊需求交给一名资深工程师,对方可以追问,也能依靠共享背景补全意图。Agent 虽然也能提问,却更容易在缺少上下文时自行猜测。

一个典型的高成功率任务,是把软件从一种编程语言迁移到另一种语言。原因不是迁移简单,而是规格极其完整。旧代码定义了行为,测试定义了边界,Agent 可以逐项对照,直到新版本表现一致。

「现在 Agent 可以替你写软件,但说明你究竟想要什么,反而变得更重要了。」

这句话对所谓 AI 原生组织有直接启示。

未来的管理者不只是分配任务,而要编写更清晰的目标和验收标准。设计文档不再只是团队沟通材料,也会成为机器执行的输入。测试、指标、约束和样例,会从开发流程末端前移到任务定义阶段。

至于「品味」如何训练,Jeff Dean 给出的方法很务实。

写下一批你认为未来 12 个月会变得重要的事情。你不必全部去做。12 个月后重新检查,哪些判断成真,哪些被别人做出来,哪些毫无进展。通过不断积累预测样本,人会逐渐校准自己的判断。

品味并不完全是天赋。它也可以通过复盘训练。

九、好的思想实验,先把行业最牢固的前提拿掉

访谈后半段,Jeff Dean 分享了一个颇为疯狂的思想实验。

过去 60 年,芯片行业一直在追求更小、更稳定、错误率更低的晶体管。人们默认,同一设计制造出的芯片应该尽可能完全一致,位翻转越少越好。

可在大型分布式系统中,工程师早已接受单个组件会失效。硬盘会坏,机器会宕机,交换机会出问题。系统可靠性并不来自每个部件绝不出错,而来自复制、校验、冗余和恢复。

于是 Jeff Dean 问:如果晶体管每天会发生 20 次错误,而不是几百万年才出一次错,会怎样?

这并不是一项现实产品计划。他只是试图把一个习以为常的前提拿掉。也许极不可靠的晶体管能以完全不同的方式制造,系统则通过多路径和高层冗余保证结果。

多数思想实验最终不会变成产品。很多行业做法持续数十年,确实有充分理由。但 Jeff Dean 认为,仍应定期重新检查这些理由。

MapReduce 就来自类似过程。

早期 Google 的爬虫和索引系统包含大量手工并行代码、检查点和故障恢复逻辑。真正的业务计算往往很简单,比如读取所有网页,判断页面语言。可大量系统代码把简单意图淹没了。

Jeff Dean 和 Sanjay Ghemawat 从函数式编程中找到灵感。他们把大量任务抽象成 Map 和 Reduce,把并行化、调度、容错和重试下沉到统一框架里。业务开发者只需要表达计算本身。

这项设计并没有让机器变得不出错。它让错误变得可以被系统吸收。

今天的 Agent 工程也可能处在类似阶段。大量团队仍在为每个任务手工编排提示词、重试逻辑和工具调用。未来,是否会出现一个像 MapReduce 一样简洁的抽象,让长程 Agent 的分解、验证、恢复和并行探索成为底层能力?

这也许正是下一批基础设施公司的机会。

十、AI 开始构建更好的 AI,科学方法被压缩成高速循环

Jeff Dean 对未来最兴奋的方向,是把科学方法本身自动化。

传统科研流程是提出假设、设计实验、运行实验、分析结果,再产生下一轮假设。这个循环的速度,长期受制于实验成本和验证延迟。

AI 可以改变两部分。

一部分是自动提出和执行更多实验。另一部分是把昂贵验证器变成廉价近似模型。

Jeff Dean 举了量子化学的例子。研究人员要判断一种分子构型的性质,可以运行密度泛函理论模拟。一次模拟可能需要一整夜。Google 的研究人员用大量模拟输入和输出训练了一个神经网络近似器。它接近原模拟器的准确度,却快了约 30 万倍。

验证速度变化之后,科学问题的形态也会变化。

过去筛选 1000 万个候选方案,可能是一个需要数月算力的项目。现在,研究者吃一顿午饭的时间,系统就能完成初筛。实验不再是珍贵的单次下注,而变成高频搜索。

这也是 AlphaEvolve、AlphaChip 等系统背后的共同逻辑。模型提出方案,工具执行方案,评价器筛选结果,优秀结果进入下一轮。只要闭环足够快,系统就能在巨大的解空间中持续探索。

机器学习本身也会成为这种自动化科学的对象。

今天,大型研究团队通常由人提出新架构或训练方法,先跑小规模实验,再挑选有希望的方案放大。Jeff Dean 认为,没有根本障碍阻止模型接管其中越来越多环节。人给出高层方向,系统自动探索结构、数据配方和训练策略,再把成功实验组合成新模型。

未来衡量研究效率的指标,可能不只是每秒浮点运算,而是「每单位算力产生多少有效发现」。

算力当然重要。如何把算力转化为发现,更重要。

十一、被 NeurIPS 拒绝的蒸馏论文,以及如何看待失败

2014 年,Jeff Dean、Geoff Hinton 和 Oriol Vinyals 提交了一篇关于知识蒸馏的论文。今天,知识蒸馏已经是模型压缩和能力迁移中的基础方法。大模型作为教师,把能力传递给更小、更快、更便宜的学生模型。

这篇后来影响深远的论文,当年却被 NeurIPS 拒绝。

一名审稿人认为,它「不太可能产生重大影响」。感兴趣的读者可访问《被拒≠失败!这些高影响力论文都被顶会拒收过》。

Jeff Dean 谈起这段经历时没有愤怒。他说,审稿人可能并不了解大规模 AI 服务面临的现实问题。对 Google 来说,把昂贵大模型转化为可服务数亿用户的小模型,显然非常重要。对只关注理论新颖性的审稿人来说,它未必显得足够「基础」。

论文被拒后,团队把它放上 arXiv。行业照样读到了它,也照样开始使用。

今天,Gemini 的 Flash 模型能够在较小体量和较低延迟下保持强能力,蒸馏正是其中的重要方法之一。

这个故事并不只是「坚持就会成功」的励志材料。它说明评价体系总有盲区。一个方案的价值,有时只有真正承受过那个系统瓶颈的人才能立刻看见。

对创业者来说,这同样重要。

市场、投资人和同行的否定,可能意味着方向错误,也可能只是对方没有处在同一个问题现场。区别在于,团队是否有足够具体的证据,知道这个问题为什么重要,为什么现在能解决。

Jeff Dean 没有鼓励人盲目坚持。他鼓励的是:理解问题,持续验证,然后不要把一次评审当成世界的最终判断。

十二、年轻的 Jeff Dean 今天会做什么

访谈接近尾声时,Diana 提出了一个带有想象力的问题。

如果把 1999 年加入 Google 时的年轻 Jeff Dean 传送到 2026 年,他会加入一家前沿实验室,还是和两三个朋友创办公司?

Jeff Dean 没有给出标准答案。

大组织拥有结构、平台和大量优秀同事。一个人在其中可以接触自己不了解的知识,也能借助成熟产品影响全球用户。小团队则更自由,也承担更大风险。创始人必须真正相信一个问题,愿意用几年时间承受不确定性。

他给出的判断标准,比「加入大厂还是创业」更根本。

「如果我解决了这个问题,并且最好的结果真的发生了,世界会因此明显变好吗?还是大家只会说,嗯,挺酷的,然后就这样?」

如果答案只是「挺酷的」,那可能不值得投入最宝贵的时间。

他也强调同伴的重要性。要找有互补能力的人,也要找低自我、愿意协作、相处愉快的人。真正困难的问题往往需要长期共事。团队成员最好各自拥有别人没有的工具,并在共同工作中继续扩充自己的「工具腰带」。

这番话有一种老派工程师的朴素。

AI 行业喜欢谈指数增长、超级智能和巨额融资。Jeff Dean 最后仍把选择落回三件小事:做一个真正关心的问题,和喜欢的人一起工作,尽力让世界变得更好。

结语:AI 时代最稀缺的,仍然是把问题看清楚

Jeff Dean 的职业生涯里,有许多被反复讲述的传奇。

他和 Sanjay Ghemawat 在几天内重写搜索系统,让索引进入内存。一次关于三分钟语音的估算,推动 Google 造出 TPU。MapReduce 把大规模并行和容错藏进统一抽象。知识蒸馏从一篇被拒论文,变成行业基础技术。

这些故事很容易让人把他想象成一个不断获得灵感的天才。

但从这场访谈看,他的方法其实高度一致。

先算清数量级。再找到真正的瓶颈。然后质疑默认假设,建立一个更简单的抽象。最后,用测量和反馈推动系统不断迭代。

今天的 AI 行业正在经历类似转折。

模型已经足够强,强到可以承担初级工程师级别的任务。接下来,决定实际生产力的,不只是模型智商,而是推理成本、上下文组织、工具质量、验证速度和长程运行可靠性。

Agent 会越来越像团队成员。可它们需要清晰规格,需要技能,需要检查点,需要评价者,也需要一个能容纳失败的系统。

创业公司的机会也不会消失,只是会变得更苛刻。最好不要去做通用模型已经能完成 20% 的事情,而要寻找那些成功率仍接近 0% 或 1% 的问题。那里可能藏着专有数据、专业评价器、窄领域模型,或全新的系统抽象。

当代码生成越来越便宜,真正昂贵的会是问题本身。

什么值得做?什么约束已经过时?什么变化刚刚跨过临界点?什么系统如果快 50 倍,会变成完全不同的产品?

Jeff Dean 没有为 6000 名创业者给出一份机会清单。他给的是一种更耐用的思考方式。

别急着追逐最热的答案。

先把问题算一遍。

https://x.com/ycombinator/status/2082938685071491219

https://www.ycrootaccess.com/p/jeff-dean-the-1-rule-for-building