新智元报道
ChatGPT和Codex,最后会合成同一个东西。
不是打包或套壳,是同一套底层技术、同一个智能体运行框架、同一个入口。
OpenAI为它起了名字:个人AGI(personal AGI)。
说这话的,是ChatGPT和Codex的负责人Thibault Sottiaux,开发者圈里都叫他Tibo。
四年前,他坐在谷歌伦敦的办公室里,眼睁睁看着一个能跟人聊天的模型躺在内网,没人能往外推。
四年后,率先走通这条路的那家公司,把ChatGPT、Codex和开发者API三条线打碎重组成一个核心产品团队,交到了他手上。
近10亿周活用户,他一个人管。
他桌上还有一个实体按钮,按一下,全网开发者的使用额度清零重来。
昨天,Tibo坐进了Matthew Berman的播客,为这个终局引入一个更具体的画面:
你会用它,你的妈妈也会用它。
至于为什么非合不可,他说:不是我们想合并,是未来的模型希望我们合并。
OpenAI核心产品与平台负责人Thibault Sottiaux
Codex并非编程工具
是ChatGPT的手
2022年ChatGPT上线,Tibo飞去了旧金山。
两年后,他进了OpenAI。
进去干的第一件事还是老本行,给OpenAI的研究员做工具。几个月后,他开始搭一个后来叫Codex的东西。
Tibo说这东西的增长曲线,一开始一直趴着,后来突然立起来。8月21日,他公布Codex活跃用户2000万。
真正的转折,在今年的7月9日。
Codex应用并进了ChatGPT的macOS和Windows桌面端。
是并进,不是消失。
Codex仍保留自己的编程界面和独立的历史记录。
现在的状态是同一个应用、两个工作入口,而不是两个产品变成了一个。
Codex应用并入macOS和Windows版ChatGPT桌面端,Codex仍保留自己那套编程体验,与ChatGPT的Chat和Work并列。
为什么非合不可?
答案是OpenAI要做的那个「超级App」,底座主要由Codex提供。
你可能觉得Codex的价值是写代码。
Tibo他们的判断是,Codex真正值钱的地方,是把一句人话变成一连串动作:写代码、调API、开浏览器、跑云端任务。
一个是近10亿人每周打开的聊天框,一个是2000万开发者盯着的编程智能体。
ChatGPT要是不会写代码、自己跑API,那它就是个漂亮的聊天框;Codex要是没有ChatGPT那个入口,它永远只属于会用终端的那批人。
Tibo这样拆解合并的逻辑:先把Codex改造成通用智能体,再把这套系统并进ChatGPT。
ChatGPT负责懂你,Codex负责替你干活。
合并,就是把理解力和执行力接到同一根线上。
人事线比产品线动得更早。
据WIRED今年6月报道,Tibo那时已经同时管着ChatGPT和Codex,直接向Greg Brockman汇报。
同一时期,OpenAI关掉了包括视频应用Sora和一个面向科学家的AI平台在内的几条独立产品线,带队的高管很多已经离开,资源直接向超级应用上收。
一边关产品,一边把最能打的两条线并在一起交给同一个人。
这背后是AI主战场的转变,早就从聊天框挪到了智能体。
据Fortune援引Ramp的2026年5月AI指数,Anthropic在美国企业采用率上以34.4%对32.3%首次反超OpenAI,推手正是Claude Code。
这也不是OpenAI第一次尝试。
去年的Operator,后来的ChatGPT Agent,都没跑起来。
Tibo的解释只有三个字:太早了。
模型不够可靠,就只能把它能做的事情死死限制住,限制到最后没人愿意用。
现在他说,技术到位了。
Codex与ChatGPT的终极合体
个人AGI
过去大半年,这两个产品往一起合并时,用户的第一反应几乎是清一色的抗拒:为什么要合?真有必要吗?
模型想合并,那合并之后到底长什么样?
Tibo给了三层。
第一层,同一套底层技术,同一个智能体运行框架,同一套产品理念。高度多模态,语音优先。你写不写代码,不重要。
第二层,界面不该由你选,该由它猜。
他不认同「程序员界面」和「非程序员界面」这种分法。
软件工程师、设计师、销售,这些标签是人类为了对付复杂度发明出来的抽象,因为真实世界太复杂,我们的脑子处理不过来。
而真实的人都散落在一条光谱上,各占一个位置。
所以该主动贴上来的是界面,而不是让人先声明自己属于哪一类。
一句话:不该由人去适应技术,该由技术来适应人。
第三层,最后只剩一个界面:个人AGI。
主持人追问:那会不会连下拉菜单都没有了?想到我妈可能跟我用一模一样的东西,感觉挺魔幻的。
Tibo说,对,就是同一个东西。
「它会是你的个人AGI。」
虽然是同一个界面,但你们连的工具不同,要的东西不同,带进去的需求不同,它自己往你们各自身上长。
个人AGI这个说法,Tibo不是第一次提到。
今年6月的巴黎VivaTech大会上,他就对Fortune说过,要做的是一个统一界面,让你去沟通、驾驭和监督你自己的个人AGI。
还有一个细节,藏着更早的信号。
新的语音上线之后,纯靠语音跟ChatGPT交互的用户量涨得很快。Tibo自己的用法是:早上坐那儿对着手机噼里啪啦说一串,说完模型直接调工具去办。
「以前根本做不到,因为没有足够好的语音模型。」
他说,这一下就把他对产品的想法整个换了。
人类永远走阻力最小的那条路。在小框里打字这件事,对一部分人自然,对大部分人并不是。
所以AGI大概不会以某天开发布会宣布的方式到来。
它更可能是这个样子:入口一个个合并,界面一个个消失,打字一点点让位给语音。
等你哪天回过神,它已经悄悄到来很久了。
快到某个点
卡住你的就不是模型了
聊到Ultra Fast,主持人扔出了一个数:比原来的fast快10到14倍。
这个数字,是主持人对现有数据的概括。
Tibo说,当生成快到一定程度,瓶颈就不在模型了,而是会跑到工具调用、网络往返、整个技术栈里那些平时没人注意的开销上。
他给的体感差异很具体:
如果你是在做一个网站或者小游戏的原型,需要模型吐一大段代码,速度提升几乎吃满;换成一串工具调用的任务,开销卡在别处,你能感觉到的就只剩3倍4倍。
也就是说,那个14倍提速,是有条件的。
主持人提到一个很多人都熟悉的画面:一口气开10到15个智能体并行跑,因为每个任务扔出去要等30到45分钟。
可这么干的代价,是你脑子一直在做上下文切换,累得要命。
十几个智能体同时跑,真正的原因不是效率,而是等待。
速度上来之后,这套工作流会反过来。
不再是十个十五个,可能就三个四个,人们将重新回到实时状态:你想,它做,你看着,你改。
Tibo管这个叫照顾你的注意力。
他说我们造的东西终归是给人用的,那就得围着人怎么管注意力来设计。
当模型能跟上你的节奏甚至比你更快,你就能一直待在心流里,边说边看原型长出来。
未来你可能还会在一块共享画布上跟它一起改,语音和文字随时切。
现在Ultra Fast在OpenAI内部也不是敞开供应的,绝大部分容量留给了外部客户,内部主要留给线上故障这样的高风险场景,因为那种时候每一秒都是钱。
至于什么时候人人都能用上,Tibo的原话是:一两年后,这个速度可能会成为默认;即使不是默认,也会非常接近默认。
他在谷歌
见过这一幕的另一个结局
Ultra Fast背后,还藏着一段慢下来的往事。
Tibo在DeepMind的本行是研究基础设施和研发工具,说白了就是给做研究的人修路搭桥,他还参与过AlphaGo那套工具链。
大约在ChatGPT问世前一年,DeepMind内部冒出来一个叫LMChat的东西。
那个团队把语言模型的规模拉上去之后,结果好得出乎意料,接下来是任何人都会想到的一步:能不能把它变成一个可以对话的产品?
Tibo说他当时就感觉到很特别,第一次看到模型写出连贯又有用的文字,起初更多是好笑,后来一点点变得真有用。
内部确实动过公开发布的念头,然后就没有然后了。
Tibo一针见血指出当年没做成的原因:DeepMind当时不是一个能发产品的组织。
研究是研究,产品是产品,两拨人不在一张桌上。
Tibo吐槽谷歌组织力,澄清了另一种流传很广的说法:谷歌高管怕冲击搜索业务,禁止DeepMind发布。
后来,Jeff Dean从另一个角度印证了这件事。
ChatGPT之前,谷歌内部确实有员工能用的聊天系统,但团队一直拿搜索准确率去衡量它,低估了写作、总结这类非搜索的用法。
再往前,2022年9月,ChatGPT还没影子,DeepMind公开了对话智能体Sparrow,能答问题、能调用谷歌搜索找证据,官方给它的定位是研究模型和概念验证。
2022年9月,ChatGPT还没上线,DeepMind公开的Sparrow已经能带着搜索证据回答追问,被问到会不会上太空时它回答自己不是人。
所以谷歌早一年就有的,是一个类ChatGPT的内部聊天系统,不是ChatGPT。
组织方式、准确率标准和既有业务顾虑,把它压在了谷歌内网里。
Tibo说他到现在经常拿这件事复盘,好的部分留下,坏的部分别再犯:
自下而上,少踩一点刹车,敢在自己还赚钱的时候颠覆自己。
重置之王
最后说说那个按钮。
Codex的限额重置,最早只是为了补偿用户:
产品在快速迭代,我们把东西搞坏了半小时,或者哪个配置调错了,体验没到预期,你还在用,那就补给你。
后来这事慢慢变了味道,产品有里程碑也重置,新功能上线也重置,顺手请全网喝一杯。
Tibo说这事既不归市场部,也不归财务:这里面没什么审批,我想按就按,只要感觉对了。
现在,还真有这么一个实体按钮。
他跟主持人说,回头给你看看,那玩意儿特别酷。
一按下去,全网开发者的使用限额清零重来。
一个能影响近10亿人怎么用AI的人,手边还真放着这么一个可以随意重置的物理按钮。
四年前在谷歌,一个做好的模型走不出内网;四年后的OpenAI,只靠一个按钮就能任性发糖。
个人AGI还在路上,先落地的是这个按钮。
参考资料:
https://x.com/MatthewBerman/status/2091959711423996249
https://www.youtube.com/watch?v=4qjEgPojjzM
https://www.wired.com/story/model-behavior-interview-with-openai-codex-lead-tibo-sottiaux/
编辑:元宇
热门跟贴