打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

2026年盛夏,全球开发者的心率,正在被一家叫OpenAI的公司按在地上摩擦。

7月,被官方誉为“碾压竞品Fable 5”的全新旗舰模型 GPT-5.6 Sol 轰然上线。

算力狂欢还没持续两天,硅谷到中关村的程序员们打开后台,集体倒吸一口凉气:

额度,空了

有人花大价钱顶格买的 Codex 20x 旗舰套餐,原本计划撑过一整个月,结果敲了36个小时代码,进度条直接见底;

更有硬核开发者拉出用量监控,赫然发现自己的账号在短短一天内被狂吞掉了 33亿(3.3 Billion)Token

就在全网哀鸿遍野、骂声四起之际,推特(X)上一位老哥悄悄贴出了一张截图,随后引发了AI圈一场近乎狂欢的“地下大迁徙”。

他不仅没有多花一分钱,反而让顶配模型继续全速飞驰。

评论区瞬间炸锅,无数同行冲上来死死按住他的手: “求求你赶紧删除推文!别再炫了!OpenAI看到马上就要打补丁了!”

打开网易新闻 查看精彩图片

开发者 Eidzoku 晒出的监控日志:GPT-5.6 单日吞噬高达 33 亿 Token,请求量暴涨 6.26 倍

一夜烧穿33亿Token:GPT-5.6 到底在发什么疯?

要理解这场“大逃亡”,得先看清大家到底被逼到了什么绝境。

GPT-5.6 Sol 确实强得可怕

在各大编程基准测试中,它展现出了惊人的复杂逻辑推演与多步骤规划能力。

然而,强悍智商的背后,是一台 吃算力不吐骨头的超级粉碎机

资深开发者 Eidzoku 记录了一组触目惊心的数据:

  • 6月23日(GPT-5.5 超高算力档):日消耗 3.27亿 Token;

  • 7月2日(GPT-5.5 超高算力档):日消耗 5.49亿 Token;

  • 7月20日(换上 GPT-5.6 Sol 高算力档):日消耗直接飙到了 33亿 Token

为什么换了个新版本,食量暴涨了整整6倍?

深入日志底层后,开发者们抓到了一个令人哭笑不得的“系统Bug级行为”:

GPT-5.6 引入了全新的代码执行模式(Code Mode),理论上它应该能够把多个独立的工具调用(Tool Calls)打包在一起 并行处理 (比如前端常用的 Promise.all 机制)。

但实际跑起来,它几乎从来不打包!

在 739 次执行跟踪里,它只有可怜的 5 次启用了并行。

剩下的 734 次,它全都在 单线串行死磕 ,查一个文件、问一次模型;

改一行代码、再问一次模型

打个通俗的比方: 这就像你想从图书馆借10本书,原本可以拉个推车一次全搬走,现在的AI却选择叫了10趟专车,每趟车只放一本书,而且每次往返都要把之前聊过的整整几万字历史记录当成‘行李’死死拖在车尾。

结果就是:单次回答的字数并没有变长,但请求次数暴涨了 6.26倍

哪怕是 OpenAI 的 Codex 负责人 Tibo 都不得不亲自发文“灭火”,承认产品在用量指引和默认高算力设置上存在混乱,并紧急重置了一部分用户的额度。

但在物理算力上限面前,官方的缓冲不过是杯水车薪。 写代码写到一半被系统“拔管”,成了所有高强度开发者的日常噩梦。

绝境中的“邪修”:意外发现 OpenAI 的“阴阳账本”

当正规跑道被烧断,极客们的本能就是 找暗门

开发者 Iam_(@SPAC89)在 Codex 进度条彻底归零的那一刻,暂时没有掏信用卡额外充值。

他把视线挪向了屏幕另一侧那个平时只用来随口闲聊的 ChatGPT 对话框

他点开设置,做了一个极其简单的动作: 在 ChatGPT 网页端直接接入 GitHub 插件(Apps),把自己的私有代码仓库挂载进去。

打开网易新闻 查看精彩图片

开发者 Iam_(@SPAC89)晒出的实操截图:顶部挂载 GPT-5.6 Pro,直接在聊天流中调用代码工具接管项目

奇迹发生了

虽然右侧专门用来“干重活”的 Codex 代理额度已经彻底红牌罚下,但左侧挂着 GitHub 的 ChatGPT 网页对话框,却依然生龙活虎!

不仅响应速度飞快,而且调用的是性能顶格的 GPT-5.6 Pro 模型。

原来,OpenAI 在底层悄悄设置了两个互不通气的“记账本”:

  1. Codex / Work 代理账本

    :专门针对自动化任务、终端执行和 IDE 联动,限制极严,五小时窗口和周额度稍不留神就会见底;

  2. ChatGPT 聊天账本

    :针对日常交互对话,虽然也有防滥用机制,但容量池极其宽裕,在 Pro 订阅下几乎有着“无限续杯”的体感。

当你把 GitHub 授权给 ChatGPT 后,网页端聊天线程实际上是在云端的独立沙盒环境中运行。

它能看懂你的代码结构、能读你的完整项目、甚至能调用你存放在 GitHub 里的自定义技能(Skills) ,除了不能直接在本地终端替你敲回车,它的思考深度、上下文理解能力,与那个昂贵到让人肉疼的 Codex 毫无二致!

全网求停更:“闭嘴!再晒官方就要打补丁了!”

这篇推文配着一张布满代码工具调用痕迹的暗色截图,在 X 平台像野火一样蔓延。

不少评论立刻流露出由衷的“恐慌”

打开网易新闻 查看精彩图片

网友在评论区焦急留言:“求求你别秀了,官方要是打补丁我们就全完了”

资深开发者们在评论区急得跳脚:

“兄弟,收了神通吧!我的自动化机器人就是靠这个逻辑在跑的,OpenAI 一旦反应过来,我们全得被端!” “这是未公开的计量缝隙,大家悄悄用就好,别把它顶上热搜啊!”

中文技术圈更是给这套操作冠上了一个极其传神的名字, “邪修省 Token 大法”

事实上,这种现象并非孤例 开发者 Timothy Reavis 也在此前独立证实了这一机制:哪怕 Codex 的 20x 额度四天前就已彻底耗尽,只要通过 ChatGPT 的虚拟环境拉取仓库,依然可以在完全不增加任何成本的前提下,利用聊天池的独立限额继续推进复杂的工程任务。

打开网易新闻 查看精彩图片

开发者 Timothy Reavis 分享相同的独立发现:ChatGPT 拥有独立的用量窗口

从“投机取巧”到“工业分工”:90/10 黄金工作流

当狂欢与恐慌稍稍平息,工程师们开始冷静下来思考它的长期用法:

这条路径若能长期存在,我们究竟该怎么把它纳入工作流

很快,以 JMT 为代表的一批架构师把这种野路子“邪修”,提炼成了一套正规军式的 工业级标准工作流,“90/10 黄金法则”

打开网易新闻 查看精彩图片

JMT 建议将九成规划与架构工作放在连接 GitHub 的 ChatGPT 中,Codex 负责执行

阶段

角色与环境

消耗的资源池

核心任务

前 90% 思考 总架构师 / 军师

:ChatGPT Pro + GitHub 挂载

宽裕的 聊天配额

全库代码通读、架构设计、Bug 深度排查、实现方案推演、Diff 代码生成

后 10% 落地 施工队 / 泥瓦匠

:本地 Codex(Sol Medium 档)

昂贵的 代理配额

接收现成方案、在本地沙盒写入文件、运行测试套件、构建闭环验证

这套分工精准击中了当前大模型的物理软肋。

ChatGPT 挂载的 GitHub 插件虽然强大,但本质上是 偏只读(Read-Only) 的,它负责“深度思考”,帮你把所有的坑在云端算力里预先踩平,生成极度精确的修改步骤;

而 Codex 拥有极高的本地操作权限,但“思考成本”极其昂贵。 此时你直接把 ChatGPT 产出的成熟蓝图丢给它,让它只充当一个没有感情的“代码执行器”,几秒钟改完、跑测试、打完收工。

原作者 Iam_ 在实测一天后给出了令人震撼的战报: 采用这种“双轨制”分流之后,高昂的 Codex 额度消耗瞬间暴跌了 50% 以上!

以前一天烧光的配额,现在甚至能稳稳撑满一周。

算力通胀时代,我们正在成为“算力套利者”

把镜头从这场热闹的社区攻防战拉远,这起事件实际上揭开了 2026 年 AI 编程领域最隐秘、也最尖锐的商业矛盾:

模型的智商在呈指数级狂飙,但订阅制的商业模式正在被算力消耗逼入死角。

过去,我们把大模型当成“打字机”,按次提问,按字付费;

而现在,当 GPT-5.6 这类模型跨入 Agent(自主智能体) 时代,AI 每前进一步,背后都是几十次自发的循环推演、工具试错和上下文重载。

对于 OpenAI 这样的商业巨头而言,他们陷入了一场两难的走钢丝:

  • 如果把额度定得太死,开发者干两小时就“断电”,产品体验瞬间崩塌;

  • 如果全面放开无限使用,单日吞噬数十亿 Token 的重度用户,分分钟能把数据中心的电费账单烧穿。

这种商业模式上的割裂,最终在产品架构上撕开了一条缝隙, 为了保障日常交流的体验,OpenAI 必须在聊天侧保留一个宽大的“缓冲油箱”; 而为了防止算力被瞬间吸干,他们又不得不在代理执行侧套上沉重的“限流枷锁”。

开发者们所谓的“邪修”,本质上是一场聪明的 跨产品线算力套利

它标志着一个全新阶段的到来:在 2026 年,漂亮的 Prompt 只是程序员硬实力的一部分, 在复杂模型生态、不同计费账本和差异化工具链之间进行资源调度与架构解耦,同样考验全局视野。

只要这架轰鸣向前的 AI 飞机还在云端滑翔,只要算力的成本与人类野心的张力还在撕扯,这样的“备用跑道”与“民间智慧”,就永远不会消失。

打开网易新闻 查看精彩图片