“蒸馏就够了!”这句口号没有出自哪家蒸馏小厂,而是OpenAI官宣GPT-5.6时的副标题。他们用一系列递归自我优化,让价格直降20%-80%,GPT-5.4级智能的成本更是在4个月内骤降至原来的1/13。

一年前就有图表显示,保持LMSys Elo评分不变,GPT-4级智能的供应成本在18个月内下降了1000倍。当时不少人认为这只是“新手红利”——从没优化到优化、从补全到推理、从密集模型到MoE,低垂的果实已经摘光。但随后18个月的剧本却出乎意料:同等智能的降价非但没有减速,反而仍在急剧加速。

打开网易新闻 查看精彩图片

推理层的加速来自三个动作。最直观的是自我优化:GPT-5.6 Sol主动分析线上流量、调优负载均衡,并用OpenAI自研的Triton与Gluon语言自动重写生产内核,这一项就把端到端推理成本砍掉了20%。

接下来是推测解码。模型自己设计并运行了上百轮实验来改进草稿模型,在监控训练的过程中还能自动处理硬件故障和训练不稳定,最终将token生成效率推高了超过15%。

KV缓存也没有被放过,针对Codex等不同工作负载,批处理、分片和缓存策略都被精细调整,让现有硬件挤出了更多吞吐。

在Agent工具层面,OpenAI优化了Rust编排层,通过“推迟发现”机制,工具、技能和插件仅在必要时才被加载,有效避免了上下文膨胀带来的重复计算开销。