周四,OpenAI首席执行官萨姆·奥尔特曼在社交平台X上发了一条简短消息:“今天大幅降价。”这句话对应的是其刚刚发布仅三周的GPT-5.6系列模型中两款产品的API价格下调——Luna模型的百万tokens输入价格从1美元降至0.2美元,输出价格从6美元降至1.2美元,降幅达80%;Terra模型的输入和输出价格分别从2.5美元、15美元降至2美元、12美元,降幅20%。主力推理模型Sol的定价则保持不变,仍为输入5美元/百万tokens、输出30美元/百万tokens。
这一降价节奏打破了AI模型供应商的常见做法。通常,新模型家族发布后,厂商会在数月内维持价格稳定,而GPT-5.6于7月9日才开放使用,不到一个月就启动调价。使用Luna的开发人员无需修改任何代码或流程,推理成本就会自动下降。对于大批量调用任务,节省的开支尤其明显。
成本骤降的背后,是OpenAI对底层推理基础设施的优化。降价前一天,公司披露了一份工程概述,详细说明了针对Codex和ChatGPT Work在推理栈上的多项改进。工程师们重写了生产环境中的GPU内核,使服务成本降低了约20%;重新设计了Sol的推测性解码系统,将token生成效率提升了超过15%;同时更新了智能体运行时,在多步骤工作流中更广泛地利用提示词缓存,减少重复计算的消耗。这些举措使得GPT-5.6能够以“每美元提供显著更高的智能”。
然而,业内更关注的是来自海外的竞争压力。近期,开发者对推理成本的敏感度明显上升,因为智能体应用往往需要调用数十甚至上百次模型才能完成一项任务。在这种场景中,模型服务成本的重要性甚至超过几个百分点的基准性能差异。中国企业如月之暗面推出的低成本开源权重模型,正在倒逼商业供应商不仅要比拼性能,更要在生产环境定价上给出竞争力。奥尔特曼口中的“在每个层级提供最佳价格与智能的权衡”,实则反映了OpenAI和Anthropic等公司当前面临的现实——单纯靠性能优势已不足以维持市场,不得不向中国对手的定价靠拢。
值得留意的是,许多智能体所经历的中间步骤并不需要Sol这类顶级推理模型,而中国实验室已经摸索出如何用更低成本的方案完成这些环节。当降价启动得越来越快、幅度越来越大,大模型竞争的焦点正在从跑分榜单快速滑向每美元获得的有效智能。
热门跟贴