8月14日消息,OpenAI周四发布GPT-5.6开发者指南。指南根据一批早期测试和生产案例整理,把优化路径拆成三步:先在Sol、Terra和Luna之间选择模型,再调整推理强度,最后检查智能体的运行方式。
在模型迁移上,OpenAI建议开发者先保留原有推理档位完成一轮测试,再把推理强度降低一级。按7月30日生效的价格,Sol、Terra和Luna每百万输入token分别收费5美元、2美元和0.20美元,输出分别为30美元、12美元和1.20美元。同一个任务换挡,仅token单价就能差25倍。
先把推理档位降一级
OpenAI在BrowseComp检索测试中比较了两种配置:GPT-5.6 Luna使用Extra High推理档位,得分84.04%,单次成本1.33美元;GPT-5.5 Extra High得分84.36%,成本33.27美元。两者只差0.32个百分点,成本相差约25倍。
这组对比由OpenAI给出,只涵盖这一项检索测试。但它至少说明,模型档位和推理强度需要分开测试:便宜的模型多想一会儿,有时比直接换旗舰更合算。
同一个模型,运行方式也会改变结果
指南列出了GPT-5.6的三项主要架构变化:持久化推理与原生压缩、原生多智能体、程序化工具调用。
在OpenAI公布的ARC-AGI-3案例中,同一个Sol模型使用标准框架时得分13.3%;保留此前的推理过程、在长任务中压缩上下文之后,得分升至38.3%,输出token只有标准框架的约六分之一。
程序化工具调用针对的是另一种情况。过去,模型可能先读完上百份文件,再从上下文中筛选需要的内容。现在它可以写一段JavaScript完成过滤、聚合和工具调用,只把最后需要判断的结果送回模型。多智能体则适合能明确拆分的并行任务;OpenAI也建议通过调度规则限制不必要的子智能体调用。
模型没有变化,运行它的框架却改变了得分、上下文长度和调用次数。API报价只是单个token的价格,一项任务最终花多少钱,要看中间跑了多少轮、调了多少工具。
生产环境不只看最高分
软件公司Superconductor在自家Rails代码库上做了另一组测试。GPT-5.6 Sol High的质量得分约为77%,低于Fable 5的约83%;前者完成任务通常需要5至6分钟,后者需要23至25分钟。Superconductor最终把Sol High定为日常主力,接受约6个百分点的质量差距,换取约四倍的速度。
A-CODE-LLM用10项软件开发任务测试GPT-5.6家族,结果也没有出现"推理档位越高、成绩越好"的规律。有些项目上,Luna基础版的得分反而超过更贵的Sol Pro。
这两个测试表明:模型选择正在变成资源调度。复杂、失败代价高的步骤留给Sol;重复提取和高频调用换成Terra或Luna试试;结果确定的筛选和聚合,尽量交给代码。
模型公司最容易展示的是API单价和基准分数,开发团队实际支付的却是一项任务从开始到完成的全部成本。跑多少轮、调多少工具、返工几次、占多少人工复核时间,都会体现在真实账单上。
这也给模型厂商出了新题。最贵的模型不会消失,它会被留给失败代价最高的步骤;大量重复、可复核的工作,则会不断向更便宜的模型和普通代码迁移。
开发团队可以先挑一个调用最频繁或花费最高的任务,保留现有配置跑一版,再降一档模型或推理档位跑一版。把成功率、总成本、耗时、重试次数、人工复核时间摆到一起,才看得出便宜的模型有没有把工作转移给人。(易句)
(本文由AI翻译,网易编辑负责校对)
热门跟贴