(图源:本地配图)
(图源:本地配图)OpenAI 自己出来劝退了。10 月 2 日挂上官网的 GPT-6 家族指南,开篇就一句话:别默认开最强那一档。
理由也很实在:按工作负载选模型,简单任务交给轻量模型,通常更快,也更便宜。IT之家 10 月 3 日做了报道。
三款模型,各接各的活
GPT-6 Astra 是给复杂推理用的,要的是最高智能水平。它能做计算机操作,在 Codex 里还能边执行边回头问你。
GPT-6.1 Sol 接复杂编码、研究和计算机操作。它在 Responses API 里支持多智能体工作流,把独立子任务分派给子智能体,最后再汇总。这个功能现在还在测试。
GPT-6 Luna 管的是大规模特定任务,还有目标明确的日常重复活。提取发票字段、给请求分类、生成结构化摘要,都归它。
还有一点官方没在指南里单独讲:据报道,GPT-6.1 Sol 处理复杂任务时,性能接近 Astra,成本却更低。
推理别拉满,速度分两档
推理强度官方分了四档。低档做提取事实、小幅修改;中档做功能规划、方案比较;高档留给疑难调试、深入分析和仔细复核。再往上一档,是高档不够用时拿来测试的,只有改进确实值得花这些时间和成本,才用得上。
速度这边,API 里的 Fast mode 适合对话、编码工具这种对响应速度要求高的场景。Ultrafast 目前面向 Astra 提供,可以独立于推理档位加快 token 生成。
据 DoNews 报道,它在 Codex 里词元生成速度最高能到 8 倍,API 调用速度提升到 6 倍,峰值 300 token/秒,面向 Pro 500 订阅和企业用户。官方说后面会推 GPT-6.1 Sol Ultrafast。
长任务按模块拆,别按字数
Astra 会把你的输入当一份技能说明书来读,自己拆出目标、约束、工具、验证标准和输出格式。整段堆在一起,模型反而要花额外 token 做归类,还容易把关键约束截掉。
一个合格的模块要能单独跑:有自己的目标、输入输出契约和验收条件,不靠别的模块的中间状态。
背景只写一次。第一条提示里把数据源、时间范围、业务口径说清,后面一句引用就行,比如沿用上一步定义的华东区 Q1 订单口径。跨轮引用要写明:开头写请基于以下内容继续,再附上不超过 50 字的核心结论。别用「上面说的」「之前提到的」,模型不会回头翻整段历史。
实测下来,带明确引用关系的三段式拆分(定义、执行、整合),比五段无关联拆分省约 40% Token,结果一致性还更高。
钱省在缓存里
稳定指令和参考资料放在会变的任务细节前面,工具定义保持一致,就能复用提示缓存。缓存过的输入 token,成本视模型不同,最高能比没缓存的输入低 95%。
长对话可以用压缩机制,在保住续接状态的前提下缩减上下文。跨时长的任务,还能用 WebSocket 接口在模型干活的过程中中途纠偏。
坑也有三个。第一个是拿三款模型当等级用:Luna 管的就是重复活,把提取发票这种活丢给 Astra,浪费钱也浪费时间。第二个是全流程开最高推理档,官方说日常问答不必追求最高强度。第三个是长任务一口气贴完整文档,结构没对齐,模型要花额外 token 归类。
你更愿意先用 Luna 把重复活干掉,还是先用 Sol 啃硬骨头?
热门跟贴