七月最后一天,OpenAI给全球开发者扔出了一枚调价炸弹。

GPT-5.6系列三款模型集体调价。入门款Luna的输入价格直接打到0.2美元/百万Token,输出1.2美元/百万Token,降幅高达80%。中档Terra紧随其后。只有旗舰Sol价格纹丝不动,仅新增了一个Fast模式,速度拉满能达到标准模式的2.5倍。CEO山姆·奥特曼在X上只轻描淡写了一句:“今天宣布大幅降价。”

打开网易新闻 查看精彩图片

图源网络

这场降价并非一时兴起。往前倒一周,7月24日,Anthropic刚做了件调性相似的事。新发布的Claude Opus 5,每百万Token输入5美元、输出25美元,价格正好是自家旗舰Fable 5的一半

Anthropic自己点明,Opus 5能用一半价格,做到接近Fable 5的前沿智能。测试数据也佐证了这点:编程基准CursorBench 3.2上,两款模型最高分只差0.5%,Opus 5单项任务成本却只有对方一半。

把时间线拉长,降价的幅度更惊人。2023年GPT-4刚推出时,输入30美元、输出60美元,基本是面向金融、律所的奢侈品定价。

两年多时间,输出价从60美元跌到Luna的1.2美元,整体跌去98%。国内市场更不用说,字节、百度、阿里这些厂商的API服务,已经做到每百万Token几块钱人民币。

这轮降价,远不止短期促销。其背后,是一场涉及企业支出逻辑、技术成本结构、开源商业模式乃至全球能源格局的深层博弈。

被Agent撑爆的账单,与隐形的“Token税”

很长一段时间里,硅谷头部公司都对价格战不屑一顾。高昂的定价反而能体现技术稀缺性。但核心变化出现在Agent(智能体)大规模走进企业工作流之后。

三年前,Token还只是人和AI聊天的成本单位,一问一答也就几十到几百个。现在,一个自动化编程Agent跑一次完整任务,动辄消耗几万Token;多智能体协同处理一件事,烧掉上百万Token都很正常

打开网易新闻 查看精彩图片

IDC预测,2026年国内企业级Token消耗量将同比涨20倍,达到日均110万亿Token的规模。有企业反馈,部署自动化Agent后,单月Token消耗量比之前人工调用阶段涨了数十倍。

账,算不过来了。

Uber今年四个月就花光了全年AI预算,不得不给研发人员设下硬性上限——每人每月AI工具算力消耗不能超1500美元。广告巨头WPP也在推进Agent规模化落地,AI相关支出增速远超预算,CEO辛迪·罗斯公开感叹,传统按人力工时计费的模式在Agent时代已难以为继。

更值得警惕的是,多家企业调研显示,AI应用中存在大量冗余调用与无效消耗,部分场景下非生产性Token占比可达四成以上,形成了一笔隐性的“Token税”。硅谷创业圈甚至催生了专门的“Token成本优化师”岗位,核心工作就是帮企业排查冗余调用、压缩无效Prompt,砍掉的无效消耗往往能占到总账单的三到四成。Meta员工内部冲榜时,30天就烧掉60万亿Token

《华尔街日报》六月就有报道,称OpenAI正在酝酿大幅降价,因为它预判Anthropic也会跟进。企业端的耐心正在消失。有科技公司负责人坦言,很难把AI编程带来的效率提升,直接对应到实际收入增长上。

“tokenmaxxing的时代结束了。”市场研究机构EMARKETER高级分析师雅各布·博恩下了判断。当LMArena排名前四的模型Elo分差不到25分,专业测试里前15名的差距微乎其微时,价格就成了最直观的竞争维度

撕开价格战的三层底牌

很多人觉得这就是厂商内卷,其实背后有三层真实推力,环环相扣。

最先变的是企业支出逻辑。AI开销正从“研发预算”挪到“运营成本”类目。以前属于探索性创新投入,对价格不敏感;现在Agent嵌入日常运营后,每一笔都要算投入产出比,企业自然不再为冗余的跑分溢价买单。

第二层推力,来自技术端的真实降本。OpenAI官方解释,GPU内核、推理系统都有优化,GPT-5.6 Sol甚至参与了自家生产系统优化,端到端服务成本下降20%,推测解码技术让Token生成效率提升15%以上。

打开网易新闻 查看精彩图片

更底层的变化来自MoE架构,它将参数激活量从6710亿降到370亿,推理计算成本直接砍掉90%到97%。用户越多、调用规模越大,又能反过来摊薄下一轮优化成本。

第三层推力,来自中国模型带来的价格冲击。以前全球大模型定价体系由硅谷主导,现在这套逻辑正在被打破。以非缓存时段标准计算,同样处理一百万输入加一百万输出Token,GPT-5.5合计35美元,Claude Opus 4.7要30美元,而DeepSeek-V4-Pro仅约5.22美元

赶上缓存命中,差距还会拉大。国内前沿模型在核心能力追平国际梯队的同时,调用价格仅为硅谷旗舰的十分之一甚至更低

OpenRouter的数据显示,从今年2月开始,美国企业使用中国模型消耗的Token占比一直超30%,近期一度达到45%。开源权重模型正用极低的边际成本撕开硅谷厂商的护城河。

这已不止是价格竞争,更是商业模式的差异。当开源模型性能追平闭源产品,开发者可以在自有服务器上私有化部署,直接分流了API调用量。对OpenAI来说,损失的不只是推理收入,更是行业“默认选项”的地位

中国模型的低价倒计时:算力折旧与芯片暗战

不过,把视角切换到未来两三年,中国成本优势的地基并非铁板一块。

国内模型能做到如此低价,部分源于此前集中采购的算力资产已进入折旧周期。DeepSeek、Qwen等开源模型的训练,依赖的是此前大批量采购的英伟达A100、H100算力集群。

2023年之后,高端GPU出口限制持续收紧。这就带来一个现实问题:现有库存的算力资产折旧摊薄完之后,下一代旗舰模型靠什么训练?

打开网易新闻 查看精彩图片

图源网络

替代方案并非没有。华为昇腾910B、寒武纪等国产芯片,已能支撑千亿参数模型的推理任务,但用来训练万亿级MoE模型,集群效率和生态成熟度仍有明显差距。CUDA生态积累了十几年的软件栈,不是一两年就能完全追平的。

更现实的风险集中在推理侧。训练还能用国产化方案逐步攻坚,可如果未来Agent应用爆发,Token需求上涨百倍,国内厂商需要新增海量推理算力卡。届时高端GPU进口通道如果依旧受限,推理算力就会成为硬瓶颈。

现在的“十分之一价格”能否长期维持,取决于国产芯片生态能不能跟上算力需求的增长节奏。这个窗口期内如果没能完成算力替代方案的落地,成本优势的根基就会松动。

越便宜的Token,越贵的系统

开源模型用十分之一的价格切走近半数企业Token调用量,让资本市场对闭源大厂的盈利模式产生了普遍质疑。但这并不代表闭源模型会输掉终局。企业级采购中,价格从来不是唯一标准

最显性的一重壁垒,是数据隐私与合规能力。金融、医疗、政府这些机构,不可能把内部敏感数据上传到公有API。对这类客户而言,私有化部署加完整的企业级安全合规体系是硬性准入门槛。

Anthropic早已为医疗和金融行业提供符合HIPAA、SOC2标准的私有化方案,明确承诺客户数据绝不用于模型训练。对医院、银行来说,数据泄露的风险损失,远高于API调用节省的成本。合规场景里,闭源厂商的溢价不是垄断利润,是为风险兜底的保费。

更深一层的博弈,是责任承担与服务保障。当模型Agent自动处理付款、编写生产环境代码,一旦出错,谁来承担后果?闭源大厂的商业协议中,包含明确的服务等级承诺、赔偿条款和技术支持响应时效。这些保障,开源社区无法提供。对年营收数十亿的大企业来说,为“容错率”支付溢价是非常理性的商业决策

还有一个极少被讨论的维度——“隐性成本的反噬”。API单价虽然便宜了,但企业为了让Agent稳定运行,投入的Prompt工程优化、RAG(检索增强生成)系统搭建、以及Agent出错后的人工兜底成本,是否远超API省下的那点钱?

有行业调研显示,部署开源模型的企业在“调参、运维、合规审查”上的综合人力成本,有时比直接购买闭源API还要高。Token单价只是冰山一角,水下是巨大的系统工程成本。

一个反常识的规律正在AI行业复现:Token单价越跌,企业的AI总开销反而涨得越快。

打开网易新闻 查看精彩图片

图源网络

这正是19世纪经济学家威廉·杰文斯发现的经典悖论——更高效的蒸汽机非但没有减少煤炭消耗,反而刺激了更大规模的工业需求,导致总消耗量暴增。同理,Token单价的不断下降,很可能不会让企业的AI总预算缩减,反而会刺激工程师设计出更复杂、更多轮次、更耗Token的Agent架构。

单次任务的总算力消耗,可能不降反升。

届时,拥有最极致工程优化能力和最低能源成本的大厂,优势反而会扩大。

目前开源模型抢占的市场,大多集中在容错率高的非核心场景。真正的核心生产场景,闭源模型依然掌握定价权。长远来看,混合部署会是常态,两种模式会长期共存。

放弃正面交锋,硅谷大厂的“降维”反制

表面看,价格战比拼的是成本。往深层看,现阶段的降价更像一笔生态入场补贴

大模型的迁移成本,在不同阶段差异极大。刚开始接入时,更换服务商只需要改接口地址,成本几乎为零。可一旦模型深度融入企业的代码库、数据接口、自动化流程,再想更换,成本就会指数级上升

重新适配提示词、重构安全规则、迁移微调数据,甚至调整内部业务流程——这些隐性成本,远高于Token单价的差额。

这个逻辑,和当年云计算的路径高度相似。AWS早年连年降价,外界普遍担忧其盈利。实际上,低价策略快速扩大了客户基数,当客户把业务系统全面迁移到云平台后,就形成了极强的粘性,厂商后续通过增值服务持续获利。现在的大模型行业,正处在同一个窗口期。

打开网易新闻 查看精彩图片

图源网络

头部厂商的策略非常清晰:塔尖旗舰模型维持定价,守住品牌高地;次一级模型主打极致性价比,抢占腰部市场;入门款打到白菜价,用低价漏斗大量获客。

这套分层定价的本质是典型的交叉补贴:用旗舰模型的高利润支撑入门款的低价获客,用生态入口的亏损换长期留存的收益。OpenAI的态度很明确:旗舰产品的价格,一分不让。

硅谷大厂的下一步反制措施,可能不会局限于价格战。

如果中国模型把价格打到1/10,他们更可能“放弃中低端API市场的正面对抗,直接向下游收购应用层公司”,或者通过“闭源模型独有的工具链”来实现降维打击。

价格战会引发行业并购潮,二三线模型厂商在失血后,很可能被大厂收购,或转型为垂直行业的数据微调服务商。

真正的利润池在哪里?

大厂用白菜价的API作为流量漏斗,后端真正的利润来自企业级私有化部署的超高溢价、基于大模型原生SaaS应用的订阅费、以及云服务器的捆绑销售。

旧范式的电费诅咒与新范式的钥匙

很多人说Token迟早会变成自来水,但很少有人注意到,价格战存在一个物理底线——能源成本

斯坦福AI Index 2026报告提到,顶级AI模型单次训练耗电可达数百万乃至上千万度。到2027至2028年,AI数据中心的总耗电量将达到与阿根廷或瑞典全国相当的水平。在典型千亿参数模型推理中,电费是刚性底线

以美国工业电价约8美分/度估算,仅电费一项就可能达到美分级别。当Token需求再上涨百倍,电价本身就会成为难以逾越的天花板。

但这只是“旧范式”的天花板。

如果未来出现非Transformer架构,或者模型从“暴力堆参数”转向“高能效的稀疏激活”,算法的范式转移可能会彻底打破能源诅咒。寻找“新范式”才是跨越物理极限的唯一途径。

多模态和复杂推理对算力的消耗仍在指数级增长,未来AI模型的定价权,可能会从芯片厂商手中,转移到掌握更便宜、更稳定电力的一方。中东的油气、沙漠的光伏、冰岛的地热、中国西部的风电——这些曾经与AI毫无关联的资源禀赋,可能成为下一阶段成本曲线的决定因素。

打开网易新闻 查看精彩图片

图源网络

价格战的喧嚣终将平息,但大模型的商业化探索才刚刚进入深水区。

成本供给侧,国内企业凭借工程化能力建立了全球成本锚点,但算力芯片的限制让这个锚点在两三年内存在根基松动的风险。

需求侧,开源在通用场景中攻城略地,但在数据合规与责任兜底的场景里,闭源大厂依然掌握定价权。

物理层面,Transformer架构下的能源底线与算法范式转移的可能性并存。

三重约束叠加之下,大模型产业的终局、是不同成本结构、不同安全等级、不同能源禀赋的AI,在各自擅长的领域里分层竞争。只靠倒卖低价API生存的企业,会在这三层约束中逐步被淘汰。

能够在算力限制中找到替代方案、在垂直场景里建立不可替代性、在能源约束下优化单位任务能耗的玩家,才是终局真正的赢家。

当Token真正变成自来水时,企业最终要支付的,将是修建整套城市供水管网,以及为水管破裂买单的代价