你所在企业的AI账单正在以超出预算的速度攀升,而每条提示词的单价看起来都还“合理”——这大概是眼下每一家认真上AI的公司共同的困惑:钱,究竟消失在哪个环节了?
Cast AI联合创始人、现任Tokenomics Foundation管理委员会成员的Laurent Gil把这中间无形的成本黑洞称为“AI采用过程中的隐性税”。他在近期的FinOps X大会上指出,模型本身的费用远不是最昂贵的部分,真正吃掉预算的,是横亘在用户提问与模型最终回应之间的一整套基础设施、任务编排、重试、空闲GPU、超长上下文窗口和低效路由决策。
一组数字让问题更扎眼。Goldman Sachs在FinOps X主舞台抛出一个预测:当前全球企业级token消耗大约是6千万亿个(6 quadrillion),三年后将膨胀到120千万亿个。这绝不是四舍五入的误差级变动,而是整整20倍的扩张。更令人不安的是,这场扩张正在以超过治理框架建设速度的节奏扑面而来。
为什么token的成本逻辑和传统云计算完全不是一回事?
就连深耕云成本控制近十年的FinOps社区也承认,token花的不是“更难管理的云账单”,而是根本不同的另一套账本。普通云工作负载的成本相对可追溯:你预配置了算力,它跑了,你收到一张对应时段的账单,动作与费用之间的因果关系清晰可见。一旦进入AI token世界,这条因果链会断裂成三个彼此割裂的层面,而多数组织只对其中一个有可见性:
第一层:生产层——你的“代币工厂”开足了马力吗?
在任何一个模型对提示词做出响应之前,基础设施得先把token“制造”出来。GPU集群、推理节点、自动伸缩策略、Kubernetes配置,这些都是名副其实的token工厂。它们效率的高或低,直接决定了后续所有环节的基准成本。然而现实里,GPU节点的利用率徘徊在30%的场景比比皆是——相当于一座昂贵工厂只开了三分之一产能,还在按全产能计费。
第二层:消费层——反直觉的经济学在此上演
这是Gil最着迷也最让人头疼的部分。两个组织发送完全相同的提示词给不同的编码代理,最终承担的成本可能天差地别。差异的来源不是提示词本身,而是它们如何管理上下文、缓存以及中间结果的处理。消费层不关心你“用了什么模型”,它关心的是“你让模型处理了多少无用信息”——每一次无效的重试、每一条塞进上下文的冗余对话历史,都在悄悄拉高账单。
第三层:价值层
Gil的演讲和Tokenomics Foundation的成立声明中,已经预示了一个必然到来的追问:花出去的每一单位token,究竟换回了多少真实的商业价值?目前大多数团队只能展示API调用次数和直接账单,却无法把token消耗与最终业务产出关联起来——在120千万亿token的消耗世界,这会是一笔比基础设施本身更昂贵的认知债。
值得关注的是,Tokenomics Foundation这个刚刚在Linux Foundation旗下启动的厂商中立组织,正是冲着这套裂痕而来的。它不推销任何工具,而是试图建立一套面向token消耗经济学的行业共同语法。当AI的用量预测从6千万亿个一路冲上120千万亿个,任何试图只用原有云成本优化逻辑去“修修补补”的尝试,都是在用一个越来越大的桶去接越来越密的漏水点——根本的策略已经不是治漏,而是重新设计管道。
热门跟贴