本文来自微信公众号: 奋进的肚腩 ,作者:肚腩说,原文标题:《AI越来越便宜,认真回答却开始变贵——算力变贵了吗?》
是的,我用Fable 5时很抠搜,抠搜到自己都有点嫌弃自己,最后我抠门到我又一次被Anthropic封了号,省了个锤子。
我们在使用一个昂贵的T0级别大模型时,在一个问题发出去之前,会先想它值不值得用最贵的模型。上下文要不要再整理一遍,提示词是不是还能少绕两句,刚才那个回答能不能自己改,别再让它重跑一次。
但当我换成MiniMax或DeepSeek,出手就阔绰了。
因为后两者价格低到暂时不用把每次思考都当成一次消费决策。想到了先问,答得不对再问。
26年年初,我买GLM Coding Plan的Pro包,一季大约六百多,那时候还不要抢。可是我昨天再看价格,最新的coding plan月费已经接近过去一个季度了。
后来把两期价格对了一下,大体对应国际版:2月的一份价格记录里,Pro是81美元一季;现在Z.AI官网是72美元一个月。人民币金额会受汇率和支付渠道影响,套餐里的模型、额度与计算方式也改过,不能把它当成同一袋米直接比较。
可是当我们在使用模型时,不会考虑这么完整的口径说明,我们只会在意,发出这些问题给大模型时要不要犹豫。
算力涨价最先改变的,可能不是GPU报价或者AIDC,而是人问问题时的手势。
十倍vs.三倍
7月29日,Dwarkesh Patel写了一篇文章,简单粗暴的结论:未来几年,算力为什么可能贵十倍以上。
他在开头先交代,这篇东西只给自己两个小时。很多问题来不及钉死,写出来总比一直放着强。
这一句得留着。因为后面的数字很容易把人带到一个并不存在的精确世界里。
Dwarkesh说,Anthropic的收入同比增长了十倍。如果这个趋势继续,到今年底可能达到1000亿至1500亿美元,明年底甚至需要摸到1万亿美元。可实验室拿到的算力,一年大约只能增长三倍。
十倍收入要从三倍算力里赚出来,只有几个可能:模型公司的利润率更高,更多算力从训练转去推理,或者算力本身更贵。
他认为三件事都在发生。
他认为Fable推理毛利可能超过80%,不过在最后的脚注里他自己承认这是一句“凭感觉的判断”;1000亿至1500亿美元也是按趋势外推,不是Anthropic发给投资人的业绩指引。至于一张H100如果能持续运行一个人类水平的软件工程师,就该按每年25万美元出租,更是思想实验,不是云厂商明天准备发送的报价单。
所以问题是:当模型越来越能赚钱,生产这些智能的机器,为什么还要继续按照机器的成本收费?
今天买一点算力,账面上买的是芯片、机房、电力和散热。假如有一天,它能替一家软件公司完成原来需要几十个人的任务,卖方就会开始盯着另一张表:这块算力替你创造了多少钱。
发一度电的成本不会因为用途不同而变化。拿它给办公室照明,和拿它运行一个能写代码、接订单、处理客户的模型,买方愿意付的钱却完全不同。
云厂商当然知道,模型公司也知道。
过去大家愿意低价卖Token,是因为先要让用户养成习惯,当习惯变成工作流,工作流变成收入,再继续讨论“成本加一点合理利润”,就显得很有互联网早期的怀旧气息。
稀缺vs.公平使用
平台不必发一封《算力不足告全体用户书》。
它可以调整套餐。
今年2月,智谱发布GLM Coding Plan价格调整函,给出的原因是需求增长、调用量提升,以及算力和模型优化投入增加。套餐价格“结构性调整”,整体涨幅30%起。
结构性调整是个很体面的词。
7月30日,套餐又改成以Token消耗为基础的积分制。官方说,这是为了让额度计算更透明、更可预期。旧用户按V1、V2和团队版分别安排,新用户进入新版套餐。历史V2的Pro档,每五小时最多约400次prompts,每周最多约2000次;GLM-5.2和GLM-5-Turbo在工作日下午高峰期按三倍额度抵扣。
这些变化不能全部归因于算力短缺,模型升级、产品定位、市场策略和老用户迁移都在里面。限额也不等于涨价,它有防滥用和保障稳定的真实需要。
只是当供应追不上需求时,商业世界处理稀缺的方法向来不止一种。
有人多付钱、有人排队、有人改到晚上用、有人切换成较弱的模型,还有人额度用完以后,看着“将在五小时后恢复”的提示(学学codex动不动来个惊喜重置和发放复活卡好不好),临时恢复了独立思考能力。
平台把这些统称为套餐选择和公平使用。
不过嘛,公平使用并没有解决稀缺。它只是把“现在不够”重新描述成成了一份每个人都能读懂、但很少有人认真读完的规则。
价格只是其中最显眼的一栏,速度、可用时段、上下文长度、是否能连续运行、能不能优先调用最强模型,都可以成为新的价签。
最贵的未必是一个Token,而是你赶着交东西的下午三点,模型还愿不愿意认真替你多想几分钟。
便宜的Token vs.变厚的账单
同时,AI推理确实一直在变便宜。
Epoch AI对多个基准的统计显示,达到同一能力水平的模型推理价格,近几年每年下降约9倍至900倍,中位数约50倍。不同任务差异很大,基准也不能完整代表真实工作,但方向很清楚:昨天只有最贵模型能做的事,过一阵往往会被更小、更便宜的模型接走。
OECD的另一组数据也显示,从2024年1月到2026年4月,文本模型的质量调整价格指数下降了近80%。
硬件变快,模型变小,量化、缓存和推理框架都在进步,同一张卡能吐出更多Token,同等水平的智能确实在降价。
但朋友们你们用AI的钞票花费却未必跟着降,因为我们已经不满足于问它一道题了。
普通聊天里,模型回答完一段话就可以休息。Agent要读代码库、查资料、调用工具、反复修改、检查结果,再把失败的步骤重新做一遍。Gartner估算,Agent模型完成一项任务所需的Token,可能是普通聊天的5倍到30倍。
单位价格掉了,购买单位却变了。
以前买一句回答,现在买它连续工作半小时。再往后,可能是一个晚上、一个项目,或者一支永远不在劳动合同里出现的虚拟团队。
一页纸每张便宜了,不妨碍公司突然开始打印整栋楼。
Epoch AI今年5月做过另一组估算。按他们选定的模型、芯片和上下文假设,全球推理供给能力每年增长超过三倍;用Google等平台的Token增长和大型科技公司的使用强度做代理,需求可能接近每年十倍。
这组数字不确定性很高。模型大小、上下文长度、用户愿意接受的速度,换一个条件,结果都会变。研究者也没有宣布普通人很快用不起AI。
他们给出的画面更像我现在的使用习惯:愿意付费的人继续使用最前沿能力,日常用户转向更小、更便宜的模型。明天的小模型会很快追上今天的大模型,所以普通人的能力未必倒退;只是“最好”和“够用”之间,会出现越来越清楚的价格差。
Fable 5面前的犹豫,MiniMax和DeepSeek面前的放松,并不是两个相反的故事。
它们本来就是同一个市场准备好的两个座位。
大家一起付,但不会平均分摊
算力真贵起来,谁付钱?
我的答案是,大家一起。
芯片公司和云厂商会拿走一部分,模型公司会用更高的效率消化一部分,也会把最强能力放进更贵的档位。应用公司重新设计订阅,企业开始把普通任务分给小模型,把最贵的模型留给代码、交易、科研和那些更容易算出回报的工作。
最后,个人也承担一部分。
有时用钱。有时用等待。有时接受模型降级。有时把问题删掉,告诉自己其实也没那么想知道。
“大家一起承担”听起来很公平,却不等于平均分摊。
有议价能力的人可以把成本继续往下传。没有议价能力的人,常常不出现在价格调整函里,只出现在调用量下降的后台曲线上。
更麻烦的是,市场会优先保障能把算力变成最多收入的任务。
写代码、做广告、跑交易、处理企业数据,都能解释为什么值得占用最强模型。一个人想把家里的旧照片整理清楚,想陪孩子多讲一个故事,或者只是凌晨睡不着,希望有人把一个问题好好回答完,这些用途未必不重要,只是很难向机房证明毛利率。
没有平台会正式宣布,你的问题价值不够。
队列和套餐会替它说得委婉一些。
本地部署的自由,也要先买显卡
理论上,还有一条路:自己部署。
模型权重放在本地,数据不必交给平台,想做什么由自己决定,也不用担心某天一个接口、一个智能体或一段长期记忆突然消失。
我也喜欢这种独立。
问题是,好的显卡买不起。显卡不够,能部署的模型、上下文和速度就都要打折扣。模型权重可以零元下载,可是能把它舒服跑起来的显存、电力和维护,这些让你畅玩大模型的配套并不免费。
本地部署的收益还直接取决于开源模型有多强。开放权重停在什么水平,普通人的本地能力大致就停在附近。你可以拥有机器,却未必拥有前沿智能。
所以我才会在不同服务之间切换。
贵的模型处理真正难的问题,MiniMax和DeepSeek承担大量日常任务,本地模型守住更私密、更独立的部分。这不是一套多高明的架构,只是一个普通用户面对价格、能力和隐私时,自然长出来的生活方式。
本地与低价模型没有把人彻底带回机房,却给前沿模型的定价权留了一道缝。每当前沿能力试图把稀缺变成长期租金,推理优化、小模型和开放权重又会把昨天昂贵的能力拖回普通人的电脑。
最好的模型今天可能很贵。够用的智能明天仍会更便宜。
Dwarkesh猜算力会不会涨十倍,我不知道。那篇文章本来就不是预言。
我只知道,套餐页越来越复杂了。月费、积分、五小时额度、周限额、高峰倍率、优先访问,每个词都在认真告诉用户:智能仍然向所有人开放,只是开放的速度、时段和深度略有不同。
我的手已经学会了这套规则。
发给Fable 5之前,先想一想。发给MiniMax和DeepSeek,先问了再说。实在私密的东西,留在本地那台还不够强的机器里。
平台当然可以给算力排座次,但什么问题值得被认真回答,最好还是留给按下发送键的人。
各位小伙伴,我很感兴趣你们每个月在AI上投入多少钱和订阅了哪些模型,投个票或者留个言,让我看看我是不是大冤种,么么哒!
本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。如对本稿件有异议或投诉,请联系 tougao@huxiu.com。
本文来自虎嗅,原文链接:https://www.huxiu.com/article/4879892.html?f=wyxwapp
热门跟贴