听雨 发自 凹非寺量子位 | 公众号 QbitAI

听雨 发自 凹非寺量子位 | 公众号 QbitAI

不是,连微软都开始心疼token了??

根据内部邮件,从今年7月开始,微软已经为各业务部门设置了「AI Token预算目标」。

将GPT-5.6设置为内部默认模型,原因是更便宜。

打开网易新闻 查看精彩图片

微软,那你这就是没见识过来自东方的神秘力量了。

要论便宜,你咋不直接上DeepSeek呢…

微软执行副总裁Jay Parikh也在内部亲自放话:

  • Tokenmaxxing不是我们优化的目标。

在微软,用AI也得勒紧裤腰带

根据Parikh的内部邮件和更新后的Copilot使用指南,微软新政可以拆成几条:

第一,设预算。从2026年7月起,微软各业务部门都有了「AI token预算目标」。

但具体的支出目标数值,目前尚未公布。

第二,看得见花费。员工可以查看自己的个人AI token支出。

内部数据显示,许多工程师每月token花费在几百到几千美元之间。

第三,换默认模型。内部默认模型从原来的选项切换为GPT-5.6,原因是比其他模型更便宜。

这还没完,微软表示,后续可能会根据监控情况施加进一步限制。

Parikh在内部邮件中说,「像管理其他所有关键资源一样管理token花费」。

他要求员工在用GitHub Copilot加速业务的同时,「每个人都应该意识到自己是如何消耗token的」。

其实这事儿也不是空穴来风。纳德拉6月份在一期播客上就说过,微软内部存在很多Tokenmaxxing。

打开网易新闻 查看精彩图片

甚至,他还承认自己也是个Tokenmaxxer,疯狂刷token,看着用量上高昂的数字,确实很上瘾。

但作为老板还是得算账。于是他又人间清醒了:生产率提升的边际收益,必须匹配token的边际成本

不是每个问题都值得调用最强、最贵的前沿模型。模型跑得更久、上下文塞得更满、Agent开得更多,也不等于最终成果更好。

两个月后,这个判断就从CEO的播客发言,变成了微软的内部政策。

不过,微软员工倒是非常不满。一位员工表示:

  • 一家在AI上重金投入、补贴了海量推理的公司,现在居然引导自家员工省钱??

这名员工的质疑相当尖锐:如果连托管AI基础设施的公司,都需要担心自己能否负担内部AI产品,那么购买这些服务的普通企业,又该怎么办?

Tokenmaxxing,大家都卷不动了…

Tokenmaxxing真正火起来,也就是最近几个月的事。

token+maxxing(刷到极致),跟gymmaxxing(猛练健身)、looksmaxxing(极致改造外貌)是同一套互联网造词逻辑。

不过,它并不形容某种自我提升,而是一种扭曲的激励——把AI用量当成了企业内部的KPI。

今年3月,Meta、OpenAI等公司的员工已经开始在内部排行榜上比拼token消耗量。

一些公司还将更高的token预算视为工程师福利,希望员工同时启动多个Agent,把更多工作交给AI。

到了5月,这股风吹到了亚马逊。

亚马逊内部搞了一个叫KiroRank的排行榜,按员工在自家AI开发平台Kiro上的AI使用量打分。

其实吧,公司的初衷大概是想鼓励工程师多用AI工具,用得越多,排名越高。

结果一些员工开始「刷榜」:让AI Agent执行没有必要或者价值很低的任务,只为提高使用量。token烧了不少,实际代码产出却没有同步增长。

打开网易新闻 查看精彩图片

月底,排行榜被关停。高级副总裁Dave Treadwell还专门提醒员工:

  • 请不要为了使用AI而使用AI。

但类似的token刷量大赛,已经在几个月内风靡硅谷:

OpenAI一名员工曾一周处理2100亿tokens,足够把整个维基百科填满33遍。

Shopify和Meta也把AI使用纳入了绩效考核,奖励重度使用的员工,批评不用的。

打开网易新闻 查看精彩图片

Meta内部还曾出现名为Claudeonomics的员工自建排行榜,统计公司8.5万多名员工的AI使用情况。

里面不仅列出Token消耗最高的250人,还颁发「Token Legend」「Cache Wizard」等虚拟称号。

好家伙,这token版「英雄联盟」都出现了…

老黄也没少火上浇油。今年3月,黄仁勋在《All-In Podcast》中公开表示:

  • 如果一个年薪50万美元的工程师每年消耗的token不到25万美元,我会深感担忧。

之后,在GTC 2026上,老黄又表示:

自己愿意在工程师几十万美元年薪之外,再提供相当于一半年薪的token预算,因为这些token有机会将工程师的能力放大10倍。

打开网易新闻 查看精彩图片

当然了,作为一个卖铲子的,工程师多烧一个token,AI基础设施就多一分需求。

老黄为Tokenmaxxing公开站台,多少带着一点朴素的商业立场。

但现在大厂们回过头来发现,事情有点不对劲了。

这不行啊,激励什么就得到什么。激励token用量,收获的是token泡沫。

404 Media发布的调查显示,Atlassian的月度AI支出在不到一年内增长至原来的三倍,超过1500万美元。公司随后开始设置支出限制,要求员工控制模型使用成本。

Uber的情况更夸张:整个公司到4月就烧光了2026全年的AI编程预算,Cursor给Uber提供的新一轮报价上涨至此前的4到5倍。

打开网易新闻 查看精彩图片

Uber随后规定,每名员工使用每一种Agent编程工具,每月不得超过1500美元。

从Amazon、Adobe、Atlassian到Citi,各家公司都开始收紧员工近乎无限的AI使用。共同解法就一个:简单任务别再默认调用最强模型,能降级就降级

据相关消息,Citi曾要求员工按照任务难度选择模型,不要所有任务都使用最昂贵的版本;部分高成本模型一度被暂停访问。

Adobe也在取消员工对Claude的无限使用。

打开网易新闻 查看精彩图片

然而,钱还不是Tokenmaxxing留下的唯一问题。

有多名开发者表示,长期依赖AI之后,他们感觉自己的编程能力正在退化。

有人发现,自己越来越难判断一段代码究竟写得对不对;还有人担心,当成百上千名工程师同时提交大量AI生成代码时,根本没人有能力逐行检查其中的安全和质量问题。

那么,老板不看token消耗量了,以后看什么?

答案是:看工作成果

比如Meta,从今年开始将「AI驱动的影响」列为员工的核心工作要求。它不再强调消耗了多少token,而是看员工能否利用AI产生实际影响。

当然,这套指标同样可能被形式化甚至被滥用。但与token排行榜相比,它至少试图回答一个更接近工作的基本问题:

你到底做成了什么?

在这波行业转向中,微软甚至算得上最后一批跟进者。

OMT

不过话说回来,硅谷想搞Tokenmaxxing,直接用DeepSeek就好了啊!!

打开网易新闻 查看精彩图片

用什么GPT-5.6、Fable 5,贵得离谱,也能怪Uber 4个月就能烧完全年所有预算…

诚挚安利老美程序员:

直接上DeepSeek V4 Flash,你蹬,你就只管蹬,公司破不了产。

[1]https://www.404media.co/microsoft-tells-engineers-tokenmaxxing-is-not-what-we-are-optimizing-for/
[2]https://www.404media.co/the-tokenpocalypse-is-here-companies-are-scrambling-to-stop-spending-so-much-on-ai/
[3]https://www.404media.co/software-developers-say-ai-is-rotting-their-brains/
[4]https://www.404media.co/companies-are-throttling-employees-ai-use-because-its-too-expensive/
[5]https://www.nytimes.com/events/hardforklive