新智元报道
五千名工程师,四个月,把Uber一整年的AI预算烧成了灰。
面对这张账单,Uber的COO直接懵了:钱烧成这样,ROI到底在哪?
紧接着,微软、Meta、亚马逊,一个接一个开始给员工手里的AI编程工具踩刹车。
魔幻的是,这一切偏偏发生在Token单价一路下跌的2026年。
而它背后的「罪魁祸首」,就是Agent。
一个Agent跑完一个完整任务吞掉的Token,是过去一次简单问答的数倍乃至数十倍。模型越会干活,账单涨得越快。
于是,一门去年还没人当回事的学问,今年成了显学——给AI算账。
建模型的时代过去了
「麻烦」才刚开始
和前两年相比,现在的模型可以说是多到数不清。开源的、闭源的、通用的、行业的,能训的几乎都训出来了。
但更难的问题随之而来:模型都有了,怎么让它们在企业里跑得又快、又省、又安全?
真实的现场比想象中更乱。
一家大型企业,应用建了百八十个,模型接了四五十个,中间靠一条条硬连接对上。哪个应用走哪个模型,全凭当初谁接的谁。
跑是能跑。但三件麻烦事会挨个找上门。
第一件是成本。
不同任务的复杂度天差地别,落地时企业却习惯性地全量呼叫最高性能的模型。资源利用率跌进谷底,Token账单一路飙升。
第二件是治理。
AI已经在碰核心业务了,但权限怎么切、操作怎么审计、敏感数据怎么防外泄,这些企业级的防线普遍千疮百孔。一个能直接调用核心数据的AI,如果没装安全护栏,本身就是一枚定时炸弹。
第三件是国产化。
在央国企主导的私有化机房里,国产芯片上的推理效率,直接决定这台AI引擎转不转得起来,转得划不划算。
这三件事指向同一个结论:企业AI的重心,正在从「模型能力」转向「AI基础设施运营」。
换句话说,AI的上半场拼的是谁的模型更强,下半场拼的是谁管得住。
而这场控制力之战的第一块阵地,正是模型路由。
全都用最强的,这毛病你可能也有
这事你大概也有体感。自己用AI写代码的时候,明明有便宜的档位摆在那儿,可你还是把档位拉满。毕竟,万一它解决不了怎么办?
一个人这么干,浪费可能只是这周的订阅额度。但到了企业这里,就会变成一句「我的订单到哪了」和一份上百页的合同条款审查,烧掉一样贵的Token。
实际上,文本分类、信息抽取这类轻松活儿,跟长文档分析、复杂推理这类硬骨头,对算力的消耗差着好几个量级。
「模型路由」要做的,就是让每个任务都匹配到「刚刚好」的模型——
简单任务走性价比,复杂任务上高性能,在效果和成本之间找到最优解。
企业与大模型之间的超级立交
就在这届WAIC上,科大讯飞星火企业军团给出了自己的答案——「星火Token Factory」。
它的作用,是横在业务和大模型之间的「统一中间层」。
所有模型调用请求,都先流经这一层,由它来统一接入、智能调度、优化成本、把守安全。
最终实现的是,让任务匹配对的模型(算得聪明),砍掉不必要的算力消耗(算得省),把每一笔Token的账算清(算得明)。
接下来,我们一件一件拆开看。
把贵的模型用在刀刃上
首先是「星火Token Factory」的第一件事,也是最核心的一件。
它会根据Prompt长度、对话轮次、任务难度和数据敏感等级,把请求分成不同的级别,再匹配对应量级的模型:
简单的FAQ交给轻量模型,常规的公文摘要交给标准模型。复杂的合同审查等Agent应用交给Agent增强模型,而战略规划、安全审计这类要紧事,强制调用最高规格模型。
整个路由决策,会综合考虑「质量、成本、延迟、可用性、安全」等五个因子,而且平均决策延迟压在100毫秒以内。
进到真实业务里,这省下来的全是真金白银。
比如有个企业就发现,客服平台日均数万次咨询中,超过60%的请求不过是查订单、问退换货这类不用动脑的问题。
接入网关按难度分流、敏感信息强制走私有化之后,月均Token成本不仅比之前全量灌给高档模型砍掉了一半还多,而且响应速度反而还更快了。
不过,选对模型还只是第一步。接下来这三层,是为了在同一件事上少花冤枉Token。
第一层是语义缓存。遇到相似的旧问题,系统直接从记忆库里掏出答案。在内部知识问答这种高频轰炸的场景里,命中率能稳定在20%到30%。
第二层是Prompt压缩,第三层是上下文裁剪,各自再精准剔掉10%到20%的输入赘肉。
三层叠加,综合可以削减30%到60%的Token消耗。
对一家日调用量以亿计的大企业来说,这几十个百分点的落差,就是财报上真金白银的差别。
同样的卡,扛起翻倍的业务
跨过路由这关,还有一块更硬的骨头:推理引擎。
在国产化私有部署场景里,推理引擎的强弱,直接宣判了算力利用率和服务成本。
在这个场景里,科大讯飞针对DeepSeek、Qwen、GLM等国产主流模型,紧贴昇腾硬件特性,从最底层的算子一路做到最上层的调度。
显存侧用模型压缩和精度优化把占用压下来,让有限的硬件能吃下更大的模型、更长的上下文;
计算侧把零散算子融合成高效指令序列,还对多卡通信做了调度优化,让计算和通信并行重叠;
缓存侧引入跨节点的KV Cache管理和上下文感知的缓存路由;
解码侧则上了面向昇腾的并行解码加速。
实测显示,相同硬件条件下,对标开源的vLLM-Ascend框架,推理效率提升约为5倍,首Token延迟降低30%到40%。
也就是说,同一批国产算力,现在能硬抗接近翻倍的业务量;反过来,企业也可以用更少的卡,撑起同样规模的服务。
另一家企业的经历,便是这串数字最好的注脚。
他们在自有的8台8卡昇腾服务器上,塞进了讯飞星火、DeepSeek、Qwen等一众模型,承载内部多个AI应用。
随着接入的应用越挂越多,工作日高峰期的并发压力不断攀升,吞吐终于撞上天花板。响应卡顿、排队等待,个别长文本请求甚至会霸占通道,把其他短请求活活拖慢。
经过评估之后,他们最终决定直接升级高性能推理框架。结果就是,整体效率提升约50%,等效省下数百万元的硬件采购成本。
你只知道花了多少,却不知道值不值
开头那张让大厂高管夜不能寐的账单里,其实藏着两个问题:钱花在哪了,和这钱花得值不值。
过去企业能查到的,最多只有前半个。
某个API调了多少次,扣了多少钱,账单上写得清清楚楚。但这笔钱办成了哪件事、顶了几个人力、这活到底该不该交给大模型,账上一个字都查不出来。
对此,「星火Token Factory」给的答案是全链路可观测。
从用户、部门、项目、模型一直追踪到部署方式,用八个维度把每一笔Token的去向扒得一清二楚,再配上预算预警、路由分析和ROI报表。
这一点对企业的数字化部门尤其要命。
一年预算砸下去,建了几十个模型、上百个应用,年底要跟大领导汇报成效。过去,多半只能靠拼凑和估算,现在总算有据可查了。
安全那一侧,「星火Token Factory」另有一套企业级体系。
三权分立加混合授权,管理不碰数据、操作不碰权限、审计不碰业务,三者互相独立、互相制约;全链路审计记录不可篡改、不可删除、不可绕过;敏感信息自动识别、分级路由,确保数据不出域。
这套治理体系,往往比模型跑分榜上的名次,更能决定一家企业的掌舵者到底敢不敢把核心业务交出去。
AI的下半场,拼的是运营力
除了作为调度中枢的「星火Token Factory」,科大讯飞星火企业军团这次还发布了三款企业级新品。它们合在一起,共同拼出一张「场景—能力—平台」新产品矩阵。
星火营销助理,是一个精通营销策略、能持续进化的AI营销数字员工。它以营销策略大脑为核心,跑通了「1名真人座席+5个AI分身」的人机协同模式,AI分身的音色和沟通风格与真人座席保持一致。在试点中,日均有效沟通时长被提高了36%。
星火AI企业风控官,则扛起「企业风险体检」这面大旗,把过去高度依赖老师傅经验的风险判断,格式化成可解释、可追溯的标准动作。审核决策效率提升5到8倍,目前已经稳稳扎进多家头部银行的信贷风控场景。
星火智能语音VoiceWise,通过高性能CPU版ASR让企业彻底摆脱对昂贵GPU的依赖,同等算力下在线识别并发路数提升约90%。全双工技术更让AI能边说边听,在某保险公司的业务高峰期,扛住了7000路实时语音并发。
如今,全球AI早就跨过了「能不能用」的青涩期。尤其是,中国的日均Token调用量,两年涨了超过一千倍。
但Uber们的账单同时也在宣告,光会用,远远不够。
真正决定一家企业能走多远的,是下半场的新法则。
当模型能力逐渐成为公共品,企业之间的差距,将越来越取决于谁能把AI管得更精细、算得更清楚、跑得更稳定。
换句话说,未来企业竞争的,不再只是模型能力,而是AI运营能力。
模型路由的调度、推理引擎的压榨、安全底线的死守、运营数据的深度解剖,这些深埋地下的隐形地基,正在成为AI规模化落地的真正支撑。
这次「星火Token Factory」补上的,正是这块地基。
它让语音、营销、风控这些冲锋在前的能力,得以在企业的血管里安全高速地奔涌;也让站在Token经济与国产化替代双重路口上的央国企,摸到一条从概念验证走向价值兑现的清晰航道。
模型参数还会继续膨胀。但下一张寄到CFO桌上的AI账单,不该再是一笔糊涂账。
算得清、接得快、管得住——这是企业AI下半场的入场券,也正是「星火Token Factory」想替企业拿到的东西。
https://www.forbes.com/sites/janakirammsv/2026/05/17/uber-burns-its-2026-ai-budget-in-four-months-on-claude-code/
https://www.news.cn/tech/20260326/8026bd54df3f489a8c79d4438cac96b3/c.html
热门跟贴