过去一年,全球大模型竞争的关键指标正在生变。第一财经AI周报显示,中国大模型调用量已连续20周超过美国;在OpenRouter调用量前十中,一年前只有两个中国模型,一年后局面几乎完全翻转。与此同时,阶跃星辰、智谱、阿里通义、DeepSeek、百度以及华为与中电信密集发布新模型、新价格和新智能体平台。把这些信号放在一起看,国产大模型正在从“榜单能力”竞争,转向“单位成本、真实调用与行业智能体落地”的综合竞赛。
调用量翻转:开发者开始用API投票
调用量连续20周领先,不是单点榜单成绩,而是开发者用API投出的市场结果。模型是否便宜、稳定、长上下文是否可靠、工具调用是否顺滑,最终都会反映在调用规模上。
第一财经AI周报提到,OpenRouter调用量前十的模型结构中,中国模型从一年前的两个席位,扩展到几乎占据主导。这个变化背后,是国产模型在开源权重、API价格、长上下文和Agent能力上的组合推进。终端侧,第二代豆包手机开售,也说明模型调用正在从云端API向手机入口延伸。
对通信行业而言,这意味着AI流量不再只是训练集群内部的东西,推理调用正在成为云网边缘和数据中心东西向流量的新增长点。
成本成为第一竞争维度:每百万Token进入“分厘时代”
国产大模型这一轮竞争,最直观的变化是价格。DeepSeek在8月17日落地峰谷定价后,又在8月23日零点调整规则,把周六、周日全天从峰谷区分中拿出来,统一按低谷价收费。中秋9月25日至27日、国庆10月1日至7日,加上调休的周末,接下来约十天出头都将按空闲价结算,被外界视为全年最集中的“半价窗口”。
DeepSeek近期上线的4.1 Flash,在性能上超过自家Pro,但价格仍按Flash档位执行。按开放平台公开口径,Flash空闲时段缓存、输入、输出分别为0.02元/百万tokens、1元/百万tokens、4元/百万tokens。对于高频调用场景,这种价格已经足以改变应用侧的成本结构。
阶跃星辰的新一代旗舰基座模型Step 5 Preview,则把竞争拉向“单位智能成本”。据科创板日报报道,该模型重点面向AI编程、软件工程、专业知识工作、金融等场景,在AA综合智能指数中跻身全球开源前三,单任务成本仅为Claude Opus 5的1/8,并计划于10月15日正式开源。价格不再只是低,而是要在能力、效率和场景覆盖之间找到平衡。
智能体开始反向优化基础设施
比降价更值得关注的,是智能体开始进入AI基础设施的腹地。据爱范儿报道,智谱GLM-5.3-Flash在超过10万颗国产AI加速器组成的集群上,从首次运行到完成全部生产流量承载仅用两周,系统端到端吞吐能力提升3.2倍。更关键的是,完成大量优化工作的并非只有基础设施工程师,还有一个由GLM-5.3驱动的Infra Agent。
唐杰将其描述为“一个帮助优化服务自身的模型”。这距离真正意义上的递归自我改进仍很远,但早期形态已经出现。
智谱团队提出的“dense feedback”,核心是让Agent获得更接近工程判断过程的信息:计算是否正确、性能下降发生在哪里、某个优化方案是否适用于当前场景。没有这种密集反馈,Agent能写代码,却很难判断“为什么结果变差”。
在具体案例中,Infra Agent发现KDA上下文并行路径中TF32计算舍入误差随序列长度累积,影响长上下文计算精度;还发现KV Transfer与DeepEP Dispatch没有有效重叠,导致部分场景传输开销超过30%,修复后降到1%以下;在一个Decode Kernel中,它识别出同一组归一化计算被重复执行四次,重新组织计算结构后获得1.71倍性能提升。
部署完成后,GLM-5.3-Flash以匿名模型名Ox-Alpha运行在OpenCode和OpenRouter平台,一周内成为两个平台使用量最高的模型之一,六天处理超过62万亿token。模型优化系统,系统再服务模型,这条闭环开始具备工程意义。人类工程师的角色也在变化:从直接解决每一个问题,转向设定目标、搭建反馈环境、审核高风险修改。
国产软硬件协同进入“可训练、可推理、可落地”
智能体要规模化,离不开国产算力底座。9月17日,中电信人工智能科技有限公司发布新一代星辰大模型Xing4.0-29B-A4B,总参数29B,激活参数仅4B,支持长上下文处理,聚焦复杂任务理解、任务规划、工具调用和自主执行,可应用于代码开发、数据分析、办公自动化及生活服务等场景。
据IT之家报道,华为中国官方称,该模型基于昇腾Atlas 900 A3 SuperPoD液冷超节点与昇思MindSpore框架完成训练,面向复杂工程任务深度优化。训练过程中,模型通过多层次软硬件协同优化实现训练性能提升96%;针对细粒度MoE、专家负载均衡、Grouped GEMM、通信计算重叠等优化,吞吐提升32%;层级与算子级选择性重计算再提升19%;自研Ascend C mHC融合算子解决Sinkhorn碎片化,计算效率提升30%,整网吞吐再提升25%。
IT之家还报道,昇腾已支持40+个业界头部模型完成原生训练。对通信产业来说,这不是单一模型发布,而是运营商、设备商、云服务商在算力、框架、模型和行业场景上的协同开始加深。运营商不再只卖连接,也在卖算力、模型和智能体平台;设备商则把超节点、液冷、互联和框架能力打包成AI基础设施。
行业智能体落地:从“生成页面”到“办成事”
模型能力提升之后,下一步是能否真正进入业务系统。量子位实测显示,Qwen 3.8 27B在开发者圈走红,工程师将其与Cerebras叠加后,生成“Google首页”仅约6.78秒,搜索出“YouTube”约6.07秒。实测中,它用约5分钟生成一个52KB的数据分析工具,能处理表格空白、重复和异常数据,并汇总核心指标。
但一到真实交易,问题就暴露出来。让它生成12306抢票页面,蓝白配色、车次列表、席座价格、余票数量、预订按钮一应俱全,甚至能弹出“购票成功”页面,但因为没有联网接入12306实时数据、用户账户、支付系统和真实后端,实际订单并不会出现。一句话生成网页,不等于一句话交付产品。行业智能体必须打通身份、支付、实时数据和外部服务。
垂直行业的多模态模型也在推进。Techmeme转引南华早报消息称,阿里巴巴达摩院开源RADAR医疗视觉语言模型,可读取CT扫描并识别约150种腹部疾病,包括癌症。这类模型说明,智能体在医疗等高门槛行业的价值,不在于聊天,而在于辅助识别、流程嵌入和专业交付。
百度则在企业侧加速。9月20日,百度智能云超级智能体大会深圳站举行,百度搭子升级企业版多人协作能力,发布企业版移动端和智能体开发平台,并启动生态共创计划。数据显示,百度搭子用户规模环比增长9倍,交付物需求环比增长4.3倍,专家套件使用量环比增长7.3倍。智能体正从个人助手走向企业协作和交付物生产。
拐点之后:看调用量,更看每Token效率与行业闭环
中国大模型调用量连续20周超过美国,是一个产业拐点信号,但不是终局。它说明开发者市场已经认可国产模型在成本、开源、工具调用和迭代速度上的综合优势。下一步,竞争会集中在三个方向:每百万Token成本能否继续下降,国产算力集群的推理效率和稳定性能否持续提升,行业智能体能否真正接入业务系统并形成数据闭环。
对通信行业而言,机会在算力网络、超节点、液冷、云网融合和智能体平台。大模型从榜单走向生产系统,考验的不只是模型参数,而是从芯片、框架、集群、API到终端和行业知识的全链条能力。调用量领先只是开始,把调用转化为可持续的产业价值,才是国产大模型真正的下一场比赛。
热门跟贴