一个不报名字的模型,把DeepSeek挤下了王座
一头不报名字的“牛”,站上了用量榜的王座
8月20日,全球最大的AI模型聚合平台OpenRouter的目录里,悄悄多了一个条目:stealth/ox-alpha。
没有公司名,没有参数规模,没有技术报告。提供商一栏写着“Stealth”(匿名),价格栏里只有两个字:免费。官方介绍也只有干巴巴的一句——面向编码、长周期智能体任务和实际生产环境的前沿模型。
按常理,这种“三无”条目活不过一天。结果上线12小时,它刷屏了。
首日,Ox Alpha冲上OpenRouter模型用量榜首,刷新平台单日用量纪录;在代码评测平台OpenCode上,它终结了DeepSeek连续56天的霸榜。那个位置,DeepSeek坐了将近两个月。
一头连名字都不报的“牛”,把王座掀了。因为Ox在英文里是公牛,又赶上电影《牛来》走红,中国网友干脆给它起了个外号:牛来大模型。
白嫖的算力,干的是真活
先说它凭什么。
硬参数确实唬人:上下文窗口104.8万token,最大输出13.1万token,文本、图片、视频都能吃,预览期每天免费100万亿token的额度——有业内媒体算了笔账,这个量相当于支付巨头Visa一整月AI用量的100倍。
一个能装下整个代码仓库的上下文窗口,加上近乎无限的免费额度,程序员闻着味就来了。
但真正让这头牛站稳榜首的,是测试成绩。独立研究员本·戴维斯(Ben Davis)从软件工程基准DeepSWE里抽了10项真实任务,Ox Alpha做对8项,通过率80%。同一组任务,Claude Fable 5是65%,GLM-5.3和Grok 4.6都是62%,GPT-5.6 Sol只有52%。在完整的113项DeepSWE评测中,它拿了63分,逼近Claude Opus 4.8。
Stripe创始人帕特里克·科里森亲自上手试了试,只留下两个词:very impressive,非常惊艳。
调用量更能说明问题。仅Hermes Agent、Claude Code等前五大应用入口,对Ox Alpha的累计调用就突破了4万亿token;上周(8月17日至23日)全球大模型总调用量93.3万亿token,中国模型连续17周压过美国排在全球第一,其中Ox Alpha单周11.6万亿token,冲进全球前二。
值得划重点的是这些流量的成色:OpenRouter数据显示,Ox Alpha头几天最大的流量来源不是围观群众,而是Agent工具——Claude Code和Hermes Agent是消耗大户,全是真刀真枪的生产力工作流。程序员是最挑剔、最不讲情面的用户群体,好用就用,不好用三分钟就换。这份成绩单,是全世界最苛刻的一批用户用真实工作流投出来的。
全民侦探,扒到只剩底裤
比性能更热闹的,是它的身世。
全球开发者用“技术指纹”给匿名模型验明正身
OpenRouter只透露,模型来自“一家暂时保持匿名的第三方提供商”。于是一场“寻找牛爹”的侦探游戏在全球开发者社区上演,候选名单跨度极大:智谱GLM、谷歌Gemini、小米MiMo、微软MAI,甚至还有人猜是OpenAI前首席科学家伊利亚创办的SSI。
开发者们用“技术指纹”一层层把它扒开。有研究者发布的分析报告列出了几条关键证据:Ox Alpha的分词器与智谱GLM-5.3的token计数完全一致,只存在固定的75个token隐藏包装差异——这几乎等于共用同一本词汇表;四组视频测试中,Ox Alpha与智谱GLM-5V-Turbo的token消耗完全相同,采样率精确到每秒147个token,这种程度的吻合很难用巧合解释;连API报错格式都对得上,错误码“1210”被指是智谱服务的专属标识。
证据链几乎都指向智谱。但也有杂音:有分析认为其分词器特征同样兼容微软MAI模型家族;几名谷歌DeepMind研究员发帖暗示,它可能是Gemini的新版本。截至发稿,没有任何厂商出面认领。
一位开发者的调侃流传很广:“AI圈现在流行法医式解剖,匿名模型被扒得底裤都不剩。”
牛之前,还有马、猎犬、大象和猫头鹰
匿名发布不是头一回。把时间线拉长看,OpenRouter上的stealth模型,几乎每一次最后都被证实来自中国厂商。
今年2月,代号Pony Alpha的匿名模型上线,5天后揭晓身份——智谱GLM-5。上次是马,这次是牛,难怪网友调侃:“无论从分类学还是从‘牛马’的隐喻来看,都很合理。”
再往前翻,Hunter Alpha后来确认是小米的MiMo-V2-Pro,Elephant Alpha出自蚂蚁的Inclusion AI,Owl Alpha是美团LongCat-2.0的马甲。一家一个代号,凑在一起快能开动物园了。
市场普遍预期,谜底大概率在8月28日揭晓——智谱GLM-5.3计划于当天正式开源,如果Ox Alpha真是它的预发布版本,时间点严丝合缝。
匿名,是烟雾弹还是试炼场
厂商为什么开始流行穿马甲?AI商讯手记认为,至少打了三层算盘。
第一层,摘掉品牌滤镜做测试。名字一挂,评价就不再纯粹:挂上中国厂商的名字,海外开发者可能先扣分再看产品;挂上巨头的名字,又会自带粉丝滤镜。匿名状态下的调用量和口碑,是含金量最高的市场反馈。
第二层,管理预期。新模型首发最怕被舆论架起来烤,先匿名跑一阵,真实表现摸清楚了,再挑时间官宣亮相,进可攻退可守。
第三层,其实是免费的暴力测压。每天100万亿token的免费额度,等于邀请全球开发者帮它做最严苛的压力测试。上线几天就跑出万亿级token的真实生产负载,这种数据花多少钱都买不来。难怪有用户直说:“免费100T额度太香,已经拿来跑真实工作流了。”
当然,匿名不是万能的。大上下文窗口不等于能有效利用每一个token,独立研究者也明确指出,它对超长输入的实际表现还缺乏独立验证。马甲能藏住名字,藏不住指纹——这一次,社区只用了三天就把证据链拼得七七八八。
王座换了主人,悬念只剩三天
回头看这件事的真正分量。
如果证据链成立,它就不只是“智谱又出了个新模型”这么简单:一个国产大模型,在不挂自己名字的情况下,被全球最挑剔的程序员用真实工作流推上了用量榜第一,还顺手接住了万亿级token的调用负载。跑分可以刷,调用量刷不出来。
这也解释了为什么中国大模型周调用量能连续17周压过美国——当海外厂商还在发布会PPT里比拼参数时,中国厂商已经学会了让产品脱掉马甲、直接下场比赛。
王座易主只用了一天,谜底揭晓只剩三天。8月28日,是智谱GLM-5.3的开源日,也是“牛来”验明正身的日子。
如果到时候站出来认领的不是智谱,那这场侦探游戏,才刚刚进入第二幕。
热门跟贴