8月20号深夜,一个忍者的表情包甩出来,OpenRouter 上多了一头叫 Ox Alpha 的"牛"。
模型是谁的?不知道。参数多大?没说。训练用了啥数据?保密。能不能跟 GPT、Claude 那些旗舰掰手腕?没人敢说。
但它能干一件事——把开发者圈当晚炸醒。
因为它给的待遇太离谱:100 万 token 的上下文、13 万 token 的最大输出、文本图片视频全能吃进去、工具调用和 JSON 结构化输出也支持,预览期完全免费。
OpenRouter 自己说得更明白:这是一款面向"长期 Agent 工作"的前沿编程模型——不是写一段代码那么简单,是要当一个能连续干几小时甚至几天的工程师。
先说让人炸的部分。
100 万 token 的上下文,13 万的输出,能吃图片能吃视频。
干过 Agent 的人知道这三个数凑一块儿意味着什么——你可以一次性喂进去一整个中型代码仓库,外加几百次工具调用的历史,外加几张产品截图和一段客户录屏的视觉参考,然后让 Agent 自己把活儿干完。
这种规格,过去只有 Google 的 Gemini 旗舰敢这么标。
现在一头连名字都不敢报的新模型,也摆出了同样的牌面。
而且它在 OpenRouter 上是免费的。
开发者不是傻子——免费的百万上下文,立刻被塞进 OpenCode、Claude Code 这类工具里跑真实项目。有人在十几个具体任务里把它跟 Fable 5、GPT-5.6 Sol、Grok-4.6 还有 GLM-5.3 拉一起横评,Ox Alpha 通过率 80%,第二名 Fable 5 是 65%。
注意,这个样本量很小,测试口径也不统一,榜单第一不等于"它就是新的王者"。但 80% 这个数字,至少说明它不是来凑数的。
那它最让人看不懂的地方是——为什么要匿名?
按以前的玩法,模型发布是这样的:先开发布会、公布技术报告、晒榜单、再开放 API。OpenAI、Anthropic、Google 全是这个路数。
Ox Alpha 反着来。
OpenRouter 自己说得很清楚:我只是路由,模型是第三方匿名供应商给的,预览期间保持隐身。
这套打法的逻辑其实挺狠。
对厂商来说,模型先匿名进入开发者的真实工作流,被压力测试,被骂被夸被反馈,最后揭晓身份——揭晓那一刻又是一轮传播。哪怕翻车,也能悄悄收场,不砸正式品牌。
对 OpenRouter 来说,它也不再只是"汇总各路 API 的中间层",它正在变成模型公司的公开试验场——统一接口、真实开发者、海量 Agent 流量、真实使用数据,正好给即将发布的模型提供一块灰度测试田。
这件事真正的信号是:模型发布这件事,规则在被悄悄重写。下一步的新模型,可能不再先开发布会,而是先悄悄潜入开发者的终端,跑一周、烧几万亿 token,再带着真实反馈闪亮登场。
再说大家最关心的事——这头牛到底是谁家的?
匿名模型上线几小时,社区就玩起了大型"猜模型"。现在比较集中的怀疑方向有四个。
**第一个,也是呼声最高的小米 MiMo。**
证据链一条比一条硬。
时间点咬得很紧——8月18号,小米 CFO 林世伟在财报电话会上刚透露过,新一代 MiMo 正在训练、有望很快发布。小米没说具体型号,所以"MiMo V3"只是网友的临时称呼。
更关键的是,小米以前干过一模一样的事。今年 3 月,一款叫 Hunter Alpha 的神秘模型就在 OpenRouter 上免费上线,被外界猜成 DeepSeek V4,最后小米自己认领——其实是 MiMo-V2-Pro 的早期内部测试版。Hunter Alpha 当时也是 100 万上下文、也是冲着 Agent 去的,上线后很快烧掉 1 万亿 token 的调用量。
更巧的是产品定位。Ox Alpha 主打"高效编程、长期 Agent、生产环境",目前的 MiMo 系列正好也把代码、工具调用、长周期 Agent 执行当主战场。
所以 Reddit 上有用户直接下判断:这玩意儿八成就是 MiMo V3,趁它还开着赶紧用。
**第二个怀疑对象是腾讯混元 HY 4。**
理由听着也合理——能扛住这么大规模免费调用的厂商本来就不多,腾讯在算力和推理基础设施上确实有这个底子。也可能是为了在正式发布前,先收一波真实 Agent 任务数据。
但猜测归猜测,目前没有 OpenRouter、腾讯或第三方机构给出任何能把它和混元绑定的硬证据。
**第三个怀疑对象是 Google Gemini。**
因为 Ox Alpha 也有百万上下文,也原生支持图片和视频输入,这两个特征摆在一起,确实容易让人往 Gemini 上想。
更绝的是有人跑去问 Ox Alpha"你是谁",它居然回答"我是 Gemini",截图一发出来,X 上就炸了。
但这种鉴别方式根本不靠谱。模型回答"我是 Claude"、"我是 GPT"、"我是 Gemini",从来都不能当成归属证据——它可能就是从训练数据里学来的合理答案。
对 Stealth Model 来说,提供方本来就主动在藏身份,让模型"自报家门"等于问一个小偷"你是不是贼"。
Gemini 只是"缩小范围"的线索,不是答案。
**第四个怀疑对象是智谱 GLM-5.3。**
这条线看上去技术含量最高。有用户跑了 50/50 的对抗字符串测试——专门设计那种让模型"露出原形"的提示词——结果 Ox Alpha 的分词器和 GLM-5.3 匹配度最高,跟 Gemini、DeepSeek、Kimi 的匹配度都只有 18%-22%。
更重要的是,国内有用户提到一个细节:智谱之前出过一个叫 Pony Alpha 的模型,现在又冒出来一个 Ox(牛),命名风格像是同一个路数。
这条线最让人意外。
聊到这儿,我自己有个判断。
四个怀疑方向里,最像真凶的有两个——小米和智谱。
小米强在"历史重演"——3 月 Hunter Alpha 的剧本几乎是这次的预演,套路、时间点、产品定位全对得上。
智谱强在"技术指纹"——分词器匹配度是几个候选里最高的,而且 Pony Alpha 加 Ox 这个命名节奏,不像临时起意,更像是刻意的产品序列。
剩下两个方向——腾讯混元和 Google Gemini——更像"逻辑上能说得通但找不到硬证据"。腾讯有算力但没动机(混元最近没放出要发新版本的风声),Google 没必要这么藏着(它发新模型从来是大张旗鼓)。
但无论最后揭晓的是谁,这头牛背后的厂商,已经在打一种新的算盘——不再是"先发论文、再开放下载、最后收开发者"的旧三板斧,而是"先匿名潜入开发者的真实工作流、跑出真实反馈、再揭晓身份"的新打法。
最后一件事值得单独拎出来说。
ox alpha 有个细节挺让人玩味——它支持三档推理强度:low、high、max。
有人拿 SVG 测试题试过。low 档 13-21 秒搞定,high 档 19-23 秒,到 max 档推理字段直接飙到 1.7 万到 6.2 万字符,单次生成耗时拉到 124-355 秒。
问题来了:max 档生成出来的东西比 low 档好吗?细节确实多了——云朵、太阳、头盔、速度线都出来了。但核心构图——鹈鹕的腿有没有踩在踏板上、车架比例对不对——并没有相应幅度的提升。
这就是典型的"过度思考"。模型花了十几倍的时间和几十倍的 token,换来的主要是装饰细节,不是结构准确性。
这件事跟 OpenRouter 给它的定位——"sustained agentic work(可持续的智能体工作)"——其实是矛盾的。
真正能持续干活的 Agent,要的不是 max 档的炫技,是 low 档的稳定。一个模型如果每一轮都要花 200 秒思考,它根本撑不住几小时甚至几天的连续工作。
换句话说,这头牛如果真要"24 小时不眠不休当工程师",它接下来得解决的不是"能不能做最难的事",是"能不能用最便宜的方式把绝大多数普通事做对"。
这条路,比刷榜单难得多。
说回 Ox Alpha 本身。
它现在在 OpenRouter 上完全免费,输入输出都零——同规格的 Gemini 3.7 Flash 是 0.375 美元/百万 token 输入、1.875 美元/百万 token 输出,GPT-5.6 Sol Pro 直接是 2.5 / 15 美元。
对比之下,免费不是小恩小惠,是直接把几百倍的成本差距拍在桌面上。
当然这种免费不会永远持续。背后厂商肯定在观察:模型在真实 Agent Harness 里会在哪些工具调用上翻车?面对多长的上下文开始遗忘目标?连续修改几十个文件后还记不记得最初的需求?开发者愿不愿意在免费结束之后继续用?
这些问题答完了,这头牛才会从"匿名灰度"走进"正式发布"。
至于忍者面具后面到底是哪家——我赌小米。证据链最完整,剧本最像。
但我也可能被打脸。
热门跟贴