8月20日,一款名为Ox Alpha的推理模型正式上线,定位面向编码、持续性智能体任务及生产级工作负载。该模型由第三方模型提供商开发运营,目前通过OpenRouter平台对外提供服务,定价为免费,上下文窗口达到1M

Ox Alpha被描述为适合长周期软件工程、复杂推理以及文本与视觉上下文结合的工作流。值得注意的是,这是一款"隐身模型"(stealth model)——开发并运营它的第三方提供商在预览期间选择保持匿名。OpenRouter仅负责路由请求,并非该模型的开发者、所有者或提供商。

根据平台披露的信息,该模型的提示词和补全内容由提供商保留,不会用于训练。其他使用行为则受隐身模型条款约束。

性能数据:吞吐34 tok/s,可用性97.82%

OpenRouter页面展示了Ox Alpha的实时运行指标。在吞吐方面,该模型达到34 tok/s(P50,跨提供商最优);延迟为3.74秒(P50,最佳提供商);过去3天正常运行时间为99.99%,可用性为97.82%。OpenRouter整体可用性为97.98%。

当上游提供商发生错误时,OpenRouter可在请求过滤器允许的情况下,将请求路由至其他健康提供商以完成恢复。用户可通过Endpoints API以编程方式访问各提供商的运行时间数据。

实际使用场景:Claude Code与Hermes Agent为主要流量来源

公开数据显示,向Ox Alpha发送流量最多的公共应用包括:

  • Claude Code:Anthropic的智能体编码工具,可读取整个代码库、跨文件规划和执行更改、运行测试并迭代失败,流量达22B tokens
  • Hermes Agent:Nous Research推出的开源、自我改进型AI智能体,可跨会话持久运行并携带记忆,从经验中构建可复用技能。

这些应用的使用情况,为Ox Alpha在真实生产工作负载中的表现提供了参考信号,也侧面提示了该模型最适用的场景方向。

接入方式:OpenAI兼容API,替换base URL即可调用

Ox Alpha目前由单一提供商托管,OpenRouter将每个请求直接转发,无需做路由决策。开发者可通过OpenRouter的API调用该模型——该API与OpenAI兼容,大多数SDK只需替换base URL即可工作,不同模型之间唯一的变化是模型slug。

平台还提供了该模型随时间变化的token量和请求流量数据,以及用于直接调用的drop-in代码示例。对于关注推理模型在编码和智能体任务中表现的开发者而言,Ox Alpha的免费定价和1M上下文窗口,可能是一个值得纳入评估清单的新选项。