开源大模型阵营又添新玩家。Ornith 公司正式发布 Ornith-1.5 开源模型家族,一口气推出三个不同规模的版本:397B MoE、35B MoE 和 9B Dense。其中 9B 还提供了面向 iPhone 和 Android 的量化移动版,本地跑大模型的门槛又低了一截。
这次发布的三个版本覆盖了从云端到端侧的不同场景。397B 的 MoE(混合专家)版本定位旗舰,35B 版本在激活参数上做了优化,而 9B Dense 版本则瞄准了移动设备。据官方介绍,Ornith-1.5 采用端到端自我改进的方式训练——模型自己提出新任务、生成任务专属脚手架,并产出用于强化学习的解决方案。
旗舰版跑分:终端测试 85.1,SWE-bench 86
数字最能说明问题。Ornith-1.5-397B 在 Terminal-Bench 2.1 上拿到 85.1 分,在 SWE-bench Verified 上拿到 86 分,DeepSWE 五次运行平均 56 分。官方称,这一成绩在大多数基准测试上达到了 Opus 4.8 和 GLM 5.2 的水平。
更值得注意的是 35B 版本的表现。这个中等规模的模型在激活仅 3B 参数的情况下,Terminal-Bench 拿到 68.5 分,SWE-bench Verified 拿到 79 分。激活参数只有总参数的十分之一不到,性能却逼近旗舰版的八成以上,MoE 架构的性价比优势体现得很明显。
9B 移动版:量化后直指手机端
面向端侧场景,Ornith 还提供了量化版的 9B-Mobile 构建,目标平台是 iPhone 和 Android。虽然官方没有给出具体的量化位数和推理速度数据,但这一动作释放的信号很明确:开源模型的竞争已经从云端蔓延到了手机本地。
从整体布局看,Ornith-1.5 家族试图用三个不同规模的版本覆盖尽可能多的部署场景——旗舰版拼性能,35B 拼性价比,9B 拼端侧覆盖。这种"全家桶"式的发布策略在开源社区并不少见,但能在三个档位同时拿出对标头部闭源模型的成绩,确实不多见。
目前官方表示本地测试正在进行中,更多细节和完整基准数据预计会陆续放出。对于开发者来说,多一个开源选择总是好事,尤其是那个能跑在手机上的 9B 版本,值得蹲一波实测。
热门跟贴