开源大模型赛道又迎来一位重量级选手。今日,Ornith-1.5正式发布,这是Ornith系列在"自我构建"方向上的关键一步——模型不再依赖人工设计的训练任务,而是自己给自己出题、自己搭解题框架、自己生成答案,再通过强化学习不断优化。
这套"端到端自我改进"的闭环,让Ornith-1.5在推理、智能体(agentic)和编程任务上展现出强劲实力。此次发布覆盖三个规模:397B MoE、35B MoE和9B dense,其中9B版本还提供了量化版Mobile型号,可直接部署在iPhone和Android设备上。
旗舰版对标Claude Opus 4.8
最受关注的是旗舰版Ornith-1.5-397B。在Terminal-Bench 2.1上,它拿下86.1分,DeepSWE基准上获得56.0分。这一成绩与Claude Opus 4.8(85.0和59.0)基本持平,同时明显领先同量级的开源模型——GLM-5.2(82.7和46.2)和DeepSeek-V4-Flash-0731(82.7和54.4)都被甩在身后。
换句话说,在终端操作和软件工程这两项硬核任务上,Ornith-1.5-397B已经摸到了闭源顶级模型的天花板。
35B版本:激活3B参数,打赢31B密集模型
中量级的Ornith-1.5-35B同样亮眼。虽然每个token只激活3B参数,但它在所有编程和智能体基准上都显著优于同尺寸的Qwen 3.6-35B。更夸张的是,这个稀疏模型在智能体编程任务上碾压了参数量相近的密集模型——Terminal-Bench 2.1得分68.5,而Gemma 4-31B只有43.4,Meta的Muse Glimmer-30B为51.7;SWE-Bench Verified上79.0对52.0和76.0。
稀疏架构的性价比,在这组数据里体现得淋漓尽致。
9B小模型:手机端也能打
面向边缘设备的Ornith-1.5-9B同样不容小觑。它在Terminal-Bench 2.1上拿到47.0分,SWE-Bench Verified达到70.6分。一个9B参数的紧凑模型,性能已经追平甚至超过Gemma 4-31B和Qwen 3.6-35B这样的大块头——而且它还能跑在手机上。
自我改进循环:从"人教"到"自学"
Ornith-1.5的核心突破在于训练机制的升级。Ornith-1.0已经引入了自我脚手架(self-scaffolding)框架,这次则把循环补完整了:模型自己提出新任务、生成任务专属脚手架、产出解决方案用于强化学习,不断创造新的学习经验。
相比依赖人工精选任务和手动设计测试工具的传统路线,Ornith-1.5的训练循环分三个阶段推进:给定环境或代码库、任务类型的高层指令、以及模型此前的解题历史,系统会持续提出难度递增的新任务——专挑模型还没解决过的问题下手,精准暴露能力短板,再通过强化学习补齐。
这种"哪里不会练哪里"的自适应训练方式,或许正是Ornith-1.5能在多个基准上追平甚至超越更大模型的关键原因。当模型学会给自己出题,开源模型的进化速度可能会超出很多人的预期。
热门跟贴