Artificial Analysis 昨天公布了 Qwen3.8-27B 的智能指数,它作为一个只有 270亿 参数的小尺寸模型现在已经可以和 GPT-5.6Luna、 DeepSeek-V4-Flash坐一桌了,这俩都是2000亿以上参数的大模型。
Qwen3.8-27B发布前,业内对它的期望值就比较高,发布后我也一直在测试,整体感觉不错,但是看专业测评它能到这个程度也感觉挺意外的。
就去 Artificial Analysis 上详细的捋了下它的各项 Benchmark (基准测试)数据,想看看它到底吃啥了这么猛。看它是不是偏科严重,在某些测试项上特别突出,从而拉高了整体分数。另外,我也会根据我的使用体验,结合 基准测试的数据说下它适合在哪些场景里用。
Artificial Analysis评估模型指数时综合了 9项基准测试 的数据,其中 AA-Omniscience (全知)项 又 分出 了 两个 小项 : Accuracy (准确率)、 Non-Hallucination Rate (非幻觉率) , 所以一共是10项基准测试加权综合后算出的指数。
Agent能力
头两项是测试模型 Agent能力 的,在权重里占大头,一共 34%
GDPval-AA v2 :这个 是让模型在 44个真实业务场景 里跑业务执行,注意他的名字带 GDP ,说明是在测试模型能不能真的干活。 权重20%
³-Banking: 是测试 银行复杂结算场景 下,模型能否准确执行,对数据准确性要求高。 权重14%
Qwen3.8-27B在这两项里的测试表现都不错,特别是银行场景下拿到了第二名,我感觉这和千问背靠阿里,有很强的支付背景有关系。
编码能力
这个是开发者们比较关注的,一共有两项,在权重里占 24%
Terminal-Bench v2.1 :测试的是模型在 终端 里执行的稳定性,命令是否对其等,针对的是 开发运维自动化、CICD流水线 这种场景,搞运维的对这个不陌生。 权重 16%
SciCode: 名称里带 sci ,说明测试的是科研代码场景,我原来以为这个简单,后来了解下下科研场景下的代码还是很难的,模型没法背题拿高分。 权重 8%
代码和终端执行也是我测试的重点,Qwen3.8-27B在编码和排查项目问题上能力不俗。终端执行也比较稳定做开发运维自动化是不错的选择,我用它反复测试了 提交代码到github + 登陆线上服务器 + 线上发布 这个DevOps自动化流程,没翻过车。
科学推理
这个分裂是考察模型在 前沿科学 方面的表现,占指数权重的24%,一共有三项基准测试。
HLE: 人类最后一道习题,都是跨学科的顶级难题,测模型能力天花板。 权重12%
GPQA Diamond: 研究生级科学难题(物化生),因为题目公开,又是选择题,所以目前 分数已接近饱和了 ,作用是 筛掉能力不足的模型。 权重 6%
CritPt: 前沿物理学难题,是为了 补充HLE覆盖不到的物理课题。 权重 6%
Qwen3.8-27B 在这个分类上的表现明显不如主流的大模型,这也是小尺寸模型的特点,在前沿科学上表现乏力。
通用能力
这一项是考察模型的知识丰富度、准确性、幻觉率、及长上下文能力。在当下的Agent时代,它的重要行明显被降低了,在权重里只占18%,一共有三项。
AA-Omniscience Accuracy: 42个主题的 开放式问答,测试模型的知识丰富度和回答问题的准确性, 越敢回答分数可能越高。权重8%
Non-Hallucination Rate :模型不出现幻觉的概率 ,测试模型不知道的时候是否会放弃回答。和上面的 Accuracy 基准项用的是一套题,测试的时候也是用的同一轮回答,所以越敢回答的模型出现幻觉的概率越高,这一项得分可能越低。 权重6%
AA-LCR: 测试模型 长上下文 的信息提取与推理整合能力。 权重4%
Qwen3.8-27B 在这一项上的表现明显不行,这也是小尺寸模型的特性,在通用能力上不如大参数的模型,参数量太小泛化不出通用能力。 不出现幻觉的概率高是因为模型的知识面窄,遇到不会的不回答。不过我看在上下文下检索的能力上表现还算不俗。
最后
Qwen3.8-27B能在Artificial Analysis的榜单上有这么不俗的表现,是着重加强了占权重比较高的 Agent 和 编码 获得高分的,光这两项就占了指数的58%,你平时拿它做本地Agent和编码可能不错。但是在通用能力,如知识丰富度,和科研能力上还差不少。
我最近在研究小尺寸的模型在本地能干点啥有意思的事情,感兴趣的可以在评论区一起讨论学习。
热门跟贴