作者|周一笑微信|smiletalker
打开网易新闻 查看精彩图片
作者|周一笑微信|smiletalker

开源模型最近密集到有点不讲道理。七月底到八月中,Kimi K3、Qwen3.8-Max 先后放出权重、DeepSeek V4 Pro 正式版也刚刚上线。与此同时,沉寂了一年多的美国开源也回来了,Meta 拿出 Muse Glimmer,英伟达跟上 Nemotron 3.5 Lightning。

如此盛况,那可就必须把五个模型接进同一个测试环境测一测,是骡子是马拉出来遛遛。

这次的测试中,每道题额外设了统一的输出上限(输出长度),思考和作答共用这个额度,超了就算没交卷,同时超过额度的任务会重新放开上限单独完整跑一遍作为对照,所有结果由脚本+真人盲评判分。

先直接上成绩:绿格最多的是 K3,十项里六项满分,DeepSeek 排第二。需要注意的是表里的 0 分,部分是因为模型思考太长被截断,没有完整输出,后文有具体解释。

打开网易新闻 查看精彩图片

模型测试成绩

接下来我们来看看这几个开源模型的具体表现。

1

逻辑推理:两个小模型交了白卷

第一组题是 24 点和五位数密码锁。

24 点是用给定的四个数字加减乘除凑出 24;密码锁是根据几条"哪些数字对、位置对不对"的线索倒推一个五位密码,都是考多步推理的经典题型。题目全部新生成,里面还埋了一组无解的 24 点,看谁会硬编一个假解出来。

无解陷阱骗到了一家。K3、Qwen、Nemotron 都识破了,Muse 主测没答到这题,后来放开上限补跑时它上了当,硬编了一个把 10 用了两次的假解。

真正的意外在密码锁上,K3 和 Qwen 全对,两个美国小模型却交了白卷,回答里一个字都没有。DeepSeek密码锁三次里有两次同样在思考撞上上限后交了白卷。

查看运行日志,两个小模型把推理题跑成了马拉松,思考写到一半就被输出上限截断了,托管商返回的结束原因写的就是超长,后面的补跑实验也印证了这一点。托管平台给这两个模型的单次输出额度本来也紧,一个只放 16K token,一个只放 24K。

打开网易新闻 查看精彩图片

Nemotron 被上限截断的原始记录

按规则放开上限补跑。Muse Glimmer 密码锁两次全对。Nemotron 烧掉六万 token,最后信心十足地交出错误答案。DeepSeek 放开上限后,密码锁同样全对。

顺着这组题我们加了一个加时赛。

每个模型 30 美分,题型不变换一套新题,解不出可以重试,直到把预算花完。

Nemotron 十轮花了不到 10 美分,24 点全拿下,但密码锁还是十次都没成。

Muse 密码锁前三次失败,第四次解出,15 美分拿下五题全解。

K3 一次认真的思考就要 35 美分,Qwen 也要将近 20 美分,预算只够试一两轮。单独放开预算后 K3 把题解了,花费 35 美分,比预算线多出 5 美分。

这里表现突出的是 DeepSeek。同一套题,它一轮全对,五题全解只花了 4 美分,比 Muse 靠重试磨出来的还便宜四倍。

2

代码画图能力:画熊猫、画地铁图、做网页,三道看得见的题

在代码呈现方面,我们先让五个模型用 SVG 代码画同样的画:一只白头鹰坐在共享单车前座蹬车,一只大熊猫坐后座撑伞。

SVG 是用代码描述图形的格式,模型看不到画布,全凭想象在代码里摆坐标。

在这一轮,完成的最好的 K3 和 Qwen 都是能看图的多模态模型。K3 的两张图都能一眼认出剧情,Qwen 一张画得最满、一张没画完。

Nemotron 和 Muse 的作品需要观众自带想象力,有点惨不忍睹。DeepSeek 一张能认出剧情(鹰趴在车把上没蹬车),另一张直接没有产出。

打开网易新闻 查看精彩图片

K3 和 Qwen 的作品自带动画。

打开网易新闻 查看精彩图片

K3 的 SVG 动画

打开网易新闻 查看精彩图片

Qwen 的 SVG 动画

第二道是做一个能用的网页。

我们编了一座虚构城市的地铁数据,四条线 26 个站,要求模型写一个单文件网页,画出规整的线路图,用户选好起点和终点后,网页要算出正确路线,再播放一段换乘动画。判分表有十项,路线算错直接判低分。

K3 两次都拿满分,线路、换乘提示、动画一个不缺。Muse 画出了图但路线算错,Nemotron 的功能缺了一大半,Qwen 在上限内没写完,页面打不开。放开上限补跑后,Qwen 补交了一版完成度很高的。DeepSeek 排第二。

打开网易新闻 查看精彩图片

K3 寻路动画

打开网易新闻 查看精彩图片

五家地铁对比

打开网易新闻 查看精彩图片

放开上限后 Qwen 补交的地铁图

第三道测试把这次横评的真实数据喂给每个模型,让它们给自己的成绩单做可视化网页。

这道题输出量最大,Muse Glimmer 两次都在上限内完成,拿下第二。K3 一次满分,一次超限被截断。Qwen 两次都没写完,放开上限补跑后完成。DeepSeek 两次都在上限内完成,拿了这道题的最高分。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

成绩单网页对比

打开网易新闻 查看精彩图片

DeepSeek 生成的单页面

打开网易新闻 查看精彩图片

Kimi K3 生成单页

3

Agent能力:接上工具修代码、洗账单,看谁能独立干完活

这个环节让模型自己动手,读文件,跑命令,改代码,一直干到收工。

agent 的表现和运行环境有关,同一个模型装进不同的工具框架,成绩可能不一样。我们用最简单的循环,是为了让五家在完全相同的规则下比。

第一题是修一个埋了三个 bug 的小项目,要求把十二个测试全部修绿。中途我们伪造了一次工具超时,五家没有被假故障带偏,全都修到了全绿。最后的差别只在花费上,两个 30B 模型一次不到 1 美分,两个万亿参数的贵上几倍,而 DeepSeek 一次只要 0.3 美分。

看来只要是算账,就是DeepSeek赢。

打开网易新闻 查看精彩图片

修 bug 任务的轮次时间线

第二题是真实的脏活。

两份账单导出文件,一份藏着 GBK 编码,一份顶着二十多行说明文字,中间混着重复交易和该剔除的记录,要求清洗合并成一张干净的表。

K3、Qwen 和 DeepSeek 全部满分,Muse 十五轮全耗在编码问题上,Nemotron 只拿到部分分数。另外我们第一次测试时托管商还不支持 Nemotron 的原生工具调用,这两道题它走的是纯文本协议。后面 DeepInfra 把支持补了上来,我们用原生工具重测了一遍,修 bug 依旧满分,账单题依旧没能通过。

4

写 Blender 脚本:建一座中式庭院

最后一个测试让模型给 Blender 写脚本,从零建一座低多边形的中式庭院,院墙、月亮门、松树、石灯笼、拱桥、水面都要有,脚本必须一次跑通并渲染出图。Blender 的 Python 接口在版本之间变动很大,一个接口名写错,整个脚本就跑不起来。

K3 两份脚本全部一次跑通,庭院像模像样。Qwen 放开上限后也出了图。Muse 的脚本一跑就报错。Nemotron 先是被上限截断,放开后又把渲染引擎的接口名写错,还是没出图。

DeepSeek 一份出图,另一份倒在一个早已废弃的接口参数上。

打开网易新闻 查看精彩图片

五家渲染结果(Muse 报错、Nemotron 截断,无图)

打开网易新闻 查看精彩图片

K3 的庭院环绕

打开网易新闻 查看精彩图片

DeepSeek 的庭院环绕

5

写作:谁更会说人话

很多人抱怨模型写东西一股 AI 味,我们出了四道改写题。

最简单的一道是把物业的官腔停水通知改成业主群消息,配了一道英文场景做对照。难的两道,一道是给已经吵起来的业主群写涨价说明,一道是把年度工作总结改成群里唠嗑的年终盘点。所有答卷打乱顺序,由真人盲评打分。

打开网易新闻 查看精彩图片

盲评工具

简单的题模型之间差距不大,每篇改写的关键信息倒是都没丢事实,分数差距主要在文风上。难的两道没有一个模型摸到 4 分,八股结构和口号频繁。DeepSeek 简单题 4 分,难题也只有 2 分。K3 是唯一在两道难题里都拿到 3 分的。不过需要说明的是,这轮测的文本都不长,结果仅供参考。

打开网易新闻 查看精彩图片

“说人话”题的高分与低分答卷

打开网易新闻 查看精彩图片

五模型核心对比(成绩、速度与价格)

6

开源模型路线更热闹了

五个模型测下来,最明显的感觉是,大模型和小模型的差距还在,但各自的长处也越来越明显。如果只看中国这三个模型,K3 在冲能力上限,Qwen 走稳和全能,DeepSeek 则在拉升性价比。

K3 的表现基本和最近几个公开 benchmark 的结果对得上,已经可以和最前沿闭源大模型放在一起比。这次测试里,它也是五个模型里做得最全面的一个,推理、写代码、Agent、Blender 都很能打。缺点也很简单,相对贵,也偏慢。

Qwen 的表现也很稳,难题基本都能做,但经常需要想很久。给它足够的时间和额度,很多事情都能做出来,只是花的时间多一些。

DeepSeek 则是这次最让人意外的一个。能力不弱,价格还特别低。加时赛里五道题全做对,花费和两个小参数模型属于同一梯队。至少从这次实际花费看,它确实做到了又强又便宜。

如果这个价格还能保持下去,后面模型继续变强,DeepSeek 带来的优势就不只是来自能力,而是性价比。它可能会把大家对“一个足够强模型到底该卖多少钱”的预期再往下拉一截。

小模型也没有失去意义。Muse 和 Nemotron 在简单任务上又快又便宜,很多工作不需要上万亿参数的模型。但任务一旦变难,需要长时间推理、写复杂代码或者连续调用工具,大模型的优势还是很明显。

Meta 预告旗舰 Muse Spark 1.2 的权重未来几周放出,阿里已经把 Qwen3.8 大杯的权重传上了 Hugging Face。半个月里同时这么多开源模型出来的景象,一年前很难想象。不管怎么说,有了更多选择,对用模型的人来说总是一件好事。

(本次测试通过 OpenRouter 接入各家托管商的通道,文中的花费都按托管商标价结算,与官方 API 的价目表不完全匹配)

点击关注我哦