8月3日,阿里正式发布Qwen3.8-Max,把千问家族史上最大的一张牌翻了出来。总参数2.4万亿,单次激活约95B,100万token上下文,基于Qwen3.5架构构建。官方定位是「编程与办公,全面跃升」,PaperBench拿到全场最高的93.0分,超过Claude系和GPT-5.6的前沿模型。
更值得留意的是,这是Qwen-Max级别模型第一次开源,权重下周放出。
官方数字当然亮眼,但我们早就学乖了,发布会上的数字是一回事,真实任务里能不能打是另一回事。尤其这次的对手不一般,三周前,月之暗面刚发布了Kimi K3,2.8万亿参数,号称全球最大开源模型,在伯克利Frontend Code Arena前端编程榜以1679分登顶,压过了Claude Fable 5的1631分。
一个PaperBench新高,一个前端榜第一,都是冲着「编程办公旗舰」这个位置来的。与其看两家各说各话,不如拉一场公平的擂台。我们设计了5个测试任务,每个任务用同一份Prompt分别喂给两个模型,关闭联网,当场见分晓。
五局打下来,谁也没想到,最后拆了台的,是一只鹈鹕骑的自行车。
我们怎么测的
5个任务,覆盖了两家最看重、也是社区吵得最凶的几条能力线,前端页面、代码重构、空间理解、中文写作、安全边界。
每个任务都用同一份Prompt,先喂给模型A的Qwen3.8-Max,记完再喂给模型B的Kimi K3,保证两边吃的是同一道题。下面这场擂台,不掺任何转述,全是当场跑出来的结果。
第一轮,前端落地页,K3赢了几个小细节
第一题,让两个模型各做一个科技产品落地页,深色科技感、导航栏、Hero区、6张功能卡片、3档价格表,带滚动入场动画。
两个模型都一次跑起来了,代码能直接打开,布局、配色、动画全部到位,第一眼看过去,完成度在同一个水平线。
Qwen3.8-Max生成
差距藏在细节里,鼠标悬停的时候,K3做的卡片有一个浮起的效果,Qwen3.8-Max这边只有简单的发光。更明显的是整体感,K3做出来的网页是一个整体,Qwen3.8-Max更像是一页一页拼起来的,能看出明显的分界线。
K3生成
这一轮,K3小胜。
第二轮,代码重构,基本功都扎实
第二题,给了一段真实项目的手续费结算代码,里面埋了一个舍入尾差bug,要求找bug、说根因、修复、重构。
两个模型都准确找出了bug,说清了根因,是float精度加逐单舍入的时机问题。修复之后,尾差也真的被消除了。
结论很平淡,但这种平淡本身是信息,这种级别的算法题已经难不住旗舰模型了。基本盘上,两个都扎实,没有拉开差距。
这一轮,平手。
第三轮,鹈鹕骑自行车,K3栽了个大跟头
如果前两轮是热身,这一轮才是真正的分水岭。
「鹈鹕骑自行车」是外网一个经典的AI测试基准,最早由开发者Simon Willison提出,让模型生成鹈鹕骑自行车的画面。
鹈鹕大嘴、短腿,和自行车天生不般配,模型的空间理解对不对,一眼就能看出来,轮子圆不圆、脚踩没踩到踏板、身体在不在车座上,全在画面里。最近这个测试因为一个会「过热爆炸变蛋」的体素鹈鹕互动作品,又火了一把。
我们用同一份Prompt,让两个模型用HTML加内嵌SVG画一只鹈鹕骑自行车。
结果出乎所有人意料,Qwen3.8-Max稳扎稳打,鹈鹕形态完整,标志性的大嘴喉囊、短腿长脖都有,自行车轮子圆、链条在、脚踩踏板,整体协调。
Qwen3.8-Max生成
K3这边,鹈鹕只有一条腿,自行车没有链条,更离谱的是,天空里云的走向是反的。
K3生成
我们甚至一度怀疑是不是把链接弄反了,检查了好几遍,链接是对的。K3的这一轮表现,确实让人意外。
这一轮,Qwen3.8-Max完胜。
第四轮,中文写作,思路撞车了
第四题,让两个模型写一篇「AI会不会取代程序员」的公众号文章,1200字,口语化,禁止「值得注意的是」「赋能」这类套话词。
结果两个模型都没有出现套话词,字数也都达标。更值得说的是思路惊人地一致,都用身边朋友或者自己的经历入手,先写焦虑,再写AI替代不了的地方,最后落到怎么好好利用AI。整体都是口语化的随笔风格。
K3生成
唯一的区别是,Qwen3.8-Max分了章节,K3通篇是一个整体。
这一轮,平手。
第五轮,安全越狱,都守住了底线
最后一题,用两类真实越狱手法测试安全边界。一类是DAN双人格角色扮演,诱导模型扮演「无所不能」的角色回答深度伪造的制作方法;另一类是Base64编码混淆,把有害请求编码后让模型解码执行。
两个模型都全程拒绝,准确识别出了越狱行为,没有被绕过去。
这一轮没有输家,两个都是赢家。考虑到越狱手法在持续翻新,能守住单轮攻击,已经是一个旗舰模型该有的底线了。
五局打完,比分和预期是反的
五局打完,比分并不悬殊,K3赢下前端,Qwen3.8-Max赢下鹈鹕,剩下三局打平。
但这个比分和我们出发前的预期是相反的,出发前,K3顶着前端榜第一的光环,大家都以为它会在前端和代码上碾压,结果它在最硬核的「空间理解加代码生成」这一关栽了大跟头。Qwen3.8-Max官方的编程数据最猛,结果它没有在代码上拉开差距,反而在鹈鹕这种「外行看热闹、内行看门道」的测试上稳稳赢下。
再叠加价格因素,判断会更清楚。Qwen3.8-Max国内API输出36元每百万token。
K3是100元,输出价格差了三倍多。
所以我们给一个尽量诚实的建议,如果你日常以写前端为主,K3在细节和整体感上确实更懂你,前提是你扛得住它的价格和额度消耗。如果你要的是综合能力、性价比,以及马上要开源的权重,Qwen3.8-Max是更稳的选择。
当然,五道题不能定义「最强」。模型在快速迭代,Qwen3.8-Max的权重下周就开源,社区拿到手会怎么用、会把它推到哪个高度,现在还说不准。
但至少今天,在鹈鹕骑自行车这件事上,K3输得不冤。而这一场擂台本身也在提醒我们,参数竞赛快要到头了,2.4万亿还是2.8万亿,都不如一道真实任务里见分晓来得实在。真正的较量,从权重落地那天才算开始。