打开网易新闻 查看精彩图片

今天一上午,我用了快7000万的Qwen Token。

打开网易新闻 查看精彩图片

刚吃完中午饭,就看到阿里更新Qwen3.8-Max的消息。

打开网易新闻 查看精彩图片

说实话,看到2.4万亿参数,我没啥感觉。100万上下文,我也没觉得多稀奇。

但有一个数字,把我看愣了:0902。

Qwen3.8-Max更新成了Qwen3.8-Max-0902,我感觉只是软件升级了一个版本。

结果一看CodeArena的榜单,直接愣住了。

打开网易新闻 查看精彩图片

  • CodeArena可是全球AI圈公认的第三方盲测平台,上一版Qwen3.8-Max的排名是1669分。 更新到0902版本后竟然直接涨到1691分,上升到第一名。
  • 第二名是谁?Claude Opus 5 Max,1688分。
  • 第三名是Kimi K3,1674分。

也就是说,阿里这次没换新模型,甚至连名字都没变,只是做了一次后训练更新,结果把Claude和Kimi都挤到了后面。这就有意思了。

一个"0902",到底干了什么?

现在很多人聊AI,第一反应还是看参数,好像模型越大,能力就一定越强。

但Qwen这次给行业展示了另一种玩法:参数不变,继续"榨"。

Qwen3.8-Max本身就是一个2.4万亿参数的MoE模型,100万Token上下文也没有变。

这次真正动的,是后训练。

阿里针对“编码”和AI办公”两个方向继续训练,让模型更擅长写代码、调用工具、处理复杂任务。

说白了:以前是"把发动机造大"。现在开始研究:同一台发动机,怎么再多跑几十公里。

为什么是“编码”?

我最近在用AI做网站深有体会,其实现在AI最值钱的功能早就不是陪你聊天了,而是“干活”

你用AI写一段代码、做个网页并不稀奇,真正厉害的是:你给他一个需求,他自己能拆解任务、自己写代码、调用工具、发现BUG,然后自己修改。

最后把一个网站的网站交付给你。

所以CodeArena测试的,恰恰就是这种多步推理、工具调用、端到端开发能力。所以这次Qwen冲到第一,这就意味着AI正在“替你完成工作”。

和AI对话聊天,完全是两个时代的产物。

最关键的是:它还更便宜

打开网易新闻 查看精彩图片

CodeArena更新后的性价比榜单里,Qwen3.8-Max-0902的综合平均成本约为每百万Tokens 5美元。

也就是说,它不只是跑到第一,还站到了性价比的第一梯队。

其实对于卢松松这种草根创业者而言,我就关注3件事:

  • (1)能不能用AI做网站,能不能干活?
  • (2)多少钱?
  • (3)能不能稳定长期用?

一旦这3个问题都测试可用了,那么这个AI从会真正变成企业愿意花钱的“数字员工”。如下图所示:

打开网易新闻 查看精彩图片

阿里为什么要在这个时候更新?

我觉得答案可能就在"0902"这三个数字里,现在的大模型的基础能力都差不多了。

大家得分都是90多分,到了这个阶段,你想再提高一分,可能比从60分提高到80分难得多。但偏偏这一分,决定了你能不能站在第一名。

这次Qwen从1669冲到1691,本质上就是在做这件事。

其实我觉得,这次Qwen冲到了CodeArena第一,真正值得关注的不是"阿里赢了Claude",而是大模型的竞争正常发生一个很大的变化:

从"预训练"走向"后训练",从"比模型大小"走向"比模型怎么干活"。

未来的大模型,可能越来越像一个人,基础模型相当于智商,后训练相当于经验,工具调用相当于手和脚,Agent能力,则决定这个人到底能不能把事情办成。

Qwen这次只是改了一个"0902"。但这个小小的版本号背后,可能藏着AI行业接下来几年最大的变化:

  • 大模型的下半场,可能不再是谁把模型造得最大,而是把一个聪明的模型训练成一个会干活的人。

打开网易新闻 查看精彩图片

卢松松是一位自媒体人、短视频博主。也是创业者必看的账号,关注草根创业圈、科技互联网、自媒体和短视频行业。感谢您的关注!