阿里巴巴通义千问团队近日悄然上线了Qwen-3.8-Max-0902版本。没有换大版本号,只是一次常规更新,却在多项基准测试中接近甚至部分超过Anthropic的Claude Fable 5。这种“不升版本就拉近差距”的做法,本身就成了行业讨论的焦点。
阿里Qwen
Qwen-3.8-Max系列参数规模达到2.4万亿,属于当前国内最大的旗舰模型之一。0902版本在Code Arena WebDev榜单上直接登顶,总分1691分,略高于Claude Opus 5(Max)的1688分,也超过了此前的Qwen-3.8-Max和Kimi K3等模型。细分来看,它在数据与分析、消费产品类别位居第一,品牌营销、游戏与仿真类别第二,内容创作工具和参考设计类别第三。
定价方面,输入每百万token约2美元,输出约6美元,缓存命中价格更低。相比之下,Claude系列旗舰模型的价格通常高出数倍。性价比优势在实际使用中非常直观。
这次更新距离Qwen-3.8 27B开源模型发布仅约两周。27B版本已经能在单台MacBook上运行,并展现出接近上一代Claude的编码能力。0902则把旗舰Max版本的编码、代理任务和部分多模态表现进一步推高。部分第三方测试显示,它在前端开发、仓库级代码生成和部分办公自动化场景中与Fable 5非常接近,有时甚至略胜一筹。
有人因此质疑是否采用了蒸馏技术。目前公开信息无法证实或证伪。值得注意的是,Fable 5发布时设置了较强的防护措施,而阿里此前也内部限制过员工使用部分外部编码工具。真正的竞争力,最终还是要靠持续的基准表现和实际落地效果来验证。
从更广的视角看,国内大模型实验室的迭代速度明显加快。不再依赖大幅更换版本号,而是通过后训练、数据配比和强化学习持续打磨同一基础模型,已经成为一种新常态。这种“小步快跑”的策略,让模型在编码、工具调用和长程任务上的表现快速逼近国际头部水平。
算力层面,阿里在乌兰察布等地的数据中心依托丰富的风光资源,把电力成本压到较低水平,为大规模训练和推理提供了成本优势。垂直整合的趋势也在显现:从自研芯片到大模型,再到云服务和应用场景,形成闭环。
市场影响已经开始显现。开发者对高性价比、中文友好且编码能力强的模型需求旺盛。Qwen系列在多个公开排行榜上的表现,正在改变企业选型时的权重。价格敏感的团队更愿意尝试国内模型,而头部模型则继续在复杂推理和安全性上保持领先。
未来一段时间,大模型竞争会更加聚焦在真实场景的可靠性和成本效率上。单纯刷榜已经不够,能否稳定完成复杂编程、多步工具调用和长期任务,才是真正的考验。阿里用一次不换版本号的更新就拉近与Fable 5的距离,说明国内团队在工程优化和数据效率上已经积累了相当实力。
这种“默默变强”的方式,或许正是当前大模型竞赛最有意思的地方。技术差距在缩小,迭代节奏在加快,真正决定胜负的,还是谁能把模型更稳地送到用户手里,并持续创造实际价值。
热门跟贴