9月2日,阿里Qwen3.8-Max迎来重要升级,正式推出0902版本,这距离该模型的首次发布仅仅过去一个月。
此次升级并非简单的参数微调,而是围绕编程(Coding)和专业办公(Cowork)两大核心场景,对Qwen3.8-Max进行了专项后训练,让模型在真实企业复杂任务、科研和长周期任务中表现更加出色。
在聚焦前端编程能力(WebDev)的全球权威三方榜单CodeArena中,Qwen3.8-Max-0902的得分较此前提升了18分,达到1688分,超越Claude Opus 5、Kimi K3等一众模型。
千问官方公布的性能基准显示,Qwen3.8-Max-0902在8项编程评测任务中全面提升,其中几项的提升幅度相当惊人:
TerminalBench 3.0从11.3分跃升至29.0分;
DeepSWE 1.1从56.6分提升至69.3分;
QwenSWEbench V2从55.1分提升至70.0分;
职业任务基准JobBench也从53.4分提升至64.0分。
相比之下,Agent及多模态任务的提升幅度不大。
另外,Qwen3.8-Max-0902在性价比方面同样惊艳,价格与Qwen3.8-Max一样,保持不变,仍为输入2美元、输出6 美元/百万Token。
升级不加价,好评!
在CodeArena同步更新的模型性价比榜单(帕累托前沿)显示,Qwen3.8-Max-0902新版本每百万Tokens的综合平均价格仅为5美元。
对比来看,当前性能排名第二和第三的模型,每百万Tokens的综合价格分别高达20美元和12美元。
基准终究只是基准,真实体验如何才是关键。我们围绕Coding和Cowork两大场景,设计了两轮实测。
实测一:前端编程:
“做一个团队项目进度看板,深色主题,支持添加、删除任务,展示进度条,数据要能自动保存”。
我们给模型下达了一个一句话需求,在没有追加任何提示的情况下,Qwen3.8-Max-0902一次性交付了一个完整的单文件网页。
深色风格界面,顶部是任务总数、平均进度、已完成数三张统计卡片,中部是可输入任务名称、选择所属模块、拖动设定进度的添加表单,下方还自动生成了按模块统计平均进度的柱状图。
更关键的是,这个页面开箱即用:任务数据写入浏览器localStorage,刷新页面不会丢失,每条任务带删除按钮;图表随窗口尺寸自适应。
我们直接在浏览器中打开验证,添加、删除、持久化全部正常,全程没有二次修改。
实测二:专业办公:
小编让千问办公编写了一个常见的年终总结,然后把华东、华南、华北三个区域的年度月度销售数据交给Qwen3.8-Max-0902,要求完成数据整理、分析与洞察输出。
Qwen3.8-Max-0902自主将任务拆解为“生数据提取—编写分析脚本—执行并汇总结论”三步,报告生成后,他还会回读验证报告内容的完整性,等它确认没问题后才会交付给小编。
最后,它给出的不仅有数据分析表,还有一份完整的分析报告,交付说明提到:报告含4 张趋势/结构图与 3 张核对表;Excel 含月度明细、区域汇总、季度趋势、图表和洞察结论 5 个工作表,数值已独立复核通过。
这全程都是由模型自行编写并执行脚本,所有数字都来自真实计算,结论还指出了总结中可能出现的遗漏、错误。
美中不足的是速度,这份报告整整花了半个小时才完成。
回头看Qwen3.8-Max的路线,会发现这次0902并不是突然转向,此前Qwen3.8-Max已经把目标从单轮问答进一步推向Coding、办公、科研、Agent和长周期任务。
甚 至在模型训练层面,也开始围绕真实环境、任务难度、工作空间和Harness建立更 完整的训练体系。
而这次0902又进一步强化Coding & Cowork,某种程度上也说明Qwen正在继续把模型能力从回答问题推向完成任务。
现在,全新的Qwen3.8-Max-0902版本模型已正式上线千问AI平台,对外提供API服务。与此同时,千问办公、Qoder以及千问App等产品也已第一时间完成接入,供所有企业、开发者和普通用户使用。
热门跟贴