一条来自社交平台的消息,让AI编程圈炸了锅:Gemini 3.8 Flash在DeepSWE V1.1基准测试中拿下了73.7%的得分。这条发布于9月2日下午的动态,短时间内就收获了近万次浏览。

DeepSWE这个基准测试,在AI编程领域的分量不轻。它专门用来衡量大模型在真实软件工程任务上的完成能力——不是简单的代码补全,而是让模型像真正的工程师一样,去理解需求、修改代码、跑通测试。能在这一项上拿到73.7%,意味着模型在处理实际工程问题时的表现,已经进入了一个相当高的水平。

打开网易新闻 查看精彩图片

这个分数意味着什么?

如果把DeepSWE的得分看作一次"实战考核",73.7%的成绩说明Gemini 3.8 Flash在超过七成的任务中都能独立完成。对于关注AI编程工具的开发者来说,这个数字直接关系到"我能不能把活交给它干"的判断。相比那些只会在标准题库里刷分的模型,DeepSWE的题目更接近日常开发中会遇到的情况,所以这个分数的参考价值也更高。

值得注意的是,这次的主角是Flash系列。在Google的模型产品线里,Flash定位是轻量高效,主打低延迟和低成本。以往这类模型在复杂推理任务上往往要逊色于旗舰版,但这次73.7%的成绩,说明轻量级模型在编程能力上也能追得很紧。对开发者来说,这意味着可以用更低的成本获得接近顶配的编程辅助能力。

轻量模型的逆袭

过去一年,AI编程工具的竞争焦点一直在"谁更强"上,各家旗舰模型轮番刷新榜单。但Flash系列这次的表现,把竞争拉到了另一个维度:在保证能力的同时,把成本和速度做到极致。对于个人开发者和中小团队来说,这可能是比"最强"更实用的方向——毕竟不是每个团队都烧得起旗舰模型的API费用。

73.7%这个数字,放在DeepSWE的榜单里属于什么位置,目前还没有完整的对比数据。但单从绝对分数来看,它已经足以让不少以编程见长的模型感到压力。尤其是考虑到Flash系列的定位,这个成绩的含金量还要再打上一个折扣——用更少的资源,做到了接近顶尖的水平。

接下来看什么?

这次的消息来自社交平台的官方账号发布,信息量很简洁:一个模型、一个基准、一个分数。但背后值得关注的点不少。一是Gemini 3.8 Flash的完整能力边界在哪里,DeepSWE只是编程维度,其他任务的表现还有待更多测试;二是这个分数会不会引发其他厂商跟进,在轻量级模型上加大投入。

对普通开发者来说,最直接的影响可能是:下次选AI编程工具的时候,可以多看一眼Flash这类轻量选项。过去"便宜没好货"的惯性思维,在73.7%这个数字面前,可能要重新掂量一下了。