AI模型迭代速度越来越快,各家厂商的基准测试分数不断刷新纪录。但对很多实际任务来说,真的每次都需要调用最顶尖的模型吗?AlphaSense的一项测试给出了一个值得注意的答案:在某些任务上,开源模型的表现足以媲美顶级闭源模型,而成本却低得多。

测试方法:关键在于信息检索方式

打开网易新闻 查看精彩图片

AlphaSense是一家开发AI文档管理服务的公司,他们测试的重点并非单纯比拼模型参数,而是关注如何让AI高效处理财务信息。测试发现,让AI分析财务数据时,信息喂给模型的方式对任务效率和成本影响巨大。

打开网易新闻 查看精彩图片

如果把所有相关信息一股脑全塞给AI,模型需要处理海量数据,单次任务的成本会很高。另一种做法是先用专门的检索系统从海量信息中精准提取出相关内容,再交给AI分析,这样能大幅压缩成本。AlphaSense基于这个思路,开发了自家的信息检索平台“AlphaSense Search”,并测试了它和不同AI模型搭配后的财务分析性能。

核心结果:开源模型性价比突出

AlphaSense用245道财务信息分析题,对9款模型进行了测试,包括GPT-5.6 Sol、Claude Haike 4.5、Claude Sonnet 5、Claude Opus 4.8、Claude Opus 5、Kimi K3、GLM-5.2、Inkling以及Google的开源模型Gemma 4 31B。测试衡量了两个维度:回答精度的相对得分,以及单次任务的成本中位数。

结果中最亮眼的是Gemma 4 31B。作为一款免费开源模型,它在测试中的回答精度与闭源模型Claude Sonnet 5持平,但单次任务成本仅为后者的1/40。测试中精度最高的模型是GPT-5.6 Sol,被评价为“品质与价格平衡出色”。

Google官方回应:不是所有场景都需要最强模型

打开网易新闻 查看精彩图片

这份测试结果也引起了Google官方的注意。Google Gemma的官方X账号转发了这一结果,并配文称:“你并不总需要最前沿的模型。最近的基准测试显示,Gemma 4 31B在回答质量上追平了Sonnet 5,成本却低了约40倍。凭借高成本效益和低延迟,Gemma可以支撑那些使用大型模型在经济上不划算的高吞吐量场景。”

这段话点出了一个行业趋势:在追求更高基准分数的同时,成本效益正在成为企业选择模型时的关键考量。对于大量重复性、高并发的任务,开源小模型的优势正在显现。

对开发者的启示

这个案例给开发者和技术决策者提供了一个新的思考角度:

  • 按需选型:不是所有任务都需要调用最强的闭源大模型,先评估任务复杂度,再匹配模型能力。
  • 检索增强是关键:AlphaSense的测试表明,搭配高效的检索系统,小模型也能在专业领域交出高分答卷。
  • 成本结构重塑:当单次调用成本降到1/40,意味着过去因成本过高而无法落地的AI应用场景,现在有了商业化的可能。

模型评测榜单的竞争依然激烈,但AlphaSense的测试提醒我们:在真实业务场景中,“够用且便宜”往往比“最强但昂贵”更具实际价值。开源模型与高效检索架构的组合,正在为AI应用开辟一条更务实的路径。