一年半前,DeepSeek R1 的发布让市场震动。一家中国实验室突然与 OpenAI 的 o1——首个商业推理模型——同台竞技,且据称成本低得多。市场随之紧张,数千亿市值在数日内蒸发。当时关于基础设施建设的规划是否被高估了?

彼时的图景比头条新闻所暗示的更为模糊。在 DeepSeek 自己的报告中,R1 在 AIME 2024 等单项测试上击败了 o1,但在事实知识(SimpleQA)等其他测试上明显落后。后续的基准测试暴露了更多差距:中国模型仅在个别领域达到顶尖,而非全面领先。

打开网易新闻 查看精彩图片

转折点:最新一代中国开源模型

直到今年6月底,Z.ai 的 GLM-5.2 仍呈现出同样的模式。随后,最新一代中国开源权重模型发布:Moonshot 的 Kimi K3、阿里巴巴的 Qwen3.8-Max 以及 GLM-5.3。

如今,中国模型在几乎所有广泛且要求严苛的评测中均位居前列。它们处理长知识任务、跨多步骤编程以及协调工具的能力,都远超其前辈。

投资者视角:模型性能差距已缩至“投资问题”

以常见基准衡量,常被提及的“几个月差距”已缩小到足以成为投资者的问题。据《华尔街日报》报道,Anthropic 在即将进行的 IPO 前面临棘手提问,并以自身在顶层的剩余领先优势作为辩护。而在那一层级之下,领域主要属于来自中国的开源且价格低廉得多的模型。

投资者担忧,单纯的模型性能已几乎无法支撑一项业务。今天某个模型能独家做到的事,几个月后一个可免费下载的模型也能做到。

目前有两项指控在讨论中:中国实验室被指利用西方模型作为“教师”,这种做法被称为蒸馏(distillation)。而无论指控是否成立,结论都是一样的:模型领先优势无法被捍卫。