七月底八月初,韩国多家AI企业扎堆发布新模型,齐刷刷将DeepSeek列为核心对标对象,宣称“性能相当”、“局部超越”。
有人说,这些AI企业目的不纯,是踩中韩国预算节点的“基准分表演”。也有人说,这些AI企业的技术大多来自我国开源模型,简直是抄袭。
但这些都不重要,重要的是,这就是开源的宿命。
01
集体“超越”背后
七月末的韩国AI圈,上演了一场步调高度一致的“对标秀”。
LGAI研究院、SK电讯、Upstage、MotifTechnologies等企业密集发布大模型,口径惊人一致:性能对标DeepSeek系列,特定领域实现反超。
从7500亿参数的K-EXAONE2.0,到6880亿参数的A.XK2,再到2500亿参数的SolarOpen2,参数规模节节攀升,“超越DeepSeek”的通稿铺满了韩国的科技媒体版面。
但实际上,这场集体超越,有着另一个目的,而这个目的就藏在时间线里。
就在这场发布潮的前几周,韩国敲定了一个“独立AI基础模型”的项目入围名单,NaverCloud、Upstage、SK电讯、NCAI、LGAI研究院五家企业成功入选。
这个项目年投入约1936亿韩元,配套1576亿韩元专项采购英伟达B200与H100显卡,同时打包开放公共数据、提供人才补贴。
更关键的是项目实行残酷的淘汰赛制:每半年淘汰一次,年底首轮就要从5家砍至4家,后续逐步压缩至2家。
换句话说,这些韩国的模型发布都在踩“签约前冲刺”的窗口期。
所谓的“性能超越”,本质上是面向政府预算的技术路演:拿出亮眼的评测分数,证明自己配得上举国的资源倾斜,拿到活下去的门票。
这里边因此出现了不少有意思的现象。
一是选择性评测的数字游戏。
比如LG的EXAONE系列主打韩国高考数学、AIME竞赛题等窄赛道得分,却对GPQADiamond理科综合推理、编码能力等通用指标避重就轻。LG自己都承认,在综合推理与编码能力上,EXAONE仍落后于DeepSeek。
二是“借开源基座做本地化”的路径依赖。
SK电讯早年的A.X4.0,官方文档明确标注基于开源的Qwen2.5做继续预训练,替换韩语分词器后再完成SFT与RLHF。相当于站在咱们大模型的肩膀上,灌进去海量韩语语料,再转头和原始中文模型比韩语能力。
到了后来的A.X3.1,为了摆脱“套壳”质疑,SKT转而主打“从零自研”,但训练token量、参数规模双双缩水,能力不升反降。
因此这场路演里的“超越”,水分其实一目了然。
02
借鸡生蛋是开源宿命
很多人看到这里会愤愤不平,觉得韩企“蹭开源、吹自研”不地道。
但站在产业逻辑看,这恰恰是开源模式的结果:你选择把模型权重、训练框架公之于众,就等于默认其他开发者都可以站在你的基础上二次创新。
借鸡生蛋,不是开源的bug,而是开源的宿命。
开源大模型的核心价值,不是“只有我自己能用”,而是通过开放降低行业创新门槛,让更多主体基于基座做场景化、本地化的适配。
对于韩国这样的市场而言,从头训练一个通用大模型成本极高、周期极长,还要面对5000万人口带来的语料天花板、人才储备不足等天然短板。
而DeepSeek、通义千问等我国开源模型,在同等参数规模下已经做到了全球头部的性能水平,代码、权重完全开放,拿来做继续预训练的边际成本很低。选择站在我国开源模型的肩膀上做韩语本地化,是工程层面最理性、性价比最高的选择。
这不是韩国企业没本事,是我国开源模型的实力足够强,强到成为了别国做AI的“默认起点”。
所以大可不必把这种“二次开发”视为吃亏。
开源生态的核心逻辑,是用技术开放换生态话语权。当越来越多的国家、企业基于你的基座开发行业模型、区域模型,你的技术路线、工具链、生态标准就会成为行业事实标准。就像当年Linux开源之后,无数企业基于它做定制化操作系统,反而巩固了Linux在服务器市场的统治地位。
今天韩国企业基于中国开源模型做韩语AI,本质上是在为中国AI的技术路线做全球落地的验证与推广。
从另一个角度看,“被对标”本身就是一种认可。
韩国搞“主权AI”,没有把GPT-4o、Gemini当成核心参照物,偏偏选中了DeepSeek,恰恰说明在性价比、开源度、工程可落地性的综合维度上,我国模型已经是全球同赛道的标杆。
03
开源AI的生态位跃迁
这场韩国AI的“超越秀”,表面看是技术宣传,背后折射的却是全球AI产业格局的悄然变化。
过去谈到开源大模型,默认基座是Meta的Llama系列。
但短短两年时间,DeepSeek、Qwen等我国开源模型快速崛起,在性能、效率、开源程度上全面追赶甚至反超。
对于中小国家和地区而言,来自东方的开源模型已经成了比硅谷大模型更优的选择:没有严苛的使用限制,性能足够强,适配成本更低。韩国的国家级AI项目集体对标、甚至基于中国模型二次开发,就是这个趋势的缩影。
但我们也要清醒看到,这种“被借鸡生蛋”的局面,既是机遇也是挑战。
一方面,开源生态的护城河正在加速形成。
当全球越来越多的开发者、企业基于中国模型做二次开发,围绕这些模型的工具链、数据集、行业方案会越来越丰富,形成正向循环。别人借你的鸡生了蛋,最终这些蛋又会反过来丰富你的生态,让你的基座变得更有价值。这种生态层面的网络效应,一旦形成就很难被颠覆。
另一方面,我们也要警惕“基准分内卷”的陷阱。
韩国半年一淘汰的赛制,已经倒逼企业把资源砸在刷评测分数上,而不是底层架构创新、长期数据管线建设。这种短视行为,只会让模型停留在“跑分好看、实用拉胯”的层面,陷入“用韩语基准证明韩国模型最强,再用这个结论申请更多韩语项目预算”的自我循环。
这对于我国AI产业而言,是一个很值得观察的反例。
说到底,开源从来不是一场无私的慈善,而是一种更高明的产业竞争策略。你开放了自己的技术底座,就必然会有人借鸡生蛋,甚至在局部赛道反过来超过你。
但这正是开源的魅力所在:它让你的技术突破了自身的边界,渗透到更多国家、更多行业、更多场景里。
热门跟贴