在全球人工智能的赛道上,过去很长一段时间,所有人都默认了一个无法打破的格局。英伟达手握CUDA软件生态,牢牢掌控AI算力世界的底层规则。全球几乎所有大模型企业、科研机构、程序员,想要训练AI、开发模型,都必须依靠英伟达的GPU芯片,必须学习CUDA这套专属编程体系。

这就像在AI世界里,盘踞着一头强大的巨龙。巨龙掌握唯一的通行钥匙,所有开发者想要进入AI领域,只能向巨龙采购硬件、遵守巨龙定下的规则。硬件定价、软件生态、技术门槛,全部由对方说了算。一旦供应链收紧、技术限制落地,大量科研项目、企业研发计划就会瞬间陷入停滞。

无数程序员、AI创业者,多年来一直忍受这套生态带来的束缚。芯片价格居高不下,开发迁移成本极高,一旦脱离CUDA体系,大量代码就要全部重写,投入巨额时间成本。很长一段时间里,行业内很多人都悲观地认为,CUDA生态的垄断几乎不可能被撼动,想要打破这个局面,至少需要十年以上漫长的追赶。

就在所有人都习惯了这套既定规则的时候,一则重磅消息,震动了整个全球AI开发者圈子。DeepSeek正式官宣,联合华为昇腾,把整套底层开发工具链完整开源。推出Tilelang编译工具,同一套代码,既能跑在英伟达GPU之上,也可以直接在华为昇腾芯片上高效运行,不需要大规模改写代码。

消息一出,海外技术社区Hugging Face、GitHub瞬间沸腾。全球无数程序员、AI工程师纷纷转发、下载代码,一场由代码开源驱动,全世界开发者共同参与的“屠龙之战”,正式拉开帷幕。

很多普通读者看不懂这件事背后的分量。大家会疑惑,一次开源工具发布,真的能够撼动英伟达深耕十余年建立的庞大生态吗?这场联合出击,到底破解了AI行业怎样的死局?今天,我们层层剥开AI算力大战的内核,看懂这场惊心动魄的技术突围,读懂为什么无数程序员,愿意主动加入这场跨越国界的技术突围。

一、AI世界的巨龙:CUDA垄断,困住了全世界开发者

想要看懂这场突围,首先要读懂英伟达这头“算力巨龙”的护城河到底是什么。很多人以为,英伟达的核心竞争力,只是芯片硬件性能强大。但真正业内人都清楚,硬件只是表象,真正锁住整个行业的,是CUDA软件生态。

AI芯片本身,只是一块计算硬件。想要让芯片发挥算力,需要底层编程语言、算子库、通信组件、调试工具共同配合。CUDA就是英伟达打造的一整套软件体系。过去十几年,全球开发者为英伟达GPU写了海量代码,沉淀了数百万个算子、工具库、开源项目。

久而久之形成了极强的锁定效应。程序员学会CUDA,写出来的代码,只能在英伟达显卡上高效运行。如果企业想要更换其他品牌AI芯片,绝大部分代码需要推倒重写,重新调试算子,测试分布式通信,投入数千万资金,耗费数月甚至数年时间。

这就是行业内人人头疼的“生态枷锁”。

举个简单例子:一家AI创业公司,前期用英伟达GPU训练模型,团队所有工程师熟练掌握CUDA开发。后续出于供应链安全考虑,计划切换国产芯片。看似只是更换硬件,实际上整个底层代码体系全部要重构。算子性能不匹配,多卡通信不稳定,模型训练时容易出现精度丢失、训练崩溃。项目周期被无限拉长,研发成本成倍暴涨。

这种生态锁定,带来了连锁后果。

第一,AI芯片定价掌握在少数厂商手中,高端AI卡价格常年居高不下,中小企业、高校科研团队算力采购成本压力巨大。

第二,技术限制随时可能落地。一旦硬件出口管制收紧,很多海外科研机构、国内企业,会面临算力断供的风险。

第三,整个行业的技术路线被单一生态定义。所有开发者只能沿着CUDA的思路去做模型开发,其他芯片厂商无论硬件性能做多强,没有配套软件生态,很难吸引开发者使用。

过去几年,全球多家芯片厂商,都尝试打造替代CUDA的软件栈。投入巨额资金,招募顶尖工程师,但是收效有限。生态的建设,不是靠一家企业单打独斗就能完成。软件生态的核心是开发者,没有足够多程序员使用,再多工具库,也只是放在服务器里的静态代码,无法持续迭代。

硅谷很多分析师曾经断言:CUDA生态积累的代码资产,是十几年千万级开发者共同沉淀的成果,想要从零追赶,几乎不可能完成。想要打破垄断,必须找到全新的思路。

就在所有人都觉得,局面难以逆转的时候,DeepSeek和华为昇腾,找到了一条截然不同的破局路线。

二、曲折的突围之路:曾经的国产芯片适配,困在“能跑”和“好用”之间

很多人会问,国产芯片发展多年,为什么到现在,这次开源才被称作关键一击?这里就要讲一段国内AI产业曲折心酸的追赶历程。

早些年,国产AI芯片的适配工作,大多停留在“模型可以跑起来”这个基础层面。

厂商拿到开源大模型,投入工程师,修改模型代码,调整算子,最终让模型能够在国产芯片上完成推理。对外发布公告,宣布模型适配成功。但是这种适配,有巨大短板。

这种适配,属于一次性适配。模型换一个版本,代码结构改动,又要重新投入人力修改算子。底层算子没有统一标准,不同芯片之间代码不互通。开发者如果同时维护英伟达和国产芯片两套环境,就要维护两套完全独立的代码库,工作量翻倍。

而且很多早期适配,仅仅保证模型可以运行,性能表现并不理想。训练速度、显存占用、多卡通信效率,对比英伟达平台存在明显差距。企业做商用落地的时候,会顾虑稳定性、算力吞吐量,不敢大规模部署。

所以很长一段时间,行业陷入一个尴尬循环:芯片硬件性能持续提升,但是软件生态薄弱,开发者不愿意迁移;开发者少,芯片厂商就没有足够动力持续优化工具链;生态发展缓慢,企业不敢大规模采购芯片。

无数国产芯片团队,在这个死循环里面苦苦挣扎。硬件一次次迭代,性能指标不断突破,软件生态的短板始终难以补齐。很多技术团队,耗费数年心血打磨芯片,最后卡在生态这一关,难以打开市场。

DeepSeek自身的研发历程,同样体会过这套生态枷锁带来的痛苦。DeepSeek研发大模型,最早也是基于英伟达CUDA生态开发。团队在训练超大模型的时候,发现了CUDA体系的局限性。代码绑定单一硬件,一旦算力供给受限,整个模型研发项目就会面临停滞风险。

团队开始思考,能不能打造一套跨硬件的底层编程体系。开发者写一次代码,就可以在不同品牌AI芯片上面高效运行,不需要针对不同硬件反复重写算子。Tilelang这套编译语言,就是在这样的背景下诞生。

Tilelang最早在英伟达GPU上完成验证,DeepSeek团队基于Tilelang,完成V4系列大模型的训练,证明这套工具链,足以支撑万亿参数大模型完整训练流程。在验证技术可行性之后,DeepSeek选择和华为昇腾深度协同,把Tilelang完整迁移到昇腾平台,并且把整套底层组件,全部对外开源。

这一次,不再是简单的模型适配。而是直接把训练大模型用到的全套底层工具,包含Tilelang高级语言编译器、高性能算子库、分布式通信组件,全部开源。英伟达平台对应的每一个核心组件,昇腾平台都有一一对应的高性能版本。同一套Tilelang代码,两边硬件都可以直接跑。

这是本质上的区别。过去是模型适配芯片;现在是底层工具跨硬件通用。开发者学会Tilelang,写出来的代码,天然支持多类硬件,不用再绑定CUDA。

消息公布之后,整个AI行业都感受到巨大震动。海外科技媒体第一时间报道,评论称这是多年来,CUDA生态遇到最严峻的挑战。

三、开源代码,号召全球程序员共同屠龙:底层逻辑彻底改变

很多人不理解,开源代码这件事,为什么有这么大的威力。核心在于:生态从来不是一家公司花钱堆出来的,生态是无数开发者持续使用、提交代码、迭代优化,一点点生长出来的。

DeepSeek把整套工具链开源,等于向全世界程序员敞开大门。不管是高校学生、独立开发者、海外AI创业团队,任何人都可以免费下载代码,使用Tilelang,基于昇腾或者英伟达硬件开发模型。开发者可以提交优化代码,修复BUG,拓展算子,所有人共享成果。

这场“屠龙”,不是DeepSeek和华为两家企业单独对抗巨头,而是搭建一套开放的技术底座,邀请全球所有被CUDA生态束缚的程序员,一起参与共建新生态。

GitHub开源页面上线短短几天,全球大量开发者涌入。

有来自欧美高校的AI科研人员,下载代码,在昇腾算力集群上测试大模型训练;

有海外独立开发者,基于Tilelang开发轻量化算子,提交代码优化方案;

有中小企业工程师,开始测试把原有模型从CUDA迁移到Tilelang,评估迁移成本。

一位海外的独立AI工程师,在技术论坛写下自己的感受。他说自己手上有一个小型开源模型项目,受限于算力成本,只能小规模测试。之前想要迁移到非英伟达硬件,预估要耗费三个月重构算子。现在用Tilelang,少量修改,就可以直接在昇腾集群运行,开发成本直接下降七成。

还有很多高校科研团队,对此充满期待。高校科研经费有限,高端AI显卡采购成本高昂。这套开源工具链,意味着科研人员可以选择性价比更高的算力硬件,开展大模型相关研究,不用被昂贵的算力卡脖子。

当然,这场突围,前路依旧充满挑战,并不是开源代码发布,就可以一夜之间完成生态替代。CUDA经过十几年积累,沉淀海量算子库,开发者群体基数庞大。Tilelang新生态,还需要持续迭代,不断完善工具、补齐算子,持续优化稳定性,吸引更多开发者加入。

这也是很多行业分析师保持冷静的原因。生态建设是一场漫长的马拉松,不是一次战役就能定胜负。但是不可否认,这次开源,找到了正确的破局思路。

过去打造替代生态,是芯片厂商单打独斗,自己写工具、自己维护,开发者被动使用。现在是开放共建,模型厂商、芯片厂商、全球程序员,共同参与工具链迭代。开发者写的代码,一次开发,多硬件通用,降低迁移成本,自然会吸引更多人参与进来。

这个底层逻辑的转变,正是这次联合行动最核心的价值。

四、芯模协同,双剑合璧,国产算力底座迎来转折点

DeepSeek负责模型算法、底层编程工具;华为昇腾提供AI芯片硬件、算力集群,两者形成“芯模协同”的组合。不是简单的硬件加模型拼凑,而是研发阶段深度绑定优化。

传统模式,芯片和模型研发相互独立。芯片硬件开发完成之后,模型团队再去适配硬件。而芯模协同,是芯片研发、模型研发同步推进。模型团队提出算力需求,芯片团队针对性优化硬件架构;芯片硬件特性,反馈给模型团队,优化底层算子。软硬件一体打磨,释放硬件最大算力。

在DeepSeek V4大模型研发阶段,昇腾芯片就已经纳入官方硬件验证清单。模型训练的整套流程,同时在英伟达GPU与昇腾芯片上完成验证。这代表国产算力平台,已经具备支撑万亿参数超大模型完整训练的能力,不再只能做推理轻量任务。

很多人会好奇,这套组合,在商用场景有哪些实际优势?

第一,供应链安全可控。对于国内政企、大型企业AI项目,算力底座自主可控,是刚需。如果算力完全依赖海外芯片,一旦外部技术限制加码,项目存在巨大风险。昇腾芯片搭配DeepSeek开源模型与Tilelang工具链,形成完整自主可控的AI训练、推理全链路方案。

第二,算力成本优势。同等规模算力集群,昇腾芯片采购成本更低,长期大规模部署,能够显著降低企业AI项目的算力开销。中小企业、地方科研机构,拥有了性价比更高的算力选择。

第三,降低跨硬件迁移门槛。未来开发者使用Tilelang开发,不再绑定单一硬件。后续如果出现更多国产AI芯片,只要适配Tilelang,同一套代码直接运行。未来整个AI行业,会形成多元化算力格局,不再是一家独大。

当然,我们也要客观看待差距。在海外部分大型超算集群、成熟生态工具插件丰富度上,CUDA依旧拥有深厚积累。新生态的建设,需要持续投入,不断打磨细节,补齐各类工具插件。技术突围,从来不是一蹴而就,每一步进展,都需要无数工程师日夜攻坚。

国内AI产业一路走来,经历太多坎坷。芯片研发,多次遭遇外部技术封锁;大模型训练,长期面临算力供给压力。一代代工程师默默坚守,一点点追赶技术差距。这次开源成果,不是凭空而来,是无数科研人员多年持续攻坚,积攒下的成果。

五、全球AI格局正在改写,开源浪潮带来行业大变局

在DeepSeek联合华为发布开源工具之后,全球AI行业正在发生微妙变化。

长期以来,全球AI产业的叙事,由硅谷主导。AI算力、底层软件标准,由海外巨头定义。大模型研发,流行“烧钱堆算力”路线,投入数百亿资金,采购海量高端GPU,训练超大模型。

而DeepSeek走出了不一样的路线。依靠算法优化、底层算子创新,大幅度降低模型训练算力消耗。此前DeepSeek相关模型,仅用较低算力投入,就达到对标国际顶尖闭源模型的性能。这证明,AI模型的突破,不只有堆算力这一条路。算法创新、底层编程优化,同样可以实现巨大性能提升。

当这套低成本、跨硬件的工具链全面开源之后,全球AI研发的门槛被拉低。对于很多发展中国家的技术团队、小型创业公司,他们没有巨额资金采购昂贵高端GPU集群。借助这套开源工具链,搭配性价比更高的算力硬件,也可以开展大模型训练、微调研究。

这会带来全球AI研发格局的重塑。AI不再是少数资金雄厚的巨头专属游戏,更多地区、更多小型团队,可以参与到大模型研发浪潮之中。

海外资本圈,已经敏锐察觉到变化。华尔街分析师发布研报,开始重新评估英伟达长期增长逻辑。如果未来跨硬件开源生态持续壮大,大量开发者逐步迁移,CUDA生态的锁定效应会逐步减弱,高端AI芯片的定价权也会受到冲击。

当然,英伟达本身实力雄厚,也在积极布局开源模型,持续迭代CUDA生态,不会轻易放弃自己的市场地位。未来很长一段时间,全球算力赛道,将会进入激烈的多强竞争阶段。CUDA生态依旧占据主流,但是不再是唯一选项。

一场算力底层标准的争夺战,已经拉开序幕。争夺的不再仅仅是芯片销量,而是开发者、软件生态、底层编程标准。谁掌握了开发者生态,谁就能在未来AI产业掌握话语权。

六、普通人如何看懂这场技术大战,生态之争关乎每一个人

很多普通读者会觉得,AI芯片、底层代码,距离日常生活很远,巨头之间的技术竞争,和普通人没有关系。但实际上,这场生态之战,最终会影响普通人未来使用AI产品的成本、安全、丰富度。

AI应用,无论是智能对话、AI绘图、AI编程、工业智能、医疗AI,底层都需要算力支撑。如果算力生态长期单一垄断,算力硬件成本居高不下,所有AI产品的运营成本,最终都会转嫁到用户身上。

多元化算力生态成熟之后,算力采购成本下降,各类AI应用的服务价格会更加亲民。更多中小企业可以低成本搭建私有AI模型,开发垂直行业应用。工业、农业、医疗、教育领域,会涌现更多落地的AI工具。

同时,自主可控的算力底座,也保障数字信息安全。政务、医疗、金融等领域的数据,事关国计民生。在自主可控算力平台上运行AI模型,数据不用出境,规避各类数据安全风险。

对于程序员群体来说,更是迎来新机遇。过去AI开发者,必须花费大量时间学习CUDA,技能绑定单一硬件平台。Tilelang这类跨硬件编程语言成熟之后,程序员掌握一套技术,就可以适配多种芯片,职业选择更加丰富。国内AI芯片产业发展,也会催生大量底层开发、算子优化的技术岗位,给技术人才带来更多就业机会。

当然,我们也要理性看待,不要过度神化单次开源的意义。一次代码开源,只是生态建设的起点,不是终点。后续还有大量工作要做:丰富算子库、完善调试工具、优化文档、完善社区支持,吸引更多企业落地商用案例。生态的成长,需要数年持续耕耘。

在全球科技竞争的大背景之下,底层软件生态的突破,难度不亚于芯片硬件研发。硬件看得见摸得着,芯片参数可以直观对比;软件生态看不见,需要无数开发者持续共建,沉淀工具、案例、文档。这是一场漫长、持久的攻坚战。

七、写在最后:开源没有国界,但是技术自主有根基

这场由DeepSeek联合华为发起的开源行动,号召全世界程序员一起共建新生态,有一层很深刻的内涵:开源代码没有国界,但是技术自主,是一个国家数字产业的根基。

拥抱开源,不等于放弃自主研发。恰恰相反,把自研工具链开源,吸引全球开发者参与迭代,是更高维度的技术竞争策略。开放共享,吸纳全世界开发者的智慧,一起完善这套跨硬件体系,打破单一生态的垄断枷锁。

曾经,在芯片、底层软件领域,我们长期跟在别人身后,遵守别人制定的规则。现在,国内技术团队开始尝试打造新的底层技术体系,并且选择开源,邀请全球开发者共同参与建设。这是中国AI产业,从应用层追赶,走向底层标准探索的标志性一步。

屠龙的征程,才刚刚起步。前路依旧有无数难关,有强大的对手,有漫长的生态建设周期。但是最珍贵的,是我们已经迈出这关键一步。不再被动接受别人制定的底层规则,开始动手打造属于自己、同时向全世界开放的技术底座。

未来数年,我们会持续看见这套开源工具链的迭代升级,看见越来越多开发者尝试Tilelang,看见昇腾算力集群落地更多大模型项目。全球AI算力的格局,正在一点点发生改变。

这场技术战场的突围告诉我们:科技的垄断,从来不是永恒不变。再强大的技术壁垒,只要有开放的思路、持续的技术攻坚、全球开发者携手共建,就有机会打破枷锁。

代码无声,力量千钧。一行行开源代码,汇聚全球程序员的力量,正在缓慢撬动盘踞多年的算力巨龙。AI的未来,不该由单一厂商定义,而应该由全世界开发者共同创造。