最近刷到不少AI创业者吐槽,租一张能训大模型的GPU,排队排到三个月后,价格涨得比房租还快。但另一边,不少地方斥资几十亿建的智算中心,通电之后就亮着灯空转,有的利用率连10%都不到。

这种魔幻的供需错配,不是什么“算力过剩”,也不是“真的不够用”——根本就是建错了方向。我们缺的从来不是盖大楼的钱,是能把算力真正用起来的本事。

为什么贵机房,成了摆设

过去两年,国内一口气新建了超过200个智算中心,从省到市几乎都在抢“算力高地”的招牌,剪彩通稿发了一堆,结果真正用起来的时候,全是坑。

有个做视频生成的小AI团队,曾经被当地智算中心邀请入驻,说GPU便宜还有政府补贴,算下来比云厂商便宜一半。结果他们待了三周就打包走人,三个问题直接把人搞崩:

第一是卡不对路。大部分创业团队的模型,都是基于英伟达的CUDA生态开发的,换国产卡跑,算子不匹配,常用的训练框架也不支持。整个团队啥业务没干,工程师光改适配就熬了两周,改到最后还是跑不稳定,根本没法干活。

第二是有卡没路。训大模型需要几百张卡连在一起协同计算,卡之间的网络带宽和拓扑就是“算力高速路”,路堵了,纸面上有几百张卡的总算力,实际能用的直接砍半,卡跟卡各干各的,成了一盘散沙。

第三是没人会管。GPU集群跟传统服务器不一样,要做任务调度、镜像适配、故障自动切换、多租户隔离,每一样都得懂AI训练的专业运维盯着。很多智算中心是原来管传统数据中心的团队接手,管普通存储计算没问题,管AI训练集群完全摸不着门道。

说白了,就像你花十几万买了台全画幅专业相机,结果只会用自动档拍朋友圈,再好的硬件,也发挥不出十分之一的价值。

错配的根子,是出发点错了

为什么会出现这种“一边饿一边撑”的情况?说穿了,很多智算中心从立项开始,逻辑就错了。

这两年智算中心是硬科技领域的“硬招牌”,一个项目几十亿投资,既是符合方向的新基建,报表好看,考核也亮眼。但很多人都忘了,算力跟修桥修路不一样:桥修好了放在那,二十年都能用;可GPU是电子产品,放三年就贬值一半,是有严格“保鲜期”的资产,放着不用一天,就亏一天的钱。

之前做工程、盖机房的公司,前两年拿地拿补贴赚得盆满钵满,现在风向变了,甲方开始追问“上架率多少?实际营收多少?”,只会盖楼不会运营的,接下来日子肯定不好过。

但换个角度看,这种错配里其实藏着真机会。现在市场上真正缺的,从来不是盖机房的施工队,缺的是三种人:能打通国产GPU软件生态适配的技术团队,能做多型号异构算力统一调度的团队,还有能把闲置空转的机柜盘活、拆成小块算力卖给小团队的服务商。

这些人现在不多,手里的活却堆成山,是真的供不应求。

这件事,跟普通人有什么关系

我见过不少人,一听到“算力紧缺”就动了心,想着要么掏钱买卡屯着,要么跟着炒算力份额套利,想蹭一波AI的风口。我得给你浇盆冷水:这个缺口根本不是普通人能随便蹭的。

真正紧缺的从来不是泛泛的“算力”,是特定型号的高端卡、能多卡协同的集群档期,本质是工程能力的缺口,不是信息差套利的机会。散户冲进去,大概率就是接盘。

如果你本身是做技术的,有工程底子,反而可以看看这个方向:现在最值钱的技能真不是只会调几个API。能把一堆别人搞不定的闲置算力、低价国产卡理顺了,让它真的能跑起来干活,这个位置现在几乎是空的,机会比挤破头去抢大模型调优的坑大得多。

你看现在卖AI课的,张嘴就是“算力大爆发,抢不上车就来不及”,一套课卖九千八,可他们从来不会跟你说,一半新建的智算中心都在空转。说真话,课就卖不动了。

最后其实想明白一件事:这个时代最贵的从来不是硬件,是把硬件变成生产力的那套本事。机房会空转,补贴会退潮,GPU会贬值,只有能把事情落地的本事,永远不会过期。