周三下午三点,一位程序员合上笔记本,把刚撤回的二手RTX 3090重新插回主机。不是新卡买不起,而是这张2018年发布的老家伙,跑70亿参数的模型依旧顺滑得让人说不出狠话。在本地AI推理这个新战场,它正用一种反直觉的方式逼着新卡低头——靠的是那24GB显存,而不是什么最新的架构。

有人说,RTX 5080的算力明明更强,为什么非要抱着一张6岁老卡不放?这种“速度优先”的直觉放在游戏里成立,在本地推理面前却要重新画线。一个大语言模型能不能跑起来,第一步看的不是CUDA核心数量,也不是张量核迭代到了第几代,而是你能不能把参数全塞进显存。RTX 3090刚问世时被嫌“显存溢出”的24GB GDDR6X,放到现在成了刚好卡住主流水位线的天花板。相比之下,RTX 5080只有16GB,哪怕是运行一个理论体积14GB的模型,光临时缓存、运行时开销就能多吃掉几个GB,稍微没做好量化,系统内存就得出来救火——内存带宽从近1TB/s直掉到系统端的几十GB/s,延迟一上来,再强的算力也像踩了刹车。

打开网易新闻 查看精彩图片

反过来,又有人揪着代际差距说事:GDDR7比GDDR6X快那么多,凭什么不选新卡?单论带宽数字确实漂亮,但本地推理的瓶颈常常不是纯带宽,而是容量。3090那块384位宽的内存总线能给出936 GB/s的吞吐,已经足够撑住绝大多数开源模型的即时推理;一旦16GB的卡撑爆显存,数据溢出去啃系统内存,实时性崩盘,什么高速显存都成了摆设。所以不是新卡不好,是本地推理这套工作流,整个重心的支点不在峰值算力,而在能否让模型完整、高速地待在显存里。

这也解释了为什么现在想搭一套家庭推理实验室的人,会翻遍二手市场去淘RTX 3090。原厂时期10496个CUDA核心、第三代张量核、24GB的GDDR6X,这些规格在当年属于“过分”,到了大模型平民化的档口突然成了精准匹配。如果非要去买一张全新NVIDIA卡来拿到超过24GB显存,你只能盯上定价令人胃疼的RTX 5090——这一进一出,不是预算充裕到没处花的用户,自然会倒向老卡。

我的判断很简单:在本地AI推理这个具体场景里,显存容量就是那条最短的木板。模型参数的大小、运行时需要的额外内存、缓存和系统归置,这些叠加在一起,让理论上的“14GB模型塞进16GB卡”变成一句需要大量技巧才能实现的话。而24GB直接把你从那一整套压缩、卸载、分层的优化里解放出来,远比纸面上的乘加次数更值钱。至少在今天,还不存在一张同等价位、新代次、能拿出相同从容度的替代品。