来源:市场资讯

(来源:口罩哥本哥口罩哥研报60秒)

线性注意力省下 KV cache,却把瓶颈推向 HBM 与机柜级互连

2026.07.19 · 技术前沿

[CHIP]市场把线性注意力读成"利空英伟达"。SemiAnalysis 说反了——省的是 KV cache,涨上来的是 HBM、专家路由机柜级互连。

7月16日,月之暗面发布Kimi K3,2.8 万亿参数,全球最大开源权重模型。当天英伟达收跌 2.2%,像极了 DeepSeek R1 那一夜。

空头逻辑很直接:KDA 属线性注意力,KV cache 的网络带宽压力最高降约 10 倍。一听,卡是不是要卖不动了。

SemiAnalysis 直接反驳:"the opposite is true"(事实恰恰相反)。KDA 省的是注意力状态,省不掉 2.8 万亿权重——单模型权重就要占1.5TB 以上 HBM。—— SemiAnalysis 2026.07.18

更关键的是 WideEP:896 个专家摊到多卡,每卡只放一部分,代价是每个 token 都要跨卡 all-to-all。省了这头,互连那头反而更饿。

瓶颈迁移:省下的与涨上来的

KDA 降 KV cache,WideEP 与 2.8T 权重把压力推向 HBM 与互连

KDA 线性注意力

KV 带宽 ↓ 最高 10x

2.8 万亿权重

≥1.5TB HBM 常驻

WideEP 896 专家

token 跨卡 all-to-all

HBM + 互连

需求 ↑ 不降反升

64 卡超节点起步

来源:SemiAnalysis 2026.07.18 · Moonshot AI 官方技术说明 · Tenten AI 2026.07.18

于是官方建议 64 卡以上超节点部署。

这正是 GB300 NVL72 的主场:72 卡、20TB 显存、130 TB/s NVLink,机柜内带宽是 DGX B200 的 18 倍。

delta 在瓶颈迁移:省下的是单卡 FLOPS 叙事,涨上来的是 HBM、铜背板与 scale-up 域。

HBM 2026 年已被 SK 海力士、美光订到售罄,DRAM 一季 ASP 同比涨 136%。

打开网易新闻 查看精彩图片

被忽视的赢家是昇腾 950——同走 64 卡超节点、自研 HBM。

出口管制逼出的,恰是国产 scale-up 的需求。越省,越买。