WebGPU正在改变我们对浏览器内性能的认知,尤其是在AI推理负载方面。这不再是小幅改进:当你在"底层"工作,优化计算图和内核时,性能提升可以达到5倍到10倍的量级。

有意思的是,这些结果并不依赖某一种魔法,而是来自一系列非常具体的架构决策:构建一个专为WebGPU设计的推理引擎,编写定制内核,并对数据流施加激进的优化,以减少最常见的瓶颈——内存。

打开网易新闻 查看精彩图片

通用推理栈的灵活性,本身就是成本

许多推理栈从诞生之初就带着通用化的目标:支持大量算子、大量后端、大量组合。这种灵活性是有代价的。

而一个专为WebGPU设计的推理引擎则可以做到:更少的"层",更少的抽象,不再阻碍重要的优化。

性能不是靠"对的算法",是靠"对的实现"

GPU上的性能竞争,往往不是靠"对的算法"赢得的,而是靠"对的实现"。编写定制内核,意味着可以干预那些影响巨大的细节。

当一个内核是为计算图中某个特定片段设计的(而不是为了通用复用),它就可以围绕该用例的真实约束来构建。

浏览器里GPU不慢,慢的是内存

在浏览器里,和其他地方一样,GPU并不"慢":真正成为刹车的往往是内存。许多推理流水线之所以付出沉重代价,是因为每一次操作都要重复同一套动作。

这个模式重复几十次甚至上百次之后,就会成为主导成本。

算子融合:把多次往返压成一次

一个非常强大的杠杆是把多个操作融合(fusion)成一个。如果不再按顺序执行独立算子(中间要经过中间缓冲区),而是把它们融合起来,我们就能获得收益。

收益不只是理论上的:减少向内存的往返次数,就能解锁"两位数"级别的加速。