现在AI已经融入大家日常了,搜个问题写文案生成图片,随手点一下都要AI跑一遍计算。很少有人留意,这一次次调用背后,数据中心的电表已经快转疯了,GPU堆得越多,功耗墙把整个行业卡得越难受。有人另辟蹊径,提出干脆不用电,用光来算AI。
很多人只知道AI训练要一次性砸进去海量电力,其实AI推理才是现在耗电大户。毕竟训练就做一次,推理是每一个用户每一次使用都要跑一遍,现在几亿人天天用AI工具,推理耗电极速攀升,数据中心都快扛不住了。不少大公司现在忙着找新能源,甚至自己建发电厂,说白了都是从供电端想办法。不从计算本身改,怎么都解决不了根本问题,整个行业都在等着有人找出新路子。
传统电子芯片靠电子跑电路来计算,这个新方案的思路完全不一样,用的是光的干涉效应。AI计算里最吃算力的就是大规模矩阵乘法,光传的时候互相叠加干涉,天生就能做完这个运算,速度还快得离谱。打个大家能懂的比方,电子计算就像人工排长队挨个递纸条,一次只能传一张,慢不说还挤得慌。光计算就像无数束光同时穿过透镜,结果直接在出口呈现,并行能力拉满。
光和电子比,传输的时候发热量低太多,不同波长的光走同一条路也不会互相干扰,天生就能带好多路信号。这刚好能解决现在电子芯片功耗太高、带宽不够、扩不动规模的痛点,怎么看都像是为AI量身订做的新方向。别看思路挺美好,现在这个项目还在早期研究阶段,一大堆硬骨头等着啃。Q/C这次和桑迪亚的集成纳米技术中心合作,就是要先搞清楚,哪些光学运算和器件能当可扩展光学处理器的基础模块,最终画出一条能超越GPU改良路线的技术图。
有好几个问题卡了光计算几十年,一直没走出去实验室,这次研究团队就是要正面刚这些问题。最关键的就是非线性运算,这可以说是光计算天生的短板。神经网络要处理复杂问题,必须得有非线性函数,可是光在普通介质里的表现本质就是线性的,这道坎绕不开。还有存储的问题,电子芯片算到一半把中间结果存进内存太方便,光想要停下来保存可太难了。
精度和损耗也都是绕不开的问题,光信号在器件里走一趟就衰减一点,模拟计算的误差还会一层一层堆起来,最后算出来错得离谱可不行。就算这些都解决了,光子器件还要和现有的电子系统拼到一起,光电转换本身就会多出来额外的能耗和延迟,也得想办法搞定。这次桑迪亚国家实验室出了自己压箱底的本事,纳米科学和纳米光子学的积累几十年了。
桑迪亚本身就是美国能源部旗下的国家级实验室,一万七千多名员工,年预算足足五十亿美元,从微电子到高性能计算都有很深的布局,长期搞国防能源领域的重大科研,实力完全没得挑。对初创公司Q/C来说,能搭上桑迪亚的设备和人才团队,相当于把从原理验证到器件开发的时间直接缩短了一大截。Q/C的目标很清晰,就是不想跟着别人慢慢改良GPU,要做就做从根上不一样的新架构。
Q/C自己也在旧金山新建了一个四千八百平方英尺的集成光子实验室,专门用来搞光子学、计算架构这些研发。他们的长期目标就是做出来时钟频率和带宽比现有方案高得多,能耗还低很多的光学处理器。得说清楚,这些现在还只是研发目标,不是已经做出来的成品。放眼全球,现在光计算已经成了多国科研机构和科技企业抢着布局的前沿赛道,不是这家初创公司自己拍脑袋想的风口。
摩尔定律慢慢放缓,AI对算力的需求还在疯涨,整个行业都在找破局的方向。现在数据中心里,用光代替铜线传数据的光互连技术已经商用了,这其实已经给光计算落地攒下了不少产业基础。但光计算要真的能用上,门槛可不只在硬件。
能不能和现有的AI软件框架兼容,就是个大问题,总不能让全世界开发者把现有模型全部推倒重写吧。从实验室成果到能量产的产品,还要跨制造工艺、成本、软件生态好几个坎,哪一步都不好走。现在业内比较理性的看法是,光计算大概率不会彻底换掉现在的电子芯片,最后光电融合,才是下一代AI硬件最可能的方向。毕竟GPU的功耗墙已经摆在那儿了,总得有人闯一条新路出来。
参考资料:科技日报 光计算:下一代AI算力突围新方向
热门跟贴