评估大语言模型(LLM)推理性能,业界常用每秒生成token数(tok/s)来衡量速度。但一个更全面的新指标正在出现:tok/s/MW——即系统每消耗一兆瓦总配置功率,每秒能生成多少token。
这个指标将性能与能耗绑定在一起,能更真实地反映推理系统的整体效率,而不仅仅是单看生成速度。
打开网易新闻 查看精彩图片
一个具体测算案例
以英伟达B300配置为例,在单并发用户下,运行DeepSeek V4时每块GPU可生成约14个输出tok/s。根据SemiAnalysis数据中心行业模型估算,每块B300的配置功率为1.9 kW(即0.0019 MW)。
代入公式计算:14 tok/s ÷ 0.0019 MW = 7,368 tok/s/MW,即每配置兆瓦约7,400个输出tok/s。
这个数字意味着,在考虑功率消耗的前提下,该配置的推理吞吐效率达到了一个可量化的基准。对于数据中心规划和模型部署决策来说,这类指标有助于在性能与能源成本之间做出更精准的权衡。
热门跟贴