评估大语言模型(LLM)推理能力,业界一直缺少一个兼顾性能与能耗的统一定量标准。近期,一个名为tok/s/MW的新指标进入视野:它衡量的是系统每消耗一兆瓦总配置功率,每秒能生成多少个token。
这一指标的提出,将推理效率的讨论从单纯的生成速度,拉向了算力投入的真实回报维度。它试图回答一个更本质的问题:在既定电力与硬件预算下,模型能跑多快。
打开网易新闻 查看精彩图片
一个具体的测算案例
以单并发用户场景为例,某B300配置在DeepSeek V4模型上,每块GPU可生成约14个输出token/秒。根据SemiAnalysis的数据中心行业模型估算,每块B300的配置功率为1.9千瓦,即0.0019兆瓦。
代入公式计算:14 tok/s ÷ 0.0019 MW = 7,368 tok/s/MW。这意味着,该配置下每消耗一兆瓦功率,系统每秒可产出约7,400个输出token。
这个数字为横向比较不同硬件方案、不同模型架构的推理效率,提供了一个可量化的新维度。对于关注数据中心运营成本与算力规划的技术决策者而言,它比单纯的token吞吐量更具参考价值。
热门跟贴