观点网讯:8月31日,中金发布研究报告《Token启示录(五):推理产业链深度-测算篇》。该报告为推理产业链深度报告下篇,在中金研究测算视角下定量分析了推理优化对效率与成本的影响,并梳理产业链参与者格局。
格局方面,根据IDC,2025年中国公有云MaaS市场按调用量计算,火山引擎占据了接近一半的份额,其次是阿里云、百度智能云、硅基流动以及移动云。
测算结果显示,以样本量最大的模型D为例,其在B200上的每卡吐出量区间为152 token/s到14,949 token/s,对应的每百万Token成本区间为0.04~3.3美元。
模型A在GB200上同样呈现339~12,116 token/s的宽幅分布,不同模型与芯片组合间的性能差异明显。
效率方面,中金测算模型D的每卡吐出量均值由H100的850 token/s、H200的1,233 token/s,提升至B200的3,916 token/s与GB200的4,586 token/s,提升幅度约3~5倍。
成本方面,中金测算显示,在经过逐层优化后,混合实际成本可达约0.039美元/百万Token,较基准情况下约44.46美元/百万Token的推理成本大幅下降。基准情况设定为稠密架构400B、MHA、FP8、Prefill全注意力、推理引擎工程达成率10%、集群利用效率30%。
中金认为,硬件厂商外,推理产业链主要参与者包括模型厂商、超大规模云厂商、新云、推理优化平台、异构算力管理平台、多模型API聚合平台等,各环节毛利率主要取决于推理优化能力、硬件利用率、硬件采购成本和产品定价权。
单项优化较难形成持续的成本优势,覆盖模型、算法、引擎与硬件的Co-design能力更有可能形成持续的单位Token成本优势;第三方厂商服务敏捷、专注推理引擎提升有效吞吐,长期则需要向硬件或者向模型靠拢。
免责声明:本文内容与数据由观点根据公开信息整理,不构成投资建议,使用前请核实。
热门跟贴