近日,益企研究院举办了主题为“智能体应用时代,如何评估与提升 Token 性价比?”的直播,

并行科技副总裁赵鸿冰博士、清程极智联合创始人师天麾、世纪互联计算与生态负责人尹传智博士、新华三集团先进技术研究部总经理朱仕银参与了此次直播。会议由益企研究院联合创始人王海峰主持,各位专家围绕算法、算力、存储、网络设备,乃至供配电、散热等,以及可衡量的 Token 性价比测试标准等话题展开了深入的交流,本文为此次直播中的相关精彩观点整理。

此前已经刊登了本次。由于篇幅较长,本文为直播回顾的第二部分。

打开网易新闻 查看精彩图片

04

如果单纯讨论token性价比的话,私有化部署还是租用API,企业应该如何进行选择?

赵鸿冰:决定采用公有云还是私有化部署方式的原则,依然需要从用户视角出发,即功能、性能和价格。

比如说,从功能角度考虑,是否采用私有化部署,要看是不是有数据安全的硬性需求,诸如军工、金融、医疗等某些涉密的行业,别无他选,一定需要采用私有化部署方案。这跟价格没有关系。除此之外,在其他场景,采用公用云API的方式与私有化部署相比,公有云的优势是非常明显的。

首先,大模型的能力还远远没有收敛,其变化日新月异。在公有云上面的API,往往是最新的、最先进的,这是使用公有云方案的第一个优势。

此外,在公有云上部署的大模型,已经经过了非常专业的团队的多个层面的优化,其运行效率、性能和成本有着巨大的优势。比如说,并行科技的一些客户,用同样的硬件、规模和模型版本,以私有化方式部署的模型,其性能与我们团队部署在公有云上的方案,性能相差百倍。这是使用公有云方案的第二个优势。

最后一点就是公有云的规模优势,能够应对弹性的工作负载。对于进行私有化部署的企业,若以5000人规模、初始并发量100为基准进行资源配置,当业务,在设定初始并发数为100的情况下,当业务并发需求攀升至200、300乃至400、500时,现有基础设施将难以满足弹性扩容要求,会引发性能瓶颈。

朱仕银:确实不同的客户,会基于不同的需求考量,来进行本地化部署或者云化部署的选择。

如果企业自身有着长期稳定的、超大Token消耗量,并且基本利用率也比较稳定,加上自身的能力比较强,有着IT服务团队,那企业可能会选择进行本地化部署。

诸如政府、金融、央国企等关键部门,他们有很多合规的要求,有很多私有化数据,需要进行本地化部署。他们衡量的出发点,就不只是单一的Token成本或者性价比,而是要考虑合规和政策的因素。

在这种情况下,如果企业自身的能力较强,可以做一些深度的推理优化,那么可以将自身的Token性价比做一些提升。

在另外一种情况下,如果企业自身比较小,Token消耗量波动很大,有很多突发的、非连续需求,这种情况肯定是更适合进行云端的租赁,这样的Token性价比更强。毕竟这样就可以省去硬件的固定资产投资、运维团队的建立等。

当然,如果企业只有一些短期的AI项目,也没必要进行私有化部署。毕竟AI领域,很多硬件折旧,一般也就3-5年,如果短期内项目就已经结束,硬件都无法完成摊薄成本。这样的项目,也建议企业采用云端API的方式来使用Token。

师天麾:除非为了数据安全,或者需要私有化部署基于自有行业数据调制的模型,或者是愿意投资在AI基础设施的重资产企业。否则,单纯讨论Token性价比的角度,没有必要以私有化方式部署AI,自然是公有云的Token性价比更高。

毕竟,如果以私有化方式部署AI,不仅需要投入硬件设备,还需要优化相关的软件。如果只是单纯使用相关的开源AI软件,必然和业界的高水平系统相差很远,那就需要再搭建相对昂贵的优化团队,或者购买类似并行科技这样公司的服务。

整体而言,购买公有云的Token性价比要超过私有化部署的方式,毕竟现在算力更新迭代得非常快,而且新产品涨价也很猛。如前面所说,目前的发展趋势就是硬件越贵Token越便宜,这一点非常明确。

尹传智:所谓私有化部署,就是需要企业先投入一个比较高的固定成本,那么后续的边际成本就会较低。使用量越大,企业的Token成本就会降得越低。

那么,如果使用公有云的API,只需要较低的固定成本,即接入成本。不过,在使用时边际成本就会较高,使用的Token越多,需要付出的就越多。

如前面讨论过的,探讨Token性价比,AI系统最重要的是利用率。在企业的私有化部署中,利用率是不是很高、GPU是否始终在运行?否则的话,折旧成本就会很高。

企业需要了解,在自身企业中的相关业务中,有多少业务是需要稳定利用AI的?这些业务是否敏感,是否涉及企业私密数据?如果不涉及私密数据、业务不敏感,那么就可以选择公有云的方式;否则那就需要选择私有化部署。

另外,私有化部署会涉及供电冗余、网络链路、运维等的成本投入,毕竟需要保障AI系统的高可用性。企业不可能接受在使用私有化部署的AI系统时,集群突然出现故障导致的业务中断。

如果企业的大部分业务场景,采用私有化部署以降低Token使用成本,而引入公有云的大模型服务作为备份,那么可以减少基础设施中供电冗余、备机等相关系统的的投入,从而降低整体的私有化部署成本。

但是,如果企业即便只有一个小集群,也需要保障其核心业务在该集群的高可用性,那么就要投入更多以保障整体系统的安全性和高可用性,就会大幅度提升其Token成本。

因此,整体而言,私有化部署还是利用公有云来使用Token,这个需要按照企业的业务场景需求来进行考量,不存在固定的选择。

另外,选择私有化部署还是公有云,也不一定是二选一,也可以有中间道路。比如说在美国的Fireworks AI平台上,企业可以选择该公司提供的托管式专属的算力池、高可用的保障。这种方式,Fireworks AI可以承担备机、冗余供电和网路等相关的成本,会比企业自建基础设施来实现高可用专属算力池的成本略低。

这种中间道路,也会降低企业使用Token时候所付出的成本。

05

关于Token性价比的衡量,有没有大家公认的性价比的衡量标准?大家如何进行科学衡量?

师天麾:Token的性价比跟用户的场景高度相关。比如说,同样的基础设施,采用价格不同的模型,自然Token就会有所区别。如果选定模型,就可以比较不同Token服务商的价格,或者以私有化的方式来部署大模型,比较不同硬件系统的价格。

但是,目前并没有一套绝对标准的方法,可以作为Token性价比评估的Benchmark。但是有一些基准测试可以作为参考,其中会涉及缓存命中率等指标。

假设采用同一个大模型为例,除去DeepSeek这类价格变动频繁的模型之外,市场上多数模型服务商的定价与官网价格基本上保持一致,但是缓存定价可能存在差异。那么,在模型能力相近、价格对齐的前提下,核心差异点便在于缓存命中率的高低,而缓存命中率则会直接影响Token成本。此外,还需要考量服务稳定性、延迟、吞吐量等性能指标,是否满足需求。

在AI Coding场景中,如果对各服务商的性能指标并没有特别要求,只看重成本,那么缓存命中率越高的服务商,Token的使用成本就越低。以使用DeepSeek原厂服务为例,凭借其较高的缓存命中率,能够实现较低的Token成本。

另一方面,不同服务商的定价可能存在差异。在AI Coding场景中,尤其在长上下文输入、多轮对话以及大量缓存命中的场景中,其成本的主要来源就是缓存命中的价格,其缓存命中率也会直接影响最终成本。

对于同一模型、不同服务商的选择,关键在于比较各家的缓存价格和缓存命中率。用户可以自行测算:例如在相同场景下,假设缓存命中率为80%,剩余15%至18%为输入请求,其余为输出请求,可以据此计算实际费用。

清程极智有一款产品叫 AI Ping,专门提供 Token 服务评测,上面有各种 Token 服务商的性能对比数据,欢迎访问 aiping.cn 了解更多。

赵鸿冰:从技术视角来看,我不确定未来是否会出现类似Artificial Analysis 那样,从技术维度推出系列基准测试、角逐各方面 SOTA 的评估体系。

相比之下,我更倾向于从经济视角进行理解。用户的消费选择往往是最客观的衡量标准。如果要简单概括 Token 性价比的评估方式,核心便在于市场认可度——即是否有用户愿意付费,以及付费用户的规模大小。

尹传智:我认为,在软件层面,要制定统一的Token性价比衡量标准确实存在较大难度。

那从 AIDC 的角度出发,我们关注的核心指标是:在固定的功率预算下,能够生产多少个有效 Token。当然,这一视角仅为管中窥豹,仅反映了问题的一个层面。

整体有效 Token 的成本,涵盖了设备折旧、电力消耗、机柜、网络等各项支出,将其除以符合 SLA 标准的有效 Token 数量,即可计算出单个 Token 的成本。

然而,这一公式仅仅是数字层面的计算。更关键的问题在于:生产出的 Token 是否物有所值?这最终需要回答一个核心问题,即要从客户视角来进行分析:客户在消耗这些 Token 后,能否顺利完成预期任务?

客户最终关注的,实际上是完成任务所需的总成本,这依赖于大模型厂商以及上层软件系统层面的持续努力。

因此,我们目前所见的衡量标准可能并不完整。需要从客户任务闭环的整体视角出发,重新审视 Token 是否具备可衡量的价值标准。

朱仕银:确实,当前在Token 性价比的衡量标准上,行业尚未形成统一的强制性标准。

衡量标准设定的前提是,得确定衡量的指标。目前最直观的指标就是,每百万Token的价格。但该指标存在明显缺陷,它只反映标价,没有涵盖模型的效果、输出质量、幻觉率、响应延迟等关键维度。一些看似低价的服务,如果频繁输出无效内容,那么实际的有效Token性价比反而更差。

那么,更严谨的衡量方式应聚焦"有效 Token 性价比",即在计费单价基础上剔除幻觉、无效输出等损耗,计算真实业务场景下的可用 Token 成本。但这一评估的实施成本较高,需要针对具体业务构建测试集进行质量校验,目前推广难度较大。

如果要在行业层面进行横向对比,需要满足一个前提:对齐基线测试条件。包括固定模型版本、上下文长度、输入样本、SLA 约束等,只有在这些同等条件下比较 Token 成本才有价值,脱离质量单纯比价没有意义。

访问益企研究院视频号,选择《如何获取最优的Token性价比?》,观看直播回放。