为什么一批Google TPU的客户,会主动找Google要一份第三方基准测试的成绩?因为他们说,AgentX的负载,就是他们跑智能体推理时真实流量的样子。
这份被客户点名的成绩单,来自SemiAnalysis。而SemiAnalysis给出的回应是:我们也在做AgentX的TPU基准测试,就在接下来几个月。
换句话说,客户想要的那份数据,目前还没有正式出炉。但需求已经先一步传到了Google那边。
客户要的不是跑分,是参照物
AgentX被客户描述为"具有代表性的负载",对应的是智能体推理流量。这类流量和传统推理不太一样,它往往不是一次问答就结束,而是多轮调用、反复决策,对硬件的压力分布也不同。
所以客户盯着的不是某个抽象的算力数字,而是一个能对上自己业务场景的参照物。当这个参照物出现在TPU上时,采购和选型的判断才有依据。
这也是为什么他们会直接向Google询问AgentX在TPU上的表现——需求已经具体到了某个基准的名字。
SemiAnalysis的下一步:把AgentX搬到TPU上
SemiAnalysis宣布,正在推进AgentX的TPU基准测试工作,时间点是"接下来几个月"。这条消息本身没有给出具体的测试方法、指标口径或发布时间表。
但它的指向很明确:AgentX这套基准,要从原来的评测对象扩展到TPU平台。对关注TPU推理表现的人来说,这是一个值得记下的进度条。
与此同时,SemiAnalysis对几支团队表达了认可——Google、RadixArk、Red Hat和Inferact,理由是这些团队把TPU推理带给了更广泛的用户。
三个可以记住的点
- 客户已经在向Google索要AgentX在TPU上的性能结果,理由是它代表了自己的智能体推理流量。
- SemiAnalysis正在做AgentX的TPU基准测试,预计在接下来几个月内推进。
- 被点名的团队包括Google、RadixArk、Red Hat和Inferact,评价是它们把TPU推理推向了更广的范围。
把这三件事放在一起看,逻辑链条并不复杂:真实负载先出现,客户先感知到,基准测试随后跟上。AgentX在TPU上的成绩单还没出来,但等它的人已经排上了。
热门跟贴