在云上跑大模型推理,成本往往惊人。但一个Google Cloud TPU v5e芯片(16GB HBM,spot价格约$0.58/小时)就能以1,496 tokens/秒的聚合吞吐量服务Gemma-4模型,单流延迟低至8.02ms,原生支持工具调用。以每百万输出token约$0.107的成本,足以支撑8-16个并发轻量级代理。这不是纸面参数,而是我在真实硬件上跑出来的数字。 这个构建日志最值得读的部分,不是那些顺利的配置,而是作者承认“我错了”的地方——四个原本信心十足的预测被基准测试一一推翻,每一个否定都比原来的猜测更有价值。 测试环境如下: - 硬件:v5litepod-1(一个v5e芯片),位于us-west4-a - 软件:vllm/vllm-tpu:nightly,vLLM 0.26.1rc1.dev125+ga7a204cc6 - 后端:tpu-inference JAX - 模型:google/gemma-4-E2B-it,bf16精度 如果你也想复现,需要先完成几个关键步骤。 第一步,登录gcloud并设置应用默认凭据: gcloud auth login gcloud auth application-default login 第二步,把Hugging Face token存进Secret Manager,而不是写死在脚本或env文件里。因为TPU VM的启动脚本会作为实例元数据存储,任何包进脚本的密钥都能从实例中读取。用以下命令创建secret: printf '%s' "hf_xxxxxxxxxxxx" | gcloud secrets create hf-token --data-file=- --project=YOUR_PROJECT 第三步,注意一个坑:flex-start v5litepod-1只在us-west4-a被接受。即使你在europe-west4-a或-b有配额,API也会直接拒绝,报错“FLEX_START provisioning model is not supported”。别浪费时间在其他区域尝试。 gcloud命令中,v5e必须拼写为v5litepod,比如“gcloud compute tpus tpu-vm create ... --accelerator-type=v5litepod-1”。另外有三种配置模式,spot最便宜,但会被抢占,收到约30秒通知,没有运行时长限制,按使用计费直到删除。 最终跑出来的性能数据是多少?聚合输出1,496 tokens/秒,单流每token延迟8.02ms。这意味着一个芯片就能支撑起一个小型agent集群。更难得的是,这个日志把“我原来以为会怎样”和“实际怎样”都写了出来。四个被推翻的预测,每一个都让作者对TPU和vLLM的理解加深了一层。 如果你打算用TPU跑Gemma,这份实测日志比任何PPT都靠谱。至少它告诉你,一个$0.58/小时的芯片能做到什么,以及哪些官方文档没写的坑需要绕开。
热门跟贴