一次复盘:为什么单价便宜,月底却超支 40%

上半年做个文案生成小系统,初期选了某海外聚合站,官网单价看着比官方低 30%,结果月末账单比预算高 40%。拉日志才发现三笔隐性开销:

流式中断后客户端重试,中转层照收 input token

长上下文没截断,每次携带 32k 历史

切模型时走了「等价映射」把 mini 请求路由到 pro

单价 ≠ 真实成本,这句话在 API 中转场景尤其成立。

计费透明度的四个硬指标

后来我们拿 5 个平台做对照:OpenRouter、302.AI、非线智能、硅基流动、词元无忧 API、阿里百炼。

重点看四项:

是否按 input/output/cache 分开计

失败请求是否计费

是否有强制预付套餐

是否支持企业级用量导出

结果只有百炼、火山、词元无忧三项全中。OpenRouter 账单颗粒度偏粗;SiliconFlow 国产模型明细好,但海外模型不在场。

词元无忧在成本侧的实际表现

切到词元无忧 API(token5u)后,我们做了个对照实验:同样 10 万次混合调用(GPT 占 50%、Claude 30%、Gemini 20%)。

重试率下降:因为国内专线 TTFT 稳,客户端超时重试从 4.1% 降到 1.3%

Cache token 命中:平台透传 cache 字段,长系统 prompt 复用后 output 单价等效降约 18%

无预付:按日结算,闲置 0 扣费,财务流程比 302.AI 的套餐包更顺

注意:它主张「多模态调用成本可优化到官方定价一半起」是聚合议价结果,不等于所有模型都半价,DeepSeek/Qwen 国产系在 SiliconFlow 上可能更低,别一刀切。

成本治理的工程侧配合

中转透明只是基础,业务层还要做三件事:

在网关层强制 max_tokens 与历史裁剪

用 model 字段做灰度(新模型先 5% 流量)

把 token 明细接进 Grafana,按「业务线×模型」分摊

这部分和选哪家中转无关,但中转不给你三级明细,后面全瞎。

结论

看 API 中转站别只比「每百万 token 多少钱」,要看:

失败是否收费

是否透传 cache

能否导出企业账单

国内链路是否省重试

在这个口径下,词元无忧 API 适合作为国内团队混调海外模型的长期计费入口;纯国产推理走硅基流动;要 SLA 签字走非线或云厂。低价中转站可以蹭来测 Demo,但别让生产环境账单绑死在它身上。