在Anthropic API上跑一次模型评估,费用是9.14美元;换到Claude Code走订阅,费用是0美元。同一款模型claude-opus-4-8,27次调用,这不是估算,而是命令行工具在输出信封里打印的total_cost_usd:如果这次运行走API会花多少钱。走订阅后,这个数字只是“没人付钱”的收据。
这次切换还修好了比账单更重要的东西。使用--output-format json和--json-schema运行,走的是与API相同的结构化输出机制,即内部强制工具调用。作者的评估套件格式可靠性从15项中通过7项,提升到15项全部通过。
不过schema需要先放宽:要剥离pattern、minLength、maxLength、minItems、maxItems、format以及$schema元引用,因为CLI校验器不认draft-2020-12。严格校验仍保留在调用方的Zod层,所以实际上没有放松任何限制,只是把校验挪到了能运行的地方。
一个陷阱值得整篇帖子:如果子进程环境里存在ANTHROPIC_API_KEY,CLI会悄悄把费用记到API账户,而不是订阅账户。不会有报错,不会有警告,直到月底账单出现。这个变量需要在spawn时显式剥离。这是作者在其他人写的runner里最先寻找的失败模式:资金泄漏是无声的,唯一症状就是月底收到一张你以为免费运行的账单。
还有比省钱更重要的边界。这是开发循环工具。Anthropic的消费者条款禁止自动化访问,“除非你通过Anthropic API Key访问服务,或我们另行明确允许”;而规范API使用的商业条款并不涵盖消费者订阅。在自己机器上跑评估runner,是按CLI的设计用途使用;部署成对外服务则不是。对CLI迭代,用API上线。你的评估套件跑一次要花多少钱,又有没有人真正知道?原文发布于dylan.merigaud.com。
热门跟贴