把同一个编程问题反复扔给Codex,我每次都看到相似的场景——答案倒是正确,但前面的解释、多余的要点和收尾的重复段落,总是比真正有用的答案长出不少。
Genshijin 这个外部指令声称能剔除这些“语言脂肪”。它的 README 写着大约能削减 75% 的 token 消耗,为了不把这一指标直接当作省钱承诺,我用同样的任务跑了 192 次。
结果日语这边确实变短了,但幅度没那么夸张;英语那边更意外——答案不但没缩短,反而变得更长。一旦把输入 token 也算进去,不论用哪种语言,用 Genshijin 后的中位 API 成本都没有降低。Caveman 是英文环境中类似的一个缩短回复的系统提示技能,其公开的“真实数据”页面显示:平均输出减少 65%,输入完全没有减少,反而因为注入技能规则,每轮大约多出 1000 到 1500 个输入 token。对一些简短的编码问题,这会直接变成负收益。
这个区别很关键:一项技能可以让回答变短,但同时可能让请求本身变大。README 里提到的 75% 是输出行为指标,并不等于 Codex 的订阅账单会降低 75%。Genshijin 并不替换底层模型,它只是一个风格指令,指导模型去掉日语中的敬语、缓冲语、模棱两可的表达和冗余的助词,保留技术内容。我测试的任务覆盖了 React 内联对象属性、认证中间件的 token 过期边界、PostgreSQL 连接池限制、rebase 与 merge 的取舍、回调转 async/await、单体架构与微服务对比、小型 PR 安全审查,以及 PostgreSQL 的丢失更新竞态条件。
每个任务分别用原生语义一致的日语和英语提示执行,并对比四种条件:每项都重复三次,条件顺序用固定种子随机化,每次调用使用 gpt-5.6-sol 且推理强度设为低,会话环境为只读沙箱、禁止使用工具、只允许输出最终答案。这套对照是为了一个内部基准比较,而不是对全部编码场景的通用推断。但它至少揭示了一件事:如果你单纯因为看到“节省 75% 输出”就以为能省下真金白银,账单可能并不会配合你的预期。
热门跟贴