大模型Token烧不起?GitHub霸榜的“马尾辫”,教AI学会“抠门”

最近跟群里的兄弟们交流,发现大家用 Codex、Claude Code 这些 AI 编程神器时,都有一个共同的痛点:代码是写得爽了,但 Token 烧得也是真快啊!

虽然免费版也能用,但额度捉襟见肘。

怎么在保持 AI 智商的同时,把 Token 消耗打下来?

最近 GitHub 上这个“抠门”神器彻底火了。

今天星哥就带大家盘一盘,这帮开发者为了省钱,到底能有多拼。

 一、为了省 Token,开发者们拼了
打开网易新闻 查看精彩图片
一、为了省 Token,开发者们拼了

以前大家聊 AI 编程,都在卷谁的上下文长、谁的工具多。

现在风向变了,社交媒体上最热门的话题变成了:怎么省 Token?

但最近,另一个叫 马尾辫”(Ponytail) 的项目更猛,直接霸榜 GitHub 热门榜单连续三周。

这项目的介绍特别逗,刻画了一个刻板印象里的“老油条”程序员:

戴着椭圆眼镜,扎着长马尾辫,在公司待的时间比版本控制系统的历史还长。你给他看五十行代码,他什么也没说,直接用一行替换掉了。
打开网易新闻 查看精彩图片

这根“马尾辫”的核心绝活,就是教 AI 怎么少写废话代码

它不是单纯的文本压缩工具,而是给 AI Agent 植入了一套 “极简主义”灵魂,让 AI 在动手前,先琢磨怎么用最少 Token 把事儿办了。

二、安装Ponytail插件

Ponytail 开源提供各种工具的安装的,比如Claude Code、Codex、OpenCode、Gemini CLI、OpenClaw等等

https://github.com/DietrichGebert/ponytail

以星哥常用的Claude Code、Codex为例

Claude Code安装Ponytail

查看安装插件列表
/plugin list

安装Ponytail

安装命令(需分两次发送指令,不能一次性粘贴)
/plugin marketplace add DietrichGebert/ponytail

打开网易新闻 查看精彩图片

/plugin install ponytail@ponytail
打开网易新闻 查看精彩图片

有三个选项

  • • Install for you (user scope)【推荐个人使用】

  • • Install for all collaborators on this repository (project scope), 仓库项目级安装,本仓库所有协作者都会自动加载该插件,适合团队协作场景。

  • • Install for you, in this repo only (local scope):本地仓库级安装,仅在当前这个代码仓库内生效,切换其他仓库插件失效。

查看是否安装成功

 /plugin list
⎿ Installed plugins:
• ponytail@ponytail (v4.8.4, user) √ enabled
Codex安装Ponytail

codex plugin marketplace add DietrichGebert/ponytail


codex
打开网易新闻 查看精彩图片
三、实测“马尾辫”:真能省下大半钱包?

光说不练假把式,星哥也顺手在 CC上 装了 Ponytail 体验了一把。

直接问CC,它会告诉你答案

如何使用ponytail
模式切换主命令

# 查看当前生效档位
/ponytail


# 4档强度切换
/ponytail lite # 轻度:仅提醒冗余,不强制删减
/ponytail full # 默认标准:强制精简,优先标准库、少样板代码
/ponytail ultra # 极端极简:删除优先,只保留最小可用逻辑
/ponytail off # 关闭插件,恢复 Claude 默认代码输出

档位

适合场景

效果

lite

学习、教学、需要完整注释示例

温和提示,保留完整代码结构

full

日常业务开发(默认)

砍掉冗余样板,代码量减少 70% 左右

ultra

脚本、工具函数、单行工具

极致压缩,一行能解决绝不写多行

off

大型架构设计、需要完整脚手架

关闭精简,输出完整工程化代码

它的核心理念就三个字母:YAGNI(You Aren’t Gonna Need It,你不会需要它的)。这是极限编程里的老话:在真正需要之前,别去瞎实现。

全局常驻

直接执行 /ponytail full

本次会话全程生效,后续所有代码生成自动走精简逻辑,无需重复指令。

单词任务临时生效

用 ponytail插件 ultra写一个python日志打印函数

结果:
> 用 ponytail插件 ultra写一个python日志打印函数
# startup_log.py
print("SessionStart: startup hook success: PONYTAIL MODE ACTIVE — level: full")

Skipped function wrapper — one print, one call. Add a function if this needs to fire from multiple sites.

✻ Baked for 52s

Ponytail 包含 6 个技能,最核心的主技能支持 lite、full、ultra 三档强度。它的逻辑是“爬梯子”:

  1. 1. 能不做?跳过。

  2. 2. 代码库里有现成的?直接复用。

  3. 3. 标准库能搞定?用标准库。

  4. 4. 平台原生支持?用原生。

  5. 5. 实在不行,再写最小可用实现。

听起来很美好,实测效果如何?

我让 Codex 帮我分析一个包含 Python 后端、FastAPI、React 前端的股票分析系统仓库,找 Bug。

  • 不用 Ponytail :Codex 一顿猛如虎的操作,烧了 24 万多个 Token,上下文余量只剩 6%。找出了 5 个部署风险。

  • 用了 Ponytail :AI 的思考链路变了。它明确写道:“ 接下来我会跑最便宜的确定性检查:先看 Python 语法和关键静态错误。能被机器直接抓住的 bug,优先让机器抓。 ” 结果同样找出了 5 个问题,但 只用了不到一半的 Token,上下文余量还剩 26%!直接省了 5 万多 Token。

不过,星哥也要吐个槽。

在让它写个 2D 跑酷游戏时,Ponytail 有个毛病:太爱问问题了

“做桌面键盘还是手机滑动?”“视觉取向是什么?”……它为了“不盲目写代码”,会疯狂向你确认需求。如果你不选,它就不开工。

而且,这种“反复判断”的过程,有时候本身也会消耗额外的 Token。

所以,马尾辫最适合的场景是

  • 前端小功能 (日期选择、颜色选择等,它会自动去调标准库,而不是傻傻地写几百行组件)。

  • 老项目的局部修改 (加个字段、修个 Bug,它会优先复用现有代码)。

  • 代码评审和瘦身

如果是从零开始搓一个完整产品,它的省 Token 效果就没那么惊艳了。

四、节省Token

过去一年,整个行业都在教 Agent 怎么“做得更多”:更长的上下文、更复杂的规划、更强的工具调用。

一个优秀工程师最大的价值,往往不是他能敲多少行代码,而是他的“判断力”——知道什么该做,更知道什么“不该做”。

如今,这种高级的判断力,正在被封装成各种 Skill 和工作流,变成 AI 的新必修课。

最后,星哥想说句大实话:

但在“省 Token”这件事上,大厂们估计是装聋作哑的。毕竟,他们的商业模式就是巴不得你多用 Token,免费不够充 Plus,Plus 不够充 Pro,Pro 不够买点数。

所以,别指望大厂主动帮你省钱了。

真正站在开发者这边、帮你捂紧钱包的,还得是咱们开源社区里这些懂行的“老油条”们。