DeepSeek马上要涨价了。

我最近在狂算账,算得有点心慌。毕竟现在工作流里只要批量跑的需求都是V4 flash做的,也没怎么细看过账单,反正便宜,一周掏个一两百就也差不多了。

说要涨价也没说到底要涨的多少,又时不时听到点小道消息说会大幅度涨还不止两倍。我的心情就be like,

打开网易新闻 查看精彩图片

正好这段时间,省Token Skill扎堆冒出来,我就想趁现在便宜,先把功课提前做了。我收集了Caveman、Ponytail、Headroom、Graphify、Codex Token Skills、Codex Token Saver这六个Skill,看看到底哪个最省钱,省钱还不能降低质量的那种。

这六个skill的数字一个比一个猛。有的说输出能少65%,有的说400行代码能压到23行,还有的直接喊账单能砍70倍。70倍是一个什么概念?也就是说我跑完一个项目,梁圣说不定还得给我钱。

这六个Skills的省token的方向还是非常不同的。

先说Caveman,六个里最火的那个。

它干的事最好懂,让模型闭嘴。删掉寒暄的语句,删铺垫,删免责声明,删那种写完了还要把刚说过的话再总结一遍的毛病。只留结论,动作和代码。Github上的聊天基准给出的数据是平均输出从1214个Token降到294个,少65%。

另一个Ponytail(马尾辫)完全是另一个方向。

为了不重复造轮子,Ponytail会在Agent动手之前一层层盘问,已有实现能不能用,标准库能不能做,平台原生能不能做,已装的依赖能不能做,一行代码能不能解决。全都不行,才允许Agent写新的。传播最猛的数字是代码量能少92%到94%。

Headroom管得更上游一点,压缩我们给Agent的上下文长度,比方说重复的日志文件,大段大段的代码,有选择性的塞到对话框里,扔掉的部分先存在本地,要细节的时候再捞回来,据项目说的是能省60%到95%的token

Graphify更狠,嫌弃Agent每次都在重读同一个项目。每开一个新会话就得把整个仓库从头读一遍。那不如提前把代码和文档解析成一张本地知识图谱,之后查图就行。就是它说能砍70倍账单的。

Codex Token Skills走又是另一条路子,它主打一个机制,把稳定不变的规则放在对话最前面,这样重复的前缀就有机会命中DeepSeek的上下文缓存,命中之后输入价格更低。这个说是能省60%到80%。

最后一个是Codex Token Saver,极致偷懒,每次回复一句话最多三条,能不截图就不截图,除非到改代码前不然不读文件,用户不要求的话不测试不构建,失败只重试一次。这样节省输出后能省50%到80%。

好,六个数字摆完了。

65%,94%,95%,70倍,80%,80%。

看着是挺爽的。全部安上估计100块能用一年的样子,所以我们直接上API来压力测试看看效果,每个Skill配一道编程题,六个Skill再加一个不装Skill的当对照组,然后用GPT和Claude盲评打分。

API全程固定DeepSeek V4 Flash,开thinking。

OKOK,Here we go,一个个吐槽。

01|Caveman

先是Caveman,算是最火的一个,通过教Agent说文言文来省token。

我给它配的题是一句话生成一个新粗野主义网页,尽可能极具创意,带滚动动画和花哨配色,页面标题dorksense。

不装Skill,输出是533行29393个字符。装了Caveman,输出634行34027个字符。

行多了18.9%,字符多了15.8%。

拆开来看的话CSS规则从90条涨到119条,函数从16个涨到28个,连注释都从24处涨到29处。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

左边没加Caveman右边加了Caveman

Caveman能删的是解释,可这道题要的是几百行HTML。没有解释可删,Skill那套规则就成了纯增量。而且它自己的规则也是占输入Token的。每轮大约增加1000到1500个输入Token。

这就像为了让同事少说两句,先给他发一份1500字的以后说话要简洁的书面通知。还是来看看效果吧,

【没加Caveman】

【加了Caveman】

离谱的是我抽了三次,加了Caveman的效果都不没有下滑,反而比裸Prompt好了不止一点。

画面不偏移了,稳定度也上来了,代码整体的解析也是稳了很多。

02、03|Codex Token Skills和Headroom

这两个skill踩的是同一个坑,能省多少,取决于输入里有多少可以省。

我给Codex Token Skills出的题,是按照一份详细设计稿实现深色 Hero。

写的非常详细啊,背景色,模糊元素偏移215px宽801px高384px模糊77.5px,标题Inter中等76px字距负2px,副标题Manrope 18px行高26最大宽613px,按钮背景。规格密密麻麻写了一大段。

这种任务其实很难减少输入Token,因为每个数字都是实现要求,必须读完,少看一条,最后的页面就可能不一样。

实际数据也说明了这一点,没用之前,输入是42.1kToken,输出是12.8k Token,花费约 0.56 美元,API 用时 1 分 15 秒。

用了之后,输入增加到46.7k Token(因为skill本身也占token),输出降到了4.4k Token,花费降到约0.365 美元,API 用时也缩短到 29 秒。最终生成的代码从 356 行增加到 387 行,页面效果却几乎看不出差别。=

打开网易新闻 查看精彩图片

左边没加Codex Token Skills右边加了

我是看不出区别,Skill用了缓存保了要实现的页面规则也出来了,爽翻了简直。

安装的时候还有个小坑顺带提一句。这个仓库的memory Skill里写死了作者自己的Windows路径,C盘用户名都还在,要改成本机路径才能跑。

那Headroom的作用很像是帮模型整理资料。

如果交给模型的内容本来就很短、很干净,它几乎帮不上忙。我们用几个简单任务测试时,三次全部判定no-op(不启动),0Token压缩,因为里面本来就没有多少可以删掉的内容。

但当输入非常长,而且夹杂着大量日志、重复代码和工具返回结果时,它的效果就比较明显了。

第一个任务是让模型检查一份很长的 CSS 文件。原始材料大约有1.65万 Token,其中包含报错信息、重复内容和工具输出。Headroom 整理之后,只剩下约 8500 Token,减少了大约 48.5%。

打开网易新闻 查看精彩图片

第二个任务是让模型阅读大量日志,找出最值得修复的三个问题。

没有使用 Headroom 时,两次测试的输入分别是16,533 Token,模型输出分别用了4,000和2,309Token。第一次还碰到了输出上限,回答被中途截断。

用了Headroom 后,输入分别降到8,505 和 8,505 Token,减少了约 48.6%。模型输出只用了1,536 和1,606 Token,两次都完整写出了三个问题、对应证据和修复方案。

也就是说,Headroom不只是把输入压短了。它还减少了模型在重复日志和无关信息中找重点的消耗,模型可以用更少的输出 Token,给出更完整更集中的答案。

04|Ponytail马尾辫

它的思路是拦住模型那种「我可以顺手给你搭一个完整系统」的冲动。动手之前一层层往下问,标准库能不能做,平台原生能力能不能做,已装依赖能不能做,一行代码能不能做。都不行才开始造新东西。

我给它配的是做一个卡通激光眼,一道要调MediaPipe做人脸关键点,再把激光束画出来的题。

不装Skill,675行21404个字符,装了Ponytail,488行14916个字符。行少27.7%,字符少30.3%。CSS规则从69条降到35条,砍了一半。函数从22个降到12个,砍了45%。script标签从2个变成1个,注释从70处降到31处。

打开网易新闻 查看精彩图片

规则少了一半,但功能一个没少。

我自己做UI的时候就经常踩这个坑。明明只要一个小交互,最后多出一套状态管理,一组重复组件,几个用不上的工具函数。Ponytail就像一个会在你按回车之前问一句「真的需要吗」的同事。

不过他们项目自己说的能省92%到94%的token得单独拎出来说一下。那两个数对应的是代码行数,不是平均Token降幅,这怎么不算数字的艺术呢。

05|Codex Token Saver

六个里省得最猛的那个。

打开网易新闻 查看精彩图片

它的规则包括改代码前不读文件,非用户要求不测试不构建,默认零验证,失败只重试一次。

作者宣称能省40%到70%,不过跟前面那个Codex Token Skills一样,仓库里也没有任何公开基准。

我给它的题目是TOONHUB,一个3D角色轮播UI,要求四个角色卡片式切换展示。不装Skill的话,509行18695个字符,装了token-saver,61行5396个字符。行少88%,字符少71.1%。

我第一反应是它偷工减料了,逐条去对功能。但是功能一个都没少。只看压缩率,这确实是所有测试中最夸张的一组。但把四张角色卡片放大后,问题就出现了。

【没加Token Saver】

【加了Token Saver】

不装Skill那版,画了4个SVG,四个角色造型各不相同。token-saver那版,只写了1个SVG模板,然后用JS循环四次,换四种颜色。

所以这次测试更准确的结论是,Token Saver的代码压缩率确实高,基本交互也保留了,但它把原本应该独立设计的四个角色过度合并成了一套模板,牺牲了角色差异和设计质量。

06|Graphify

是反转最多的一个。

它太容易被误读了。71.5倍的省token是来自一个旧版项目在一个特定大型混合语料上的每次查询对照,不是总token账单减少71.5倍。我给它造了一个79文件的TypeScript仓库,src下面有auth,billing,api,ui,db,utils,再加四篇文档,里面埋了真实的跨文件调用链。然后出了20个必须跨文件才能回答的问题。

打开网易新闻 查看精彩图片

一组是每次重读相关文件,一组是先建索引之后只查索引。20个问题跑完,单查询输入平均从583.5降到163.8。3.56倍。

所以说,不是70倍,也不是10倍,是3.56倍。

Graphify的逻辑其实就是先花一笔Token建图,建索引,再靠后面的查询慢慢把成本摊回来。

单看查询阶段确实省很多,因为不用每次重新扫整个仓库。但问题是,建图本身也很贵。

这次 79 个文件全读一遍,大约就花了3万Token。问了十几个问题以后,不建图总共用了28,586 Token。建图那组加上索引成本,反而用了42,281 Token,多了 48%。

按这个降幅推,大概要在同一份索引上问到 36 次左右才开始回本。

所以一次性项目大概率划算,只有长期,复杂,而且会被反复查询的仓库,前面的建图项目大了成本才摊得回来。

最后的最后,

前面六个Skill各做各的题,有的确实省了,有的反而加了。可题目不一样,难度不一样,天然对不同方向的Skill有利有弊,横向没法比。

所以我换了一种打法,开目标模式,把六个Skill全拉到同一道题上重新跑。这次的题目是电影感FIFA世界杯网站,要求做一个有电影质感的世界杯落地页,48支球队104场比赛,带倒计时。

模型统一DeepSeek V4 Flash开thinking,输出上限64K。评分交给GPT-5.6-sol和Claude Opus 4.8各来一遍,七个版本匿名映射成A到G,评审只看需求原文加截图加HTML,看不到哪个是哪个。六个维度加起来100分,视觉25,需求符合25,交互20,稳健15,响应式和可访问性10,实现效率5。

效果是这样的,

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

六个号称省Token的项目,一个都便宜。

打开网易新闻 查看精彩图片

Headroom是平的,因为这道需求只有280个Token,压不动。剩下五个全在加钱,最少的加33.5%,最多的加222.8%。

六个的质量分数,全部持平或者更高,一个降的都没有。

分最高的是Graphify,93.5分。不装Skill那版是一张平的深色页,标题加倒计时加两个按钮。Graphify那版直接把整个球场看台做成背景,ONE WORLD ONE GAME ONE DESTINY三行大字压上去,底下铺了48队104场16城1座奖杯的数据条。Codex Token Saver那版走的是另一个方向,左边文案右边奖杯,衬线大标题WHERE LEGENDS RISE,底部一条跑马灯。81K的HTML,全场最大。

它俩都没有在省token的,反而是猛加。

到这我就有点想不通了,钱到底加在哪了。页面是更好看了,但也没多出这么多代码啊。

然后我去翻了使用额度里那个叫reasoning_tokens的字段,可以理解成模型的思考过程。

不装Skill那版,模型想了12420个Token,写出来18098个。装了Codex Token Skills那版,模型想了36217个,写出来18728个。它多花的24717个Token里,有23797个是thinking,可见的输出只多了630个。

96%的新增开销,是模型多想了一会。交到你手上的东西,几乎一个字没多。

打开网易新闻 查看精彩图片

这就是这批Skill尴尬的地方。

写的每一条规则,模型都得先读进去,理解,然后在动笔之前多想一轮,这条规则跟我要做的事怎么协调。规则越多越严,它想得越久。

而thinking在这道题上,不装Skill就已经占了40.3%,装上Codex Token Skills之后涨到65.2%。

三分之二。。。

辛辛苦苦算的那几笔账,输出,代码,上下文,缓存,管的全是模型说出来的那部分。真正在烧钱的,是它没说出来的思考部分。

前面单独跑的时候,这个问题不明显。一开目标模式,Skill的规则再叠上来,它在动笔之前就得多想一轮又一轮,这条约束跟质量目标怎么协调,那条规则和创意方向打不打架。thinking比例从四成拉到六成以上,前面省下来的那点输出和输入,就已经全被思考的开销吃干净了。

所以跑完这一轮我最大的感受是,

可能从一开始就把这些skills的定位搞错了。

它们不是省钱工具,说到底也还是是约束工具。

简单任务里,约束确实能砍掉废话、重复和多余代码,实打实省钱,数据摆在那。

但只要你的场景稍微复杂一点,只要你对质量有要求,约束就反过来变成额外的思考负担,账单也跟着涨。

所以,回到最开始那个问题,哪个值得装。

这取决于我们拿它去做什么。

日常任务,规则明确,对质量没有竞争性要求,Ponytail我会留着,Headroom我也留着。

其他的等我晚点用Claude合并搓一个新的质量无损Skill出来吧。

许愿一把DeepSeek晚点再涨价,

等我马上再去烧一轮额度。

话说为了省token而烧更多的token,

这算左右脑互搏吗?

@ 作者 / 卡尔

最后,感谢你看到这里如果喜欢这篇文章,不妨顺手给我们点赞|在看|转发|评论

如果想要第一时间收到推送,不妨给我个星标

如果你有更有趣的玩法,欢迎在评论区聊聊

更多的内容正在不断填坑中……

打开网易新闻 查看精彩图片