Andrej Karpathy昨天发了条X,讲当AI越来越强,输出速度也越来越快后,我们怎么更好地看懂AI的输出,我觉得非常有参考价值。有很实用的可以直接借用的Prompt,也可以从他的例子延伸出去,聊聊怎么让Agent产出更符合自己需要的东西。
他给了四个办法:
1、让AI用ASD-STE100写解释(他说这样常常好读很多,规范太严的时候,就让模型做到「八成接近」);
2、让AI画图;
3、让AI直接输出HTML,做成能交互的网页;
4、以及他最看好的,为任意一个问题现做一段讲解视频,比如「做一个3Blue1Brown风格的X讲解视频,用我的ElevenLabs API配音」(国内的话,其实豆包、Minimax还有Qwen的语音生成模型也非常好用)。
他的判断是,AI会把越来越多的活干掉,我们的工作会往上走到监督和理解,而智能和代码越来越充裕,为一个问题现做一个用完就扔的网页或视频,也开始划算了。
原帖在这,你也可以直接丢给你的agent: https://x.com/karpathy/status/2105819303471976479
先别急着把词抄进AGENTS.md
这条X我看的时候已经有两万多收藏,然后我看到有人当天就照着把ASD-STE100写进了CLAUDE.md、system prompt,GitHub上一天多就新建了29个名字里带ASD-STE100的仓库,不少是把它做成了skill,好像捡到了一本秘籍。其实这招两个月前就在圈里火过一轮,Matt Pocock把它写进了全局CLAUDE.md,levelsio让Claude存进了memory,两条都有好几千赞:
公众号上也一样,我搜了一下,昨天到今天光标题里带Karpathy的就有十几篇,翻下来基本都在转述他的四个办法。
但……这完全错了。
AGENTS.md、CLAUDE.md这类配置每次开会话都会加载,你写代码、写周报、写公众号,它都会把AI往航空维修手册的方向拽,可Karpathy拿它是为了读懂一段解释,而且他自己也说这个规范太严,有时候只让模型做到八成接近。
再说,一个词在他那儿好用,换个任务、换个模型就不一定了,我之前写原型图提示词那篇里就说过,同一套提示词在不同模型上的表现可能很不相同。
我觉得这条X里真正值得抄的,是这个词背后那套做法:先知道自己想要什么效果,再找一个能指向它的名字,然后拿去试。只抄词、只转述理念,其实都没学到点上,所以我来写一下吧。
下面是我从这条X出发,自己想、自己测的过程,每一步你都可以照着走一遍,最后找到的会是你自己的词。
ASD-STE100为什么有用?
ASD-STE100这个名字我倒也是第一次知道。它是一套最早给航空维修手册用的受控英语规范,有写作规则也有词典,哪个词能用、一句话最多几个词,都规定得死死的。Karpathy帖子里附的这张图,把规则分节、词典条目、字数上限都摆在了一页上:
拿图里那句改写来看,ensure、prior to、commence这些词都不在批准词表里,词典直接给了替换:
再对比一下我们平时最常说的「写得简洁一点」,你想要的是字少一点,句子短一点,还是少用术语?这些都可以叫简洁,AI大概只能挑一个它觉得对的。
我的推测是,ASD-STE100这类名字其实是被压缩过的要求,一个名字背后已经有一整套规则、作品和做法,在模型的训练语料里对应的东西可能也更集中,不像「高级」「有质感」「简洁」那么宽。不过这只是猜测,那就测一下。
设计一个对照测试
测的时候用的是A/B测试的思路,有点像做科学实验,控制变量:同一个任务,只改一句话,别的一个字不动,每个条件开一个新的agent,互相看不到对方写了什么,我自己电脑上的配置也都关掉,免得混进别的变量。任务是给没有机器学习背景的读者解释RSI(递归自我改进,就是AI参与改进AI),事实只给一句定义,篇幅放到400字以内,给它留足发挥的空间。
名字一共15个,从写作结构、体裁到具体某个作家都有,跨度尽量拉大,每个跑两次,看同一个名字的效果稳不稳。提示词长这样,任务和名字都可以换成你自己的:
给经常用AI、但没有机器学习背景的读者,用中文解释RSI(Recursive Self-Improvement,递归自我改进,指AI参与改进AI)。用「{你想测的名字}」的写法来写。400字以内。只输出正文,不要说明你用了什么写法。看文字的结果
「写得简洁一点」那组是我最意外的,我原本以为它至少会短一点,可能现在的模型不用提醒也写得挺简洁了。
名字指向的东西越具体,获得的结果差得就越多。ASD-STE100两次都是小标题加编号步骤,「人」和「AI」从头到尾就这两个叫法;到了体裁那一组,整篇的样子都换了,药品说明书两次都从【通用名称】写起,第一次那版的【不良反应】一栏,顺手列出了偏差放大、自评失真、监督滞后三个风险。
王小波那组提醒了我另一件事,两次都用第一人称讲了一段「我年轻时在云南插队」的经历,一次是修拖拉机的师傅,一次是自己打锤子的老铁匠。王小波年轻时确实在云南当过知青,但这两段故事都是模型编的,借一个人的名字,它会把这个人身上的东西一起带进来,包括你不想要的那部分。
全文在这,左右滑动可以看:
所以选哪个被压缩过的词汇去调整模型的输出,得看你要什么:想让说明好查、不出歧义,可以试ASD-STE100或者维基百科词条;想让读者第一句就拿到结论,试金字塔原理或者新闻倒金字塔;想写得有点意思,苏格拉底式对话、单口相声都可以;要发小红书,直接说小红书笔记就行。
换到图上再测
文字测完,我又想知道名字在图上管不管用,就让四个agent各画一张RSI的图解,提示词同样只差一句:不加要求、「画得高级一点」、「用3Blue1Brown的风格」和「用xkcd的风格」,每个条件只生成了一版。
「画得高级一点」那张换了字体,把循环画成了螺旋,配色还是不加要求那一路;两个名字那两张,从配色、字体到线条整套都换了。
换到视频上再测
Karpathy最看好的是讲解视频,最近大家也都在关注GPT-6 Astra、Opus5.5之后语言模型剪辑的能力,你让coding agent去剪,说「更有电影感」「转场更顺」,它也只能自己琢磨,剪辑圈里其实有一大堆现成的词。
J-cut,下一个镜头的声音先进来,画面再切过去,比如「从街景切到咖啡店时做J-cut,先听见店里的磨豆机声,再看见咖啡店」;L-cut反过来,画面已经切走了,上一个镜头的声音还在,比如人还在讲最后一句,画面已经切到了电脑演示。这两个字母,来自它们在剪辑软件时间线上摆出来的形状:
Match cut,用前后两个镜头共同的形状、构图或者动作把它们接起来,比如让杯口和月亮在画面里大小、位置对上;cut on action,在动作进行中切,下一个镜头接着同一个动作,比如抬杯抬到一半,从中景切到手部特写。
如果理解了这些概念,你在表达视频剪辑的需求的时候,会精准许多。
找到你自己的词
这些名字当然不用背,更好的办法是从你本来就喜欢的东西里找,一本书、一个作家、一部电影、一个常看的频道都行。Karpathy说的3Blue1Brown就是一个,不过最好说清楚你要借它哪部分。
先挑一小段你喜欢的,问问自己到底喜欢它哪:先讲案例再讲道理?句子像在跟朋友聊天?还是把一个复杂关系一步步画出来了?然后丢给AI:
请分析{粘贴你喜欢的那段}的表达方式,区分结构、句子节奏和具体技法。找出我可以用来表达这些偏好的已有术语,给出定义和可核对的出处。如果没有合适的名称,就直接描述做法。最后,用同一个小任务演示两种候选,让我比较。
我之前写生成高保真App原型图的提示词时,有过类似的过程。我想要样式更好、代码更少,AI建议用Tailwind CSS,我就写进了提示词,其实我当时压根不知道这是啥,然后前后试了不下20次,浪费了300多次cursor次数。那篇里我写过两句话,你不会,但你可以学,AI是最好的老师;还有就是测试&迭代,现在回头看,找词也是这两步。
找到名字以后,先让AI讲清楚这个名字具体要求了什么,再回原书、原作品核对一下,然后拿上面那个对照提示词,跟不加要求的版本各跑一两次,看它到底改了什么,王小波那种顺手编经历的情况,也只有这样才看得出来。
觉得好用,就把这个名字、出处、适合什么任务,还有一句具体要求存进你的词表。真要往AGENTS.md里写,我觉得也应该写这种自己测过的,而且标清楚用在哪类任务上。
以后看电影、看广告、看喜欢的博主视频,可以多问一句:这个让我觉得很顺的地方,有没有名字?没有的话,我能不能把它描述出来?同样是J-cut,声音提前半秒和提前三秒,效果可能完全不一样,也不是每个地方都要用技巧。
我觉得这在某种程度上就是我们常说的taste了,看得多了,你才知道自己喜欢什么,也才说得清楚。
从Karpathy这条X出发,我多做的其实就三件事,想一想它为什么有用,设计个测试,再把结果验证一遍,我觉得这种思考、测试、验证,可能是用好AI更需要的东西。
热门跟贴