很多人以为本地Agent的强弱取决于模型本身。howie_serious给出了另一个答案:Claude Code和Codex这类本地/桌面Agent之所以强大,一大原因在于它们能够使用Shell。
这个判断把注意力从模型参数拉回到了一个更朴素的地方——Agent能不能真正动手做事。
Shell是入口,不是工具
Shell本身不干活,它连通的是整个CLI生态。howie_serious列举了一串名字:git、ffmpeg、curl、pandoc、gh、cron、ssh。
这些工具各自解决一类问题。git管版本,ffmpeg管音视频,curl管网络请求,pandoc管文档转换,gh管代码托管平台操作,cron管定时任务,ssh管远程连接。
Agent通过Shell调用它们,等于一次性接入了这些能力。它不需要自己重新实现一遍,只需要知道什么时候该调哪个。
从思考者到执行者
语言模型擅长的是推理和生成文本。但推理出结果和把结果落地,中间隔着一堆具体操作。
Shell补上的正是这一段。Agent不再局限于内部逻辑,而是具备了与外部系统交互的能力,可以完成复杂任务。
howie_serious强调,这类Agent的能力不仅体现在自身的推理能力上,更在于其作为操作者,通过Shell与外界环境交互。
换句话说,它的强大不只来自脑子里装了什么,还来自手上能碰到什么。
一个自我证明的例子
howie_serious提到,他展示的部分内容,本身就是通过Agent操作Shell自动生成的。他甚至直接说,这个视频都是Agent靠操作Shell做出来的。
这个细节值得停一下。如果内容生产流程本身可以由Agent驱动,那说明Shell这条通路已经能支撑起一条完整的任务链,而不只是零散的命令调用。
AI Agent的角色正在发生变化。它不只是回答问题的那一方,也开始成为执行流程的那一方。而Shell,就是它伸向外部世界的那只手。
热门跟贴