你有没有遇到过这个时刻:把任务交给Claude Code、Codex或Cursor——不是“改个错别字”那种小活儿,而是“重构auth中间件并更新测试”——然后它就自己去干了。就算你关掉了所有“编辑前先问我”的弹窗,让它一口气跑完,你还是忍不住想看看它到底做了什么、在哪个棘手的地方卡过壳、有没有跑偏。这一看,可能就是几分钟。而这几分钟里,你要么干坐在那儿盯着终端滚屏,要么起身走开,然后真的忘了回来检查。

没人盯着,这就是问题的全部:编程智能体已经强大到可以长时间无人值守地工作,但交互界面还停留在“要么死盯终端,要么干脆忘了它”的阶段。

SKI就是为解决这个问题而来的:一个免费的桌面应用,给编程智能体装上一副“嗓子”——而且是双向的。你可以用说话代替打字,和Claude Code、Codex、Cursor、Gemini CLI以及更多智能体对话;更关键的是,你能听到它们出声回答。当智能体完成一个任务或走到决策点时,它会直接说出来:“测试通过了,要我发布吗?”——你完全不必守在终端前才能捕捉到这句话。你可以开在另一个窗口、另一个房间,或者埋头在另一项工作上。

它以一个轻量的桌面小部件形式存在:一个悬浮胶囊;在MacBook上,则是吸附在摄像头下方的“刘海栏”。按住一个键就能说话,语音转文字和文字转语音都在本地运行,数据不出机器。

为什么要强调“编程智能体的语音”,而不是“语音听写”?这里有个实质区别。听写工具早就有了,也确实做得不错——它们把你的话变成文字,投放到光标所在的位置。这确实有用,但它只是把语音当作输入法。SKI做的事不一样:它让智能体成为对话的参与者,主动开口同步状态,而不是等着你去问。