R-CLI正式开源,采用MIT许可证,完整工具链已发布至GitHub仓库。该项目正是Terminal Bench 2.1历史最高得分记录背后的测试框架,用户可在约两分钟内用自有API密钥运行,所有成绩均有公开验证日志。

开发团队提出的唯一回报要求是:给仓库加星,并分享给一位为AI编程付费过高的开发者。官方称,这对社区和开源都是胜利,希望声量够大。

运行方式有三种:macOS/Linux下一条curl命令,Windows PowerShell下一条命令,或直接克隆源码构建——依赖仅需Bun、Git和ripgrep。

这篇公告的核心论点是:测试工具(harness)才是主导变量。行业普遍认为编程性能取决于模型本身,但官方对比实验显示,相同模型仅更换工具,分数提升就超过一个模型代际。R-CLI基于递归编码引擎RLM,父代理将任务分派给在受限上下文中运行的子代理,每个子代理只处理一小块清晰问题,避免单一巨大上下文窗口累积噪声;结果回传后压缩上下文,循环继续。正是这一结构让同一模型在R-CLI内得分更高,且少用10%至30%的Token。

数据均附有验证依据:来自技术报告的两组已发表运行记录,每项任务的验证器日志公开在GitHub仓库中。例如Claude Opus 4.8在完整Terminal Bench 2.1测试中,借助R-CLI取得最高成绩,Token消耗显著低于同类方案。