智猩猩AI整理

编辑: 没方

如果让 AI 去解决一个连人类都不知道答案的问题,它应该怎么干?

不是搜几篇网页,再拼一个看起来合理的回答。

它得像真正的研究团队一样,提出假设、找证据、写代码验证、发现方向不对再推翻重来,甚至让多个 Agent 同时探索不同路线。

这正是陈天桥正在押注的一条 AI 路线。

今年4月,他出资并亲自主导创立ApodexAI。其技术前身来自此前布局的MiroMind项目。在对后者完成战略调整与技术重构,优化迭代为全新主体ApodexAI。

这家新公司给自己的定位是 Heavy-Duty Solver:不满足于回答已有问题,希望让 AI 去解决那些没有标准答案、甚至人类自己都不知道从哪下手的难题。

远点看,他们瞄准的是 AI 自进化,乃至 RSI(Recursive Self-Improvement)。

但问题来了。

要走向 AI自进化,意味着 AI 得能够独立跑完长时程任务,持续调用工具、管理文件和状态,还要支持暂停、恢复、人工干预以及多路并行探索。

单靠模型本身远远不够,还需要一套完整的 Agent Runtime 来支撑。

因此 ,ApodexAI 最近在开源 Apodex 1.1 模型家族的同时,就把自己内部使用的一套 Agent Harness 也开源了,名字叫FrontierAgent

打开网易新闻 查看精彩图片

FrontierAgent 特别的地方在于,它把平时散落在不同 Agent 项目里的东西,比较完整地捏在了一起。

任务运行、文件环境、状态保存、多 Agent 调度、人工干预、操作审批、失败恢复、结果交付和 Benchmark 评测,都放进了 Harness 体系。

此外, Apodex 1.1模型相关技术的论文还登上了huggingface热榜第一。

打开网易新闻 查看精彩图片

01

安装教程

安装指令:

cp .env.example .env

接着在.env中配置模型信息:

JINA_API_KEY=

启动后界面如下,跟 Claude Code 差不多:

打开网易新闻 查看精彩图片

FrontierAgent 原生提供两套 Workflow。

第一套是 Stateful ReAct, 启动指令:

uv run frontier-agent --mode react --cwd /path/to/project

这个模式比较适合明确、聚焦的任务,比如分析代码仓库、读论文、处理文档、调查一个具体问题。它只有一个 Agent,但这个 Agent 是有状态的。

它会持续在一个独立 Workspace 里查网页、读文件、跑 Shell、写代码、生成结果,而不是每执行一步就把之前发生的事情忘掉。

我让它帮我读取了 Apodex_AI 的最新两条推文,结果如下:

打开网易新闻 查看精彩图片

另一套则是 FrontierAgent 更有特色的 Agent Team。 启动指令:

uv run frontier-agent --mode agent_team --cwd /path/to/project

这时候,任务不再只交给一个 Agent。

系统会先启动一个 Coordinator,由它负责把问题拆开,然后建立一块 Task Board,把不同子任务分给多个 Sub-Agent 并行执行。

各个 Sub-Agent 完成以后,会把结构化报告交回来,最后再由 Coordinator 汇总、检查和生成最终答案。

这个过程是能看见的。

FrontierAgent 的侧边栏会实时显示 Task Board,每个子任务是 pending、active、completed,还是已经 blocked,都可以直接看到。

打开网易新闻 查看精彩图片

02

FrontierAgent连

评测系统一起开源

FrontierAgent 还有一个很少见的地方,它连评测系统也一起开源了。

仓库里直接带了一套 Benchmark,目前已经接入 BrowseComp、BrowseComp-ZH、Humanity's Last Exam、FrontierScience、OfficeQA、GDPval、APEX、OneMillion-Bench 等。

值得注意的是,ApodexAI 自己评测模型时,用的也是 FrontierAgent 的同一套 Workflow Engine。

这就让它和很多为了展示 Agent 效果临时拼出来的 Demo 不太一样。

开发者拿到的,基本就是 ApodexAI 自己用来跑复杂任务、测模型的那层执行系统。

从 ApodexAI 公布的评测结果能明显看出 Harness 的影响。

打开网易新闻 查看精彩图片

同样是 Apodex 1.1,换成 Agent Team 之后,6 项 Benchmark 全部高于单 Agent ReAct:GDPval 从 69.5 提升到 78.8,FrontierScience-Research 从 55.0 提升到 63.3,BioMysteryBench 更是从 23.5 提升到 35.3。

在 FrontierFinance 和 FrontierScience-Research 上,Agent Team 甚至超过了图中多款头部模型。

这说明,同一个模型放进不同的 Agent Workflow,最终表现可能完全不一样。Harness,正在从“工程配套”变成模型能力的一部分。

关注+星标,获取AI前沿进展与开源一线动态