2026 年 8 月,一个过去主要在工程师圈子里讨论的词,突然被推到了台前:Harness。

过去两年,人们反复追问 GPT 和 Claude 谁更强,DeepSeek 能不能以更低的价格追上闭源模型。但最近,竞争的焦点开始发生变化。

短短一周,多件事情密集发生:

DeepSeek 发布 DeepSeek Harness,提出“Everything is a Plugin”;

OpenAI 更明确地展现 Codex 作为开放 Agent 基础设施的形态;

打开网易新闻 查看精彩图片

8 月 20 日,Earendil Product 发布《What is a Harness?》,解释 Harness 的组成,也强调用户为什么应该拥有自己的 Harness。

与此同时,DeepSeek-V4-Flash 在没有改变模型架构和规模的情况下,通过重新后训练显著提升了多项 Agent 基准表现。公开说明还特别提到,部分代码 Agent 测试使用了 DeepSeek Harness 的极简模式。

把这些变化放在一起看,一个更重要的趋势正在浮现:

Harness 正在从“模型外面的运行时”,变成“模型如何被训练和评估”的一部分。

这可能才是本轮 Agent 竞争最值得关注的变化。

Agent 的能力,不只属于模型

过去,人们习惯把 Agent 的强弱归因于模型:

Claude 强,所以 Claude Code 强;GPT 强,所以 Codex 强;只要 DeepSeek 的模型追上来,它的 Agent 自然也会追上来。

打开网易新闻 查看精彩图片

但真正长期使用过 Coding Agent 的人往往会发现:同一个模型接入不同产品,表现可能完全不像同一个模型。

差别很大程度上来自 Harness。

如果做一个极度简化的表达,今天的 Agent 能力更接近:

Agent 能力 = Model × Harness

模型提供推理、生成和判断能力;工具决定它能对外部世界做什么;Harness 则负责把两者组织成一个能够持续执行任务的系统。

它决定模型能看到哪些上下文,什么时候调用什么工具,工具结果以什么形式返回,失败以后如何重试和恢复,上下文过长时如何压缩,什么时候启动子 Agent,哪些操作必须经过人工审批。

它还决定一个最容易被忽略的问题:什么时候应该停止。

因此,Harness 本身就是性能变量。

同一个模型运行在不同 Harness 中,任务成功率、Token 消耗、执行速度和单次成功成本都可能相差很大。过去一些被归因于“模型能力”的结果,实际上测试的是模型与 Harness 的组合能力。

Harness 做得好,功劳经常被算给模型;Harness 做得差,模型也会跟着背锅。

当头部模型的基础能力逐渐接近,这一层差异只会越来越重要。以后评价一个 Agent,不能只问“用了什么模型”,还要再问一句:

这个模型运行在什么 Harness 上?

Harness 开始进入训练过程

DeepSeek-V4-Flash 最近的更新提供了一个值得注意的信号。

据其公开信息,新版本保持了原有模型架构和规模,主要调整后训练,却在多项 Agent 任务上获得明显提升;部分代码 Agent 评测则运行在 DeepSeek Harness 的极简模式中。

这并不能单独证明 Harness 已经决定模型能力,却揭示了一个明确方向:

模型与 Harness 的关系,正在从“先训练模型,再把它装进运行时”,走向联合设计和协同优化。

因为真正面向 Agent 任务的后训练,不可能在真空中进行。模型必须学习如何选择和调用工具,如何理解错误反馈,如何维持跨越多轮的任务,如何从失败路径中恢复,如何避免重复调用和无效探索,何时分派子任务,以及什么情况下应该结束执行。

这些规则并不完全来自模型本身。它们很大程度上由 Harness 定义。

换句话说,Harness 不再只是模型训练完成后的“外壳”。它也可能成为训练任务、组织轨迹、设计奖励和进行评估的环境。

Harness 正在从运行环境,延伸为训练环境。

真正稀缺的资产,可能是执行轨迹

Agent 每完成一次真实任务,都会产生一条执行轨迹。

打开网易新闻 查看精彩图片

它与普通聊天数据不同。一条完整的 Agent 轨迹可能包含:用户提出了什么目标,Agent 如何拆解任务,调用了哪些工具,在哪一步失败,失败后如何恢复,什么时候出现重复调用,Token 从哪里开始被浪费,用户在哪一步进行了干预,以及最终通过哪条路径完成任务。

传统对话数据主要告诉模型“一个问题应该怎样回答”;Agent 轨迹则有机会教会模型:

一件事情应该怎样完成。

打开网易新闻 查看精彩图片

如果某种 Harness 获得广泛采用,并且厂商能在获得授权、保护隐私和妥善处理商业数据的前提下收集部分轨迹,就可能形成一套新的增长飞轮:

定义 Harness → 吸引开发者 → 承载更多真实任务 → 获得可用于评估或训练的轨迹 → 优化模型与调度策略 → Agent 表现提升 → 吸引更多开发者。

这有一点像 CUDA,但又比 CUDA 多了一层。

CUDA 通过编程接口和软件生态构建平台壁垒;Harness 除了形成开发生态,还可能在运行过程中产生新的行为数据。因此,它潜在地同时拥有两种飞轮:平台飞轮与数据飞轮。

不过,这里必须加上一条边界:开源 Harness 本身不会自动给维护者带来用户数据。数据飞轮能否成立,取决于托管服务、遥测设计、用户授权、企业隐私要求,以及社区是否愿意回传评测和轨迹。

代码可以开源,数据不会凭空出现。

三家公司,三种 Harness 定义

打开网易新闻 查看精彩图片

DeepSeek Harness 最醒目的主张是“Everything is a Plugin”。模型、工具、会话、沙箱、调度循环、子 Agent 和界面都可以被替换。

它强调的是可组合性:

你想重新拼装一个什么样的 Agent?

OpenAI 的路线则更强调可嵌入性。Codex SDK 可以把 Codex Agent 嵌入工作流和应用;App Server 对外提供线程、审批、技能、应用和认证等基础能力。

它回答的问题更接近:

你想把 Agent 放进什么系统?

DeepSeek 倾向于形成开放、可替换的运行时生态;OpenAI 则拥有模型、Codex、API、工具体系和真实任务之间更紧密的一体化条件,更容易在内部形成“模型—Harness—使用反馈—模型优化”的闭环。

Earendil 代表的第三种路线,则强调 Harness 的独立性和用户所有权。

打开网易新闻 查看精彩图片

在《What is a Harness?》中,Earendil 将 Harness 定义为“为 AI 模型提供运行环境的软件”,并将其主要组成概括为系统提示词、工具、Agent 循环和连接不同模型的转换层。

但文章真正强调的,是一个控制权问题:

Harness 应该属于谁?

Earendil 的答案很明确:模型通常掌握在 AI 公司手中,但 Harness 可以由用户拥有。

如果 Harness 独立于模型,用户今天可以运行 Claude,明天可以换成 GPT,后天也可以接入 DeepSeek 或其他开放权重模型。真正留在用户手里的,是自己积累的工具、扩展、会话、工作流和历史状态。

这并不是中立的技术描述,而是一套关于控制权的产品主张。

Earendil 将 Pi 定位为一个开源、模型中立、运行在用户本地设备上的极简 Harness。它希望建立的市场结构是:模型可以替换,Harness 才是用户长期拥有和持续改造的资产。

因此,三方虽然都在谈 Harness,背后代表的却是三种不同的路线:

DeepSeek 强调可组合:用户可以重新拼装一个 Agent;

OpenAI 强调可嵌入:把成熟的 Agent 运行能力接入各种业务系统;

Earendil 强调可拥有:模型可以更换,但 Harness、工具和历史状态应该留在用户手中。

所谓“什么是 Harness”,已经不只是一道技术定义题,也是一场关于 Agent 控制层归属的叙事竞争。

谁定义了这个词,谁就在影响开发者以后如何理解 Agent。而一种 Harness 一旦形成事实标准,还可能反过来影响工具协议、Agent 循环、基准测试,甚至模型的后训练方式。

最终争夺的,是谁来定义 Agent 应该如何行动。

Harness 将成为按照效果付费的最后一关

Harness 不仅影响性能,也直接决定企业为 Agent 支付多少成本。

过去,市场关注的是每百万 Token 的价格。但企业真正关心的并不是模型消耗了多少 Token,而是:

完成一个任务到底需要多少钱。

同一个任务,是八步完成还是八十步?第一次工具调用就成功,还是连续走错十次?需要一个 Agent,还是临时拉起三个子 Agent?是否频繁需要人工介入?

打开网易新闻 查看精彩图片

这些都与 Harness 的决策有关。

因此,Agent 的商业模式可能逐渐从按 Token 计价,转向按任务计价,甚至按结果计价。而 Harness 恰好掌握完成这种计价所需要的信息:任务有没有完成,一共执行了多少步骤,调用了哪些工具,是否有人类介入,以及最终产生了什么结果。

如果 AI 服务最终从“按计算资源收费”走向“按任务或效果收费”,Harness 很可能成为模型与业务结果之间的计量和结算基础设施。

下一轮竞争,是 Model × Harness 的复利

回头再看 Harness,它已经不只是一个 Agent Framework。

它同时连接着运行时、开发者生态、任务成本、用户资产、执行轨迹、评估体系和模型后训练。

工具可以复制,API 可以兼容,插件可以重写。真正难以复制的是:数百万个真实 Agent 究竟如何一步一步把事情做成。

哪些步骤有效?哪些调用只是浪费?什么时候应该继续?什么时候应该停下?什么时候应该交给人?什么时候第二个 Agent 真能提高成功率?

这些轨迹长期积累下来,可能形成一套新的 Agent 行为数据库。

打开网易新闻 查看精彩图片

过去,模型公司争夺的是互联网文本;进入 Agent 时代,竞争对象可能逐渐变成:

现实世界中的任务,是如何被模型一步一步完成的。

谁定义主流 Harness,谁就更有机会影响 Agent 的行动方式;谁拥有规模最大、质量最高并且合法可用的真实执行轨迹,谁就更可能获得下一代 Agent 后训练的优势。

模型战争当然没有结束,但战场正在向下移动一层。

竞争不再只是“谁拥有最强模型”,而是:

谁能率先转动最强的 Model × Harness 飞轮。

一旦这个飞轮形成,真正难以追赶的可能不再是基准测试上的几分差距,而是生态、数据和训练之间不断累积的复利。

参考资料

DeepSeek Harness:Everything is a Plugin

DeepSeek-V4-Flash 模型说明

Codex SDK

Codex App Server

Earendil Product:《What is a Harness?》