来源:市场资讯

(来源:定位与商业模式研究)

打开网易新闻 查看精彩图片

"能跑"不等于"敢交付"。当 Agent 系统从演示走向生产,从单个模型走向多智能体团队,从黑盒执行走向可审计可控,我们需要的不是更强的模型,而是一个真正的 Agent 操作系统。

前天(8月13日),DeepSeek 正式发布、开源了DeepSeek Harness(dsh),一个 MIT 许可的 Agent 驾驭框架。这不是又一个"大模型 + 工具列表",而是一套系统化的工程基础设施,旨在让 Agent 从"能跑"进化为"可控、可验收、可持续"——这正是我们所说的从"能跑"到"敢交付"的转变。

打开网易新闻 查看精彩图片

1. 行业的痛点已经暴露

2026 年上半年,行业数据已经刺痛了很多企业:

  • 40% 的 agentic AI 项目:在 2027 年底前面临被取消或下线的风险,主因不是模型能力不足,而是治理缺口

  • 多数项目不是死在 PoC,而是停在规模化之前

  • 上下文漂移:已被确认为所有前沿模型上的工程风险

这些都指向一个核心问题:模型解决"能不能做到",但系统必须解决"敢不敢交付"。

2. 技术对标从"模型能力"转向"执行可靠性"

DeepSeek 的策略转变很聪明:与其和 OpenAI/Anthropic 比模型参数和推理能力(这场比赛很难赢),不如把竞争维度移到"执行系统的可控性、可观测性、可治理性"这些企业更在乎的指标上。

  • Claude Code 和 Codex 的会话是黑盒私有的,无法外部审计

  • DeepSeek Harness 把会话变成类型化事件日志,支持 keyless 重放、快照回归、全文检索

这一步转变,从"谁的模型更聪明"变成"谁的系统更可信"。

3. 开源 = 快速验证 + 生态共建 + 技术标准化

DeepSeek 选择 MIT 许可并快速开源(v0.1 时就发布),目的很明确:

  • 闭环加速:在社区中暴露缺口,迭代速度远快于单独商业化

  • 降低采用门槛:企业更愿意集成开源基础设施而非被技术锁定

  • 争夺标准:如同 Linux 之于操作系统,DeepSeek Harness 想成为 Agent 系统的"事实标准"

打开网易新闻 查看精彩图片

创新 1:会"改写自己"的运行时(Self-modifying Runtime)

痛点:传统 agent 框架的能力是静态的。模型只能"调用"工具,框架本身无法演进。

DeepSeek 的答案:通过Typert 类型反射 + Cordis 动态加载,让 Agent 能:

  • 检视自己的运行时结构(有哪些工具、插件、能力)

  • 动态生成新插件并在node:vm 沙箱中执行

  • 挂载/卸载新能力,而不需要重启系统

关键组件:

  • dsh-tool-cordis:模型可见的运行时检视工具

  • cordis-host-runner:node:vm 隔离 + 请求-运行往返

  • 风险受控:生命周期守卫 + 权限隔离,"可改写"不等于"失控改写"

为什么这是创新?

其他 Agent 框架只允许模型"调用"工具。DeepSeek 让 Agent改变自己的工具集—— 这是从"静态框架"向"动态自进化系统"的质的飞跃。

实际效果:Agent 可以在运行时识别自己的缺陷("我缺少某个能力"),然后自己生成、验证、加载新能力,而不必等待人工干预。

创新 2:事件溯源 + 可重放会话

痛点:Agent 最恐怖的生产灾难不是单次失败,而是失败后无法复盘。

Claude Code 的会话是私有的,你看不到 Agent 到底做了什么

无法重放意味着无法审计、无法定位根因、无法验证修复

DeepSeek 的答案:把Session 设计为一等公民:

  • 会话 =类型化、版本化的事件日志(SessionEventMap)

  • 系统状态来自日志的折叠和投影(类似数据库的事务日志)

  • 支持JSONL/zstd + SQLite 双持久后端,效率与可靠性兼顾

关键能力:

  • Keyless重放:无需原始API Key,从日志重放任何历史会话

  • 快照回归测试:可以对不同版本的Agent逻辑做对比测试

  • 全文检索 + 血缘追踪:SQLite FTS5+关系查询,快速定位某个错误决策是在第几步做的

为什么这是创新?

传统日志是"发生了什么"的记录。DeepSeek 让日志变成"系统完整的决定论重建"——给定同一份日志,任何人、任何时间都能得到相同的行为轨迹。

工程价值:

  • 可审计:所有 Agent 行为都有完整的审计链

  • 可复现:Bug 复现不再靠"描述",而是靠"重放"

  • 可学习:失败案例成为训练数据,可驱动自进化

创新 3:异构子Agent协议

痛点:企业环境中通常有多个 Agent 产品和工具链。如何让它们互相调用、协作?

DeepSeek的答案:定义两层协议:

ACP(Agent Client Protocol):自动化专用,面向任务编排

dsh-sdk:JSON-RPC进程外驱动,更通用

关键意义:

可以把 Claude Code、Codex 当作"sub-agent"委派任务

不同 Agent 实现可以互相调用,形成异构智能体网络

协议化接口意味着我们不被单一厂商锁定

实现形式:

  • 五种sub-agent后端:in-process spawn、in-process fork、ACP、Claude Code、Codex

  • 三类工具支持:委派、控制、报告

  • 父子协作形成闭环

为什么这是创新:

大多数 Agent 系统是单体架构("我就是唯一的 Agent")。DeepSeek 承认现实:企业有多个 Agent 和工具链,系统应该支持它们协议化、可替换的互操作。这就像 OS 的"进程通信"——不同厂商的应用也能通过标准协议通信。

创新 4:可移植沙箱+"fail-closed"设计

痛点:Agent 执行高风险操作(改文件、运行命令、访问网络)时,如何保证不越权?

DeepSeek的答案:一整个跨平台沙箱族

  • Linux:Landlock(内核能力隔离)+ bwrap(namespace)

  • macOS:Seatbelt(App Sandbox)

  • Windows:受限令牌 + ACL

关键设计:

  • 原生 C11 实现:native/landlock-run,自限制后 exec(不依赖外部工具)

  • Fail-closed exit 125:当内核无法强制隔离时,直接失败而非偷偷放开

  • 双重机制:沙箱隔离 + 权限策略(sandbox-policy)分级控制

为什么这是创新?

沙箱很多系统都有,但 DeepSeek 的创新是:

  • 跨平台一致:同一份策略,Windows/macOS/Linux 行为一致

  • "安全失败"是第一原则:宁可功能受限,也不偷偷放开权限

  • 原生底层:C11 Landlock 实现意味着零依赖、最小化攻击面

这体现了一个工程哲学:治理不是在应用层的 prompt 里祈祷,而是在基础设施层被机制强制执行。

创新 5:把"可靠性"当作工程纪律

痛点:很多 Agent 系统把可靠性寄托在 prompt 调优、温度参数、或"模型自我反思"上。这都是概率性的,无法保证。

DeepSeek 的答案:建立一套机器强制的工程门禁:

机器强制门禁:

  • 100% 代码覆盖率(coverage)

  • 自动化快照回归测试(snapshot tests)

  • 死代码检测(knip)、复制代码检测(jscpd)

  • 导出一致性检查(publint)

  • 运行时不变量校验(invariants

决策与知识沉淀:

  • Agent Notes: ~680 条决策记录(为什么这样设计、为什么放弃另一个方案)

  • Postmortem:事故复盘(发生了什么、为什么发生、怎么防止再发生)
  • 这些知识可以被持续迭代利用

自动生成文档:

  • config-catalog:自动生成所有配置选项的文档

  • tool-catalog:所有模型工具的 schema 自动列举

  • persistence-catalog:所有持久化事件类型的目录

  • 双语文档体系:.md + .zh.md + .i18n.yaml 三元组,词条一致性强制

为什么这是创新?

可靠性 = 工程化,而不是靠 prompt 调优。这是 DeepSeek Harness 与一线 Agent 产品(Claude Code/Codex)的本质区别。

前者把可靠性看作可优化的指标(覆盖率、测试通过率、不变量成立率);后者依赖不可量化的因素(模型"有没有想对"、prompt 有没有足够清晰)。

三、与 Claude Code/Codex的对比

打开网易新闻 查看精彩图片

关键差异:DeepSeek Harness 不是"更强的 Agent",而是把 Agent 变成可控、可审计、可扩展的基础设施。

四、Harness Engineering最新趋势

从DeepSeek Harness的设计,我们能看到Harness Engineering(驾驭工程)的三个最新发展趋势:

1. 从"框架能力"走向"可治理运行时"

自改写运行时、沙箱与 fail-closed,让框架具备工程演进能力

治理不是静态的策略配置,而是动态的、可观测的、可降级的决策引擎

2. 从"日志"走向"事件-可重放-可审计"

事件溯源让 Agent 行为变成可回放的证据链

这是可规模化交付的前提:必须能解释"为什么 Agent 做了这个决策"

3. 从"调参/自评"走向"工程纪律与自动化守门"

可靠性不靠运气,而靠门禁、覆盖、不变量、postmortem、资产新鲜度管理

这标志着 Agent 工程从"科研探索"向"工程规范"的转变

五、给企业的启示

如果企业正在评估 Agent 系统,DeepSeek Harness 给出的信号是:

问"能跑"之前,先问"能控"

一个 Agent 会不会跑,和一个 Agent 能不能被企业安全地部署,是两回事。前者看模型能力,后者看系统底座。

可重放性是生产级系统的必须项

如果你的 Agent 系统无法完整重放某个历史行为,那它就无法被审计、无法被修复、无法被学习。

权限与治理必须在基础设施层强制

不要依赖 prompt 来约束 Agent 的行为。使用沙箱、权限策略、审批流等机制在系统层强制执行。

开源基础设施 = 技术自主

闭源产品再好,你也被锁定在厂商的技术选择上。开源 Agent OS 意味着你可以定制、可以审计、可以主导自己的 AI 战略。

结语

从"能跑"到"敢交付",不是模型更强就能做到的。需要的是一个真正的操作系统——把编排、验证、记忆、治理统一成闭环,让 Agent 进入生产流程且可控、可追溯、可持续。

DeepSeek Harness v0.1 的发布,标志着 Agent 工程不再是"工程师 + 好的 prompt",而是一个系统化的驾驭工程学科。

五大创新(自改写运行时、事件溯源、异构协议、可移植沙箱、工程纪律)合在一起,形成了一个闭环:

  • 框架足够灵活(能改写自己)

  • 行为足够透明(事件可重放)

  • 协作足够开放(子代理协议)

  • 安全足够可信(沙箱 + 治理)

  • 质量足够有保障(工程纪律)

这就是下一代 AI 基础设施的样子。