研究员|卢杨

8月,DeepSeek迎来了一轮密集的产品发布及迭代。

DeepSeek悄然更新了V4 Pro正式版(DeepSeek-V4-Pro-0813)后,8月13日晚,DeepSeek Harness也开启公测,在GitHub开源。

打开网易新闻 查看精彩图片

同时而来的就是涨价。当日,DeepSeek宣布将对API价格进行更新调整,采用峰谷定价,新价格将于8月17日0时正式生效。

打开网易新闻 查看精彩图片

直接看新品。旗舰模型V4 Pro正式版从预览转正,版本号更新为DeepSeek-V4-Pro-0813,支持100万Token上下文窗口和最高38.4万Token单次输出,性能大幅跃升:DeepSWE基准从预览版的12.8飙至62.7,Terminal Bench 2.1从72.1提升至87.9,多项Agent能力已接近甚至超越海外前沿模型。

紧随其后开启公测的DeepSeek Harness,定位“将模型转化为智能体的工具”,负责调度上下文、工具和任务状态。值得关注的是,V4 Pro的Agent能力评测正是基于Harness极简模式完成的,模型与框架的协同效应已初步显现。

DeepSeek在Agent执行层的布局,逐渐明朗。

Harness在DeepSeek内部被定义为智能体的执行框架:围绕大模型构建的控制与编排系统,负责调度工具、管理任务状态和执行闭环。

开发团队将这一架构概括为“模型加框架等于完整智能体”:基座模型提供推理能力,Harness负责执行落地,二者共同构成Agent的全貌。在这一架构中,基座大模型充当智能体的决策中枢,处理理解与推理任务;Harness则作为执行层,将决策转化为对真实环境的操作指令,完成从思考到行动的闭环。

今年5月,DeepSeek Harness正式于内部立项。团队由崔添翼担任负责人。崔添翼本科毕业于浙江大学计算机系,梁文锋校友。8月1日,他面向全球公开征集Harness内测用户,优先筛选具备Agent Harness开源项目经验的开发者。

至8月3日,该招募帖累计收到769份报名申请,对应712个独立开源仓库,总Star数超过120万,涵盖Coding Agent、记忆系统、安全工具等18个细分方向。

DeepSeek Harness采用“一切皆插件”的架构,由Cordis驱动。系统将宿主运行时和前端界面拆成两套独立的插件体系,各管各的生命周期。模型接入、工具注册表、会话日志、审批策略乃至驱动智能体运转的主循环,全部以插件形式存在,可自由替换和组合。

系统预置了四套Agent配置方案。标准模式面向通用编程场景,工具链最为完整;PTC模式(程序化工具调用)支持模型通过编写代码一次性编排多轮工具操作,降低交互频次和上下文占用;极简模式只开放命令行终端和文本编辑器两个工具,主要用于性能测试与教学演示;创造模式则允许用户以自然语言对话的方式,让系统协助生成新的自定义预设。

在安全方面,Harness内置了进程沙箱能力,各平台分别调用原生隔离方案:Linux依托bwrap与Landlock,macOS采用Seatbelt机制,Windows则借助ACL受限令牌实现权限管控。

沙箱分为只读、工作区写入和完全访问三档,逐级控制文件读写范围。API Key等敏感凭据由独立通道传输,不会写入会话日志,仅在日志中保留引用标记,从传输和存储两个环节降低泄漏风险。

在生态建设方面,Harness显得十分包容,它被设计支持Model Context Protocol,任何MCP服务器均可接入。同步开放的npm插件生态系统允许开发者将内测期间开发的插件迁移至个人账号下公开分发。有消息称其内测阶段便已有近300个插件被开发出来,涵盖界面改造、记忆系统、进度条、小游戏等多种功能。

从7月底的V4-Flash正式版上线,到8月中旬的V4 Pro正式版与Harness公测,DeepSeek在不到半个月的时间里完成了模型迭代与Agent框架的双线落地。当模型的智力水平持续提升,Harness要解决的,正是如何让这些能力在真实环境中稳定地运转起来。这,也让AI模型的未来更具吸引力。

编辑|邱慧