智东西8月4日报道,8月1日,DeepSeek的Agent Harness团队负责人崔添翼发文招募DeepSeek Harness内测人员,要求申请者参与过开源Agent项目的建立和维护,并提交GitHub仓库作为代表作品。
一条内测招募帖,很快变成了一场Agent开源生态的大摸底。大量开发者带着自己的项目涌入评论区,从个人Harness、Coding Agent,到记忆系统、安全工具、评测框架,几乎覆盖了当前Agent基础设施探索的各个方向。
据开发者统计,截至8月3日上午11:30,共有769位报名者、去重后712个开源仓库、合计超过120万Stars,跨越了18个赛道,评论区秒变“开源Agent路演”。
统计仓库地址:https://github.com/Octo-o-o-o/deepseek-harness-applicants
从目前公开信息看,DeepSeek已经在内部使用Harness完成DeepSeek-V4-Flash正式版的基准测试,而社区也开始猜测,DeepSeek未来可能会基打造一款面向软件工程场景的AI Coding Agent。
按照社区流传的说法,这款产品或将具备自主规划、工具调用、代码执行等能力,并围绕长周期Agent工作流加入Memory、项目仓库感知(Repo Awareness)等机制,定位上可能会对标Claude Code、Codex等现有Coding Agent产品。
这些信息目前尚未得到DeepSeek官方确认。不过,从此前公布的Harness基准成绩来看,DeepSeek测试的重点本身就集中在终端操作、多工具调用、全栈开发等长流程任务场景。
若社区预测成立,Harness承担的角色可能正是连接模型能力与真实软件工程流程的执行层。
而这场由769位开发者、712个开源仓库参与的“评论区路演”,恰好提前暴露了一个AI Coding Agent走向工程化需要持续升级的能力版图:
如何让Agent长时间稳定运行、如何管理项目上下文和记忆、如何控制工具调用风险,以及如何在真实开发环境中完成从理解需求到交付代码的完整闭环。
一、DeepSeek Harness重点关注的,是模型之外的Agent执行层
关于Harness,业内一直有这样一个公式:
Model+Harness=Agent。
模型负责理解需求、推理和生成方案,Harness负责把这些能力落到真实环境中:调用工具、操作终端、读写文件、管理上下文、处理执行过程中的错误,最终完成一个完整任务闭环。
把目前公开信息放在一起看,DeepSeek Harness的定位已经逐渐清晰:它并不是一个单纯的代码生成工具,而是在模型和真实软件工程环境之间增加一层“执行系统”。
这一点也在DeepSeek-V4-Flash成绩单中的五组基准里有所体现,Terminal Bench测试终端环境操作,Cybergym测试安全攻防能力,Toolathlon测试多工具调用,DSBench-FullStack和DSBench-Hard则聚焦全栈开发任务。
这些测试的共同特点是:任务链条长、步骤多,需要Agent持续调用工具并根据反馈调整策略。
DeepSeek选择测试的方向,更接近一个能够自主执行软件工程任务的Agent。这也和社区流传的对标Claude Code、Codex等产品的目标一致。
除了基准之外,DeepSeek的生态动作也透露出类似信号。目前公开信息显示,DeepSeek-V4-Flash已支持Responses API,并适配Codex,走向标准化工具调用协议;识图模式正在灰度,用于补充代码Agent在理解架构图、报错截图等视觉信息上的能力。
这些动作共同指向一个趋势:未来Coding Agent的竞争,不只取决于模型能力,也取决于模型之外的工程基础设施。
二、769份报名记录,暴露了Agent工程化的三大进化方向
769份报名记录里,开发者关注的是一个非常现实的问题:
当Agent需要独立完成一个真实工程任务时,哪些方面还需要优化?
首先是长任务执行能力。这是Agent从Demo走向生产的第一道门槛。DeepSeek公布的五组基准,本质上都在测试Agent是否具备持续执行复杂任务的能力。如果Agent只能完成一次调用,就无法覆盖Terminal Bench、DSBench这类需要多步骤、多工具协作的任务。
从报名项目来看,智能体框架和编程智能体是最大的两个方向,合计242个,占全部项目约三分之一。
Top 10高星项目中,deer-flow(79k星)探索长周期SuperAgent框架;CodeWhale(40k星)是由DeepSeek原生项目发展成的编程智能体框架;orca(36k星)关注多Agent编排。
这些开源项目路径不同,但都在回答同一个问题:如何让Agent在“持续执行”上走得更远。
其次是上下文和记忆管理。当任务从几分钟延长到几个小时,Agent面临的除了推理能力问题,还有如何保存状态、理解项目历史,并在后续任务中正确调用已有信息。
在报名统计中,记忆与上下文相关项目共有56个,累计194k星(剔除头部项目vllm的88k星后仍约106k星)。开发者正在尝试Git、数据库、知识图谱等不同路线,但Agent记忆目前仍没有统一答案。
最后是评测和安全。研究与评测、安全治理两个方向各有24个项目,是报名生态中规模较小的类别,但决定着Agent能否真正进入生产环境
有开发者尝试建立跨Harness评测体系;有开发者则关注工具调用权限、文件系统隔离和代码执行沙箱。如果说长任务和记忆解决的是“Agent能不能完成任务”,那么评测和安全解决的就是“Agent能不能被放心使用”。
最终来看,这三个方向对应了Agent从“能用”走向“好用”的关键迭代路径:长任务执行能力决定Agent能否完成复杂工作,上下文和记忆能力决定Agent能否持续参与长期项目,而评测和安全能力决定Agent能否被真正部署到生产环境。
这也是Harness需要持续优化的核心方向:在模型能力之上,进一步完善Agent面向真实世界任务的执行体系。
三、769份报名记录里,藏着DeepSeek Harness内测需要的关键反馈
DeepSeek官方尚未,也或许不会公布最终的筛选标准和名单。
但从这份报名统计表来看,真正有价值的,是开发者们正在从不同角度探索Agent落地应用的路径。
对于DeepSeek Harness团队而言,内测名单的意义,或许并不是寻找“最热门”的项目,而是找到能够在产品迭代过程中,提供有效反馈的开发者。以下几类能力,可能正是一个Agent基础设施持续优化所需要的。
首先,是验证模型能力如何转化为执行能力。
DeepSeek Harness的核心挑战,是让模型能够稳定完成复杂任务。比如名单中,akashic-agent的作者于V4 Flash高思考强度模式运行TerminalBench2.1,拿到70.8%的成绩,是基于DeepSeek模型调优Agent运行时并给出实测结果的开发者。
其次,是验证DeepSeek Harness能否进入真实应用场景。
一个Agent基础设施最终能否成功,不只取决于底层技术能力,也取决于它是否真正满足开发者和应用场景的需求。这次报名中,open-design(83k星)、lobehub(81k星)、career-ops(63k星)等高星项目,都已经拥有一定用户基础,并处于Agent应用生态的上层。
这些开发者长期面对真实用户和实际工作流,能够帮助DeepSeek了解Harness在不同场景中的使用需求:哪些能力最重要、哪些环节容易失效、哪些功能需要进一步优化。
对于仍处于探索阶段的Agent基础设施来说,这类来自一线应用的反馈,可能比单纯的测试数据更有价值。
此外,Agent产品化还需要提前发现安全风险。
随着Agent获得更强的工具调用和代码执行能力,权限控制、文件隔离、安全边界等问题会越来越重要。报名区中有开发者曾挖掘Codex、Claude Code、Cursor等产品漏洞,关注的正是这些Agent从Demo走向产品时必须面对的问题。
当然,这份名单并非完整样本。由于评论区天然混杂报名、讨论和围观,加上提交格式不统一,部分项目仍存在身份无法确认、仓库失效、描述缺失等问题。
这份统计档案也并不是完全准确,我们在核查过程中发现,有一些开源项目的分类出现了错误,比如我的世界机器人被分到了安全领域,但总体上是可以作为参考的。
同时,很多高星项目的报名也并不是作者本人,有不少是仅提交过PR的参与者,并不能完全代表这些Agent项目。
结语:一份提前出现的Agent工程路线图
DeepSeek Harness最终会是什么样,目前还没有答案。但这场由内测招募引发的开源项目“大摸底”,却揭露了Agent时代的竞争焦点。
769份报名记录、712个开源仓库、120万Stars背后,开发者关注的是一个底层的问题:当模型具备越来越强的推理能力后,如何让它稳定、长期、可靠地完成真实任务。
有人在解决长任务执行,让Agent不会跑到一半失控;有人在探索记忆和上下文管理,让Agent能理解一个持续演进的项目;有人在测试安全边界,确保工具调用和代码执行不会成为风险源。
这些项目未必都会进入DeepSeek的内测名单,但它们提前勾勒出了一张未来Agent工程演进的路线图。
热门跟贴