打开网易新闻 查看精彩图片

8月12日,DeepSeek Harness团队的公众号悄无声息地上线了。Logo是一只黑色鲸鱼,认证主体是北京深度求索,注册日期7月6日,至今还没发过一篇推文。但这件事在开发者圈子里的震动,不比任何一个大模型发布小。

因为DeepSeek这次做的不是模型。是做Harness。

很多人还没意识到这意味着什么。给你一个数据:有人把同一个Claude Opus 4.5放到两个不同的Harness下跑同一个测试。用Claude Code这个Harness时得分95%,换一个朴素的HuggingFace配置只剩42%。同一个模型,换了层外壳,差了53个百分点。

这53个百分点不是模型能力的差距,是Harness的差距。你用什么模型,可能没有你用什么Harness重要。

量化交易员接手AI编程下半场

DeepSeek这次找的项目负责人挺出人意料。不是大模型技术专家,不是开发者工具产品经理,是一个搞量化交易的。

崔添翼这个名字,老一辈竞赛党应该不陌生。他的《背包九讲》动态规划教程从2008年写到现在还在GitHub上更新,是一代中国信息学竞赛选手的启蒙读物。2008年全国青少年信息学奥林匹克竞赛铜牌保送浙大,ACM亚洲区域赛拿过六次金牌。

但毕业后他没进互联网大厂。他去了Jane Street,在那里做了近九年的软件开发和量化研究。2022年联合创办量化对冲基金TSY Capital,从零搭建交易系统。2026年2月离开,3月加入DeepSeek。

算法竞赛到量化交易,再到AI编程Agent,这个履历放在AI圈属于非典型。但如果你了解Harness的本质,就会发现这个选择非常精准。

一个交易策略在回测中表现再漂亮,如果不能接入实时数据、稳定发出指令、处理异常并控制风险,它就没有实际价值。大模型也是一样。它可以在聊天框里把问题分析得头头是道,但如果不会找到正确文件、调用合适工具、执行命令、检查结果和恢复错误,它依然只是一个很聪明的聊天框。

Harness要解决的核心问题,正是如何让一套聪明的逻辑在复杂环境里稳定运行。这不是模型问题,是工程问题,是系统问题。而在量化交易领域打磨了近十年的崔添翼,可能比任何纯AI背景的人都更懂这件事。

一次临时开发者大会

DeepSeek Harness其实早就在路上了。今年5月,DeepSeek资深研究员陈德里发了一条招聘信息,第一次公开确认了Agent Harness团队的存在。他说DeepSeek准备从零开始做Code Harness。至于产品叫什么,他的语气相当随意:"也许你可以叫它DeepSeek Code之类的。"

7月31日,DeepSeek更新V4-Flash时透露,部分公开Code Agent测试已经用上了DeepSeek Harness极简模式,标注"即将发布"。

8月1日,崔添翼公开邀请Agent Harness开源开发者报名,只需留下GitHub账号和代表作。评论区很快成了一场临时开发者大会。LLaMA-Factory作者、Understand-Anything作者、LobeHub团队和elizaOS核心开发者纷纷出现。有开发者用AI整理了其中425条有效回复,发现至少61个人已经亲手造过Harness——Rust、Go、双Loop、崩溃恢复、多Agent协作,各种路线都有。

造轮子的人,都想看看DeepSeek的官方轮子长什么样。

几天后,DeepSeek又开始征集首批生态伙伴,准备接入插件、Skill、MCP和第三方界面。走到这一步,它显然已经不只是在招人,而是在为产品登场提前布置舞台。

便宜模型加好Harness等于豪华战绩

Harness为什么值得这么大的注意力?因为进入Agent时代,门票已经换了。

黄仁勋把Harness称为"下一代软件公司的操作系统"。这不是夸张。模型只提供推理能力,Harness提供的是整个执行系统——上下文管理、工具调用、任务拆分、错误恢复、状态持久化。没有好的Harness,一个再强的模型也只是个聪明的聊天框。

好的Harness还有一个更实际的威力:让便宜模型打出豪华战绩。

有一个叫Pi的开源项目,86K星,被很多人说是最适配DeepSeek模型的民间Harness。它的设计哲学非常克制,默认只给模型四件工具:读文件、写文件、改文件、执行命令。但就这四件工具,配合正确的上下文策略和错误恢复机制,一个35B的模型跑出了接近旗舰模型的效果。

这正在改写AI编程的成本公式。如果花200美元买旗舰模型能做到的事,花20美元买中端模型加一个好Harness也能做到,那模型的定价权就不再由模型厂说了算。

Harness才是那个把模型从"能说话"变成"能干活"的东西。而在Harness这件事上,中国团队可能第一次站在了和硅谷同一条起跑线上。

下半场的门票

过去一年,整个AI编程行业都在卷模型。谁的SWE-bench分数高,谁的参数大,谁的推理快。但如果你仔细看最近一个月的新闻脉络——Codex开始打码你的秘密信息,Claude Code修复三个权限绕过漏洞,MCP协议走向无状态——你会发现战场已经悄悄转移了。

模型能力的提升正在撞上边际效益递减的墙。Claude Opus 5拿了96%的SWE-bench Verified,再往上提一两个点对实际开发体验的影响已经微乎其微。但Harness的提升空间还大得惊人。同一个模型换一个Harness就差了53个百分点,而这才刚刚开始。

DeepSeek在这个节点推出自己的Harness,时机非常微妙。论模型能力,DeepSeek V4在SWE-bench上离Claude Opus 5还有15个百分点的差距。但如果在Harness层面做出代差级别的优势,用80分的模型配90分的Harness,完全有可能在真实开发场景中反超95分的模型配60分的Harness。

这就是DeepSeek黑鲸鱼的真正野心:不在模型层面硬刚,而是在Harness层面重新定义游戏规则。

生态的隐性博弈

DeepSeek Harness的公众号选择在8月12日这个节点上线,还有一层容易被忽视的博弈逻辑。

就在同一周,OpenAI的Codex推出了secret redaction功能,开始自动打码命令中的API密钥;Anthropic的Claude Code修复了三个Agent权限绕过漏洞;GitHub的Agentic Workflow被曝出GitLost提示注入漏洞。每一个事件都在传递同一个信号:封闭生态正在被安全事件反复捶打。

而DeepSeek选择的路线恰恰相反。从第一天起就走开源路线,把Harness的设计哲学、代码实现、生态接入标准全部摊在桌面上。崔添翼在开发者社群里说过一句话:"与其在闭源堡垒里修修补补,不如让大家一起盯着每一行代码。"

这不是道德选择,是效率选择。一个开源Harness的安全性不是靠安全团队的人数保证的,是靠每一个接入的开发者、每一个提交的PR、每一个审计者共同保证的。在AI Agent安全挑战日益严峻的今天,这种"众目睽睽"的安全模型,可能比任何大厂的封闭安全审计都更可靠。

而且开源还有一个隐蔽的战略价值:锁定生态。当足够多的开发者基于DeepSeek Harness的标准写Skill、建MCP插件、搭Agent Pipeline,这套工具就成了事实标准。而事实标准的迁移成本,比技术壁垒更难跨越。

崔添翼从量化交易带来的不是AI技术,是一套让复杂系统在真实世界里稳定运转的方法论。而这件事,比再发布一个超大规模模型重要得多。

因为模型会越来越便宜,越来越同质化。但谁能造出最好的Harness,谁就握住了AI编程下半场的门票。