DeepSeek Harness,终于发布,并且将源代码开源了。

为啥说「终于」呢?因为我已经内测了快半个月,现在也是终于能发了。。。

这段时间里,为了测试,我几乎把我所有Vibe Coding项目,都从Codex迁移到了黑鲸(是的,logo黑化了)。

打开网易新闻 查看精彩图片

深度体验这么久,又把官方Repo从头到尾翻了个底朝天之后,我最大的感触是——

这简直是套彻头彻尾为「自进化」和「DIY」而生的马鞍啊。

内测群里,有大佬直接给改成了这样。。。

打开网易新闻 查看精彩图片

这样。

打开网易新闻 查看精彩图片

还有这样的TUI。

打开网易新闻 查看精彩图片

而DSH真正能做的,远远不止这些。

这意味着,如果你想,完全可以自己上手改造,或者针对特定场景定制运行时。

目前,官方已经内置了一百多个插件。后续社区会提供更多。

打开网易新闻 查看精彩图片

Agent时代的安卓,来了。

但在说底层技术相关的内容前,咱们还是先讲讲产品体验本身。

打开网易新闻 查看精彩图片

但梁圣这次可能不止收你电费钱了,17号要大涨价,尤其是缓存。。。

打开网易新闻 查看精彩图片

不过,你也是可以接入其他模型的。

之后就能看到「黑鲸」真容了,基本和DeepSeek网页版长得一模一样,只不过现在对话列表成了本地项目管理列表。

使用上也和主流Agent有些区别。

开启会话前,你需要额外选择工作目录,以及——

Agent预设。

打开网易新闻 查看精彩图片

这是DSH比较新鲜的功能,目前官方有四类预设供你选择——

此外,也支持自定义预设。

打开网易新闻 查看精彩图片

这也是DSH带给我最深的印象——这是一个非常极客,甚至可以说是开发者天选的马鞍。

很多设计都围绕这个第一性原理展开。

比如有个叫轨迹的功能。

众所周知,随着Agent跑得越久、工具链越复杂,Chat摘要就越来越黑盒,根本搞不清楚模型在背后干啥。

DSH做的这个轨迹,就是一个能随时监控Agent的回放窗口。

和Chat视图的是润色后的对话不同,Trajectory能直接看到原始事件级记录,你可以随时回放,查看会话内部到底发生了什么。

打开网易新闻 查看精彩图片

这样,能更直观地看到模型究竟是在哪栽了跟头,每个环节都烧了多少钱。

此外,DeepSeek还在仓库里内置了一堆Skill,专为开发而生。

看了一眼MD,功能大概有这些——

打开网易新闻 查看精彩图片

不过,我不是重度开发者用户,日常确实不太用得着这些。

但多轮交互下来,我发现DSH有一个非常好用的小设计——

即便不开计划模式,黑鲸在遇见用户指令不明确的情况时,也会主动拉起提问。

这点和Codex很不一样。在DSH的鞭策下,黑鲸会非常主动地开启头脑风暴,并且给出建议选项。

说实话,太爽了,能节省巨多脑力,少吃很多根香蕉(bushi)。

打开网易新闻 查看精彩图片

其他就和Codex没啥区别。

打开网易新闻 查看精彩图片

像任务清单这种功能,也是有的。

打开网易新闻 查看精彩图片

比较遗憾的是,经典Agent三列表中右侧栏还没做出来,体验上还是有些不方便。

甚至能直接在对话中播放视频。。。

打开网易新闻 查看精彩图片

诸如此类,反正就是很多UI和交互上的小细节,跟Codex比起来肯定还是有差距,可能也得等后续更新打磨吧。

但众所周知,V4是个瞎子啊o(╥﹏╥)o,这个功能需要额外搭配多模态模型食用。

最后聊聊Token消耗。

也是很神了,DSH专门在屏幕最下方搞了个统计表,你可以随时在这里查看Token消耗量、缓存命中率,以防一不留神给信用卡刷爆掉。

缓存命中方面,也是很猛的,大多处于99%左右,有几次直接干到100%了。

当然,也是遇到过几次掉到60-70%的情况的。

但奈何内测的时候DeepSeek是真便宜啊!

说实话,我真就没咋关注过这个仪表盘。

感谢梁叔叔。

打开网易新闻 查看精彩图片

最后就来拴上这套原生马具后,黑鲸的表现吧。

我让V4 Flash分别用Codex和DeepSeek自己的harness跑了几个demo,大家可以自行对比一下。

左边是DSH,右边是Codex。模型、推理强度完全一致。

首先是鹈鹕自行车。

比较经典的一个测试了,说实话,没太大差别,甚至右边Codex的审美更好。

打开网易新闻 查看精彩图片

但这个猪八戒3D白模就很离谱了。

同样是只简单嘱咐了一句任务,没有写复杂提示词,右边Codex马鞍一把梭的产物简直不像个生物。

从《后室》逃出来的是吧。

打开网易新闻 查看精彩图片

至于原因,我个人感觉是:DSH驾驭下,模型的长程任务能力会强非常非常多。

像猪八戒这个demo,就一句「生成猪八戒3D白模」,DS直接猛跑了20min。

打开网易新闻 查看精彩图片

反观Codex,几乎就没怎么返工,6分钟就跑完了,异常自信。

搁这带货来了啊??

打开网易新闻 查看精彩图片

这也是社区比较一致的反馈,听有个哥们说,他最长跑了10个小时。。。

我自己的体验也差不多,基本都是一句prompt直出,很少出现直接、不绕弯子地交付半成品的情况。

比如这个第一人称射击游戏,我真就啥prompt没给,下蹲、换弹、瞄准、NPC……所有功能都它自己做的。

打开网易新闻 查看精彩图片

也建议大家不用让AI单独生成一遍Prompt,直接语音输入把需求讲清楚就行,太过详细反而会限制模型发挥。

对了,这有个黑鲸给自己做的「思考」gif,欢迎大家拿去当表情包。

打开网易新闻 查看精彩图片

所以,买了梁叔叔的API,接DSH还是Codex?

结论很简单:自家模型肯定是优先搭配自家Harness。

不然也没必要单独做一个了。。。

实测的部分就先到这,主要聊的还是产品设计上的细节。至于模型能力,市面上已经有太多demo了,这里不再赘述。

我更想聊的,是藏在这个对话框之下的东西。

打开官方Repo,你会发现README里反复出现同一个词——Cordis。

啥意思?我看了一下,大概可以理解为乐高的底座板。

你玩乐高的时候,不会从零开始捏,你有一块带凸点的底板,然后往上插各种零件。

Cordis,就是程序员写代码时的「那块底板」。在设计Agent框架时,它将整体拆解为一个个独立插件,各司其职。

这样,可以最大程度避免重复造轮子。

开发者若有魔改需求,只需按规则 Vibe Coding 一个新插件,直接插到底板上即可;若对现有插件不满,也能随时拔下替换。

说实话,这是一种相当AI-Native的设计思路。

要知道,Skill只是Prompt Engineering的范畴,已经爆发出如此强大的影响力。

而Cordis插件,允许用户自定义整个Agent运行时。

这个主流Agent的思路很不一样,虽然Codex的Harness也开源了,但骨子里还是iPhone这类闭源哲学——

Rust写单体核心,依靠「外部挂件」做App Store扩展,MCP工具、hooks、skills,统统挂在核心外面,你不能随意触碰主干。

优点当然很明显。

Rust直接控制内存和并发,比插件框架的抽象层更快;一体化封装,可控性也更高、更极致。

缺点嘛,就是封闭,社区没啥插手空间。

而DSH,我觉得,就是Agent时代的安卓

打开网易新闻 查看精彩图片

甚至还内置了一个魔改Cordis的Skill。

打开网易新闻 查看精彩图片

这意味着,任何人、在任何时候遇到Bug或需要新功能,都可以直接动手实现,然后再开源出来。

未来,其他用户遇到相似问题时,也能直接安装社区已有的DSH插件,就像《我的世界》装模组一样。

比如前面说到困扰我很久的侧边栏功能,社区里就有老哥做了插件。

打开网易新闻 查看精彩图片

事实上,DeepSeek Harness已经预留好了Plugin Store,光是官方,现在就已经内置了100多个插件。

打开网易新闻 查看精彩图片

这也是DeepSeek Harness团队呼吁的事情:

打开网易新闻 查看精彩图片

我感觉DeepSeek可能在下一盘大棋。

今年自从Anthropic那篇self-improvement博客发出来之后,大家一直在聊「自进化」,但说实话,始终没有一个很清晰的路线图。

DeepSeek这套思路,是我目前看到的比较可落地的实现方式——

普通用户也能参与AI的自进化。

Cordist协议下,模型可以在不打断任务的前提下,自己写个插件、自己安上。

再配上用户生态,你想想:从成百上千万个Agent实例里,筛出魔改得比较好的插件,再融回主线……

这不得起飞了啊!

打开网易新闻 查看精彩图片

什么?你问说了这么多,这Cordis对用户体验到底有啥帮助??

好问题。

在社区里问了一圈,目前看来,对普通用户而言,暂时是没太大帮助。。。

毕竟是个吃生态的feature,也许要等后面大量高质量插件沉淀下来后,才能体现出差异。