文 | 字母AI

千呼万唤始出来,DeepSeek V4 Pro正式版和传说中的DeepSeek Harness(DSH)终于问世了。

说起DSH这个产品,它曾于8月1日开始招募内测。招募采取筛选制,优先吸纳具备大型项目开发、AI Agent二次开发经验的工程师,申请人需要提交代码托管平台账号和过往项目代表作品,入选者还要签署保密协议。

打开网易新闻 查看精彩图片

现在终于算是见到了DSH的庐山真面目。经过字母AI一晚上的测试,结论是这个产品性能很好、响应速度快,关键是还非常省token。

只能说,还得是DeepSeek,老配方老味道!

再看V4 Pro正式版这边,虽然8月13日时,由于DeepSeek修改了API文件的表述,以及在DeepSeek官网增加公告,导致8月13日上午,全网都在热传V4 Pro正式版已经发布。

可事实上,此次发布实则为一场乌龙,所谓的DeepSeek V4 Pro正式版不仅性能堪忧,而且价格还保持着此前的价格不变。

8月13日下午,DeepSeek官方撤下了首页关于DeepSeek V4 Pro正式版发布的公告。

而8月13日晚间发布的,才是真正的DeepSeek V4 Pro正式版。

Agent能力大幅提升。DeepSWE从预览版的12.8分直接飙到62.7分,涨幅接近五倍;DSBench-Hard从31.1冲到 67.2;DSBench-FullStack从41.8提升到71.1。尤其是在Agent领域影响力最大的基准Terminal Bench 2.1上,DeepSeek V4 Pro正式版性能比肩当下最强的Claude Fable 5。

打开网易新闻 查看精彩图片

话又说回来了,虽然此前DeepSeek公告称价格上调,但谁也没想到涨价涨得这么多。

输出方面,高峰时段价格为原价的4.5倍,为27元/百万token,空闲时段为原价的2.25倍,为13.5元/百万token。以单日20万输出token的代码审查场景为例,调价前单日成本约1.2元,高峰时段将升至5.4元,空闲时段升至2.7元。

打开网易新闻 查看精彩图片

缓存未命中输入方面,高峰时段为原价的3倍,为9元/百万token,空闲时段为原价的1.5倍,为4.5元/百万token。缓存命中输入方面,高峰涨幅最高,达到原价的12倍,为0.3元/百万token,空闲时段为原价的6倍,为0.15元/百万token。

无论如何,不妨先来一起看一下这个产品。

它不是下一个Codex, 它是第一个DSH

应了梁文锋那句“我们不在乎C端”,DSH的安装门槛非常高,不仅要有node.js环境,还需要用户自己去GitHub上面用npm命令安装。像是Codex、Workbuddy这样的Harness,都是可以直接双击安装的。

之所以有安装门槛,是因为DSH既不是桌面GUI,也不是TUI、CLI,而是走了一条几乎没人走过的路,DSH是BS架构的Web UI,打开就是个网页,网页里带一块Agent干活的区域。

要理解DSH为什么这么“反用户”,就得先理解支撑它的那篇论文《A Programming Paradigm for Spatiotemporal Composability》,由北京大学和DeepSeek联合署名。

DSH的思路叫做一切皆插件,任务需要什么,就调用什么插件,用完立马卸载腾空间。

打个比方,Claude Code是一辆车,你可以给它装上装甲、防滑胎甚至是武器,但它归根结底就是一辆车。Codex同样是一辆车,可你只能给它改改内饰和车漆。DSH只是一个底盘,你可以给它加轮子让它变成车,但你同样可以给它加螺旋桨让它变成直升机。

为了满足这个核心设计理念,论文提出了两个维度。

第一个维度叫时间可组合性。意思是,当一个组件被移除时,它对共享环境造成的所有修改,必须能被完全、安全地撤销。

论文引用了“效应”这个概念,传统的效应指的是一个程序在跑出结果之外,还会动手改变外面的世界,比如创建了一个文件,那么磁盘里就会记录这个文件的内容。

DSH是把运行办法、撤销办法全都记录在了效应之中,还专门给它起了个名字,叫做可逆效应。

这个很好理解,经典“效应”像是你买东西时收银台给你开的小票,它只记录你买了什么,如果你想退货,你还得走一些程序。而DSH论文中的可逆效应,就像是你在胖东来买东西,你退货的时候不需要走程序,直接把商品交给客服,剩下的他们(系统)会替你解决。

每一次上下文变换都自带一个逆变换,运行时全程追踪,组件卸载时自动回滚。

第二个维度叫空间可组合性。

这是一种运行时的组件组合模型。和传统的静态依赖注入不同,组件的依赖关系不是在代码编写时或启动时固定的,而是在一个共享的运行时“空间”中动态建立、动态消解的。

举个例子,假如说你想让DSH给你念一本书。DSH上有视觉相关的插件,它可以充当眼睛,把书的内容记录下来,但是它没办法念出声。同时DSH还有声音相关的插件,它只会读却不会记。将视觉插件和声音插件放在同一个空间内,它们就会自动关联,视觉插件负责把记录的文字给声音插件,声音插件再将其读出来。

论文里拿VS Code当反例,VS Code的扩展全部跑在一个共享进程里,装了就不能热卸载,想停用一个带代码的扩展,就得重启整个扩展宿主。

按论文统计,安装量前100的扩展里,有87个包含可执行代码,都得靠重启来卸载。

可是一旦重启,进程内积累的缓存、连接、部分计算结果全部作废,重建要花上几秒到几分钟;为了维持可用性,还得养冗余副本,以供重启之后Vs Code调用

DSH采用了一套Cordis系统,实现了热模块替换,改完插件直接原地替换,缓存和活动连接都给你留着,改炸了还能事务性回滚。

但DSH真正让人惊艳的,并不在这套理论本身,而是它把理论用在了哪里。

DSH定义了四套完全不同的执行模式:普通任务直接做;长程任务进入Goal,可以跨多个自主轮次(autonomous rounds)持续执行;一两个任务可以丢给子Agent,默认后台运行;大规模并行任务进入Workflow,用一段JavaScript去编排多个 Agent。

小事,比如“帮我把这个文件改一下”,AI直接上手就干,不搞流程、不折腾。

大事,比如“给我写一个完整项目”,可能得干好几个小时。为了防止过程中出错,所以DSH给它定制一个“总目标”,让它能连续干好多轮,直到目标达成才收工。就像带了个KPI,没完成不许下班。

为了能更好地完成任务,DSH甚至还有一个单独的Ralph Loop,每一轮都创建一个完全“失忆”的新Agent,不继承上一轮对话,只通过共享的Workspace保留长期记忆,然后一轮轮迭代。

DSH也是为了AI自进化设计的。

插件化意味着架构解耦,任何模块都可以独立演化;AI注意力受限,又是大规模并发,解耦设计能最大限度发挥这种高并发优势,还避免了把自己搞崩溃的问题。

传统软件里,模块之间经常“你中有我,我中有你”。改一个地方,可能连带弄坏十个地方。

插件化就不一样,每个功能都是一个独立的插件,只通过一个标准接口跟系统相连。插件之间不直接认识、不互相扯皮。

正因为这样,任何一个插件都能单独升级、单独替换、单独进化,不用动其他插件。

假如按照传统模块A干活必须等模块B先干完,那大家排着队,互相干等。但解耦之后,每个模块都是独立的,谁也不挡谁的路,几十个任务可以同时撒出去跑,互不干扰。

AI注意力有限没关系,因为每个模块是独立的小任务,AI分头指挥、同时推进,效率拉满。

同样的任务,便宜120倍

相同的任务,差不多的效果,Fable 5一共花了9.8美金的token,约合人民币将近70块钱。用DSH配上DeepSeek V4 Pro 正式版跑,只花了5毛9分钱人民币。

此前根据Artificial Analysis的测算,DeepSeek V4 Flash正式版在相同的任务条件下,比Claude Fable 5便宜了约100倍。

但V4 Flash毕竟只是个轻量模型,并不能完成复杂任务。这次随着V4 Pro正式版以及DSH的组合,已经比Claude Fable 5便宜将近120倍了。

Artificial Analysis曾预测,随着DeepSeek V4 Pro正式版发布,DeepSeek斩杀线将会覆盖全球超过70%的模型。现在看来Artificial Analysis预测的非常准确。

不过我也得“唱个反调”,由于我测试的时间段属于非高峰时间段,所以token价格相对便宜,如果换做高峰时间段,那么V4 Pro正式版的token费用将比Fable 5便宜不到100倍。

在我测试的过程中发现,DSH的缓存命中率能高到离谱,有时候甚至能高到99%。

要知道,无论是高峰还是非高峰,命中缓存都比非命中缓存便宜整30倍。

除了前文提到的热替换和可逆效应以外,还有一点就是论文里的“增量协调”(Incremental Reconciliation)。

配置层是一棵由“档案卡”(entry)组成的树,每张档案卡声明一个插件,里面的信息包括它叫什么、跑哪份代码、带什么配置。

传统做法是,档案一改,就把对应的整个实例连根拔起、全部重来。

增量协调不是这样。它先看改动落在档案卡的哪一格,再做最小动作,只有代码地址变了,才重建整个实例。如果只是隔离方式变了,那就单独调一下隔离域。如果改的是配置本身,就交给插件自己比对,只有真动到实质内容才重载。标成停用就卸掉,取消停用再装回来。插件底下还挂着子插件的话,就按各自的编号“按名对账”:新增的装进来、删掉的卸下去、没动的原样留着,一层层递归下去。

这样一路修补下来的最终状态,和把整个系统推倒重建再加载的最终状态完全一致。

用人话说,就是改东西的时候只动该动的,没动的原地继续干活,而且最终效果跟全部推倒重来一模一样。

在以前,把宫保鸡丁变成宫保鸡丁(微辣),需要将整个餐馆停业,重新培训厨子、服务员和大堂经理。然而这样显然是浪费算力,增量协调相当于是检查一下宫保鸡丁(微辣)的菜谱,发现好像只要撒一点辣椒进去就可以了,于是就让所有流程保持不变,多增加了一道撒辣椒的程序。

DSH在“省token”这件事上,还留了一整套后手。它的PTC模式(程序化工具调用),让模型生成一段代码去组合多轮工具调用,原本要五次模型往返的操作序列,一次就完成了。

相当于是把五次的输入输出,压缩成了一次。

诚然,DeepSeek涨价了,还涨了不少钱。就算是梁文锋也没办法让DeepSeek永远便宜,但DSH能让“便宜”这件事在涨价之后依然成立。

模型定价是DeepSeek说了算,DSH能做的,是把每一分钱榨出最大价值,贵可以贵,但绝不白贵。