在多模态这个问题上,梁文锋在那次投资人交流会上曾这么说过:“多模态布局,我们一直在做。对产品来讲,它很重要;对C端用户产品来讲,它很重要。但是对智能的上限,它是一个组件,它不是主线本身。我们应该会上相关的模型,就是我们V4的后续版本会支持原生的多模态。”
梁文锋也的确做到了。2026年8月21日,DeepSeek上线了DeepSeek V4 Flash Vision Exp,DeepSeek官方称,这是一个多模态视觉理解模型。
和V4 Flash以及V4 Pro不同,DeepSeek V4 Flash Vision Exp没有技术报告,也没开源,官方只给了一张性能表和几个演示案例。
可DeepSeek V4 Flash Vision Exp怎么看都不像是个“组件”。
以往来看,DeepSeek OCR、DeepSeek OCR 2这样的模型才贴合梁文锋口中“组件”的定位。这些模型的作用,是把图片以像素形式存在的文字,转换成电脑可以识别的纯文本字符。
因此,相较DeepSeek OCR而言,DeepSeek V4 Flash Vision Exp更像是一个“主线”模型。
难道梁文锋对多模态的看法改变了?事实可能并非如此。不过有一点可以肯定,那就是梁文锋学会了放低姿态,用产品和用户形成更密切的交流。
梁文锋此前曾说,“通往AGI要经过产品这个台阶,但不用花太多精力做C端、B端。”而随着DSH的爆火,发布后不到一个星期,DS就发布更新,提升了多模态能力。
过去的梁文锋对于产品有一种“偏执”,不完美不发布。DeepSeek V3.2版本和DeepSeek V4预览版之间,相隔足足4个半月,如果从V3正式发布开始算,仅仅1个大版本,就用了1年零4个月。
现如今不仅更新变快了,还把DeepSeek V4 Flash Vision Exp这种实验性质的模型开放给公众,都是在说明梁文锋态度上发生了一些转变。
01
多模态是Agent和推理的入口
如果你是练跑步的,那么你应该给别人看的成绩你跑了多少米用了多少秒,这样别人才知道你到底是快还是慢。但如果你告诉别人的是三分球命中率是多少,那很显然,你想告诉别人的是你有多准。
DeepSeek V4 Flash Vision Exp也是如此,它想表达的事情,远非是一个展示DeepSeek现有的多模态能力那么简单。
明明是一个多模态模型,官方公布的测评里,放的却是一串Agent基准。比如Terminal Bench 2.1得83.9,DeepSWE 59.3。
其实在AI视觉模型圈里有一套默认的考卷。
一个新视觉模型发布,通常要放的是这几项:MMMU,跨30个学科、大学水平的图文理解与推理,考“看到图能不能做对题”;MathVista,考图片里的数学推理;DocVQA,考从扫描文档里找到答案;ChartQA,考读懂图表里的数字和趋势;OCRBench,考最基础的文字识别。
无论是Qwen-VL、Gemini 还是GPT-4o,发新版本的时候,展示的都是这套基准。
即便是DeepSeek V4 Flash Vision Exp也放了一些多模态侧的基准,然而这些基准也“不太正经”,充满了浓浓的Agent味。
Chartography考的是专业人士读专业图表做决策,ApexBench是多模态Agent基准,Agents’ Last Exam 是通用Agent评测。没有一项是“看图答题”,全是“看完图,把事做下去”。
这张跑分图,本身就是DeepSeek的一种暗示。
梁文锋自始至终都认为多模态不是AGI的主线,DeepSeek V4 Flash Vision Exp是DeepSeek在Agent跟推理这条主线上的一个必然产物,只不过它刚好也是“多模态”罢了。
DeepSeek V4 Flash Vision Exp所展现出来的价值观是,多模态从来不是让你“看图聊天”,而是让Agent看懂网页截图、读懂图表数据、理解UI布局,然后把任务做下去。
多模态不是目的,是手段,是给主线用的插件。DeepSeek的主线仍然是Agent和推理,DeepSeek V4 Flash Vision Exp所干的事,也不过是强化了产品的推理能力。
虽然DeepSeek V4 Flash Vision Exp这个很神秘,但它也并非是一个凭空出现的模型。
4月29日晚,DeepSeek多模态负责人陈小康(Xiaokang Chen)在X平台发文预告,配文 “Now, we see you”,宣布DeepSeek多模态识图功能开启灰度测试。
第二天,DeepSeek正式在GitHub发布技术报告《Thinking with Visual Primitives》(以视觉原语思考)及配套仓库。论文作者单位包含DeepSeek、北京大学、清华大学,属于三方联合研究成果。
然而这篇论文在5月1日凌晨就被删除,相关官宣推文也消失不见,GitHub官方仓库直接变为404状态,项目彻底无法访问。DeepSeek全程未发布任何撤稿公告,也没有公开解释原因。
好在,社区留下了这篇论文的拷贝版本。
这篇论文没有去讲“我们模型看得多清楚”,而是提出一个问题:模型能看见,但不一定能想清楚。
传统多模态模型用自然语言描述图片里的对象,比如“左边那个男的”“右边那个高的”。可是在复杂场景里,这种描述非常模糊,模型很容易越推越乱,最后导致整个逻辑崩塌。
就拿集体照来说,左边一共好几个男的,那么哪个男的才是模型所描述的那个?
DeepSeek的解法,是把点坐标和边界框提升为“思维的最小单元”,直接嵌进推理链,让模型“边推理边指向”,就像人数东西时会伸出手指,一个一个点着数。
靠这套机制,模型在计数、空间推理、迷宫导航这类任务上,把抽象的判断精确锚定到图像坐标,从“左边那个男的”、“右边那个高的”,变成了“我手指的这个”、“我手指的那个”。
6月,经过DeepSeek官方确认,其在客户端和网页端上线的Vision模式,底层就是这套视觉原语机制。
而DeepSeek V4 Flash Vision Exp,是把同一套技术嫁接到了V4-Flash的API基座上,重点强化多模态Agent能力,核心推理逻辑完全沿用了论文的方案,没有跳出其技术框架。
不仅如此,论文当时的实验,就是基于DeepSeek-V4-Flash作为语言骨干所搭建的多模态方案。这次的DeepSeek V4 Flash Vision Exp光看名字也知道,仍然使用的是DeepSeek-V4-Flash。
除了DeepSeek V4 Flash Vision Exp这个模型,DeepSeek在多模态方面的进展还体现在DSH上,8月19日晚,作为DeepSeek目前的主力产品,DSH更新了rc.8版本,提升了Agent的多模态能力。
rc.8的核心,是DeepSeek在多模态这件事上,“两条腿”走路。
一条叫“原生直通”。rc.8给模型适配器加了可配置的原生图片请求能力,只要底层模型声明支持视觉输入,比如GLM、Qwen,或者刚上线的V4-Flash-Vision-Exp,Harness就把图片原封不动送进模型,不做任何中间加工。
另一条叫“工具层视觉”,服务的是纯文本模型。
比如用DeepSeek自己的V4-Flash,直接读图会失败。这时Harness不会报错退出,而是自动降级成一套工具链,先做OCR识别文字,再统计图片颜色比例、扫描部分像素行、读取尺寸和颜色模式,把这些信息拆成结构化证据,最后交给文本模型去推理整张图。
Cherry Studio的核心创始人Yinsen把这种方式称为“伪视觉”,对付PPT截图、流程图、界面这类结构清晰的图够用,面对真实照片和复杂的空间关系就很勉强。
但要说明的一点是,DSH在rc.8之前,甚至连“伪视觉”都没有,全靠社区的视觉插件,还有通过pi2dsh桥接进来的视觉方案。
它们的做法大同小异,先调一个外部的视觉模型(比如 GLM、Qwen)把图片识别成文字,再把结果塞回文本模型。
这些插件证明了DSH架构的开放性,也同时暴露了一件事,DeepSeek自己没有视觉模型,只能借别人的眼睛。
02
DSH还有哪些可以补足?
正如开头提到的,虽说梁文锋没有改变旧观点,但梁文锋也学会放低了姿态。
2025年,在DeepSeek R1惊艳全球之后,社区就开始等待DeepSeek发布V4。
2025年下半年,随着V3.1、V3.2等迭代版本陆续推出,无数媒体“独家爆料”,称DeepSeek下一代旗舰大模型V4,计划于2025年7月、8月、9月……直至2025年年底发布。
结果自然是无一准确,堪称现代版狼来了。
2026年春节前,距离V3 发布已经过去400多天,所有人都在赌DeepSeek会复刻春节档R1的奇迹,把V4卡在农历新年这个节庆日子上线。
结果2月4日,外媒援引消息人士的话,称春节期间V4不会发布,DeepSeek官方也对此事保持沉默。
然后时间线一路后移。最后到了4月24日,V4才以预览版的形式登场,一次同时放出了V4-Pro和V4-Flash。
梁文锋的产品观是,宁可跳票,也不肯在产品没有完全做好的前提下发布。
可也就是在这段时间里,DeepSeek“掉队”了。
国际方面,2025年8月,OpenAI发布了GPT-5;11月,Anthropic发布Opus 4.5。这两款模型都是问鼎全球的性能榜的产品。
而在国内,2025年4月Qwen 3,不到半年后,阿里一口气放出来了Qwen3-VL、Qwen3-Omni、Qwen3-Max、Qwen3-Coder。还有Kimi的首个原生多模态模型K2.5、智谱的GLM-4.7、MiniMax的M2.1、腾讯的hunyuan world等等,数不胜数。
与之相对的,DeepSeek发布的产品只有V3.1(8月V3.1,9月V3.1-terminus)和V3.2(12月)。
除了DeepSeek,全世界都在以月为单位发布模型,Anthropic更是以天为单位,在2026年2月1日到3月末,52天的时间里发布了73款功能和产品。
假如梁文锋是大厂的产品经理,以他发产品的效率,恐怕撑不过试用期就得被开除。只可惜DeepSeek是他的。
正式版更磨人。
6月29日,DeepSeek给全体API开发者发邮件,明确表示V4正式版7月中旬上线。7月21日,有消息表示正式版将要延期,目标挪到7月底。7月28日,又有消息说可能拖到8月10日至20日之间。
7月31日,V4-Flash正式版才千呼万唤始出来,而V4-Pro正式版,直到8月12日晚间才正式上线。
梁文锋对待产品,不做到自己满意,绝对不放出来。
可到了DeepSeek V4 Flash Vision Exp这里,明显味道变了。
模型上线当晚,社区就开始对其进行检测。根据实测显示,DeepSeek V4 Flash Vision Exp连梁文锋本人最具代表性的一张照片都无法识别。
不仅如此,还有用户反馈,称DeepSeek V4 Flash Vision Exp在理解复杂图表时会漏掉关键信息,中文场景的处理偏弱,有人在对话里插入图片后,还发现上下文缓存机制受到牵连。
一圈看下来,社区对DeepSeek V4 Flash Vision Exp的普遍看法是“效果好像也就那样”。
这个模型就像是在餐馆等着上菜,看不见后厨,不知道这盘菜什么时候才能端上来,厨师怕你等不及,于是从锅里盛了一勺给你尝尝,告诉你说菜还没做好,但是在做了。
其中的原因,很可能在于梁文锋持续受到优秀产品的压力。DSH从立项之初就对标Anthropic的Claude Code和OpenAI的Codex。
8月23日,外媒报道称Anthropic或将于8月底递表上市,因此目前正处于静默期,Claude Code没有较大的更新。
OpenAI却很激进,8月20日直接开源了Codex Harness,这是支撑Codex运行的底层系统。负责把模型和工具接起来,让模型能打开文件、执行命令、记住任务进行到哪一步,以及遇到有风险的操作要停下来询问。
但这并不是重点,重点是,在产品逻辑上,Codex Harness把多模态放在了Agent运行时的核心位置。
在Codex的工作流里,图片不是先交给某个外部视觉模型,再把识别结果转述给文本模型。
模型是可以直接接收截图、界面和其他视觉输入的,并把这些内容纳入同一条任务链。模型会先理解画面,再决定要调用什么工具、修改哪些文件、运行哪些命令,最后根据执行结果继续修正。
正如前文所述,DSH无论是哪条腿,在多模态这件事上,在DeepSeek V4 Flash Vision Exp之前,它都是割裂开的。DSH只负责以“模型处理过的图片”进行推理,而非用图片进行推理。
显然,Codex效果更强,首先是因为它减少了一次信息损耗。图片经过OCR或摘要之后,模型看到的已经不是原始画面,而是工具挑选出来的文字和特征。
只要处理过的图片漏掉一些信息,那么后面的推理就只能建立在不完整的证据上。
举个例子,前面的话就相当于模型处理后的图片,后面那句话是原图。你会发现,仅仅只漏掉一个字,意思就完全相反了。
要断章取义——出自“不要断章取义”
原生视觉输入则让模型直接面对图像,文字、布局、位置和相互关系可以在同一上下文里被判断。
其次,Codex把视觉理解和行动闭环连在了一起。它不是单独回答“这张图里有什么”,而是要根据截图判断下一步该做什么,再通过终端、文件和其他工具验证结果。
就算是中间出错了,新的截图和执行反馈还能继续回到同一条推理链里。这样一来,多模态就不再是“识别完了就完了,后面发生啥不关我事”的状态了,而是一个持续的服务,以提高推理的性能。
而这一步也是目前DSH所欠缺的。
所以这也是为什么OpenAI在开源Codex Harness后,DeepSeek会立马开源DeepSeek V4 Flash Vision Exp,梁文锋是想告诉用户,别急,别人有的我们也有,不过需要一点时间。
03
社区正在补足DSH的最后一公里
当然,DSH最明显的短板,是它和普通用户之间距离太远了,没点计算机知识,估计连DSH怎么安装都不清楚。
好在的是,正是由于DSH开源,所以这最后一公里,社区已经开始接手了。
最典型的例子是DSH Desktop,这个项目由一位06年的大二学生Benson Wang开发。
它的核心就四个大字“一键安装”。把原本需要复杂安装环境,以及输入npm指令才能安装使用的DSH,变成一个exe,下载以后双击安装就能直接变成一个桌面工具。
然而就是这么简单的一个项目,短短几天,就在GitHub上获得了1.8万颗星星。可见,大家普遍都认为DSH就该有一个简单方便的桌面版本,现在的DSH确实有些“反人类”了。
顺便一提,DSH Desktop这个项目的贡献者也有DSH负责人崔添翼,不过这并不是说明他参与了开发,而是GitHub本身的开源协作机制,让DSH原本的贡献者出现在了这里。
Benson Wang表示,他正在开发手机版的DSH,项目名为anywhere DSH。
他计划通过 iOS 和 Android 连接桌面端,让用户在手机上发起任务、查看 Agent 进度,并在需要时继续跟进。
这也是社区最有价值的地方。
事实上,DSH官方团队本身也非常关注社区。比如他们关注了DSH-better-sidebar这个项目,这是DSH第三方社区UI增强插件,给DSH原生Web界面提供了一套完整的服务化侧边栏工作台框架。以及awesome-dsh-plugins,提供DSH插件精选和搜索雷达,相当于是一个DSH的插件市场。
或许不久的将来,DSH会“收编”这些优秀的项目和开发者,丰富现在的DSH。
诚然,社区项目不能自动等同于DeepSeek的战略转向。开放生态越是发展,就越是会有版本兼容、权限控制、插件安全等问题出现。
但官方的态度就说明,DSH正在通过社区吸纳好的想法。
或许不久的将来,DSH也将上线官方的插件市场,想用什么插件,自己直接在官方的入口里搜就行了。
热门跟贴