2026年8月21日下午,DeepSeek官方API文档的“模型细节”页面出现了一个新的名字:deepseek-v4-flash-vision-exp。
一个实验性质的模型。DeepSeek V4系列首款原生支持图片输入的视觉模型。纯文本能力与V4-Flash正式版持平,视觉理解能力大幅提升,多模态Agent能力已接近Anthropic的旗舰模型Opus-4.8。
上线时间,恰好是DeepSeek Harness发布一周之后。
一周前,DeepSeek的模型还看不见图。
一周前,它还看不见
2026年4月下旬,DeepSeek发布V4预览版,包括V4-Pro和V4-Flash两个版本。当时的升级重点放在Agent、推理和长上下文上,没有公布视觉输入能力。8月13日,DeepSeek更新V4-Pro并开放Harness。Harness试图把模型、工具、技能、会话、沙箱、存储和Agent Loop放进一套可组合的运行框架中。
但一个非常实际的问题很快暴露出来:DeepSeek自己的模型没有视觉能力。
过去一周,在DeepSeek Harness的GitHub讨论区里,“怎么让DeepSeek看图”已经成为一个高频问题。有开发者上传图片时,Harness会直接返回一行报错:MODEL\_DOES\_NOT\_SUPPORT\_IMAGES。原因是V4 Flash和V4 Pro在模型目录里都被声明为纯文本模型,输入模态只有text。图片甚至无法进入会话。
于是社区开始自己给DeepSeek“装眼睛”。一种方案是在DeepSeek前面再接一个Qwen-VL等视觉模型,先把图片转换成文字描述,再把文字交给DeepSeek推理。另一种方案尝试修改Harness,让图片先保存到工作区,再由视觉插件读取。过去几天,GitHub上已经出现多个类似的vision bridge插件。
形成了一副略显尴尬的局面:DeepSeek刚发布了一套高度插件化的Agent Harness,Agent已经能够调用终端、文件、代码和外部工具,但面对最常见的截图、网页图片和报错界面时,仍需要借用其他公司的模型。
V4 Flash Vision Exp的出现,开始补上这块拼图。
能力接近Opus-4.8
从跑分数据看,视觉版本的提升是结构性的。
纯文本能力方面,V4-Flash-Vision-Exp与V4-Flash正式版持平。换句话说,增加视觉能力并没有牺牲文本处理能力。
在需要视觉理解的Agent Benchmark上,提升则相当明显。多模态Agent能力已接近Opus-4.8。具体到各项基准测试:Terminal Bench 2.1得分83.9(V4-Flash 82.7,Opus-4.8 85.0);NL2Repo得分57.7(V4-Flash 54.2,Opus-4.8 69.7);Toolathlon-Verified得分75.9(V4-Flash 70.3,Opus-4.8 76.2);DeepSWE得分59.3(V4-Flash 54.4,Opus-4.8 58.0)。
ApexBench(Pass@1)从26.2跃升至36.5。Chartography图表理解得分64.3,接近Opus-4.8的65.0。ZeroBench(Pass@5)得分35.0,超越Opus-4.8的34.0。
模型基于2840亿参数的MoE架构,采用HCA和CSA技术压缩KV缓存,可将百万Token推理算力需求降低73%。具备100万上下文窗口,最大输出长度384K。
DeepSeek正在补齐一套Agent系统最基础的感知入口。
不涨价的视觉
更值得注意的是定价。
视觉模型最容易被质疑的一点是:加了视觉能力,价格会不会涨?
DeepSeek的答案是:不涨。
计费价格与V4-Flash模型完全一致。图片会转换成Token后按Token计费,一张图片最多占384个Token。缓存命中情况下,空闲时段输入0.05元/百万Token,高峰时段0.10元;缓存未命中空闲时段1.5元,高峰时段3元;输出空闲时段4.5元,高峰时段9元。
“一张图最高只要0.001元”。与V4-Flash价格一致,而V4-Flash此前以“价格低至竞品1%”著称。
作为对比,Anthropic Opus 4.8的输出定价约为25美元,而DeepSeek V4 Flash的输出定价约0.28美元。差了两个数量级。
多模态API支持Chat Completions、Messages、Responses三种格式调用,支持图文混合输入,支持base64内联、外部URL、Files API三种图片传入方式。Files API同步上线,不收费,用户可先将图片上传到平台,再在请求中通过file\_id引用,同一张图片在多个请求中无需重复上传。
DeepSeek正在用一贯的打法进入多模态赛道:性能接近,价格打一到两个数量级。
Agent时代的视觉拼图
V4 Flash Vision Exp的战略意义,不止于“能看懂图”本身。
8月19日,DeepSeek Harness发布v0.1.0-rc.8版本,带来14项更新,涵盖多模态输入、子Agent协作等能力。8月21日,视觉模型上线。一周之内,Harness先支持多模态输入,视觉模型再上线——工具链和模型在同一条时间线上完成闭环。
此前的Harness更新已经提前写好了视觉能力的接口。Release Notes明确增加了一项功能:“增强多模态支持度,DeepSeek模型适配器支持配置启用原生图片请求”。与此同时,/goal、/plan等命令开始支持图文输入。
这个变化刚出现时,很多开发者就在猜测:DeepSeek自己的视觉模型是不是要来了?
8月21日,答案揭晓。从时间线上看,DeepSeek对视觉能力的准备其实已经提前写进了Harness。
招商证券此前研报指出,DeepSeek Harness的战略意图是成为“Agent时代的安卓”。视觉模型的加入,恰恰补上了Harness多模态能力的关键一环。
当Agent能够同时处理文本和图像,能调用的工具范围就从“纯文本世界”扩展到了“包含图片、截图、文档、网页的完整数字世界”。一个能看图的Agent,意味着它可以读取软件界面截图并分析问题、理解文档页面和表格内容、识别错误信息并协助调试、根据视觉素材辅助内容生成。
AI Agent的竞争,正在从“能不能回答问题”转向“能不能真正干活”。而视觉能力,是“真正干活”的入场券。DeepSeek用一款不涨价的实验模型,拿到了这张入场券。
至于实验版之后,Pro版什么时候来——那可能是下一个悬念。
热门跟贴