DeepSeek 又更新了。
这次不是继续卷推理、代码,而是补上了一个非常关键的能力:视觉。
DeepSeek 最新上线实验模型 DeepSeek-V4-Flash-Vision-Exp,目前已经可以通过 API 调用。
简单来说,就是:V4 Flash 终于把“眼睛”装上了。
更重要的是,从官方公布的第一批评测来看,这次升级并不只是让模型“能看图”,而是让 DeepSeek 正式开始补齐多模态 Agent。
文本能力没掉,但突然会“看”了
按照 DeepSeek 的介绍,V4-Flash-Vision-Exp 在纯文本能力上基本保持了 V4 Flash 的水平,包括 Agent、推理和世界知识。
真正明显的提升来自多模态。
从官方公布的 Benchmark 来看,新模型在纯文本 Agent 测试中整体与 V4 Flash 接近,部分项目有所提升。
但到了多模态 Agent测试,差距一下子拉开了。
例如 ApexBench 从 26.2 提升到 36.5,而 Opus 4.8 是 39.4;在 ZeroBench 上,新模型甚至以 35.0 小幅超过 Opus 4.8 的 34.0。
当然,这并不意味着 DeepSeek 已经全面超过 Opus 4.8。从整张榜单来看,Opus 4.8 在不少项目上依然领先。
但至少可以得出一个很明显的结论:DeepSeek 的 Flash 模型,已经把多模态 Agent 能力推到了接近顶级闭源模型的位置。
为什么“视觉 Agent”比“看图”重要?
现在的大模型能识别图片,其实已经不新鲜了。
真正重要的是:模型能不能把“看见”变成“行动”。
比如让 AI 操作电脑,它首先得看懂网页上的按钮、菜单和弹窗;让它处理 PDF、Excel 或各种软件,它也得理解表格、图表、截图和界面布局。
所以 V4-Flash-Vision-Exp 并不是简单增加了一个图片识别功能。
它更像是在给 Agent 装眼睛。
一旦 AI 不仅能调用 API,还能直接理解屏幕上的内容,Agent 能做的事情就会一下子扩展很多。
而且视觉输入并不贵
新模型已经登陆 DeepSeek API,模型名称为:
deepseek-v4-flash-vision-exp
它支持文字和图片混合输入,图片可以通过 Base64、外部 URL 或 Files API 提交。
计费也很直接:每张图片最高转换为 384 Tokens,并按照 V4 Flash 的价格收费。
与此同时,DeepSeek Harness 也更新到了 0.1.1,已经直接支持这个新的视觉模型。
把这两件事放在一起看,DeepSeek 的路线其实越来越清晰:它不是只想做一个“会看图的聊天机器人”,而是在继续补齐自己的 Agent 技术栈。
从 V4、DeepSeek Harness,再到现在的 V4 Flash Vision,模型、Harness 和多模态正在逐渐合到一起。
过去我们谈 Agent,更多还是“模型 + 工具调用”。
但真正通用的 Agent,最终一定还需要视觉。
因为现实世界本来就不是纯文本的。
当 AI 真正拥有“眼睛”,Agent 才开始从 API 的世界,走进我们每天使用的电脑和现实世界。
参考资料
DeepSeek Vision API 文档:https://api-docs.deepseek.com/guides/vision/
热门跟贴