打开网易新闻 查看精彩图片

不是,DeepSeek 又悄摸更新了?

就在今天下午,DeepSeek 发布了新模型DeepSeek-V4-Flash-Vision-Exp

名字忒长,但核心就一点,Vision 视觉能力。没错,等星星盼月亮,大鲸鱼它终于开眼了。。。

打开网易新闻 查看精彩图片

直接看跑分,装上眼睛后,相比老的 0731 版本,一些 Agent 评测成绩出现了明显跃升,跟 Claude Opus 4.8 也能打得有来有回。

打开网易新闻 查看精彩图片

而且与此同时,DeepSeek Harness ( DSH ) 也在第一时间进行了适配,图谋已久了属于是。

要知道,之前想给 DSH 的 V4 Flash 发张图,那大概率回你的是不好意思,俺瞅不见。

打开网易新闻 查看精彩图片

想要识图,就得去安装第三方的插件,然后再吭哧吭哧配置识图模型的 API,为这事儿,开发者们没少抱怨。

不过现在就简单多了,大伙儿想体验的,只要把 DSH 更新一下,就能在模型选择栏看到 “ deepseek-v4-flash-vision-exp ” 了。

打开网易新闻 查看精彩图片

话不多说,咱也直接开测。

先来个最简单的识图,直接把它老板的照片扔进去,看它认不认得。

刚开始我是拿 Codex 试的,速度相当快,但推理太过保守,认出特征就止步了,说是不给信息它不敢瞎猜。。。

打开网易新闻 查看精彩图片

那咋行,咱直接切到官方的 DSH,兼容更好一点,果然不保守了,会自己上网搜信息对比。

但结果么,我一口老盐汽水差点喷出来,它都能看到刘海,眼镜和蓝色西装了,甚至还锁定了 AI 行业的领军人物,结果最后认成了隔壁月之暗面的杨植麟。

打开网易新闻 查看精彩图片

好家伙,过程全对,结果全错,不想领工资了是吧?

接下来我又从一部神秘电影中,截了张图丢给它,看看它知不知道出自哪儿。

打开网易新闻 查看精彩图片

很快啊,两眼一扫,告诉我草地上有两头拟人化的牛,还说这画风多少有点黑色幽默。

不过接着就又开始要信息了,我让它自己去搜,它调查了一会儿,终于认出来出自《牛来》。

打开网易新闻 查看精彩图片

然后我又甩给它一张杭州地标的图片,3.5 秒,它就认出来了是奥体中心的大莲花。

作为对比,多模态大哥大的 Gemini 也用了 3.8 秒,速度这一块儿没毛病。

打开网易新闻 查看精彩图片

从这儿也能看出,DeepSeek-V4-Flash-Vision-Exp 的多模态调教得比较保守,基础的世界知识储备是有的,但再细一些的信息,就习惯于调用联网工具进行补充,说白了,还是要跟 DeepSeek Harness 打配合。

那咱干脆就直接上开发任务,感受一下,加了多模态后,干起活来有多爽。

直接丢给它一张《星际穿越》里的黑洞照片,让它复刻一。。。

打开网易新闻 查看精彩图片

诶,不是,怎么还限制大小啊,高于 3.5M 不让传,略拉了好吧。

看官方文档,发现大小倒是其次,因为即使上传进去,这次的多模态也会自动缩放,不过每张图片最多消耗384个 token,也挺实惠了。

那咱先手动压缩一下继续干,让它根据图片造一个网页版的黑洞,看看效果。

打开网易新闻 查看精彩图片

一番折腾后,黑洞搓出来了,看着有点一般。

我给的是 9:16 的竖屏图,所以它也搓了个竖屏的;而且图中有个飞船,它也顺手给造出来了,不说样子如何,看得确实挺准。。。

打开网易新闻 查看精彩图片

接下来咱直接截图给它,让它自己看着修,再喂一张更酷炫的,让它优化视觉效果。

打开网易新闻 查看精彩图片

不一会儿,最终成品出来了,果然,它自己也能瞅着刚刚的效果太不像话了,直接整体大换血,根据新图片的效果重构了黑洞。

这回也没彩虹飞船了,黑洞周围也有变形效果了,整体的质感向第二幅图靠齐,直接起飞。

除此之外,官方公告里还有个很丝滑的 PPT,用裁切,排版的方式将图片融入到了文案之中,咱也来复刻一手。

把场景从雪山换成雨林,稍微改改提示词,这回它足足捣鼓了半小时,才交出了 PPT。

当然,这效果也是顶中顶,整体配色和主题一致,用了深绿加淡黄的色彩,有种木头的质感。

打开网易新闻 查看精彩图片

图片内容也能跟 PPT 讲解的东西一一对应,翻看思维链能看到,它是真的带着眼睛干活儿,哪张图不对会剔掉,图片太多了,也能自己看着挑一挑。

打开网易新闻 查看精彩图片

其中印象比较深的还有背景的动效,尤其是森林和亚马逊河当底图的时候,看着像是镜头在缓慢推进,相当高级。

话说回来,现在这些大模型厂商确实越来越重视多模态了。

除了 DeepSeek 之外,今天早上,还有个没有透露来路神秘的模型 Ox Alpha ( 简称牛来 ), 也突然在全球知名的大模型中转站 OpenRouter 里上线测试。

打开网易新闻 查看精彩图片

具体是哪家的大家都还说不明白,有猜小米的,有猜腾讯的,还有猜是智谱的。。。

打开网易新闻 查看精彩图片

众说纷纭,但是梗图已经搓的满天飞了。

打开网易新闻 查看精彩图片

再往前,还有不忘初心的 Gemini,即使 Pro 难产,已经连更 3 个 Flash 模型了,多模态这块仍旧是扛把子。

乃至于 GPT,Claude 的旗舰模型,即使不像 Gemini 那样专一,但考虑到通用场景,也会尽量补一些多模态的能力,让用户用起来更顺手。

没办法,这就是大伙儿一个 token 一个 token 试出来的经验。

不过按照现在模型的更新频率,DeepSeek 的下一个多模态模型可能已经在路上了。。。

撰文:风华

编辑:江江 & 面线

美编:焕妍

图片、资料来源

DeepSeek公众号,X,DeepSeek Harness,部分图源网络

打开网易新闻 查看精彩图片