Jay 发自 凹非寺
量子位 | 公众号 QbitAI
家人们,鲸鱼开眼了!
等了四个月,DeepSeek的多模态模型:deepseek-v4-flash-vision-exp,终于发布。
我也是第一时间赶到现场,连夜开始实测。
相比V4 Flash最大的不同,就是支持原生支持图片输入了,但图片生成当然还是没有的。
基础识图能力实测下来,和一直在内测的网页版差不多,感觉就是同一个模型。
但在Agent任务上,「眼睛」确实可谓是超强的装备了。
先看,纯文本能力(Agent、推理、世界知识等),DeepSeek-V4-Flash-Vision-Exp与DeepSeek-V4-Flash正式版持平。
但值得注意的是,在需要多模态的Agent Benchmark上,这个新视觉模型相比V4-Flash,实现了大幅跃升!
甚至已接近Opus-4.8。
官方也展示了一些demo。
首先是PPT,也是最需要视觉能力的白领场景了,纯靠AI盲画真的很难绷啊。。。
他们还用这个新模型对DeepSeek官网做了二次创作,你别说,玻璃UI动效还真挺好看的,建议merge到主线上(bushi)。
最后是一个黏土风格的前端,相比前俩demo灵动很多,也是在展示模型的审美吧。
如今,这个新视觉模型已上线API,计费价格与flash一致。
在API服务中,图片会转换成token后按token计费,一张图片最多占384 tokens。
如果按「高峰时期+缓存未命中」来计价的话,换算人民币,看一张图大约0.12分钱。
也就是说,即便每张都占满384 tokens,1分钱理论上能看大约9张图。
同样情况下,Image 2看一张需要2.06分,比DeepSeek贵将近20倍。。。
这还没完。
DeepSeek Harness也迎来了版本更新,正式原生支持「第一方」多模态模型。
现在,你可以直接在最新版的DSH里,选择这个视觉模型。
啧啧啧,模型和工具同天就位,接生一条龙是吧。
(bushi)
应该也是计划已久的合体吧,毕竟多模态模型搭配Harness食用,可以解锁很多新场景。
DeepSeek视觉模型实测
所以我也用DSH搭配Vision模型,测了一下。
满足一大心愿,之前DSH刚发的时候我就想做白模和Codex比比,奈何大鲸鱼没眼睛,我也不好意思欺负瞎子。
现在,我终于能让他照着图雕「牛来」了。
它自己下了个Blender,跑了很久,过程中截图返工了很多次。
最后的成果长这样——
效果真可以啊,虽然等了很久,但这个光泽确实不赖。
然后是前端任务,让他用Canvas手绘了个宇宙风格的demo,点击可生成UFO,效果还是不错。
其他Agent能力就不说了,官方demo都有,主要看看基础的识图能力。
找了张三代蜘蛛侠同框的图片丢给他,专门挑了侧脸的,想着可能难度高一点。
结果瞬间就出答案了,可能就两三秒,应该是已经被训练过。
需要WebSearch的也没问题,就是有点慢。
《牛来》剧照,这个视觉模型Loop了好几轮,在网上翻了个遍,花了三分多钟才出答案。
但用网页版就快特别多,看来简单识图确实不需要太多Tool Call。
最后,数手指还是不太行,这也是现阶段多模态模型的通病了,第一轮对话永远固执地认为是五根。
怎么说呢,如果单看识图能力的话,个人感觉就是网页版那个模型,能力没啥区别。
不过,现在搭配Harness和Max推理食用,确实可以赋能不少任务。
等了四个月的眼睛…
其实吧,从今年大Agent时代开启以来,大家都在嘟囔DeepSeek到底啥时候支持多模态。
可惜,众所周知,DeepSeek是一心向往AGI的,并不打算多模态上花太多心思,因此一拖再拖。。。
但像前端开发这类任务,看不了图真的很影响反馈迭代效率啊!!
图片生成无所谓,至少不能是瞎子吧。
Codex在这方面就特别方便,还和产品结合起来了,可以直接在图片上批注修改意见。
四月份,好消息来了——
DeepSeek开始灰测识图。
6月,这个识图模式,端上了网页版和App端。
不过,这个图片模型自此就没声了,一直在内测状态。。。
整整将近四个月过去,DeepSeek,终于摘下了眼罩。
One More Thing
对了,除了DS之外,多模态这块,国产模型圈还有个事儿。
最近X上出了个「牛来」模型。。。
是的,就是那个电影院的《牛来》,火爆了,让海外AI圈知道了什么是真正的抽象。
实在太火,甚至OpenCode都为这款新模型启动了「一周限免」活动。
目前,牛来模型还没正式认领,但最多的猜测,指向了智谱。
对,DeepSeek曾经的盲人兄弟,智谱。。。
DeepSeek官方博客:https://mp.weixin.qq.com/s/UGMfvPMwBIB4oFYZZejekA
热门跟贴