机器之心编辑部
没想到吧,最近 DeepSeek 频频上新!
就在刚刚,DeepSeek 官宣DeepSeek-V4-Flash-Vision-Exp上线 DeepSeek API 平台。
也就是说,DeepSeek 的多模态模型服务来了。
链接:https://api-docs.deepseek.com/zh-cn/
据官方推文介绍:今天,DeepSeek 在其 API 平台上线了多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,开发者把请求中的 model 参数设为 deepseek-v4-flash-vision-exp 即可调用。模型名末尾的 Exp 已经说明了定位:这是一个实验性版本,而非 V4-Flash 的多模态正式版。
两个小时前刚刚更新的 DeepSeek Harness 也已经新增了该模型。
有意思的是,此时正是OpenRouter 和 OpenCode 上的隐身模型Ox Alpha(被戏称为「牛来」)在社交网络上引爆讨论热潮之际。
这个匿名模型的自我介绍与 DeepSeek 今天的发布几乎踩在同一组关键词上:面向代码、长程 Agent 工作与真实生产环境,100 万 token 上下文,原生支持文本、图片与视频输入,推理强制开启并分 low、high、max 三档。
Ox Alpha 目前免费,上线还不到一天,调用量就已非常高,不少人直接把它接进了自己的智能体。
不知道后续会是哪家公司会来认领「牛来」?据说是一家国产模型,正如下面这张图暗示的那样:两个国产模型的「视觉」对决。如此热闹,就像一首人工智能的「牛与鲸之歌」。
此时距离 DeepSeek 在 4 月 24 日发布 V4 系列预览版并开源,已经过去将近四个月。
这四个月里,V4 的其他拼图一块块补齐:7 月 31 日 V4-Flash 正式版 API 上线公测,8 月 13 日 V4-Pro 正式版与官方 Agent 框架DeepSeek Harness(dsh)同日落地,后者如今已有17.8 万GitHub Star。
视觉是最后一块,也是外界等得最久的一块。以至于在官方开放之前,社区已经等不及自己动手,把第三方视觉编码器接到 V4-Flash-0731 上做出了非官方的「混合视觉」版本。
按照 DeepSeek 的说法,V4-Flash-Vision-Exp 在纯文本能力上与 V4-Flash 正式版持平,涵盖 Agent、推理与世界知识;而在需要视觉理解的 Agent Benchmark 上,相比 V4-Flash 实现大幅跃升,多模态 Agent 能力已接近 Claude Opus-4.8。
V4-Flash-Vision-Exp、V4-Flash-0731 与 Opus-4.8 的十一项基准对比表
公告给出的三个能力示例,分别是在 Agent 框架下生成一份面向高净值客户的西藏自驾游定制 PPT、对 DeepSeek Harness 官网做深海黑蓝加玻璃 UI 风格的二次创作,以及做一个黏土怪物风格的动态特效前端 Demo。
示例1:在 Agent 框架下生成商业定制西藏自驾游 PPT
- Prompt:帮我做个西藏攻略的ppt,藏南+藏北,一个月,自驾游,我是高端定制游,只做私人服务,和别的旅行团不一样,核心调性:野性、原始、探索感——不是常规打卡路线,是深入无人区级别的体验。视觉风格要大气、粗粝、有力量感,拒绝小清新和网红风。ppt要发送给高净值客户,要足够大气、野性、高端美观且最后给到三种真实定价方案,所有配图使用真实摄影图片风格(实拍质感)
示例2:对DeepSeek Harness 官网进行二次创作
要求模型用黑蓝深海、玻璃 UI 和 ASCII 原子像素等视觉要素,
经过长多轮交互后重构得到的未来主义风格开发者网站
示例3:制作黏土怪物风格动态特效的前端 Mini Demo
提示模型在“一群可爱的 3D 黏土小怪物加入一个跃动的复古舞池派对”的灵感下进行创作
我们就不过多介绍了,模型能力怎么样,大家亲自去尝试吧。
热门跟贴