这两天霸屏的,清一色是多模态模型。
先是 Ox Alpha(牛来模型)上周四晚匿名空降,紧接着 DeepSeek 又发布 DeepSeek-V4-Flash-Vision-Exp。
先说"牛来"。它能免费使用到8月27日,默认 100 万 Token 上下文,支持图片和视频输入。虽然匿名,但大多线索已经指向智谱。
这头牛跑得也确实快。
截至8月23日下午,OpenCode 统计页已记录约 13 万亿 Token、19.5 万名独立用户、近 400 万个已完成 Session,在过去一周模型用量排第二。
再看 DeepSeek-V4-Flash-Vision-Exp。它给以文本、推理能力见长的 V4 Flash 接上了图片理解。虽然后缀是实验版本的意思,但也是 DSH 社区狂装多模态理解插件之后,官方的首次行为回应。
据我了解,近期除了这两家,还会有其他主打多模态能力的模型上新。
既然混战在即,我趁这个周末把牛来和 DeepSeek 的新模型扔进了几组任务实测 —— 让它们 Battle 是一方面,后面新选手上场了,也好有个比较基准。
掰头 Round 1:看图识大佬
第一轮先上个猛料,让这俩模型认一下现在国内最出名的两个企业家。
一句话 Prompt:
图中有两个人,分别说出他们是谁。
结果,DeepSeek 要认出自己老板真有点困难。
第一次,它说图中是“王小川|百川智能,刘庆峰|科大讯分”,一个都没猜对。
我不信邪又问了一次。这次答案有质的飞跃,变成了“张一鸣|字节跳动,杨植麟|月之暗面”。猜对了张一鸣,但把自己家老板换了。
最后一遍,它答图 A 是王小川|百川智能,图 B 是印奇|旷视科技。把上轮的半对半错改成了全错❌。
我扒了它的错题记录,发现这推理过程确实很费劲 —— 要搜索人物背景板上的字再做排除法。
候选 list 里还出现了王慧文。那他为啥被排除了呢?因为 DeepSeek 认为他“更胖”。
只有老王受伤的世界达成了。
再看牛来。
牛来这个模型有点脾气。面对这个问题,它连续两次拒绝回答。问到第三次也就是最后一次,它才开始认真思考。
不过思考起来的牛来还是很牛的,想了一下子就给出了正确答案”张一鸣|字节跳动,梁文锋|深度求索”。
掰头 Round 2:做个精致滴小游戏
第二次比拼,让它俩做小游戏。
别看这考试类型传统,但这次的考题是让梁圣/梁子大战海外基模,对模型 Logo 和梁文锋形象的正确使用,以及游戏执行的丝滑度都有要求。
先准备好Q版梁圣和三个版本的模型怪兽素材,再加上酷酷的模型封面图当作风格参考。这步还是来自亲爱的 ChatGPT。
然后是Prompt:
游戏整体呈现像素风。图三为游戏的标题图。先看DeepSeek-V4-Flash-Vision-Exp的交作业过程。
它这个任务做了大约 22 分钟,交付了一个 html 文件,中间自己修了几轮 bug。我看推理过程,镜头不跟随人物移动这个 bug,它反复修了几次。
可惜第一次我打开 html 文件后发现是个黑屏,啥画面都没的,只能让它接着修。
第二次交作业,它只用了9分钟多。
坦白说完成度还算不错,人物操控、攻击、怪物刷新、过关机制、动画这些都有覆盖到,风格也对上了我给的参考图。
仔细看的话,标题页有点错位、人物攻击动画有点裁剪,其他没发现什么明显 bug。
*封面元素错位
接着是 Ox-Alpha。
它的制作过程真有点一言难尽。就这个不算复杂的任务,居然全程耗时 5 个小时。我有次等待了1小时多,API 就直接报错、任务自己停止。
我看社区里也一直在说“为什么又卡死了”,可能是体验入口适配度的问题。但这个模型自己也有过度推理的情况,反复思考没个节制。
从晚上搞到凌晨,我终于等到了姗姗来迟的牛崽。
这个效果还是超过了 DeepSeek。不仅游戏节奏更紧凑,玩法也更丰富,打一个模型需要来回打几拳,比较符合近期行业的实际情况。
UI 设计牛来也赢了,不仅画质更清晰、人物贴图更完整、关卡终点的设计也更精致。它还加了小巧思,在游戏的背景画面里放了一只飘着的蓝色鲸鱼。
*上DeepSeek,下牛来
我还额外出了一道题,让它们做一个用石头打中城堡后面砖块的游戏。
不过或许是因为这个游戏的要求比较高,需要模型模型物理规律,还得UI友好。结果牛来和 DeepSeek 双双扑街。
牛来这个版本,石头和发射装置直接扔到城堡相反方向去了。玩这个游戏,这辈子都赢不了。
*右下角能看到城堡
DeepSeek 更拉垮,直接没输出可用版本,就不放了。
掰头 Round 3:识别漫画顺序
最后一轮,来个轻松的...(其实是牛来做游戏太慢我熬不动了
我传了张乱序漫画图,让两个模型识别并排列出符合逻辑的故事顺序。
你需要根据故事情节和逻辑,进行正确的排序
DeepSeek 只用 14 秒就完成了任务,给出正确排序后,还加了完整剧情线解释
牛来的输出很高冷,无废话,只给了4个字母的顺序。不过也是正确的,用时38秒。
这波测完,两个模型的大部分特点已经比较清楚了。
如果只看效果,牛来明显更稳。视觉理解它给出正确答案的概率更高。DeepSeek-V4-Flash-Vision-Exp 偶尔会陷入一些奇怪推理。交付物的精细程度,也是牛来更好。
但这还不是最终结论,毕竟牛来现在还没被官方认领,API 定价和综合服务质量也是个盲盒。现在梁氏变祖器到底滑在了梁圣、梁子还是梁祖,还得看对手。
热门跟贴