最近我写了很多关于Harness 相关,尤其对 Pi 情有独钟,DeepSeek Harness 还不够稳定,体验也没太惊艳,我会再等等看其发展情况
之前我把 Pi + DeepSeek-V4-Flash + 多模态作为底座,中间遇到某些任务还需要切换模型
因为 DeepSeek-V4-Flash 它不是多模态
比如下面这个极简单的图 DeepSeek 都识别不了:
现在 DeepSeek 也出了多模态大模型,配上 deepseek-v4-flash-vision-exp 之后,那就毫无问题了
而且,它真的好快,输出速度我甚至满意
关键是 deepseek-v4-flash-vision-exp 在文本能力上与 DeepSeek-V4-Flash 相当,包括代理、推理和世界知识。在多模态代理基准测试中,V4-Flash-Vision-Exp 相比 V4-Flash 实现了重大飞跃,将多模态代理性能提升至接近 Opus-4.8 的水平
现在我已经不需要频繁切换模型了,deepseek-v4-flash-vision-exp 这个兼顾文本和多模态的模型就很棒
我爬了一下 DeepSeek 放出的这四个 Benchmark
ApexBench 主要考察长流程任务规划、跨应用与多工具协同,以及最终的专业工作交付能力
Agents’ Last Exam 更偏真实世界的专业工作能力,考察跨行业长周期任务执行、行业知识与推理、多步规划,以及最终结果是否满足可验证的成功条件
Chartography 专门测试复杂专业图表理解,包括 K 线、桑基图、等高线、Bode 图、Kaplan-Meier 生存曲线等,不只是识别图表元素,还要结合领域知识解释含义,并进行多步图形推理
ZeroBench 则更接近“极难看图解题”,重点考察多步视觉推理、空间理解、数学计算和复杂问题求解
这四个榜单上,deepseek-v4-flash-vision-exp 不是顶尖,却在成本与能力上达到了不错的平衡
我看很多人拿梁文锋本锋的照片测试 deepseek-v4-flash-vision-exp ,结论是它不行,这有点偏颇了,梁叔叔本身在互联网上就只有两张照片,如果不动用联网搜图,几乎所有多模态大模型都很难Hold住这个测试
我拿 DeepSeek 的PPT提示词来做实测
某多模态大模型表现如下
deepseek-v4-flash-vision-exp 表现如下
这俩模型生成的 PPT 都可二次编辑,这就很赞
然后我找了 GPT-5.6-Sol 给它们打分
综合评分:DPSK 8.0 分,某模型 7.4 分。
DPSK 版更符合高净值客户需要的私人远征感。黑金配色、大片留白、阿里与羌塘叙事都更大气、更野、更有力量。30天行程拆到了每一天,保障团队和三档服务也讲得更清楚。
某模型的版本实拍感更强,图片更丰富,“六个独家时刻”和食宿介绍写得很好。整体气场弱一档,更接近高端小团宣传册,部分照片质量不统一;2025年档期与报价已经过期,三档方案的人数和车辆标准也有矛盾。
有了视力的鲸鱼做任务的过程中它会不断审视输出的结果,逐页另存为png看是否有问题
比如它发现: 第 13–17 页(行程页和定价页) 存在 5 个设计问题:卡片内容溢出、与页脚重叠、底部行被截断、多余卡片延伸到幻灯片外;第 13 页的 D10 行程行因「双列 7 项」布局的末行超出幻灯片而被截断;第 14、15 页内容与页脚重叠
整个过程:发现问题 → 数学计算定位根因 → 调整参数 → 复验 → 发现新问题 → 再修正,循环多轮。其中第 17 页经历了至少 4 轮参数返工,说明这个模型的自我校验比较严格(会主动推翻自己之前"已确认"的参数),但单次参数确认的准确性还有波动。
直到输出满意的结果
为何它还是我的备选呢,DeepSeek 放出的还是实验性质的模型
我还实测了几个稍微复杂的任务,它的表现还差点意思,远不如GPT-Sol@Codex
热门跟贴