打开网易新闻 查看精彩图片

来源| Tech星球

| 华卫 任雪芸

大模型圈里,几乎没有哪家像DeepSeek这样,把“调价”做成了连续剧。

2026年4月,DeepSeek V4-Pro打到2.5折;5月砍到原价的四分之一,靠极致性价比把周调用量顶到全球第一。可到了8月,剧本反转,8月17日峰谷定价正式生效,高峰时段V4-Pro输出价从6元/百万Tokens跳到27元,刷新DeepSeek史上最大提价纪录;8月23日又开始回调,把周末拉成全天低谷收费模式。

半年之间,DeepSeek从全网最便宜变成了“收割者”,价格改了四五轮。

就在这波价格调整震荡里,DeepSeek那只憋了许久的多模态“眼睛”也终于睁开了。8月21日,V4-Flash-Vision-Exp上线,把视觉能力塞进强调低成本的Flash系列。只是,这只眼睛视力还不够好:Tech星球实测,它把三位同框演员当成同一个人,把王兴兴错认成马化腾,直到风景图才勉强给出可能方位;而同样的问题,豆包几乎“一击即中”给出正确答案。

现实的矛盾在用户中被激化,一边是“价格屠夫”主动收窄低价优势,另一边是能力短板刚补就被实测打脸。

豆包、千问、Kimi 们把推理、代码、Agent、多模态的短板一块块补上,DeepSeek必须回答一个新问题:如果价格趋同,但别的产品功能够全面,凭什么还能让用户一直选择?

DeepSeek睁眼了,但“视力”不太好?

DeepSeek睁眼了,但“视力”不太好?

按照DeepSeek公布的基准测试,在需要视觉理解的 Agent Benchmark 上,
DeepSeek-V4-Flash-Vision-Exp 相比 DeepSeek-V4-Flash 实现了大幅跃升,多模态能力已经接近Claude Opus-4.8。

Tech星球实测了一波,看看 DeepSeek 更新的多模态能力到底如何?

首先是人物识别能力的对比,我们稍微上了点儿强度,发了一张三位长相气质相似的演员同框的照片。结果,DeepSeek不仅认不出来,还把三个人都当成了同一个人。

打开网易新闻 查看精彩图片

然而,同样的问题丢给豆包,得到了清晰准确的答案,并给出了三位演员的照片,甚至连演员的曾用名都标出来了。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

于是,我们决定再给DeepSeek一次机会,发送了一张同一个人物做出不同表情的图。可惜的是,DeepSeek再次“出错”,把王兴兴认成了马化腾。

打开网易新闻 查看精彩图片

反观豆包,依然给出了准确的答案,还认真分析了人物身份以及表情背后可能的原因,比如它指出王兴兴本身性格专注技术,不热衷资本仪式,甚至指出可能仅仅是抓拍角度问题。

打开网易新闻 查看精彩图片

接下来,我们决定把识别对象切换到风景,选了新疆伊犁那拉提草原网红桥一张实拍照片,看模型是否能识别出对应的景点。这次,DeepSeek虽然将正确答案说了出来,但只把其当作了可能区域之一,并未给出确定性的回答。

打开网易新闻 查看精彩图片

豆包就“一击即中”,直接给出了确定性的答案。

打开网易新闻 查看精彩图片

虽然说目前任何AI大模型都存在幻觉,但豆包一直被公认为属于幻觉率较高的一个。然而,在这次视觉理解能力的测试中,DeepSeek的幻觉也十分明显。

Tech星球先用豆包生成了一张“猫咪趴在笔记本电脑上”的图片,接着将这张明确标注“豆包AI”的图分别发给了DeepSeek和豆包,假装询问猫咪写代码的逻辑。

DeepSeek的回答虽然有趣,但显然没有发现“猫咪并不能写代码”这个事实Bug,还对着实际并不能看清的一段模糊代码屏幕,自行描绘了一套猫系程序员版的伪代码逻辑。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

豆包也是一样,存在严重幻觉。它并没有区别出在现实生活中,猫咪是根本不能写代码的,还自创了一段代码。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

更离谱的是,无论豆包还是DeepSeek都没有发现这张AI生成的图,电脑只有五行键盘,明显缺少一行,还完全按照指令去分析“猫咪到底压住了哪个键盘”。在反幻觉上,豆包和DeepSeek都存在明显不足,水平大致相当。

到了图表识别环节,DeepSeek就比较得心应手了,能够读懂收到的折线图,并能明确粉丝增长的正负,也可以通过图表进行二次计算。

打开网易新闻 查看精彩图片

不过,豆包的表现也不差,答案亦准确无疑。

打开网易新闻 查看精彩图片

对比下来,我们发现豆包在识别人物上有明显的优势,这可能因为背后抖音的数据优势有关。其他场景下,诸如图表识别,反幻觉,豆包和DeepSeek几乎处于水平相当。

在外网,DeepSeek-V4-Flash-Vision-Exp倒是收获了一些不错的评价。有开发者表示,“DeepSeek-V4-Flash-Vision-Exp 搭配 DeepSeek harness框架,简直逆天了。它碾压的那些测试,我甚至之前从没跑过。”

还有开发者将其与最近的神秘模型“牛来”(OX-Alpha)做了代码能力对比测试,结论是:从测试体验来看,OX-Alpha的参数规模应该很大,性能优势明显。

打开网易新闻 查看精彩图片

此外,有细心的网友发现,V4-Flash-Vision-Exp只在 DeepSWE 和 Agents' Last Exam 上略胜 Opus 4.8 一筹,差距很小,且在Terminal Bench、NL2Repo 和 Cybergym 等Benchmark上仍然落后。

打开网易新闻 查看精彩图片

性价比还是“王”,图片Token上限拉出40倍差距?

性价比还是“王”,图片Token上限拉出40倍差距?

DeepSeek最传奇之处,是它证明了一件此前很多人不太相信的事情:大模型可以用更低的成本做到非常高的能力水平。从R1到V4,其“便宜又能打”的标签一步步被强化。百万Token级上下文、Agent能力、代码和推理能力,再加上极低的API价格,DeepSeek一度成了开发者眼里的“性价比之王”。

然而,国内模型厂商越来越多,能力间的绝对差距正在缩小。豆包可以在内容、交互和产品体验上做得更好,千问、Kimi、元宝等都在快速补齐推理、代码、Agent、多模态等能力,海外模型则在复杂推理、工具调用和Agent等等方向持续进化。而DeepSeek还依然只是个大语音模型,和用户需求存在明显gap。

到了今天,一个正在变化的现实是:DeepSeek可能依然很强,但它已经越来越难被直接称为“老大”了。此前,DeepSeek是在向所有模型厂商发问:“你凭什么比我贵?”现在,它必须开始面对的挑战是:“如果其他家够值够全面,我为什么一定要一直选你?”

曾经靠一个模型就能横扫市场的DeepSeek,现在显然需要适应一个更新的大模型竞争时代。DeepSeek或许也意识到了这一局面,这几天,用刚刚上线的V4-Flash-Vision-Exp新补齐了多模态能力这张牌,并且坚守“性价比”。

定价上,DeepSeek-v4-flash-vision-exp 的价格与V4 Flash持平,并同样采用高峰、空闲两档计费。计费方面,图片会先按尺寸转换为token再计入用量,并没有额外增加一个明显的多模态溢价。

打开网易新闻 查看精彩图片

对比国内其他厂商,即使在高峰时段,DeepSeek依然很有“诚意”,缓存命中与否及输入输出各维度定价均显著低于豆包Seed 2.1 Pro、小米MiMo-V2-Omni、Kimi K3和阿里云的主力视觉模型Qwen-VL-Plus,尤其输出端和缓存未命中场景优势更大。

打开网易新闻 查看精彩图片

实际测试中,同样的图片,在不同厂商那里可能会被折算成完全不同的Token数量,而这直接决定了最终的账单会膨胀多少。根据Tech星球的统计,各厂商之间的差异巨大,单张图片的Token上限甚至相差超过40倍。

首先是DeepSeek V4-Flash-Vision-Exp,给出了一个极具攻击性的数字:单张图片消耗最高为 384Token。即使在高峰时段的缓存未命中情况下,单张图片最高仅0.001152元,1000张图大约只需1.15元。

对比来看,虽然豆包的视觉模型未公开具体的图片转Token算法,但此前官方给出了一个直观示例:“1元钱可处理284张720P的图片”。Kimi则采取完全不同的策略:固定计费。根据其官方文档,视觉模型每张图片的计费标准固定为1024 个Token,与图片大小或分辨率无关。

相较来说,阿里云通义千问的视觉模型采用了最为精细的折算逻辑。根据阿里云官方文档,大多数模型支持每张图片最高1600万像素,更高的分辨率会消耗更多Token:每张图片的Token数计算公式为 h x w / (32 x 32) + 2。但真正值得关注的是其Token上限,按公式推算出的理论值,单张图片最多能消耗约15624个Token。在qwen-vl-plus-0710模型的规格中,还明确标注了“单图最大16384Token数”。

打开网易新闻 查看精彩图片

此外,DeepSeek还同步上线了免费的Files API,开发者可以先把图片上传到平台,后续请求中凭file_id直接引用,同一张图片无需重复上传,能省下一笔重复传输的开销。目前,Files API 支持 JPEG、PNG、GIF 和 WebP 格式,单个文件最大支持 64 MiB,单用户最大存储空间为 25 GiB,最多可以保存 10000 个文件。

尽管涨了一波价,但如果把整个市场拉进来比较,DeepSeek仍然具有明显的成本优势。用户如果能够错峰,还可以获得更低的成本。

DeepSeek可能已经不再是那个遥遥领先的“老大”,但它显然还是牌桌上的大腕儿。从主打高频、低成本调用的V4 Flash,到面向复杂推理和高规格任务的V4 Pro,再到如今补上图像、截图和界面理解能力的V4 Flash Vision,DeepSeek V4 的产品结构正在变得更加完整。

DeepSeek被“教育”后,战略变了

DeepSeek被“教育”后,战略变了

多模态模型和DeepSeek V4 Pro发布后,DeepSeek 被“教育”了。所谓“教育”,一半来自外部,一半来自自己。

外部的测评放大了DeepSeek的多模态短板,根据Tech星球实际测评,眼下DeepSeek的视力显然还没追上它的脑力。而V4 Pro,则需要在Harness框架上才能用更好的表现,Harness的操作门槛对普通用户并不友好。Tech星球体验Harness后发现,由于Harness版本依然处于测试版,因此依然存在不少Bug,比如Prompt输入时经常不能完全显示。

V4 Pro发布前,DeepSeek提前预告了那场史无前例的涨价:8月17日峰谷定价把输入从6元拉升到27元,缓存命中输入涨幅最高达1100%,是DeepSeek发布以来幅度最大的一轮提价。

一边收窄低价优势,一边能力还被友商反超,外界自然要重新盘算:还值不值?

涨价的冲击很快显现。OpenCode Go的统计显示,涨价一周以来,DeepSeek的调用量明显下滑,首当其冲的是高频、成本敏感型开发者。

紧接着DeepSeek在8月23日把周末拉成全天低谷,用更低的价格把被劝退的需求往闲时分流。这恰恰说明,DeepSeek自己也已经意识到:补贴式低价换来的“老大”光环,正在算力稀缺与成本压力下褪色。

面对这种局面,DeepSeek做出了两个动作。

第一个动作,是补齐那块最显眼的短板“多模态”。8月21日,
Deepseek-V4Flash-Vision-Exp 上线,把视觉能力塞进以效率和低成本著称的Flash体系,且不“溢价”。同期上线的免费Files API,更让图片一次上传、凭file_id复用,进一步压低重复调用的传输与计费成本。

在大模型竞争加速的背景下,如果不愿在价格上守住,就只能在能力上进攻。Tech星球用DeepSeek做完上面五个测评后,只花费了0.14元。不过,豆包是免费的,没花钱。

打开网易新闻 查看精彩图片

第二个动作,是把“涨价”包装成资源调度。峰谷定价把工作日9:00—12:00、14:00—18:00设为高峰、价格翻倍,其余为空闲、价格减半;随后更新了“周末全天低谷”。

相当于用价格杠杆把闲时算力分配给对时延不敏感的批量任务,既缓解高峰拥堵,也给愿意错峰的开发者留出低价窗口。

大模型行业正从“低价抢客户”转向“价值定价”,曾被称为“价格屠夫”的DeepSeek收刀,某种程度上也意味着纯低价策略已难以为继。但把视觉放进便宜的 Flash线,等于用“低价多模态”重新定义性价比。

如此一来,DeepSeek的V4产品矩阵正在变完整:高频低价的V4-Flash、复杂推理的V4-Pro,再到补齐图像与界面理解的DeepSeek‑V4‑Flash‑Vision‑Exp。比起一味追求低价,它开始重新考量“能力、价格、用户需求”的平衡。

而这或许只是DeepSeek面向现实“低头”的开始。