作者 | 熵简科技 AlphaEngine AI团队

DeepSeek V4 Flash模型在7月31日终于从预览版升级为正式版。

本次模型的架构没有变化,仍然是总参数284B、推理时激活13B的MoE架构,原生支持100万Token上下文。

改变的是后训练,重点提升了模型的Agent与工具调用能力。

我们 AlphaEngine 团队第一时间用投研实战中最硬核的题目对它进行了全面测评,直接说结论:DeepSeek V4 Flash只用50分之一的成本,和海外旗舰模型几乎打成平手,拥有超高性价比

打开网易新闻 查看精彩图片

图:AlphaEngine IRB投研能力测评结果

我们先看一下测评结果,最后我会说说DeepSeek V4 Flash 0731模型对AI产业发展的重要意义。

(1)深度测评 V4 Flash 投研能力的真实段位

为了系统化评估大模型的投研实战能力,我们在过去数年间持续收集、整理了一套"投研错题集":IRB(Investment Research Benchmark)。

目前,IRB 已成为金融投研场景的权威 AI 测评基准,涵盖财务分析、定量推理、陷阱识别等 18 个核心领域,并从相关性、有用性、流畅性、连贯性等 8 大维度进行人机双盲评分。

打开网易新闻 查看精彩图片

本次测评中,DeepSeek V4 Flash 0731 与 OPUS-4.8、Claude Fable 5、GPT 5.5、Kimi K3 等模型同题作答,统一评分。

V4 Flash 总得分88.09,位列第5,仅次于Claude Opus 4.8(得分89.02)。作为对照,V4-Pro-Preview 均分 85.42,位列第 9。

值得注意的是,实测下来V4 Flash单任务花费仅0.06元,Opus 4.8为2.95元、Fable 5约8.40元。

换句话说,用海外旗舰模型Opus 4.8跑一个投研任务的费用,可以拿来用V4 Flash跑50个任务,二者回答结果相差不多。

打开网易新闻 查看精彩图片

图:IRB 8大维度测评比分

以下选取 3 道代表性题目,具体展示 DeepSeek V4 Flash 在投研任务上的能力表现。

题目一:博俊科技未来业绩增速(考察准确归因能力)

题面:拆分博俊科技过去收入和利润的增长来源,未来增速能否维持?小米等主机厂自建工厂有何影响?

面对一家过去三年高速增长的公司,模型最容易犯的错是把历史增速当成未来假设,进行线性外推。

Flash 0731首先把增长拆成两个来源:客户车型放量,以及从冲压件向白车身总成、一体化压铸延伸带来的 ASP 提升。

紧接着,它没有沿用旧增速做外推,而是把"全年增速能否维持"落到四个具体约束:压铸能否量产、新工厂爬坡进度、年降谈判结果、新增产能的折旧压力。

对"小米自建工厂"这个市场关注点,它的处理同样克制,明确指出公司并非小米的直接供应商,而是通过 Tier1 间接供货,随后再用 9100 吨压铸机、72 个零件合并为 1 个、840 个焊点减少这些事实,把它定性为中期的内制化示范风险,而不是渲染成当期收入冲击。

K3 与 Opus 4.8 的判断方向基本一致,都没有把小米内制化夸大成即时利空,而是把风险落在压铸放量、客户车型和折旧上。

在投研判断中,准确的归因是一切的起点。

这道题考察的不是模型能否算出增速,而是看模型能否做出正确的假设,并根据现实情况来调整或证伪原先的判断。

题目二:PCB 钻针需求测算(考察建模纪律)

题面:鼎泰高科的业绩测算是怎么推导的?比如假设AI机柜装机量为60GW,大概对应当年多少PCB钻针需求?钻针的供求关系如何?

这是产业链测算的硬题,要求把终端算力需求,一层层折算到上游耗材的利润。

Flash 0731(89.7 分) 重建了完整测算链:机柜出货量 → 单柜等价 PCB 板数与孔数 → 单针寿命 → 针型拆分 → 销量 × ASP × 净利率。

它分别推算出GB200、GB300 和 Rubin NVL144 的单柜耗针量,并解释了 Rubin 相对 GB300 价值量大幅上升的原因。

更关键的是对"60GW"的处理,V4 Flash没有把这个数字伪装成已知事实,而是说明缺少现成口径、给出推导框架、列出需要确认的关键参数。

在投研工作中,遵守建模纪律很重要。对于未知参数要做到诚实标注,而不能直接藏进假设中。

题目三:昇腾950超节点AI集群(考察错误假设识别)

题面:华为在西班牙推出支持浸没式液冷的昇腾950超节点AI集群,这对浸没式液冷行业有什么意义?这一环节最受益的公司有哪些?

这道题的陷阱不在答案里,而在问题本身。

提问预设了"昇腾 950 采用浸没式液冷",而这个前提未必成立。

这是投研场景里最高频的一类风险。

有时用户会带着一个道听途说的技术判断来提问,模型如果直接顺着往下答,输出会显得非常专业,但整篇建立在一个错误的事实基座上,越流畅越有害

Flash 0731 没有接受这个前提。

它从上下文定位到 950 的真实架构是“全液冷机柜 + NPU 独立冷板”,也就是冷板式,而非浸没式。

纠正之后,它才给出受益环节分层、订单兑现催化剂,以及可证伪条件,而不是把一串液冷公司罗列出来了事。

相比之下,其他模型有些没有识别出了 950 并非浸没式;有些识别出来后,纠正完就把它放下了。结果是当前技术事实与远期产业假设被压在同一层里,读者无法分辨哪部分是已发生的、哪部分是模型的推演。

(2)DeepSeek V4 Flash的核心短板

一份真诚的测评不应只讲优势,DeepSeek V4 Flash并非完美。

在一些题目上,V4 Flash的得分明显低于K3以及Opus 4.8,并且这些错误存在一定共性,我们来看这两道题。

题目四:市场回调复盘(考察时间确认及未来信息剔除)

题面:今天 11 月 21 日 A 股大跌,昨天美股跌,今天黄金、商品、中国国债也在跌。看似是流动性问题,有更具体的归因吗?

V4 Flash在这道题目上马失前蹄,只得了27.3分。

题目锁定 2025 年 11 月 21 日,但 Flash 整篇以 2026 年 6 月为时间锚:用"美国 5 月非农 17.2 万人"、"10 年美债 4.52%"、"6 月 8 日上证 -1.7%"搭建归因链,并据此建议止盈 AI 链、转向银行。

触发因素、行情数据、配置建议全部脱靶,而它的论证结构其实是通顺的,这才是最危险的地方。

相比之下,K3(93.0 分)的做法是以延迟公布的 9 月非农、12 月降息预期下降、AI 拥挤交易去杠杆解释跨资产同跌。

投研复盘的第一步不是补全宏观叙事,而是确认时间点并剔除未来信息,不然就算逻辑链条再通顺也是零分

题目五:泡泡玛特终局测算(考察实体去重)

题面:请通过IP数量和单个IP的体量,测算泡泡玛特终局的收入和利润。

这题的失分方式很有代表性:Flash 的输出形态几乎是完美的,乍一看交付了一份很专业的测算报告,但遗憾的是,V4 Flash犯了两个关键错误。

首先,实体没有去重。V4 Flash把"星星人"和 Twinkle Twinkle 计成了两个独立 IP,而这本是同一个对象。

第二,口径混用。它在同一条验证链里同时使用了不同币种的可比公司收入。这些数字各自都成立,但不可放在一起交叉验证。

相比之下,K3(88.3 分) 先建立层级矩阵,超级 IP、头部 IP、腰部 IP、长尾授权分开处理,明确把 THE MONSTERS 与星星人列为不同对象,并把净利率假设单独列出而不是埋在计算里。

Opus 4.8(90.0 分) 则以有效 IP 数量与单 IP 收入分层,同时把商业模式差异作为可比性的校验条件。

一个错误的分类可能会使得测算结果成倍放大,而完整漂亮的情景分析表又会掩盖这个错误

(3)V4 Flash的正确用法

过去两年,投研选模型几乎不用犹豫:挑最贵的那个就对了。

因为旗舰和非旗舰之间存在代际差,差的不是几分,而是"能不能用",既然如此,token 贵几十倍也只能捏着鼻子用。

这次对V4 Flash的测评显示,模型之间的代际差正在松动。

V4 Flash 均分 88.09、位列第 5,很多题目上与 K3、Opus 4.8 只差 1-2 分。

在专业投研任务上,它明显越过了"可用"这条线。虽然性能差距依然存在,但不再是云泥之别。

从今往后,正确的使用方法是分层调用:少数难题用旗舰模型,多数普通任务用效率模型。

毕竟问一次Opus 4.8的成本,够你用V4 Flash问50次了。

(4)比模型跑分结果更重要的几件事

最后我想说几个比测评结果更重要的判断。

判断1:后训练的价值远比你想象的更大。

V4 Flash这次只是在原模型的基础上加强了后训练,就在投研这种高难度场景把均分推到 88.09、挤进前 5,同时把成本压到第一梯队的几十分之一。

与4月24日发布的DeepSeek V4 Pro Preview相比,V4 Flash的参数体量仅是它的不到20%,但能力评分大幅领先,这充分说明了后训练的价值。

在算力不占优的条件下,中国AI公司把"效率"这条路走出了纵深。

那么当算力约束松开的时候会发生什么?今天积累的效率优化不会因为算力变宽裕而作废,它会成为模型能力的乘数

DeepSeek V4 Pro正式版即将在8月上线,可以预见的是其能力将得到进一步提升。

判断2:AGI应该像空气和水一样无处不在。

在通往AGI的道路上,中美的顶级AI公司走出了两条截然不同的道路。

Anthropic第一时间把Mythos模型锁进受控场景,不向公众开放,同时价格水涨船高,让用户望而却步。

相比之下,Kimi和DeepSeek则开源了模型权重以及技术报告,任何人都可以下载、部署、调用。

与此同时,中国AI公司通过算法优化,大幅降低了模型的推理成本,虽然对全球资本市场造成了一定冲击,但是对AI产业的长期发展而言,绝对是一剂良药。

KK 有一个观点我非常认同:最好的技术往往都是“隐形”的

我们每天都在接触大量科技产物,无论是电灯、风扇、还是手机、导航。我们意识不到这些科技的存在,这恰恰意味着这些技术已经成功了。

我相信未来AI也将经历从“显形”技术逐渐走向“隐形”的过程,非常重要且无处不在,成为每个人生活中的一部分。

判断3:中国有较大概率成为这轮AI革命中的全球领导者。

回到第一性原理,AI长期比拼的是三件事:模型、芯片、能源。我们一项一项来看。

模型的背后,比拼的是人才、数据和算力。

在人才方面,中国有着得天独厚的优势:庞大的人口基数、普及的数理教育、有效的人才选拔体系,以至于硅谷都自嘲说,中美的AI竞争本质上是同一个人才池披着两件外衣在竞争

在能源方面,中国的发电量位居全球第一,约等于美国、欧盟、印度之和,并且还在持续增长。

当美国要求AI企业签署自主供电协议的时候,中国可以大力推进AI新基建。

打开网易新闻 查看精彩图片

图:2025年各国发电量统计,AlphaEngine

归根到底,中国AI产业当前的主要瓶颈在算力上。

硬件技术的积累迭代周期天然要比软件长,但在强大的市场需求驱动以及扎实的制造业基础支持下,相信算力瓶颈的突破只是时间问题。

届时中国完全有机会成为这轮AI革命的全球领导者。

(5)立即体验 DeepSeek V4 Flash 带来的全新 AI 投研体验

如果你已经是 AlphaEngine 用户,现在就可以亲身体验 DeepSeek V4 Flash 带来的极致性价比。

无论是AlphaEngine桌面端还是网页端,你都可以在 AlphaClaw 的模型选择界面切换至 DeepSeek V4 Flash。

打开网易新闻 查看精彩图片

你也可以绑定微信,这样就可以随时随地通过微信来和V4 Flash交流了。

还没有 AlphaEngine?登录 www.alphaengine.top 即可使用(仅限机构投资者)。

对AI投研感兴趣的朋友,欢迎扫码入群,也可以后台回复【入群】。

打开网易新闻 查看精彩图片