作者 | 熵简科技 AlphaEngine AI团队
DeepSeek 这次仍采用了熟悉的方式登场:没有发布会、没有预热,8 月 12 日深夜只把 API 文档里的版本号从 Preview 改成 DeepSeek-V4-Pro-0813,剩下的交给社区去发现。
我们 AlphaEngine 团队用自建的 IRB 投研基准,把它和 7 月底刚测过的 V4 Flash 0731 放在同一套题、同一批裁判跑了一遍。
图:AlphaEngine IRB投研能力测评结果
两句话讲完结论:
第一,投研能力的整体提升非常有限。 测评均分 88.73,Flash 0731 是 88.09,只高了 0.64 分,相对幅度 0.73%,而它的价格是 Flash 的 3 倍。
第二,Agent 能力的提升幅度很大。官方 Agent 榜单里,DeepSWE 从预览版的 12.8 冲到 62.7,涨了 390%。
(1)深度测评 V4 Pro 投研能力的真实段位
和 4 月 24 日的预览版相比,V4-Pro-0813 架构和参数量完全没变。
总参 1.6T 的 MoE,每 token 激活约 49B,1M token 上下文,最大输出 384K,CSA + HCA 的混合注意力也和预览版一致。
变化全部来自后训练的重做,这一点官方口径和 7 月底 Flash 转正时如出一辙,重点放在Agent 与工具调用能力。
为了系统化评估大模型的投研实战能力,我们在过去数年间持续收集、整理了一套"投研错题集":IRB(Investment Research Benchmark)。
目前,IRB 已成为金融投研场景的权威 AI 测评基准,涵盖财务分析、定量推理、陷阱识别等 18 个核心领域,并从相关性、有用性、流畅性、连贯性等 8 大维度进行人机双盲评分。
本次测评中,DeepSeek V4 Pro 0813 与 OPUS-4.8、Claude Fable 5、GPT 5.5、Kimi K3、V4 Flash 0731 等模型同题作答,统一评分。
V4 Pro 总得分88.72,位列第5,作为对照,V4-Pro-Preview 均分 85.42,提升幅度比较有限。
以下选取几道代表性题目,具体展示 DeepSeek V4 Pro 0813 在投研任务上的能力表现。
题目一:低轨卫星组件终局估值(考察建模纪律)
题面:考虑 ITU 组网规则,申报后 7 年内发射卫星启用资源,否则自动失效,9 年完成10%,12 年完成 50%,14 年内完成全部投放。考虑卫星平均寿命 5 年的替换需求,终局我国低轨卫星在轨数量为 5 万颗,你觉得怎么估值才合理?
Pro 0813:91.3 | Flash 0731:63.0
这道题埋了一个非常隐蔽的坑:题面给的 7/9/12/14 年时间表,看起来像需求数据,实际上是监管义务。
模型最容易犯的错,是把这四个节点直接当成需求曲线:用 14 年铺完 5 万颗去算年均发射量,再拿这个高增长阶段的量给一个成长股 PE。
Pro 0813 第一步就把这两件事切开了:ITU 的 7/9/12/14 年是建设期爬坡规则,不是终局需求。
它用 5 万颗存量除以 5 年寿命,得到稳态下每年 1 万颗的替换需求,再按单星价值量 100 万元、净利率 50%,推出稳态年收入 100 亿元、净利 50 亿元。
最后给出关键定性结论:终局是一门成熟的替换生意,所以估值锚应该落在成熟制造业的区间(15-20 倍 PE),而不是组网期的成长估值。
Flash 0731 也给出了建设期和终局两套估值,框架并不差,但它对成熟期 PE 给得明显更激进,等于把组网期的增长溢价渗进了稳态估值里。
这道题考察的不是模型会不会算 PE,而是它能否识别出题面里那些"看起来是需求、实际是约束"的信息,并且在给出结论的同时,交出结论失效的条件。
题目二:前道设备订单归因(考察叙事证伪能力)
题面:前道设备复苏已经确立,国产 EUV 传闻与存储扩产的共振,能否驱动订单超预期爆发?
Pro 0813:94.7 | Flash 0731:70.7
这道题的特殊之处在于:题面本身就是一句多头结论,这不是提问,是在诱导模型顺着往下讲。
模型最容易犯的错,是接受这个前提,然后把几件性质完全不同的事揉成一个"共振"故事,越写越顺。
Pro 0813 没有接话,而是把所谓的"订单驱动"进行拆分讨论。
可核验的订单来源包括长鑫、长存的资本开支上修和招投标。
而题目中提到的国产 EUV 整机,由于缺乏硬证据,它它明确将其标为传闻。
Flash 0731 同样没有把 EUV 当成事实,这一点它做对了。
但它在量化环节出了两处硬伤:把 85/100kwpm 误读为 85/100 万片/月,放大了约 10 倍,量化口径整体失真。
在产业研究中,识别一个叙事的证据等级是至关重要的。
(2)DeepSeek V4 Pro的短板
但这次测评也明显暴露出DeepSeek V4 Pro模型的短板和硬伤。
作为客观公平的测评者,我们挑选2道具有代表性的题目进行阐述。
题目三:国电电力估值框架(考察财务时间线校验)
题面:请为国电电力搭建估值框架:选择5家可比公司,说明 PE、PS、EV/EBITDA 等口径如何选;给出DCF增长、利润率、折现率和终值假设;分别按乐观、基准、悲观三档情景进行测算。
Pro 0813:61.0 | Flash 0731:88.7 | GPT-5.5:92.7 | Kimi K3:88.7 | Opus 4.8:87.3
这是 Pro 在本次测评中的最低分,也是最值得警惕的一道题。
先说正面的部分:它把题目要求的三件事全都做完了。
相对估值选了可比公司并说明了口径、三档情景齐备、敏感性分析也做了,从形式完整度看,这份答案几乎无可指摘。
问题出在一个数字上。
它把 2024 年转让国电建投产生的约 46 亿元一次性投资收益,塞进了 2025 年的 71.61 亿元净利润里,然后据此得出判断:"当前估值便宜只是一次性收益造成的。"
这一步的破坏力是巨大的,DCF 的起点、相对估值的分母、三档情景的中枢,全部建立在这个数字上,一步错,步步错。
题目四:磷化铟与铌酸锂(实体边界在无干扰题上失守)
题面:800G驱动下,光通信上游磷化铟和铌酸锂的需求是否会爆发?国产替代将如何加速?
Pro 0813:67.7 | Flash 0731:93.7 | GPT-5.5:94.3 | Kimi K3:93.3 | Opus 4.8:92.3
首先,绝大部分内容,V4 Pro都做对了。
磷化铟和铌酸锂的技术路线拆解完整,需求时间轴清晰,主线判断没有问题。如果在最后一段之前收尾,这会是一份合格的答案。
问题出在结尾的跟踪清单:它写进了一个叫"黑格勒"的公司,上下文里完全没有出现过。
而且它不是一笔带过,它把这家公司与云南锗业并列为磷化铟收入的跟踪主体,还给它安排了三季度的收入观察指标。
这个错误的性质需要说清楚:它不是数字算错,也不是判断偏了,而是在一份要求仅依据题内材料回答的答案里,凭空生成了一个研究对象。
对照组的收敛程度是这道题最有说服力的证据:V4 Flash、GPT-5.5、K3、Opus 4.8 四家分数落在 92.3-94.3 之间,标准差只有 0.84。
它们都老老实实把跟踪对象限定在云南锗业、通美/AXT、天通、光库等这上下文中出现过的公司。
换句话说:这道题不难,四家全对,V4 Pro 是唯一失手的。
(3)写在后面
这次DeepSeek V4 Pro正式版的能力有所提升,但表现整体略低于我们的预期。
Pro-0813 的基础动作比 Flash-0731 更扎实,尤其是日期、主体、公式、证据边界和“资料不支持就不要硬下结论”这些底层操作。
更重要的是,在一部分复杂投研题中,它已经不只做信息归纳,而会把题干叙事拆成订单、利润、技术路线与验证节点,或把碎片报告重构为可维护的研究系统。
但当题目同时整合多个公司、产品线、年份、估值口径和情景假设时,Pro 仍更容易主动把链条补完整,随之产生越界。
于是,复杂题上可能出现“框架更大、局部事实反而更不稳”的结果。
对投研从业者而言,理性做法是把 Opus 5、DeepSeek V4 Flash 继续当生产主力,等一个经得起第三方复现的 V4 Pro Pro 版本,再决定是否切换主力模型。
也可以考虑和刚发布的DeepSeek Harness结合体验下。
如果你已经是 AlphaEngine 用户,现在就可以亲自上手体验一番。
无论是AlphaEngine桌面端还是网页端,你都可以在 AlphaClaw 的模型选择界面切换至 DeepSeek V4 Flash/Pro。
还没有 AlphaEngine?登录 www.alphaengine.top 即可使用(仅限机构投资者)。
对AI投研感兴趣的朋友,欢迎扫码入群,也可以后台回复【入群】。
热门跟贴