一个法国公司,训了个1万亿参数的模型,取名叫“肥猫”。

Mistral Large 4,代号Le Chonk,10月6日上线,总参数1.05万亿,推理时激活490亿。最巧的是,DeepSeek V4-Pro的激活参数也是49B。一个1.05万亿,一个1.6万亿,激活参数一模一样。

这个数字撞得太准了,我怀疑Mistral在发模型的时候就是瞄着DeepSeek去的。两个模型都号称“开源权重”,但Mistral的权重到现在还没放出来。

我把两个模型跑了一遍,有些东西跟宣传的不太一样。

49B激活参数撞车,意味着什么

先解释一下MoE架构,不然聊不下去。

总参数可以理解成模型“知道多少东西”,激活参数决定它每次回答“花多少力气”。1.05万亿总参数听起来吓人,但每次推理只调动490亿个参数干活,剩下的都在旁边待命。Mistral把这叫“精细化的专家混合”。

49B激活参数决定了你每次调用的成本,1.05万亿总参数决定了模型的知识储备。 两个数字要分开看。

DeepSeek V4-Pro的总参数是1.6万亿,比Mistral多了50%。这意味着在知识密集型任务上,DeepSeek天生有优势——它“知道”的东西比Mistral多一半。

但Mistral多了一个DeepSeek没有的东西:视觉编码器,16亿参数,原生支持图片输入。文本加图片进,文本出。DeepSeek V4-Pro只支持文本。

打开网易新闻 查看精彩图片

编程是真强,但官方数据要打折扣

Mistral官方放出来的编程成绩很唬人:DeepSWE v1.1拿到61.7%,Terminal-Bench 4.0拿到28.3%,Coding Agent Index 49.8%,均高于DeepSeek V4-Pro。

但这些全是Mistral自报、还没独立复现的数字。 我翻了一下第三方评测,Artificial Analysis的Intelligence Index v4.3.2里,Mistral Large 4 Preview拿38.4分,DeepSeek V4-Pro是36.0分。总分上Mistral确实领先,但领先幅度没有官方宣传的那么大。

我拿一个真实场景测了一下:写一个带分页、搜索、数据校验的REST API。

Mistral Large 4的代码结构更干净,它会主动用最新的框架写法,比如用Pydantic做数据校验、用依赖注入管理数据库连接。DeepSeek V4-Pro写得也对,但有些地方用了偏老旧的写法。

不过在需要业务知识理解的环节,DeepSeek扳回来了。我故意在需求里加了一段模糊的业务描述,DeepSeek的理解更准确,Mistral偶尔会“过度脑补”。

Terminal-Bench 4.0的差距最悬殊——26.8%对14.1%。这个评测考的是多步骤终端操作能力,Mistral的优势接近一倍。但独立博主Thorsten Meyer实测后说了一句:“agentic和长任务别用ML4” ,因为幻觉在Agent场景里会像雪球一样越滚越大,他实测Mistral照样会编。

打开网易新闻 查看精彩图片

价格这块,两边打得很微妙

先看标价。

Mistral Large 4的标准价:输入$1.36/百万token,输出$4.18/百万token。DeepSeek V4-Pro的价格:输入$0.66/百万token,输出$1.98/百万token。

按标价算,DeepSeek的输出价格只有Mistral的一半不到。

但Mistral现在在搞促销,全打五折。 输入$0.68,输出$2.09,跟DeepSeek几乎持平了。缓存输入更便宜,$0.07/百万token。

问题是这个促销什么时候结束,Mistral没说。如果你要估算长期成本,按标价算比较稳妥。

有个数据值得注意:Artificial Analysis测出来,Mistral每个索引任务的成本是$1.13,DeepSeek是$0.67。DeepSeek每项任务便宜40%。

打开网易新闻 查看精彩图片

想用上它,三条路我都试了

第一条路最简单。打开Mistral Studio,创建API密钥,模型ID填 mistral-large-4 ,发一个Chat Completions请求就能跑。免费用户每月有$5额度,轻度测试完全够。

第二条路适合已经接了多家模型的人。OpenRouter上模型ID是 mistralai/mistral-large-4-0 ,切换只需要改一个slug。我实测用OpenRouter调它,延迟1.42秒,吞吐44 tok/s。这个速度不算快,比中位数稍好。

第三条路是自托管。走不通。 目前没有可下载的检查点,没有许可证文件,没有代码仓库。Mistral说权重月底放,但只给经过审查的合作伙伴和国家机构开放,普通人还得等。

如果你想把它配置到Claude Code里用,目前也没有官方支持。只能通过API间接调用,没法像GLM-5.3那样直接集成。

打开网易新闻 查看精彩图片

多模态和网络安全是它的王牌

我传了几张图片测试视觉能力,包括一张复杂的数据图表和一张手写笔记照片。

数据图表识别准确率很高,它能把表格里的数字提取出来并做简单分析。手写笔记差一些,潦草的字迹会认错。官方说一次能处理100张图片,我试了5张,没出问题。

网络安全是Mistral Large 4最强的维度。 Cybench得分93%,在真实漏洞复现和修复评测中拿到82%,明显优于Claude Opus 5.5和GPT-6 Astra。如果你做安全相关的开发,这个能力有实际价值。

中文理解方面,Mistral训练数据覆盖160多种语言,包括所有欧盟官方语言。我拿一段中文技术文档让它总结,准确率可以,但表达的流畅度不如DeepSeek和Kimi。写中文公众号文章的话,还是国产模型更顺手。

打开网易新闻 查看精彩图片

选谁不选谁,看你的场景

一句话总结:编程和网络安全选Mistral,知识问答和中文场景选DeepSeek。

如果你做Agent编程、安全分析、需要图片输入,Mistral Large 4在这几个方向确实有优势。Terminal-Bench上近一倍的差距不是小数字。

如果你做知识密集型任务、中文写作、成本敏感型应用,DeepSeek V4-Pro更合适。它的总参数多了50%,知识储备更厚,每项任务成本还低40%。

至于“开源权重”这件事,Mistral目前只是承诺,没有兑现。DeepSeek V4-Pro的权重现在就能从HuggingFace下载。如果你需要自托管,现在能选的还是DeepSeek。

Mistral说月底放权重,我到时候会盯着。真放了,1万亿参数的模型能在自己机器上跑,这事还挺让人兴奋的。但以目前的推理基础设施要求,普通人大概率还是用API。

Le Chonk这只肥猫,味道不错,但还没到可以随便抱回家养的程度。