Mistral AI把Mistral Large 4(简称ML4)放进了公开预览,同时甩出一个数字:59.9%。这个分数来自AutomationBench,覆盖657个业务流程,跑在模拟的Gmail、Google Sheets、Slack和Salesforce环境里。Mistral说,这个成绩排在Kimi K3、MiMo-V2.6-Pro和DeepSeek V4 Pro前面。

一个跑分为什么值得单独拎出来说?因为它考的不是单点问答,而是跨应用的那类活。一个流程可能是先读邮件,再改表格,顺手在聊天里通知同事,最后把信息记进客户系统。AutomationBench就是冲着这种跨应用编排去的,而不是一个孤立的提示词或单一任务。

打开网易新闻 查看精彩图片

59.9%到底说明了什么

先说清楚边界:59.9%是一个基准测试结果,不等于这套系统能在没有人工监督的情况下安全跑真实业务。那657个流程是在模拟的办公应用里完成的。真实落地会碰到不同的权限、数据格式、业务规则、异常情况,以及一旦动作做错之后的后果。

但这个基准仍然有用,因为它盯的是一个很实际的问题:把工作协调在团队本来就在用的那些应用之间——沟通的、记信息的、管客户的。Mistral把这个结果描述为面向企业场景的跨应用工作流编排上的进展,而底层能力对任何在评估AI辅助运营流程的组织都成立。

对业务团队来说,真正相关的信号不是模型能不能起草内容或回答问题,而是它能不能在一个跨多个系统的多步流程里保持上下文。这中间的差别在于:一个是建议下一步动作的助手,另一个是有可能配上适当控制、支撑更大范围工作流的系统。

和它被拿来对比的三个模型

Mistral的公告点名了三个在AutomationBench上被ML4超过的模型。公告没有给出它们各自的分数,所以这个对比不该被读成对所有工作流自动化模型或部署选项的完整排名。

这个对比有意义的地方在于,它是ML4在这项特定评测里表现不错的证据。它不能证明ML4会是每个业务流程的最佳选择。选型仍然取决于实际的工作流、涉及的系统、部署需求,以及需要多少人工复核。

换句话说,跑分领先是一件事,能不能在你的环境里跑通是另一件事。

开放权重和区域部署意味着什么

Mistral计划发布ML4的权重,这个动作在策略上很重要。开放权重的模型,能让组织在"在哪里跑、怎么跑"上有更多余地,而不是被限制在单一托管服务里。不过公告没有说明实现要求、定价、硬件需求,也没有给出权重发布计划的最终条款。

公司还提到训练数据覆盖160多种语言,以及一套端到端按欧洲法律运营的欧盟部署。这些细节让ML4对跨语言工作的组织、或者看重区域部署的组织更有相关性。但它们不能替代对具体数据处理方式和系统配置的评估。

Mistral还把智能体工作流、网络安全和知识工作任务列为ML4更广的关注方向,同时提到CyBench、AA Cyber Index、DeepSWE和Terminal Bench等基准。AutomationBench的结果是这次模型发布的一部分,但对正在探索熟悉业务软件自动化的团队来说,它格外具体。

把跑分潜力变成能跑的流程

AutomationBench给出的实际教训是:工作流自动化应该被当成一个系统来评估,而不是只看一个模型分数。在把AI模型接到运营工具上之前,团队要先弄清楚哪里自动化能创造价值,哪里必须由人来做决定。

适合早期试水的候选流程,通常有几个特征:

  • 步骤重复,横跨邮件、表格、消息或客户记录;
  • 预期结果能被清晰定义和检查;
  • 异常情况有一条可控的处理路径;
  • 有后果的动作在最终生效前,人能复核。

ML4的基准表现说明这个类别上的能力在提升,但它没有展示出与Gmail、Google Sheets、Slack或Salesforce的现成集成。基准用的是模拟应用。生产部署仍然需要相应的系统连接、权限、测试、监控和工作流设计。

跨应用的基准提升,只有在转化成可靠的生产工作流时才算数。考虑智能体自动化的企业,需要找出高价值任务,安全地接上现有工具,在需要判断的地方把人留在控制位上,并且把实现路径讲清楚。