医疗AI的竞争格局,刚刚被改写。

8月19日,xAI旗下模型Grok 4.6在医疗智能体基准测试MedAgentBench上拿下第一名,得分约95.9%。这个基准专门评估AI在真实医疗任务中的执行能力,比如处理病历、安排检查、辅助临床决策等,比单纯问答更贴近实际应用场景。

排名公布后,xAI官方账号在社交平台发文确认了这一成绩,并称这是"最有趣的真实世界医疗智能体任务基准之一"。消息发出后迅速引发关注,相关推文浏览量已接近190万

前三名竞争胶着,xAI占两席

从榜单数据看,前三名的差距并不大:

  • 第1名:Grok 4.6,得分约95.9%
  • 第2名:GPT-5.6 Sol,得分约94.7%
  • 第3名:Grok 4.5,得分约93.4%

也就是说,xAI的两代模型同时进入了前三名,且与第二名OpenAI的GPT-5.6 Sol拉开了约1.2个百分点的差距。虽然幅度不算悬殊,但在医疗这类容错率极低的场景里,任何一点性能提升都可能影响实际部署决策。

为什么医疗智能体基准值得关注

MedAgentBench之所以被业内看重,在于它考察的不是模型"知道什么",而是模型"能做什么"。传统医疗问答测试往往只要求模型给出正确答案,而智能体类基准要求模型在模拟环境中完成多步骤任务——理解患者信息、调用工具、做出判断、输出可执行结果。这更接近医生助理或临床支持系统的工作方式。

Grok 4.6在这个维度上登顶,意味着它在任务规划、工具调用和医疗知识结合方面,已经具备了较强的综合能力。对于正在探索AI辅助诊疗落地的医院和医疗科技公司来说,这类成绩是评估模型实用性的重要参考。

竞争远未结束

值得注意的是,第二名GPT-5.6 Sol的得分也达到了94.7%,与榜首仅差1.2个百分点。OpenAI在医疗AI领域的积累深厚,后续版本迭代很可能进一步缩小差距。而xAI这边,Grok 4.5和4.6两代产品同时占据前三,说明其技术路线在医疗场景中具备持续竞争力。

医疗AI的竞赛,拼的不只是模型参数,更是对真实临床需求的理解深度。Grok 4.6这次登顶是一个信号,但远不是终局。