当前,医疗行业常用的大模型评测集多来源于教科书或各类医学考试题库。此类评测集涉及的轻症和标准化病例题目多,危重症、复杂共病以及模糊疑难病例题目较少,同时还存在对医疗安全底线重视不够和真实临床诊疗场景覆盖不全等问题。

打开网易新闻 查看精彩图片

评测基准发布仪式现场 论坛会务组供图

据介绍,此次发布的MedXIAOHE评测基准为1.0版本,致力于从医生专业视角,构建医疗大模型评测标准。该评测基准立足真实的医疗病例与临床场景,从医疗安全性、疑难病例鉴别诊断能力、治疗先进性、专科多模态融合性、智能诊疗流程和真实病历鲁棒性等六大维度,对大模型进行专业考察,包含1000道专家共建题目,涵盖30个临床专科。中国工程院院士董家鸿、王宁利等院士团队,22名中华医学会和中国医师协会各学科分会主任委员和副主任委员专家,以及5家权威机构参与了评测基准研制工作。

MedXIAOHE评测基准顾问专家、中华医学会外科学分会主任委员张忠涛教授指出,在真实诊疗场景中,医疗安全尤为重要。MedXIAOHE评测基准将大模型医疗安全底线作为单独维度予以重点关注,考察大模型在禁忌证识别、用药安全、危重情况处置和误诊漏诊防控等方面的风险把控力,同时,增加了对治疗先进性的评测,考察大模型对新疗法、联合用药、序贯治疗和细分人群治疗策略的掌握程度。

中华医学会儿科学分会主任委员孙锟教授表示,MedXIAOHE评测基准尤其关注大模型的临床价值,关注真实临床病历中的信息零散、表述不规范、时间线复杂和冗余干扰等问题,着重考察大模型的信息提取、噪声过滤及不确定场景推理能力。同时,针对临床场景的连续性特点,MedXIAOHE评测基准还注重考察大模型在病史补全、诊疗路径规划、循证依据调用、多学科诊疗协同、随访安排和风险处置中的闭环构建能力。此外,评测基准还聚焦疑难复杂疾病,注重考察大模型在多病种混淆、隐匿病情和并发症干扰等场景里的临床推理能力。

会上,王宁利院士、小荷健康总裁吴海锋及来自中国康复研究中心、山东大学齐鲁第二医院、同济大学等机构的临床专家,共同启动MedXIAOHE评测基准发布暨行业共建计划。临床医生可通过项目官网(https://benchmark.xiaohe.cn)报名参与。

“我们希望吸引更多的医学专家参与医疗大模型评测基准的建立工作。未来,小荷健康将把共建成果对外开放,让MedXIAOHE评测基准成为惠及全行业的基础性平台,为建立更可信、更普惠的智慧医疗体系贡献力量。”吴海锋说。

打开网易新闻 查看精彩图片

文:夏海波

审核:李天舒 谭嘉