打开网易新闻 查看精彩图片

这项由西安交通大学生命科学与技术学院、数学与统计学院联合开展的研究,发表于2026年的《Machine Learning for Biomedical Imaging》期刊(MICCAI Open Data 2026 × MELBA专题),数据资源DOI为10.7303/SYN75210889,论文编号为arXiv:2607.22135。

**脑部MRI的"登记册"出了什么问题?**

医生在给脑部做核磁共振检查时,面对的是一张密密麻麻的灰白图像。对于患有脑胶质瘤(一种常见的脑部恶性肿瘤)的病人来说,影像里不只有一个"敌人"——除了主角"肿瘤",还可能藏着许多"配角"异常,其中最常见的一种叫做白质高信号(White Matter Hyperintensities,简称WMH)。

白质高信号这个名字听起来很陌生,但可以用一个简单的类比来理解:把健康的大脑白质比作一张洁白的宣纸,白质高信号就是宣纸上出现的一些浅黄色污渍——它们不是主体画作,却真实存在,而且相当常见。美国加州大学的Rudie研究团队曾对285例脑胶质瘤病人的核磁共振数据进行专家级标注,发现其中高达68.8%的病人脑内含有至少100立方毫米的白质高信号。换句话说,超过三分之二的胶质瘤病人脑里,除了肿瘤之外,还有这种"污渍"存在。

然而问题来了:现有的最权威脑胶质瘤MRI数据集——BraTS(Brain Tumor Segmentation,脑肿瘤分割挑战赛)——在给病灶打标签时,只给肿瘤本身建立了"户籍",那些白质高信号"黑户"既没有被标记为异常,也没有被标记为正常组织,它们就这样被默默归入了"正常大脑"的行列。

这就产生了一个严重的隐患。当工程师用这些数据训练人工智能模型,让模型学会区分"正常大脑组织"和"病变区域"时,模型会反复看到这样的"错误示例":明明是病变区域,却被贴上了"正常"的标签。就好像你在教一个孩子认识食物,把变质的牛奶放进"新鲜食品"那一堆,孩子当然会学错。这种现象在机器学习领域被称为"标签噪声"——标签打错了,模型就会学歪。

西安交通大学的研究团队正是为了解决这个问题,构建了一套名为GLI-AL(BraTS-GLI Anatomy-Lesion,胶质瘤解剖-病灶联合标签资源)的全新数据资源。这份资源的核心思想,用一句话概括就是:给脑部MRI里的每一个区域都发一张准确的"身份证",不论它是健康的神经组织、主要的肿瘤,还是那些长期被忽视的"隐形病灶"。

一、为什么以前的"档案系统"不够用?

回到档案馆的比喻。BraTS数据集就像是一座只为某类居民建档的户籍系统:它只给肿瘤的三个子区域——坏死核心(NCR,肿瘤中心坏死部分)、瘤周水肿(ED,肿瘤周围肿胀的区域)和增强型肿瘤(ET,在造影剂下会发亮的活跃肿瘤部分)——颁发了"身份证"。但对于大脑里的其他居民,不管是健康的灰质、白质、小脑,还是那些白质高信号,统统没有档案记录。

这带来了两层麻烦。第一层是在"联合分割"任务中。所谓联合分割,就是让模型同时识别健康大脑组织和病变区域。这就像要求一个工人同时管理仓库的所有货物,不只是那批"标注好的名牌货",还要管理那些没有标签的零散物品。当训练数据里,白质高信号这种"有问题的货物"被混进了"正常货物"堆里,工人(模型)当然会产生混淆。

第二层则更基础:健康的大脑组织本身,在原始BraTS标签里根本就不存在。大脑里的灰质(负责思考的神经元细胞体集中的区域)、白质(连接神经元的纤维束)、基底节(控制运动协调的核团)、脑室(充满脑脊液的腔室)、小脑和脑干,这些结构在原始BraTS标签中都是一片空白。这意味着,任何希望训练模型同时理解"这里是正常组织,那里是肿瘤"的研究者,都缺乏现成可用的标准参考。

目前的各类工具和数据集,要么像FreeSurfer或SynthSeg这样能生成健康组织标签,却不处理病灶;要么像BraTS本身只关注肿瘤;要么像SOOP卒中数据集只标注卒中病灶。没有任何一个公开可用的资源,能把健康组织标签、主要病灶标签、共存病灶标签和有据可查的病例分层信息,全部整合在同一套标签体系里——直到GLI-AL的出现。

二、GLI-AL到底是什么,它长什么样子?

GLI-AL可以理解为BraTS 2023-GLI数据集的一套"升级版标注"。研究团队没有重新采集任何MRI图像——他们只是为已有的1251例四模态脑胶质瘤MRI(T1、T1ce、T2、T2-FLAIR四种不同的核磁共振成像方式),重新制作了一套更完整、更准确的标签。

这套标签使用8个整数代码来描述每一个体素(体素就是三维图像里最小的方块单元,类比于二维图片里的像素)的身份。代码0代表背景(颅骨外的空气区域),代码1是皮质灰质,代码2是基底节,代码3是白质,代码4是病灶(包含肿瘤和白质高信号),代码5是脑室,代码6是小脑,代码7是脑干。这样一来,无论是健康的神经组织,还是各种类型的病变,都能在同一套坐标系里找到自己的位置,模型训练时再也不需要在互不兼容的标签定义之间来回切换。

整个资源包含1367个NIfTI格式(一种医学影像的标准文件格式)的标签文件,其中1251个是统一的解剖-病灶分割标签,另有116个是用于图像修复的辅助标签。标签文件与上游BraTS数据集的目录结构完全兼容,使用相同的坐标系(SRI24模板空间,1立方毫米分辨率,240×240×155体素尺寸),研究者获取上游MRI数据后,无需任何额外的配准或重采样操作,就能直接配对使用。

从数量上感受一下这套资源到底增加了多少信息:与原始BraTS-GLI的专家病灶标注相比,GLI-AL为全部1251例病例都新增了前景标签,新增体素总数高达15.13亿个,占整个资源前景体素的92.7%。其中绝大部分是此前从未出现在BraTS标签里的健康组织结构——灰质新增6.856亿体素,白质新增5.183亿体素,小脑新增1.763亿体素,以此类推。此外,专门针对标签噪声问题的病灶区域新增量虽然相对较小,却最为关键:857个病例中新增了220万个病灶体素,这些体素原本被错误地当作正常组织处理,现在终于得到了正确的"病灶"标签。

三、1251份"档案"是怎么分门别类的?

研究团队将1251个病例分为两个子集,区分标准是病例里的白质高信号是否已经得到了妥善处理。

394个病例构成"纯化子集"(Purified Subset),这是资源中质量最高的部分。纯化子集的构建思路是这样的:首先,从Rudie团队此前专家标注的285例BraTS病例里,找出那52例被专家明确确认"不含白质高信号"的病例,这是最可靠的清白记录。接着,研究团队将其余的病例用一个叫MedNeXt的深度学习模型进行筛查,MedNeXt是一种专门用于医学图像分割的神经网络。模型被训练来识别白质高信号,然后在那些没有专家结论的病例里寻找"高度可信的无白质高信号"案例,最终筛出342个模型认为安全的病例。52个专家确认的加上342个模型筛选出的,合计394例,构成纯化子集。

这里有一个精细的技术处理值得一提:那285例有专家WMH标注的病例中,有233例被专家确认含有白质高信号。在把这些病例纳入筛查流程之前,研究团队用了一个叫NiftySeg的工具,在MRI图像里原位"填补"白质高信号区域,用周围正常组织的信号值把那些"污渍"覆盖掉,相当于对图像做了一次"美颜修复"。这116个经过修复的病例,同时提供了专门的修复标签,方便后来者重现修复后的图像。

余下的857个病例构成"扩展子集"(Extended Subset)。这些病例的原始MRI图像保持不动,但研究团队用两个专门检测白质高信号的自动化工具——DeepWMH和LST-AI——分别生成候选病灶掩膜,然后取两者的交集(也就是两个工具都认为是病灶的区域),再与BraTS原有的肿瘤标签合并,形成统一的病灶标签。取交集的目的是降低任何单一工具的误报率:只有两个工具都同意"这里有病灶",才会被正式纳入标签。

四、健康组织的标签是怎么炼出来的?

给健康的大脑组织打标签,本身也是一项相当精密的工程。研究团队使用了一个名叫TumorSynth(由Wu等人开发,发表于2026年《Radiology: Imaging Cancer》期刊)的工具,它能够在含有肿瘤的脑部MRI中同时分割正常组织和肿瘤区域。对于每个病例的每种MRI模态(T1、T1ce、T2、T2-FLAIR),TumorSynth都会输出一个"概率地图"——也就是对每个体素属于哪类组织的概率估计。

但仅有概率地图还不够,还需要一套聪明的融合策略把四种模态的信息合并成一个最终标签。研究团队采用了基于"熵加权"的融合方案,熵在这里是信息论里衡量不确定性的指标——模型对某个体素的分类越确定,熵就越低;越拿不准,熵就越高。

具体的融合过程可以这样理解:把四张不同颜色滤镜拍出的照片叠加成一张。对于每个体素,先检查它是否属于已知病灶区域(也就是BraTS原有的肿瘤标注或者DeepWMH/LST-AI检测到的白质高信号)。如果是病灶体素,就强制标记为"病灶"类别,不允许被标为健康组织。如果不是病灶体素,那么对每种模态的概率预测,先计算它的不确定性(熵),不确定性越低的模态,在融合时获得越高的权重,越不确定的模态,话语权越小。最后,加权平均后取概率最高的类别作为最终标签。

这个流程还有一道质检关卡:在对全部病例运行TumorSynth之后,研究团队统计了每种模态在每个病例里预测到的前景体素总量。用统计学里的IQR(四分位距)方法检测异常值——前景体素量远低于正常水平的预测结果会被标记为异常,经人工复核后剔除出融合流程,防止质量很差的预测拖累最终标签的准确性。

五、这份资源经过了哪些质量把关?

研究团队对质量控制设置了四道防线,从数据构建到发布存档层层把关。

第一道防线是对纯化子集的严格筛选。纯化子集里的专家确认无WMH样本来自Rudie数据集里白质高信号体积严格为零的病例,这是最硬核的质量保证;而模型筛选部分则依赖于在285例专家标注数据上训练的五折交叉验证MedNeXt,只有被模型高度自信地判断为无WMH的病例才能进入纯化子集。

第二道防线是对扩展子集病灶标签的双重验证。取DeepWMH和LST-AI两个工具预测结果的交集,相当于要求两位独立"医生"都同意某区域是病变,才会被收录,比单一工具的结果更保守、更可靠。

第三道防线是健康组织标签的IQR异常检测和人工复核,确保质量低劣的概率地图不会污染最终标签。

第四道防线是发布前的完整性校验。所有1251例病例的标签文件都经过了逐文件的SHA-256哈希校验(一种用于验证文件内容未被篡改的加密指纹),发布清单里记录了每个文件的大小和哈希值。最终1251/1251例全部通过,1367个NIfTI文件全部进入发布清单,重新分发的MRI图像数量为零(这份资源严格只发布标签,不含任何原始影像数据)。

六、训练实验结果说明了什么?

有了这套资源,研究团队设计了一个受控的机器学习实验,目的是回答一个实际问题:在联合解剖-病灶分割任务里,额外花精力构建一个"纯化干净"的子集,究竟有没有必要?还是说直接用更多(但含有噪声)的训练数据,效果会更好?

实验设置了两组对比:第一组叫"Baseline"(基线),只用394例纯化子集进行训练;第二组叫"Joint-Baseline"(联合基线),用1000例训练数据,包括394例纯化子集加上从扩展子集随机选取的606例,但这606例扩展子集数据没有额外加入共存病灶标签(模拟"噪声训练"的情况)。两组都使用MedNeXt-M模型,T1和T2-FLAIR两种模态作为输入。

评估指标有两个:DSC(Dice相似系数,衡量预测区域和参考区域的重叠程度,越高越好,满分1.0)和HD95(95百分位豪斯多夫距离,衡量预测边界与参考边界之间的距离,越小越好)。

在GLI域内测试(251例胶质瘤病例)中,两组模型的健康组织分割性能非常接近:灰质DSC约96%,白质DSC约96%,小脑DSC约98%,脑干DSC约97%。这说明,即使只用394例高质量数据,模型学到的健康组织分割能力并不比用2.5倍数据训练的模型差多少。换句话说,"质量"在这里胜过了"数量"。

病灶分割上,两组DSC也很接近(约90%),但Joint-Baseline的HD95(18.9毫米)明显高于Baseline(15.7毫米),且标准差更大(30.1 vs 18.5)。这意味着Joint-Baseline在处理那些远离主肿瘤、体积较小的白质高信号时更容易出错,边界定位更不稳定。

更具说服力的结果来自外部零样本测试——把两个模型直接用在从未见过的MICCAI 2017白质高信号数据集(170例)上,测试它们对白质高信号的检测能力。结果出现了显著的分歧:Baseline的白质高信号DSC为31.1%,HD95为140.4毫米;而Joint-Baseline的白质高信号DSC骤降至4.3%,HD95高达297.5毫米,几乎对白质高信号完全没有响应。两组模型在健康组织类别上的表现依然相近,但在白质高信号检测上,含噪声训练数据的Joint-Baseline几乎失去了感知能力。

可视化结果与数字完全一致:在胶质瘤样本里,两个模型都能覆盖主肿瘤区域,差异主要体现在对隐性白质高信号的处理上;在白质高信号测试样本里,Baseline能检测出与参考标注对应的病变区域,而Joint-Baseline对这些区域几乎没有任何响应。

这个实验回答了资源的核心价值所在:纯化子集提供了一个经过白质高信号感知清洗的训练参考,帮助研究者区分"数据质量"和"样本数量"对共存病灶敏感性的各自贡献,而这个区分在只有噪声性更强的训练集时是做不到的。

七、这份资源有哪些已知局限,又该如何负责任地使用?

任何诚实的科学工作都需要坦诚地说明自己的边界。研究团队在论文中明确列出了几项重要限制。

纯化子集并非394例全部经过新的人工标注。它由两部分构成:52例专家确认无WMH的样本,以及342例模型筛选的样本。模型筛选并非人工标注,因此使用时应在报告中注明筛选来源,不能等同于纯手工标注数据集。

扩展子集的额外病灶标注来自DeepWMH和LST-AI两个自动工具的交集,这可能带来工具偏差、漏检(尤其是体积小的病灶),以及对特定病灶形态的灵敏度不足等问题。

健康组织标签由TumorSynth自动生成并经概率融合,并不等同于人工全脑解剖标注,可能在某些复杂解剖变异情况下存在误差。

此外,这份资源目前只系统处理了白质高信号这一类共存异常,微出血、腔隙性梗死等其他类型的脑部异常尚未纳入。外部WMH验证集只有T1和FLAIR两种模态,无法证明T1ce和T2在所有下游任务中的价值。

在使用这份资源时,有几点原则是明确的:GLI-AL只能用于科学研究,不得用于直接的临床诊断、治疗决策或个人风险评估。用户在发表论文时应注明所用数据层级和标签来源,并说明自动化标签的局限性。任何试图重新识别病人身份的行为都与这份资源的使用初衷相悖。

八、怎么才能获取和使用这份资源?

获取GLI-AL需要走两道门。第一道门是向BraTS 2023官方申请上游MRI数据的访问权限(Synapse项目ID:syn51156910),这是获取原始影像数据的前提。第二道门是通过GLI-AL资源页面(Synapse项目ID:syn75210889)提交电子邮件申请,接受派生资源的使用条款,才能获得这套纯标签资源。

资源以CC BY-NC 4.0(知识共享署名-非商业性使用4.0国际许可证)发布,与上游BraTS数据集的非商业使用条款保持一致。研究团队提供的辅助代码库(处理脚本和MedNeXt/nnUNet适配文件)以MIT许可证和Apache 2.0许可证开放,但不包含BraTS影像数据、各第三方工具的模型权重或完整环境。使用者在发表论文时需遵循BraTS官方引用要求,并保留如下数据来源声明:"Data used in this publication were obtained as part of the Brain Tumor Segmentation (BraTS) Challenge project through Synapse ID: syn51156910."

说到底,这项研究做的是一件在科学数据世界里常常被忽略的事:把那些"查无此人"的隐形信息,正正经经地登记在册。医学影像分析的进步,很大程度上依赖于训练数据的质量,而数据质量的提升,有时候不是靠更强的算法,而是靠更诚实、更细致的标注。当白质高信号在脑肿瘤数据集里长期以"正常组织"身份蒙混过关,训练出来的模型就会带着这个偏见去看每一个病人的大脑。

GLI-AL把这个问题摆到了台面上,并提供了一套可以直接使用的解决方案——不仅有标签,还有明确的质量分层、可追溯的标签来源、完整的文件校验记录,以及证明这套方案确实有效的实验结果。对于从事脑部MRI研究的团队来说,这意味着一个可以立即获取、立即使用的"更诚实的训练集"。

对普通大众而言,这项工作的意义或许要过几年才会具体可见——当基于更干净数据训练的AI辅助诊断系统开始在医院里协助医生,能够同时看见主要肿瘤和那些常年被忽视的白质高信号时,更早的发现和更准确的风险评估将变得更有可能。

感兴趣深入了解的读者,可以通过数据资源DOI 10.7303/SYN75210889 以及arXiv编号 2607.22135 查阅完整论文和资源详情。

Q&A

Q1:白质高信号(WMH)和脑胶质瘤有什么关系,为什么两者会同时出现在同一份MRI里?

A:白质高信号是大脑白质区域出现的一种常见异常,可能与年龄增长、血管损伤等多种因素有关,本身是一种独立的脑部改变。脑胶质瘤患者中,超过68%的人脑内同时存在至少100立方毫米的白质高信号,两者并没有直接的因果关系,只是在同一批中老年脑肿瘤患者中共同出现的概率相当高。正因为两种病变经常并存,在训练AI模型时,如果把白质高信号误标为"正常组织",就会给模型引入系统性的错误认知。

Q2:GLI-AL数据集和原始BraTS数据集有什么具体区别,研究者换用GLI-AL能获得什么额外信息?

A:原始BraTS只标注了肿瘤的三个子区域(坏死核心、瘤周水肿、增强型肿瘤),对脑内其他区域一概留白。GLI-AL在此基础上补充了两类信息:一是六类健康组织结构(灰质、基底节、白质、脑室、小脑、脑干)的完整标签,新增约15亿个体素;二是857例病例中原本被漏标的白质高信号病灶标签,共约220万个体素。研究者使用GLI-AL可以在同一套训练目标里同时监督健康组织和病灶,无需在不同任务定义之间切换,并且可以按照"纯化子集"和"扩展子集"分层分析数据质量对模型性能的影响。

Q3:GLI-AL中的纯化子集和扩展子集在实际使用中应该怎么选择?

A:纯化子集的394例病例经过白质高信号感知清洗,其中包含52例经专家确认无白质高信号的案例和342例经模型高置信筛选的案例,标签质量更高,适合用于需要严格控制标签噪声的实验,例如研究标签质量对模型性能的影响。扩展子集的857例保留了原始MRI,病灶标签由DeepWMH和LST-AI交集自动生成,可能含有一定比例的漏检或工具偏差,适合需要更大训练规模的场景,但使用时应在论文中明确说明这部分数据的标签来源和局限性,不宜与纯化子集不加区分地混用。