科学问题
放射科一直想要一个能覆盖多种疾病的通用AI,但现有方案多是单任务模型,病种覆盖窄、迁移性差。腹部增强CT尤其难,需要同时评估几十个器官与上百种病变,而基于监督学习的路线依赖昂贵的人工标注,很难扩展到开放式的临床场景。本文要回答的是:能否绕开逐病灶标注,只用日常临床报告作为监督信号,训练出一个在腹部CT上具备专家级广度与精度的通用诊断模型。
背景与领域脉络
视觉-语言学习为医学影像提供了另一条路:把同一患者的图像与文本在表征空间里拉近,把不同患者的推远,模型便能在没有像素级标注的情况下学到诊断语义。但这条路线在自然图像上的成功经验不能直接搬到腹部CT。原因有两个:腹部解剖结构密集、器官之间有大量相互遮挡,图像与报告的对应关系很难在全局层面建立;诊断信号本身稀疏,一份报告里往往只提到少数异常,模型容易把「没提到」误当成「正常」。
方法与技术路线
作者自建了腹部CT数据集RAD-CT,含42.5万例检查、150万组按CT体积配对的图像-文本对,进一步拆解出1500万组解剖结构级的图像-文本对。模型架构分三部分:视觉编码器提取CT特征,掩膜解码器输出体素级解剖分割(分割先验来自TotalSegmentator,模型不重新学习解剖),文本编码器把报告按解剖部位拆成子报告。训练时用解剖感知模块把不同患者的图像与文本在结构层面逐一对齐,并采用自适应对比学习,借助患者之间的语义相似性强化跨模态关联。评估覆盖18个解剖结构与146种征象,包含真实世界内部队列、8个外部中心队列、跨人群队列、被排除在训练外的急腹症队列,以及病理确诊的4类肿瘤,并组织了26名放射科医师、来自14个中心的阅片者研究。
主要结果
内部真实队列平均AUC达0.913
在39,160例检查构成的内部队列上,RADAR对18个解剖结构、146种征象的平均曲线下面积(AUC)为0.913,95%置信区间为0.911至0.915。这一结果覆盖的病种广度远超既往单任务模型。
8个外部中心保持稳定表现
在8个外部中心队列上,AUC范围为0.874至0.912,说明模型没有过度依赖单一医院的成像习惯与设备参数,具备跨中心迁移能力。
病理确诊肿瘤的AUC达到0.891至0.984
针对肝癌、胰腺癌、胃癌与结直肠癌四类有病理金标准的确诊病例,RADAR的AUC落在0.891至0.984之间。病理确诊是对比报告文本标签更硬的证据,这一子集验证了模型的临床可信度。
跨人群与急腹症场景均未失效
在一个跨人群队列上,RADAR不做任何微调即取得0.883的AUC。在训练时被明确排除的急腹症病例上,模型仍保持0.904的AUC,说明它对训练分布之外的急重症场景具备泛化能力。
人机协同把敏感度提高约10%
在26名放射科医师、14个中心的阅片者研究中,RADAR的表现超过多数参与者;当医师在模型辅助下阅片,整体诊断敏感度提升约10%。为避免记忆偏差,同一批医师在第二轮重新判读了相同病例。
注意力图给出可核查的诊断依据
模型输出注意力图,标出对每个诊断结论贡献最大的解剖区域与病灶位置,医师可以看到推理依据,而不是只接受一个黑箱结论。作者指出这使模型更倾向于关注疾病特异的影像特征,而非简单记忆整体模式。
创新点
与既往医学影像AI相比,本文的创新集中在两点。一是数据与监督方式:用42.5万例检查的日常临床报告作监督,把标注成本从「逐病灶勾画」降到接近零,并进一步拆出1500万组解剖级图像-文本对,使稀疏的诊断信号能够在结构层面被有效学习。二是建模路线:解剖感知加自适应对比学习,让模型按解剖结构对齐图像与文本,从而支持基于提示词(prompt)的查询,面对新的诊断需求不需要重新微调。作者还报告训练表现尚未饱和,数据规模继续扩大仍有提升空间。
意义与影响
这项工作的现实意义在于给出了一条可复制的通用医学影像模型路线:以临床报告为监督、以解剖结构为对齐单位、以提示词为交互接口。对医院而言,模型在有病理金标准与急腹症场景下的表现,说明它具备进入实际工作流的潜力;对放射科医师而言,约10%的敏感度提升意味着可以把它当作第二读者。更重要的是,它把「通用」从口号变成可测量的指标:18个解剖结构、146种征象、多中心与跨人群验证同时具备。
局限与待验证
第一,多数征象的标签来自报告文本而非病理,缺少病理金标准,作者承认这是通用模型的普遍短板,只在部分关键征象上做了针对性的病理验证。第二,跨人群验证仍不充分,作者明确提出需要在更多样的人群与临床场景中扩大测试。第三,研究为回顾性设计且豁免知情同意,前瞻性部署效果尚未验证。第四,数据来自单家顶级医院,成像协议与报告撰写习惯的集中度可能影响模型在其他地区的表现。第五,模型规模与训练数据尚在扩展阶段,当前的性能并非上限。
对我们的相关性
对华大与我们的AI布局有两点直接启发。一是监督信号的取法:用日常文本报告代替专家标注,把标注成本转化为数据规模优势,这套做法可以迁移到病理、内镜与影像多模态场景,与我们多组学数据的弱监督训练思路一致。二是评估的严谨性:本文把内部队列、8个外部中心、跨人群、被排除的急腹症、病理确诊子集与人机协同阅片全部纳入,这种分层验证清单值得作为我们内部模型的评测模板。此外,通讯作者来自浙江大学医学院附属第一医院与阿里巴巴,说明国内团队在临床数据规模与工程化上已具备产出通用模型的条件,值得关注其后续在更多模态上的扩展。
术语速查
全文 PDF 已归档 Google Drive
04-学术文献/Paper/;原文版权归 Science 及作者所有