← 返回三刊速览 本月归档 Cell · 2026-09-17 · 深度解读

CELL · DEEP READ · 2026-09-17

避免人工智能在健康和医学方面的常见失败

Avoiding common failures in AI for health and medicine

第一作者 Olawale Salaudeen 末位/资深 Marzyeh Ghassemi 共 5 位作者 DOI 10.1016/j.cell.2026.07.025
一句话结论
综述系统揭示了医疗AI在幻觉、偏见与退化上的三大失效机制,指出单点技术干预难以根治不可靠性。
记住这一句:医疗AI的技术性修补无法替代全生命周期的连续监测与系统级治理。
摘要图
图为文章官方摘要图(期刊网页 key image)

科学问题

医疗人工智能长期面临“实验室指标优异但临床落地翻车”的困境。其难点在于真实医疗场景伴随复杂的流程噪声、亚群异质性与动态分布漂移。本文系统梳理预测型与生成型AI的核心可靠性失效模式,探讨现有数据清洗、算法去偏与提示词工程为何屡屡失效,并明确安全落地必须依托的全生命周期质控路径。

背景与领域脉络

预测型AI在乳腺癌筛查和脓毒症预警中展现了临床潜力,生成型大语言模型也加速融入病历撰写与问答流程。然而真实部署暴露出致命隐患,例如商用脓毒症预警模型在剔除已确诊病例后表现逊于随机猜测,语音转录工具也在临床记录中虚构关键信息。以往研究多将数据缺失或漂移视作随机噪声,试图仅靠模型鲁棒训练或集成学习来解决问题。但这忽视了医疗数据源于诊疗行为与记账规则的系统性偏差,导致常规技术修补难以在临床中确保可靠。

方法与技术路线

本综述系统梳理了预测型AI(涵盖电子病历、X射线与病理图像)与生成型AI(涵盖临床大语言模型与多模态基座)的跨中心部署研究。评估证据整合了多国乳腺癌筛查队列、多中心脓毒症临床试验,以及300名受试者对人机医学问答的盲态评估。作者还综合了12个临床专科的动态医患交互测试。全流程将干预手段划分为数据预处理、模型训练与推理后处理三个阶段。通过对比数据插补、对抗训练、检索增强生成(RAG)及提示词工程的实测表现,系统剖析现有技术方案在真实环境下的失效机制。

主要结果

虚假临床生成极具隐蔽性

在一项针对300名参与者评估医生与大模型回答的试验中,受试者鉴别人机来源的正确率仅为随机水平(约50%)。更严重的是,受试者对低准确率AI回答的信任度与医生正确回答相当,且采纳潜在有害建议的意愿没有统计学差异。

动态交互致生成模型性能跳水

当大模型从直接接收现成病历转为自主向患者问诊收集信息时,其诊断准确率从约68%骤降至约55%。在跨越12个临床专科的测试中,模型从标准考试题切换到真实医患对话交互时,准确率同样发生大幅下跌。

流程变动引发部署后性能退化

在环境AI书记员的实战测试中,病历模板的细微改动导致国际疾病分类第十次修订版(ICD-10)的编码记录准确率从79%骤降至35%。由于生成的文本表面依旧流畅,若非依赖系统性持续监测,此类严重退化极难在日常诊疗中被及时发现。

人口统计提示诱发亚群不平等

研究人员将10例精神科病例输入Claude、ChatGPT、Gemini与医学版LLaMA这4个主流模型家族。在临床症状完全一致的前提下,一旦明确提示患者种族信息,模型给出的治疗方案质量即出现系统性下降,暴露出严重的亚群偏差。

创新点

既往研究通常针对单一场景修补算法,例如单纯提升曲线下面积(AUROC)或降低生成困惑度。本文首次统一对比了预测型与生成型医疗AI的三大共性失效模式。作者深入剖析了现有方案的理论缺陷:数据清洗错误地预设了随机缺失机制,检索增强无法根除错误推论,对抗去偏则依赖无法验证的因果假设。这一论断颠覆了单纯依赖离线算法优化的传统认知。

意义与影响

本工作打破了医疗大模型只要参数足够大就能自愈临床缺陷的技术迷思。它向学界和监管方指明,即便模型在基准测试中表现完美,微小的流程变化与捷径学习依然会引发致命失效。这推动医疗AI的研发规范从离线调参彻底转向全生命周期的部署监测、影子运行与系统级治理。

局限与待验证

本研究属于综述评述,作者并未提供全新防御算法的大规模前瞻性临床队列验证。分析主要基于已公开文献中的典型失败案例,且受限于商业闭源模型无法获取底层权重。此外,关于模型崩塌对未来医疗数据生态污染的论断,仍停留在理论推导,缺乏长期纵向实证数据。

对我们的相关性

对于从事组学与医疗AI的研究者而言,在构建疾病预测或细胞注释模型时,绝不能单纯迷信全局高AUC指标。数据处理时严禁盲目做随机插补,必须对测序批次、平台来源等混杂因素设置因果不变性检验。在使用大模型辅助组学文献挖掘或变异功能解读时,应当结合检索增强生成(RAG)构建不确定度量化与拒答机制,防止虚假生物学推论污染下游实验。

术语速查

检索增强生成(Retrieval-Augmented Generation, RAG)在大模型生成回答前从外部权威数据库检索精准信息的技术,用于抑制虚假幻觉并提供可追溯的临床依据。
模型崩塌(Model Collapse)当AI模型反复使用自身生成的合成数据进行迭代训练时,导致模型输出的多样性与事实准确性不可逆退化的现象。
快捷方式学习(Shortcut Learning)模型未学到真正的病理特征,而是依赖图像背景伪影或医院标签等偶发关联完成预测的投机行为,泛化能力极差。
域对抗训练(Domain Adversarial Training, DAT)借助对抗博弈消除不同中心或设备来源差异的算法,用来提取跨医院通用的稳定生物学特征表征。
国际疾病分类(International Classification of Diseases, ICD)世界卫生组织制定的全球通用疾病与医疗操作编码标准,在电子病历中常被研究者用作定义疾病标签的代理指标。
本页由 ppt-rabbit 基于论文全文自动生成并人工校验 · 生成于 2026-10-01 08:22 · 全文约 2398 字
全文 PDF 已归档 Google Drive 04-学术文献/Paper/;原文版权归 Cell 及作者所有