← 返回三刊速览 本月归档 Cell · 2026-08-17 · 深度解读

CELL · DEEP READ · 2026-08-17

生成人工智能应用于细胞生物学的15个挑战

Fifteen challenges for generative AI applications to cell biology

第一作者 Léo Dupire 末位/资深 Andrea Califano 共 15 位作者 DOI 10.1016/j.cell.2026.07.004
一句话结论
生成式AI难以突破细胞与多细胞建模,需引入分子互作网络等生物先验以破解组合爆炸。
记住这一句:纯数据驱动大模型无法解决细胞生物学,必须融合物理与分子网络先验。
摘要图
图为文章官方摘要图(期刊网页 key image)

科学问题

生物医药研发面临极高失败率,2014至2023年间临床试验获批率已降至6.7%。当前计算生物学亟需建立能准确预测细胞状态、功能演变及扰动响应的模型体系。然而,现有生成式AI在分子层面的成功无法直接外推至细胞和组织尺度。这是因为多细胞表型由庞大的高阶非线性调控机制决定。当前模型在缺乏物理与生物先验的情况下,深陷数据稀缺与组合爆炸的理论困境。本文系统探讨了这一瓶颈,并提出了引领该领域的关键挑战与架构转型路线。

背景与领域脉络

过去五年,以Transformer为代表的生成式AI在蛋白质折叠预测、从头设计及病原性突变预测中取得了突破。这些系统能够成功,关键在于靶标具有一维线性序列结构,且有蛋白质三维结构数据库等数十年的海量结构数据支撑。然而,当研究者试图构建虚拟细胞模型、数字免疫孪生或虚拟临床试验时,现有基础模型却屡屡受挫。细胞与多细胞组织不是简单的线性序列。它们由错综复杂的表观遗传修饰、多蛋白复合物及胞间通讯网络共同驱动。单细胞基础模型在未见细胞类型或扰动条件下的预测表现,甚至难以超越简单的线性回归基线。

方法与技术路线

作者从系统生物学与物理约束视角出发,系统梳理了现有大语言模型在多细胞系统中的表征缺陷。他们对数个核心数据源进行了理论与定量极限估算。其中包括整合30万至50万个体免疫图谱的人类免疫组计划(HIP)、包含数亿至10亿级单细胞转录组的CellxGene数据库,以及蛋白质相互作用库STRING和PrePPI。此外,作者分析了ARACNe算法与ENCODE计划所揭示的调控网络维度。他们论证了如何将图注意力机制、扩散核以及三元条件互信息算法嵌入生成式架构,以此作为生物先验来约束模型的搜索空间。

主要结果

临床研发效率危机与预测瓶颈

现代生物医学高度依赖模式生物与试错实验,转化效率持续走低。2006至2022年间,仅有14.6%的临床试验最终获得药物批准。而在2014至2023年间,这一获批比例进一步跌至6.7%。这凸显了能够在早期准确预测细胞表型和毒副反应的计算模型极度匮乏。

细胞调控维度的天文级组合爆炸

多细胞调控依赖非线性高阶相互作用。例如组装单个功能性60S核糖体大亚基,就需要47种蛋白质协同结合。若仅在人类编码的约2万个基因组元件中对47阶互作进行全空间无偏建模,将产生约3.48×10^150种状态组合。这一数值远远超过了全宇宙预估的10^80个原子总量。即便是最简化的成对相互作用,其维度也超过了10亿次计算。这导致完全无先验的从头学习在算力上无法实现。

生物学数据规模面临千倍级鸿沟

自然语言模型使用数万亿Token进行训练。相比之下,生物学单细胞领域即使动用容纳数亿至10亿细胞的CellxGene数据库,其全部测量值也仅对应10^10至10^11个Token。二者在训练语料规模上存在整整1000倍的绝对差距。即便人类免疫组计划完成了30万至50万人的多组学深度分析,其总数据量依然严重受限。经验数据表明,只有当样本量超过100万人时,非线性复杂模型在免疫疾病预测上的表现才会开始优于线性模型。

单细胞基础模型泛化性评估受限

近期针对scGPT、Geneformer等单细胞预训练基础模型的系统评测表明,现有架构在面对跨组织分布外数据时表现欠佳。在预测未见过的细胞类型、外源扰动条件或非训练集组织环境时,这些大模型未能稳定超越传统的简单线性基线。这证明单纯依赖自回归统计关联无法捕捉细胞系统的因果逻辑。

创新点

本研究从理论高度挑战了AI领域的“算力与无先验至上”信条,证明其不适用于细胞生物学。作者指出细胞调控网络受制于严苛的热力学与生化物理法则,并非人类经验假说。以此为基础,论文创新性地提出将概率图模型、分子相互作用扩散核与三阶条件信息网络作为先验注意力结构。这种设计将注意力机制限定在物理可行的生化拓扑子空间内。与纯自监督单细胞模型相比,该策略有效化解了组合爆炸难题,并大幅降低了模型对样本量的刚性依赖。

意义与影响

文章系统指明了虚拟细胞从分子向组织尺度跨越的核心障碍。这打破了仅依赖扩大数据量就能解决多细胞建模的盲目乐观。它推动了从回顾性统计跑分向具有前瞻性实验验证能力的算法架构转型。此外,该文确立了以免疫系统为试金石的多细胞多尺度建模范式,为肿瘤微环境预测、再生医学细胞命运重塑及临床试验数字模拟奠定了方法学指南。

局限与待验证

目前针对高阶相互作用扩散核的生成式架构设计仍处于理论雏形,缺乏全尺度实验验证。此外,不同细胞谱系和病理状态下的表观遗传异质性极大,预设分子图谱存在网络偏倚。若模型未能建立动态后验修正机制,错误的先验拓扑反而可能误导注意力分布。作者尚未在本文中给出十五个挑战的具体数学基准标准。

对我们的相关性

对从事单细胞与空间组学的研究者而言,切忌盲目依赖现有单细胞大模型对未见扰动进行预测。建议将组学数据嵌入具备ARACNe或STRING拓扑先验的图神经网络中。对AI算法开发者而言,研发融合三元条件互信息与热力学约束的非全连接注意力算子,是构建下一代生命科学基础模型的核心突破口。

术语速查

人类免疫组计划(HIP)一项跨全球人群的大规模多组学免疫谱系测序计划,用于解析遗传与环境对免疫细胞功能多样性的调控规律。
精确细胞网络重建算法(ARACNe)一种基于信息论中互信息和数据处理不等式的信息学算法,用来高精度推断细胞内的转录调控靶标网络。
单细胞生成式预训练变换器(scGPT)一种基于Transformer架构的单细胞大模型,用于学习单细胞转录组图谱的隐式表征并预测基因表达变化。
蛋白质相互作用预测系统(PrePPI)一种结合结构同源建模与非结构特征的计算平台,用于高通量预测蛋白质之间的物理和功能结合。
内在无序区(IDR)蛋白质中缺乏固定三维结构的柔性多肽片段,广泛介导高阶相分离与多分子转录调控复合物的动态组装。
本页由 ppt-rabbit 基于论文全文自动生成并人工校验 · 生成于 2026-10-01 08:22 · 全文约 2700 字
全文 PDF 已归档 Google Drive 04-学术文献/Paper/;原文版权归 Cell 及作者所有