← 返回三刊速览 本月归档 Nature · 2026-09-09 · 深度解读

NATURE · DEEP READ · 2026-09-09

基于操作扰动蛋白质组学的虚拟细胞模型

An operational perturbation proteomics-based virtual cell model

第一作者 Rui Sun 末位/资深 Tiannan Guo 共 33 位作者 DOI 10.1038/s41586-026-11001-9
一句话结论
团队用 3,800 万个时间分辨的蛋白质测量值训练出虚拟细胞模型 ProteinTalks,在药效、协同与耐药预测上全面超过了以转录组为基座的模型。
记住这一句:蛋白质组的时间动态比转录组快照更贴近表型;参数量少三个数量级,预测反而更准。
摘要图
图为文章官方摘要图(期刊网页 key image)

科学问题

虚拟细胞模型是计算药物研发的核心目标,但现有模型大多建立在静态转录组快照之上:既学不到细胞应答的时间动态,又因为转录组处在中心法则的中间层而与表型耦合偏弱。本文追问的是,如果以大规模、多时间点的扰动蛋白质组为训练数据,能否得到一个既能推演动力学、又能跨细胞与临床场景迁移的虚拟细胞模型。

背景与领域脉络

用大规模组学数据训练基座模型,已成为构建虚拟细胞的主流路径。Geneformer、scFoundation、UCE 从转录组快照中学习通用表征。STATE、STACK、x-Cell、CellOT 等方法把扰动响应纳入建模,PRESCIENT 一类方法补上了轨迹。但它们多停留在静态嵌入、扰动终点,或是在预设隐空间内做插值。蛋白质是细胞功能的主要执行者,与表型连接更直接。只是受制于质谱通量,学界一直缺少系统性的时间分辨扰动蛋白质组数据。

方法与技术路线

团队搭建 96 孔板半自动化平台,用数据非依赖采集质谱(DIA-MS)对 18 株乳腺癌细胞系做药物扰动。其中 16 株为三阴性、2 株为非三阴性,涉及 63 种 FDA 批准药物与 59 种两两组合,共 914 个“组合—细胞系”配对。研究先在 11 个时间点采集 2,528 个样本以确定动力学分段。随后固定 6、24、48 小时三个节点做生物学三重复的大规模检测,得到 16,311 个质谱文件与 23,482 条细胞活力数据。模型以神经常微分方程为核心,让扰动条件下的动力学与潜在表征联合学习。

主要结果

一张覆盖 3,800 万蛋白质测量值的扰动图谱

研究累计投入约 6,668 小时质谱机时,DIA-NN 在 5,585 个蛋白组中定量出超过 3,800 万个蛋白质测量值,并配套 23,482 个细胞毒性数据点。这些数据构成 ProteinTalks 数据集(PTDS),11 个时间点的样本在降维后清晰地分成早、中、晚三簇。

扰动蛋白质组能反推药物的作用机制

63 种药物的直接靶蛋白中鉴定到 61 个,覆盖率达 48.8%。作者提出 PertScore 量化蛋白变化,筛出 823 个显著响应蛋白(PertScore≥10 且 FDR<0.05)。作用机制相关通路在给药 6 小时就被显著扰动,细胞死亡相关通路要到 48 小时才富集。药物类别与预期生物学一致:烷化剂影响 DNA 损伤修复,激素治疗改变代谢重编程,微管抑制剂干扰细胞骨架,CDK 抑制剂扰乱细胞周期。

耐药与敏感细胞的动态差异点名了具体蛋白

在 CDK 抑制剂耐药与敏感的细胞之间,63 个蛋白表现出动态差异(ANOVA P<0.05)。其中 41 个在耐药组持续上升而敏感组下降,富集于细胞周期、嘌呤核苷酸代谢与碳代谢;另 22 个呈相反趋势,关联小分子转运与 AKT 信号。差异在 48 小时最直观:5-氟尿嘧啶下 ATG3 的敏感/耐药比值为 0.15,多西他赛下 BTF3 为 0.12,阿培利司下 CKS2 在敏感组高出耐药组 7.71 倍。

参数少三个数量级,跨场景预测却更强

在跨细胞系泛化测试中,ProteinTalks 平均 AUPRC 达 0.89、AUROC 达 0.95、准确率 0.90,优于 7 个基准模型。它的参数量与样本需求,比静态转录组基座模型少约 1,000 倍。作者还验证了训练集规模与性能的正向关系,说明这套动态表征确实从数据中获益。

从细胞系一路迁移到患者样本

模型把 501 例乳腺癌患者的临床结局做了分层,并从 3,000 种老药新用化合物库中为三阴性乳腺癌患者来源类器官(PDO)排出候选药物,整体表现优于所评估的基准实现。这意味着在细胞系上学到的动力学表征可以迁移到患者来源模型与临床活检。

创新点

与 Geneformer、scFoundation 等以静态转录组为基座、参数量高出三个数量级的模型不同,ProteinTalks 以时间分辨扰动蛋白质组为核心驱动力。它用神经常微分方程让动力学参与表征学习,而不是在固定隐空间里插值。它的可迁移性也更强:训练于细胞系,却能用于患者来源类器官与临床活检样本。

意义与影响

这项工作填补了蛋白质动力学虚拟细胞的空白,说明蛋白质组数据在表征复杂表型响应上有直接优势,也改变了学界主要依赖转录组建模的惯性。模型能够高通量筛选药物组合、从机制层面挖掘耐药靶点,为高精度计算药物发现与个体化用药提供了新路径。

局限与待验证

数据全部来自 18 株乳腺癌细胞系,对实体瘤异质性与肿瘤微环境的刻画不足。DIA-MS 覆盖的 5,585 个蛋白偏高丰度,低丰度信号分子与转录因子可能缺失。模型没有整合翻译后修饰,非基因组层面的耐药机制仍然难以模拟。

对我们的相关性

对 AI 与计算生物学研究者,本文示范了神经常微分方程与多组学先验结合的动态建模方式,说明了小样本驱动高阶动力学的可行性。对单细胞与空间组学同行,其三时相采样策略与 PertScore 指标可用于量化扰动后的级联传导。做肿瘤耐药研究的人可以直接使用公开的 PTDS 数据库(db.prottalks.com)挖掘候选靶点。

术语速查

数据非依赖采集质谱(data-independent acquisition mass spectrometry, DIA-MS)一种高通量蛋白质组采集方式,把母离子按窗口连续碎裂并扫描全部碎片离子,减少漏检并提升定量重现性。
神经常微分方程(neural ordinary differential equation, Neural ODE)把神经网络嵌入微分方程求解过程的建模范式,可连续刻画随时间演化的隐藏状态,适合学习细胞动力学。
PertScore本文提出的统计指标,用于量化细胞受药前后蛋白质丰度的显著改变,从中识别介导药物响应的功能蛋白。
患者来源类器官(patient-derived organoid, PDO)用患者肿瘤组织在体外三维培养出的微型器官模型,保留亲本肿瘤的关键表型,常用于高保真药物筛选。
多时间点扰动数据集(multi-time-point perturbation dataset, mtPTDS)本研究建立的 11 个时间点数据集,用来捕捉从早期药理响应到晚期细胞死亡的蛋白质动态全景。
曲线下面积(AUPRC / AUROC)评估二分类模型排序能力的常用指标,AUPRC 对正负样本不平衡更敏感,AUROC 刻画整体区分度。
本页由 ppt-rabbit 基于论文全文自动生成并人工校验 · 生成于 2026-10-01 08:22 · 全文约 3028 字
全文 PDF 已归档 Google Drive 04-学术文献/Paper/;原文版权归 Nature 及作者所有