科学问题
要用AI预测药物如何改变细胞状态,前提是有一批在统一条件下测出的、覆盖足够多药物与细胞类型的大规模扰动数据。既往的单细胞药物筛选存在三个短板:批次效应大、不同研究之间协议不一致、覆盖的扰动条件有限。本文要回答的是:能否在一个平台内并行处理上千种药物剂量条件,让不同细胞模型在同一体系中受药,从而把批次效应压到最低,并同时读出分子与表型两层的响应。
背景与领域脉络
单细胞扰动图谱是细胞行为预测模型的燃料。此前的工作多把细胞系分开培养再各自测序,批次效应往往与真实药物响应混在一起,模型容易学到技术噪声。另一种思路是把多个遗传背景不同的细胞模型混合成「细胞村」,在同一个孔内共培养并同时受药,这样处理条件与测序过程完全一致,差异更可能来自药物本身。本文沿这条思路构建了名为Mosaic的平台,并在此基础上生成Tahoe-100M图谱。
方法与技术路线
作者把50种来源不同的癌细胞系混合成球状体的细胞村,铺在14块96孔板中培养,再按等细胞数分配到1786个亚文库。每个细胞村接受一种药物剂量条件,最终覆盖1100多种小分子扰动。受药后做单细胞RNA测序,共回收1.006亿个通过最低质控的细胞。分析上不只看转录组位移,还系统量化增殖、细胞毒性、谱系特异易感性与细胞周期等表型,并用通路水平的表达特征来归类药物作用机制、识别脱靶效应与耐药相关的适应性应激反应。
主要结果
图谱规模达到1.006亿个细胞
最终数据集包含1.006亿个通过最低过滤的细胞,来自50种癌细胞系与1100多种药物剂量条件。细胞村的混合设计使不同细胞系在同一孔内经历完全相同的处理与测序流程,作者报告批次效应显著低于分孔培养的常规方案。
混合培养不改变细胞系的内在身份
作者把本数据与单培养金标准数据集对比,发现细胞在细胞村中仍然保留各自的谱系特征,说明混合没有抹掉细胞类型差异。这一验证是后续用该图谱做跨细胞系比较的前提。
单细胞表型可区分药物作用机制
除转录组位移外,数据同时记录了增殖抑制、细胞毒性与细胞周期变化等表型。基于通路的表达特征可以区分不同作用机制的药物,识别脱靶活性,并暴露与耐药相关的适应性应激反应。
药物响应既能走向分化也能走向趋同
作者刻画了群体水平上的转录组异质性,判断同一药物处理是把细胞推向多种互不相同的命运,还是收敛到少数共同状态。这为理解耐药亚群的形成提供了细胞层面的观察窗口。
数据开放用于训练预测模型
图谱以公开形式发布,配套的细胞与分子两层读数被设计为可直接用于训练药物响应与基因调控的预测框架,作者明确将其定位为细胞行为预测模型的训练底座。
创新点
创新点不在单点技术,而在规模与对照设计的组合。与既往把细胞系分开处理的筛选不同,Mosaic平台把上百种遗传背景不同的细胞模型混进同一个细胞村,使上千种扰动共享同一处理与测序条件,把批次效应从「需要事后校正」变成「在设计阶段消除」。同时,本文把表型读数(增殖、毒性、细胞周期)与转录组读数统一在同一坐标系下,使药物作用机制的判断不再只依赖表达谱。
意义与影响
药物响应预测、基因调控建模与细胞状态迁移研究都需要大规模、低噪声的扰动数据。Tahoe-100M把这个量级推到亿级细胞与千级条件,并明确以开放数据的形式支撑AI建模,等于为「虚拟细胞」类工作提供了一份通用训练集。对药企而言,加入细胞层面的表型读数后,早期筛选可以在更少实验轮次内区分作用机制与脱靶效应。对基础研究而言,细胞村的设计本身验证了混合培养的可行性,为后续把更多模型、更多扰动放进同一实验体系提供了范例。
局限与待验证
第一,图谱全部基于癌细胞系,缺少原代细胞与正常组织模型,结论外推到体内环境需谨慎。第二,数据以细胞系为单位的覆盖度为主,作者也承认受测序深度分配影响,单细胞层面的读数深度做出了一定让步。第三,平台依赖球状体共培养,细胞村内不同细胞系之间可能存在未被完全控制的相互影响。第四,覆盖的药物剂量条件虽多,但每种条件的重复次数有限,罕见效应的统计功效不足。
对我们的相关性
对华大与我们在AI for Life Science上的布局,这份数据有几处直接可用。一是它示范了「扰动图谱如何做才能被模型用」:统一处理、低批次效应、表型与转录组双读数、整体开放,这四点可以作为我们自建扰动数据集的设计清单。二是亿级单细胞数据的存储、解码与训练管线本身就是工程挑战,本图谱的处理方式值得对照。三是如果要做跨模态细胞表征模型,Tahoe-100M可以作为预训练或评测的公开基准,与我们在时空组学上的数据形成互补而非重复。
术语速查
全文 PDF 已归档 Google Drive
04-学术文献/Paper/;原文版权归 Cell 及作者所有