科学问题
精神分裂症与阿尔茨海默病等脑病的风险位点大多落在非编码区,它们究竟通过哪一类脑细胞起作用?
背景与领域脉络
全基因组关联研究(GWAS)通过大规模人群比较,找出与疾病相关的遗传位点,目前已定位数以千计的风险位点。这些位点多数位于非编码区,只能通过调控基因表达起作用。传统的脑转录组关联研究(TWAS)把 GWAS 与表达预测模型结合以定位致病基因,但它几乎都依赖整块皮层匀浆,参考队列又以欧洲祖源为主。匀浆会把神经元、胶质与免疫细胞混在一起,细胞类型特异的调控信号被平均掉。
方法与技术路线
研究以 PsychAD 联盟的背外侧前额叶皮层(DLPFC,负责工作记忆等高级认知的脑区)单核 RNA 测序数据为参照,覆盖 1,494 名供体与 600 余万个细胞核。作者在三种祖源、32 个细胞群体上训练了 94 个 snTIM,并用独立队列做外部验证。随后把这些模型与 12 项精神及神经退行性疾病的 GWAS 汇总统计量结合,完成细胞类型分辨的 snTWAS,最后在百万退伍军人计划(MVP)约 60 万参与者中做表型组关联复核。
主要结果
细胞分辨率带来更多可插补基因
在欧洲祖源中,模型可可靠插补 12,289 个基因,占受检基因的 74.1%;非洲祖源为 62.6%(10,375 个),美洲混血祖源为 33.4%(5,543 个)。把分辨率从合并细胞核提升到细胞大类与亚类,可插补基因分别比前者多出 20% 与 21%。
细粒度模型找到更多疾病关联
在 12 种疾病的关联分析中,合并核模型给出 1,254 个显著基因–性状关联,细胞大类给出 2,470 个,亚类给出 3,003 个。亚类模型比其他任何单一模型都更可能检出新的、且与临床表型相关的关联。
跨祖源信号高度一致
模型预测性能在祖源之间强相关:欧洲与美洲混血祖源的相关系数为 0.58,欧洲与非洲为 0.54,非洲与美洲混血为 0.49。非洲与美洲混血模型还额外捕获了 882 个和 335 个欧洲模型无法可靠插补的基因。
跨疾病共享信号集中在小胶质细胞
12 种疾病两两比较中,75.8% 的组合存在共享的疾病相关基因,47.0% 的组合存在共享通路。以阿尔茨海默病与帕金森病为例,合并核模型没有找到共享通路,小胶质细胞层面却给出 47 条。作者还发现细胞大类中免疫群体的信号最为特异。
大规模表型组复核与精细定位
在 MVP 队列中,作者用 1,428 个欧洲、1,057 个非洲和 725 个美洲混血表型编码复核了 snTWAS 结果。非欧洲祖源的分析既找到祖源特异的关联,也改善了风险基因的多祖源精细定位。与已发表的抑郁症单核 TWAS 相比,本次多出 6,095 个可插补基因和 31 个显著基因–细胞类型组合。
创新点
既往脑 TWAS 依赖整块组织且几乎只覆盖欧洲祖源,本研究把模型训练、疾病关联与表型复核全部放到单核分辨率与多祖源框架中完成,并把模型与汇总统计量公开为社区资源。
意义与影响
该工作把非编码风险位点落到具体细胞类型,为精神与神经疾病的靶点排序提供了细胞语境。在阿尔茨海默病案例中,研究把风险位点与小胶质细胞共表达模块、淀粉样斑块负荷联系起来,提出 ZYX 等新的候选效应基因。
局限与待验证
美洲混血祖源的训练样本只有 118 人,可插补基因比例明显偏低,非洲与美洲混血祖源的整体统计功效也受限。作者同时指出,当前单核方案对异构体的捕获有限,无法处理异构体层面的调控,而后者可能解释更多遗传度。
对我们的相关性
有两点可以直接借鉴。第一,细胞类型分辨率越高、遗传关联越多,这与按细胞邻域而非整块组织做关联分析的思路一致。第二,作者强调模型不能跨祖源硬套,必须使用祖源匹配的参照数据,这对中国人群队列的遗传解读尤为关键。
术语速查
全文 PDF 已归档 Google Drive
04-学术文献/Paper/;原文版权归 Nature 及作者所有