← 返回三刊速览 本月归档 Nature · 2026-09-09 · 深度解读

NATURE · DEEP READ · 2026-09-09

使用GPN-Star预测全基因组功能约束

Predicting genome-wide functional constraints with GPN-Star

第一作者 Chengzhong Ye 末位/资深 Yun S. Song 共 8 位作者 DOI 10.1038/s41586-026-11005-5
一句话结论
融合系统发育树与全基因组比对的2亿参数模型,在编码与非编码突变效应预测中全面领先大模型。
记住这一句:显式引入演化树比对信息,能用小模型击败千亿参数单序列基因组大模型。
摘要图
图为文章官方摘要图(期刊网页 key image)

科学问题

理解全基因组变异对疾病与表型的影响,是现代人类遗传学的核心难题。现有基于深度学习的基因组语言模型往往依赖海量计算暴力学习,却在人非编码调控区与复杂真核序列上表现欠佳,甚至落后于经典演化模型。本研究旨在回答:能否通过在语言模型中显式融入系统发育树与多物种比对信息,以更小算力精准捕捉跨尺度的基因组功能约束?

背景与领域脉络

数亿年的自然选择在基因组中留下了功能约束的演化印记,有害突变常被净化选择清除,而中性或有利突变得以留存。经典演化工具如PhastCons和PhyloP长期依赖全基因组多序列比对推断保守性,但难以捕捉复杂的非线性序列模式。近来单序列基因组语言模型兴起,但其参数规模高达数百亿,训练耗资巨大,在预测远端增强子等非编码调控元件时预测能力依然薄弱。研究团队此前构建了GPN-MSA,初步证实多物种比对的价值,但模型仍未能精细利用物种树的分化时间与层级分支信息,亟需一套兼具生物学物理规律与深层架构的新算法。

方法与技术路线

作者开发了融合系统发育树与全基因组比对(WGA)的预训练网络GPN-Star。该模型采用编码器架构,结合掩码语言建模任务,将多物种比对序列划分为目标物种与源物种。模型先依据演化树聚类源物种并池化为支系特征,再通过跨注意力机制结合物种间演化距离加权计算上下文表征。团队基于脊椎动物(约6亿年)、哺乳动物(约1亿年)和灵长类(约6500万年)三个时间尺度的全基因组比对,在8块NVIDIA A100 GPU上训练了约2亿参数的人类模型。为剔除背景突变率偏倚,团队利用高置信中性位点标定模型对数似然比,获得纯粹反映选择约束的校准分数。最后,作者在五种模式生物中验证了该架构的泛化能力。

主要结果

临床与肿瘤编码突变预测

在ClinVar数据库的20973个致病突变与26238个良性错义突变基准中,脊椎动物模型GPN-Star (V)获得最高AUPRC评分,持平蛋白质大模型ESM-1b并超越30亿参数的ESM-2。针对COSMIC数据库中181个肿瘤高频突变与gnomAD中14426个普通人群突变的判别,GPN-Star (V)的表现同样大幅优于Evo 2和CADD等基线模型。

非编码致病突变精准识别

针对非编码区预测难题,哺乳动物模型GPN-Star (M)在OMIM的338个致病与2968个良性非编码突变测试中拔得头筹。在HGMD的745个致病与6601个对照变异评估中,该模型AUPRC继续保持第一。其在远端增强子和启动子区域的预测优势尤为明显,显著超越Enformer、Borzoi以及AlphaGenome等序列功能模型。

GWAS精细定位突变富集

针对英国生物样本库(UK Biobank)中65种复杂性状精细定位的215个高因果概率(PIP>0.9)与1798个非因果错义突变,GPN-Star (M)分类精度显著超越AlphaMissense。在83种性状对应的1113个因果与10036个非因果非编码突变测试中,GPN-Star同样领先,且在启动子区的119个因果位点上完胜各类启动子专用预测工具。

罕见变异检测与跨物种泛化

研究人员将模型评分整合至DeepRVAT工具中,使复杂性状的显著关联基因数从原本的约380个提升至415个,独立重复基因数提升至355个以上。团队还将该架构无缝迁移至小鼠、鸡、黑腹果蝇、秀丽隐杆线虫和拟南芥五种模式生物,均仅需极少超参数调优便实现了出色的变异效应预测精度。

创新点

相比单序列暴力预训练的Evo 2(400亿参数)与Nucleotide Transformer(25亿参数),GPN-Star仅用2亿参数便实现了更优的变异效应预测精度,大幅削减了算力开销。在架构层面,它突破了早期GPN-MSA仅简单拼接对齐序列的局限,首次利用系统发育树构建跨注意力演化距离偏置与支系特征池化。模型还首创了基于中性演化位点的突变率校准方案,成功将自然选择约束信号与基因组背景突变率噪音清晰解耦。

意义与影响

该成果颠覆了基因组基础模型盲目追求参数膨胀的单一技术路线,确立了融合演化先验的高效建模范式。研究揭示了不同演化时间尺度在变异解读中的独特价值,证实较近的灵长类和哺乳类演化约束更利于解析复杂性状非编码调控机制。这一成果为临床致病变异筛选、全基因组罕见变异关联分析以及药物靶点发现提供了高精度的先验打分工具,有力推动了功能基因组学与演化生物学的深度融合。

局限与待验证

模型精度高度依赖输入全基因组多序列比对的对齐质量,在非同源区域、大片段结构变异及物种特异性新生序列上难以展开有效推断。此外,尽管校准算法剔除了部分中性突变率偏倚,但针对物种特异性正选择或近期快速演化元件的解析能力仍待进一步验证,且训练对高质量多物种参考基因组的组装质量存在前置依赖。

对我们的相关性

对从事计算生物学和AI大模型的研究者而言,本文提供了将生物演化物理图谱深度融合进Transformer注意力机制的典型架构范例,极具工程借鉴价值。对医学遗传学与GWAS研究人员,GPN-Star评分可直接接入Fine-mapping或DeepRVAT等罕见变异关联检验流程,显著提高统计检力并缩小候选变异范围。做表观遗传与非编码调控解析的团队,亦可借助其针对增强子与启动子的精准打分,辅助先验靶位点筛选。

术语速查

全基因组比对(WGA)跨物种多序列比对算法,用于在全基因组尺度上寻找并排列同源染色体位点,以此揭示演化保守与分化模式。
系统发育树(Species tree)反映物种谱系分支历史与分化时间的树状图谱,用于量化不同物种间的亲缘演化距离与突变积累时间。
掩码语言建模(MLM)自监督预训练策略,随机遮蔽输入序列中的部分碱基并让模型结合上下文猜测,用于学习序列深层分布规律。
分层连锁不平衡评分回归(S-LDSC)统计遗传学分析方法,通过整合基因组注释与GWAS汇总统计量,评估特定功能元件对复杂性状遗传力的富集程度。
罕见变异关联检验(RVAT)统计算法流程,通过在基因或功能元件单元内聚合罕见突变并加权分析,以弥补单个低频变异统计检力不足的问题。
本页由 ppt-rabbit 基于论文全文自动生成并人工校验 · 生成于 2026-10-01 08:22 · 全文约 2801 字
全文 PDF 已归档 Google Drive 04-学术文献/Paper/;原文版权归 Nature 及作者所有