科学问题
狨猴是神经生物学与衰老退行性疾病的重要灵长类模型。但由于重复序列高度富集,其旧版参考基因组残留了数千个未解间隙。着丝粒、近端着丝粒短臂与性染色体等复杂结构长期处于测序盲区,严重阻碍了疾病致病机制的解析。本研究旨在构建完整的无间隙狨猴基因组,并以此系统揭示新大陆猴着丝粒的组织架构与谱系特异性演化特征。
背景与领域脉络
人类与大猿T2T基因组的突破,证明超长测序技术能彻底攻克复杂重复序列。相比之下,新大陆猴的基因组资源依然停留在草图阶段。既往版本如calJac4存在大量组装断裂,不仅在重测序中引发大量变异假阳性,还掩盖了关键的结构变异。新大陆猴的着丝粒由二聚体卫星序列构成,缺乏类人猿的高阶重复结构。这种特殊的染色体组织方式此前始终缺乏完整序列支撑,亟需全新的完整组装予以厘清。
方法与技术路线
研究人员采集了一只雄性(calJac240)与一只雌性(calJac220)健康狨猴的培养成纤维细胞。测序策略整合了逾60倍深度的PacBio HiFi读段、30倍超100 kb的牛津纳米孔超长读段,并利用Hi-C完成单倍型定相。组装核心算法基于Verkko流程,并用DeepVariant开展多轮打磨。团队结合Merqury评估准确性,利用Flagger与NucFlag检验组装异质性,并排除了双胞胎嵌合干扰。最后依托10种组织的IsoSeq转录组与CAT2流程展开基因注释。
主要结果
补齐基因组序列盲区
团队生成了1套完整T2T基因组与3套近T2T单倍型,测序质量QV值达到65.29至67.32。新基因组新填补了88 Mb以上序列,其中包括30.24 Mb着丝粒与短臂区域,以及22.41 Mb节段重复,并成功挽救了400多个编码基因。
显著压低变异检测误差
团队将40只狨猴的短读段比对至新旧参考基因组。相较于calJac4,新基准使插入缺失假阳性显著下降(Wilcoxon检验p=3.7×10⁻⁸)。同时,每只动物未定型位点平均减少了约84,000个,大幅提升了群体变异检测可靠性。
发掘数百个特异新基因
结合10种组织的IsoSeq数据,研究共注释出21,121个蛋白编码基因,包含97.8%的人类同源物。研究鉴定出566个在至少两种组织中表达的新转录模型,其中包含345个谱系特异性旁系同源基因,以及195个候选从头转录位点。
揭示节段重复与基因扩增
狨猴单倍型平均含有147.3至165.0 Mb的节段重复序列,比非猿类灵长类均值多出17.0至34.8 Mb。其中染色质重塑基因SCML1在人类中仅有单拷贝,而在狨猴X染色体约2.2 Mb区间内串联扩增至6到7个拷贝。
构建首个狨猴图谱泛基因组
团队基于6套单倍型构建出2.99 Gb的泛基因组图谱,捕获了58,381个结构变异。在针对230只实验动物的重测序分析中,团队锁定了81个人类阿尔茨海默病同源基因座中的75个天然编码变异基因,为疾病易感性研究建立了变异图谱。
创新点
相比过去基于短读段拼接的断裂版本calJac4,本研究首次产出无间隙的狨猴T2T参考序列,彻底填补了88 Mb未知区域。技术上克服了双胞胎造血嵌合现象带来的定相障碍,清晰解析了二聚体卫星着丝粒及核糖体DNA介导的非同源重组机制。此外,构建的图谱化泛基因组摆脱了单一线性基因组的偏倚。
意义与影响
该基准消除了过去因序列缺失导致的定位漂移与变异假象,显著提升了脑科学与衰老疾病建模的精确度。在灵长类比较演化层面,它填补了新大陆猴高精度染色体架构的空白,确证了核糖体DNA促进非同源染色体短臂交换的模型,为理解核型演化规律提供了坚实材料。
局限与待验证
目前泛基因组图谱仅纳入两只个体的6套单倍型,群体遗传多样性代表范围依然偏窄。由PanGenie分型所得的结构变异位点尚缺乏独立的正交实验数据验证。此外,新发掘的566个转录本模型及SCML1等扩增基因在神经或免疫系统中的生理功能,仍需后续实验深入阐明。
对我们的相关性
对从事基因组学与演化生物学的学者,文中的超长读段图组装策略与嵌合体验证逻辑极具借鉴价值。做单细胞与空间组学的团队可直接切换到calJac240新参考底图,大幅提高测序读段比对率并减少异构体错配。计算生物学团队还可利用公开的泛基因组图谱开发复杂变异检测工具。
术语速查
全文 PDF 已归档 Google Drive
04-学术文献/Paper/;原文版权归 Cell 及作者所有