← 返回三刊速览 本月归档 Cell · 2026-08(月级) · 深度解读

CELL · DEEP READ · 2026-08(月级)

完整恒河猴参考基因组中的复杂亚端粒结构

Complex subtelomeric architectures in a complete rhesus macaque reference genome

第一作者 Shilong Zhang 末位/资深 Yafei Mao 共 20 位作者 DOI 10.1016/j.cell.2026.02.018
一句话结论
完成恒河猴首个近无错T2T参考基因组,解析8 Mbp亚端粒卫星阵列与58个转录活跃基因
记住这一句:亚端粒GC富集重复区的测序偏好性是T2T组装瓶颈,其高度有序结构驱动了灵长类新基因演化
摘要图
图为文章官方摘要图(期刊网页 key image)

科学问题

长期以来,真核生物基因组亚端粒高度重复区域极难精确组装,其序列常发生拼接坍缩或缺失。这导致灵长类亚端粒的高阶重复架构、表观修饰特征及其携带的功能基因长期未被解析。本研究旨在系统查明阻碍亚端粒精确定序的测序技术偏倚,构建近无错的恒河猴完整参考基因组,并回答旧大陆猴亚端粒区域蕴含何种独特的重复序列组织结构与转录活性功能。

背景与领域脉络

端粒到端粒(T2T)完整基因组是开展精准比较基因组学与功能遗传学的基础。近年来长读段测序技术飞速发展,人类及部分类人猿基因组已实现T2T组装。但现有恒河猴参考基因组(如Mmul_10或T2T-MFA8)仍残留大量未解空隙与拼接错误。由于长读段测序在极端GC含量及串联重复区存在系统性偏倚,杂合组装算法在这些区域极易发生组装坍缩。借助纯合细胞系结合优化的图组装与校正策略,攻克这些复杂盲区已具备可行性。

方法与技术路线

研究使用近乎全纯合的雌性中国恒河猴细胞系(MMU2019108-1],并补充独立雄性个体的Y染色体。测序平台包括178 Gbp的PacBio HiFi读段、125 Gbp的ONT超长读段(N50为109 kbp)以及359 Gbp的Illumina短读段。算法上采用Hifiasm完成初拼,利用基于ONT R10.4.1构建的稀疏de Bruijn图及锚定连通图拆解9处坍缩区域。针对PacBio测序深度骤降区,采用局部参考锚定k-mer图与短读段招募策略修正系统性碱基错误。组装质量经荧光原位杂交(FISH)进行物理定位验证。

主要结果

组装达到超高连续性与碱基精度

新组装T2T-MMU8v2.0的组装连续性检验得分为100分(GCI=100),N50达到162.29 Mbp。在k=21尺度下测序质量值(QV)估算为100,在k=31下为77。相比Mmul_10和T2T-MFA8v1.1,分别新解析了约302 Mbp和约25 Mbp的缺失序列。

揭示平台特异性测序偏好特征

作者在PacBio HiFi数据中定位了268处测序深度骤降区域,总跨度约16.68 Mbp,其中116处(约8.5 Mbp)为高GC含量的串联重复。在ONT读段中发现了单核苷酸同聚物错误与链偏好性。尤其在190处串联重复位点中,ONT读段均出现系统性GGG三核苷酸缺失,而短读段完全支持该缺失区域。

鉴定四种SATR卫星高阶结构

研究共解析了约8 Mbp的SATR卫星DNA序列,包括3.44 Mbp的SATR1、4.48 Mbp的SATR1v及0.22 Mbp的SATR2。这些阵列富集于短臂亚端粒区(富集达99倍)。作者划分出4类架构,由串联重复与片段重复间隔区交替排列构成。Subtelomeric SD间隔区的一致性高达97.88%,显著高于染色体内部区域的91.76%(p=1.57×10⁻¹⁷)。

亚端粒呈现独特的表观与转录活性

SATR1-SATR1v核心单元中,SATR1v的GC含量均值达81%,而SATR1仅为44%。亚端粒SD间隔区保持76%的平均DNA甲基化水平,显著高于非洲大猿同类元件的43%。更重要的是,这些新解析的重复区域内精确定位了58个具有转录活性的功能基因,颠覆了亚端粒主要由无转录功能废弃DNA组成的传统假设。

创新点

与先前的恒河猴参考基因组Mmul_10和T2T-MFA8v1.1相比,本研究首次明确了亚端粒GC富集重复区是长读段测序的主要盲区。技术上,设计了基于ONT超长读段的稀疏de Bruijn图解纠缠算法,配合局部锚定k-mer图与短读段校正,解决了深度丢失与系统性缺失难题。生物学上,打破了非洲大猿亚端粒由pCht阵列主导的固有认知,首次定义了旧大陆猴特异的四类SATR高阶亚端粒结构与高甲基化特征。

意义与影响

该成果树立了非人灵长类参考基因组的最高精度标杆,提供了质量值QV达到100近乎无错的组装模板。它阐明了灵长类亚端粒在染色体进化与新基因产生中的驱动作用,改变了领域内对亚端粒异染色质属于转录荒漠的传统认识。此外,完备的亚端粒参考序列显著提升了后续群体变异检测、短读段回比准确率以及单核表观染色质可及性分析的信噪比。

局限与待验证

与已报道的人类和灵长类T2T基因组类似,恒河猴基因组中的核糖体DNA(rDNA)超长高度串联阵列由于极高的序列均质性,在当前版本中仍未实现完全解析。此外,研究所揭示的58个亚端粒活性基因的精确生物学功能、组织表达特异性以及在不同野生或实验恒河猴群体中的拷贝数多态性,仍有待更大规模的群体样本深入验证。

对我们的相关性

基因组组装研究者可直接借鉴本研究应对超高GC、深度骤降及ONT系统性系统误差的图拓扑解环与短读招募方法。对单细胞及表观组学研究者而言,该高精度参考基因组消除了数以百计亚端粒假阳性比对区域,能大幅提升单细胞ATAC-seq与RNA-seq在末端基因簇的比对置信度。生物信息学与AI模型开发者则可将其作为非人灵长类基底真值,用于训练识别超长串联重复与结构变异的深度学习算法。

术语速查

质量值(Quality Value (QV))以对数标度量化组装序列碱基准确度的指标,QV 100代表理论错误率低至百亿分之一。
基因组连续性检查器(Genome Continuity Inspector (GCI))基于超长测序读段全长回比连续性评估基因组完整度的算法工具,评分为100代表无断裂坍缩。
片段重复(Segmental Duplication (SD))长度大于1 kbp且序列一致性超过90%的基因组低拷贝重复片段,常介导基因演化与重排。
卫星DNA(Satellite DNA (SATR))由高重复率串联单元构成的异染色质主要成分,SATR为旧大陆猴染色体亚端粒特征卫星家族。
德布鲁因图(de Bruijn Graph)通过将序列重叠片段拆分为固定长度k-mer构建的有向拓扑图,常用于解析复杂基因组组装路径。
本页由 ppt-rabbit 基于论文全文自动生成并人工校验 · 生成于 2026-10-01 08:22 · 全文约 2745 字
全文 PDF 已归档 Google Drive 04-学术文献/Paper/;原文版权归 Cell 及作者所有