科学问题
长期以来,人类基因组测序高度依赖将测序读段比对到单一参考基因组来鉴定变异。然而,参考基因组本身存在序列缺失、组装空隙以及结构多态性差异,导致高度重复的节段重复区与复杂变异区被长期排除在基准之外。以往基于变异的评估方法存在循环依赖和性能天花板。本研究旨在回答:能否直接构建一套近乎零差错的全二倍体端粒到端粒(T2T)全基因组真实标准,从而彻底摆脱比对偏倚?
背景与领域脉络
人类基因组重测序长期以GIAB变异集为金标准,但这些标准大多排除了性染色体及约12%的复杂常染色体区域。此前T2T-CHM13组装填补了人类基因组最后8%的空缺,但该样本为纯合单倍体,无法体现真实二倍体中的单倍型多态性与结构变异。泛基因组图谱虽能缓解单一样本的参考偏差,其自身的质量评估却仍受限于不完整的线性参考基因组。由于缺乏高精度的全基因组真实单倍型序列作为对照,高度重复区、大片段重复及多拷贝疾病相关基因的算法评估一直停滞不前。
方法与技术路线
研究团队以广泛使用的标准品HG002细胞系为对象。测序平台整合了约170×覆盖度的PacBio HiFi长读段、209×覆盖度的Nanopore超长读段,并辅以父本HG003和母本HG004的Illumina短读段用于定相。团队同时结合Strand-seq与Hi-C测序完成染色体骨架搭建,并借助荧光原位杂交(FISH)评估核糖体DNA(rDNA)阵列大小。首先利用Verkko算法生成初始二倍体组装,随后开展三轮众包协作与人工矫正。最后,团队开发出Genome Quality Checker(GQC)评估套件,通过多平台正交数据实施多重质控与低置信区间过滤。
主要结果
全基因组实现近乎完美准确度
新组装在6.0 Gb的二倍体基因组中实现了99.35%的无差错覆盖。31-mer评估的共识质量值(QV)从初始版本的Q63.1提升至Q68.9,相当于错误率从二百万分之一骤降至八百万分之一。
序列完整性大幅超越以往基准
该基准相比GIAB v4.2.1版本新增了701.4 Mb常染色体高置信序列,并完整补齐了此前缺失的216.8 Mb性染色体序列。全基因组仅保留38.8 Mb(约0.65%)的低置信度区域,其中86.3%为未完全解析的rDNA阵列。
全单倍型高精度个性化注释
团队在两条单倍型上分别完成了全基因组注释。母本单倍型共注释出19,956个蛋白编码基因,父本单倍型注释出19,190个蛋白编码基因,为解析单倍型特异性基因变异奠定了高分辨率参考基础。
从头组装准确率呈数量级提升
全基因组基准测评显示,从头组装(de novo assembly)比传统变异检出方法多解析出2%至7%的基因组序列。在复杂结构变异区域,组装策略的准确度比基于比对的变异检出高出了整整一个数量级。
创新点
本研究从概念上颠覆了以GRCh38等线性参考基因组为核心的传统变异基准,首次确立了全二倍体「基因组真实基准(Genome Benchmark)」。与以往仅关注变异位点的GIAB v4.2.1或仅解析单倍体的T2T-CHM13相比,该工作构建出首个涵盖XY全染色体、近乎零差错的真实人类二倍体序列,并配套开发了不依赖传统比对参考的GQC评估工具,打破了泛基因组验证中的循环依赖。
意义与影响
该成果彻底打破了人类全基因组测序与变异鉴定的评价天花板。它将以往无法触及的122个高难度复杂医学相关基因及MHC II类基因区纳入评估视野,为复杂疾病致病机制解析扫清了盲区。这一突破标志着基因组医学正在由「比对找突变」转向直接解析「完整单倍型从头推断」,为未来临床普及个性化完整基因组测序提供了核心质控基石。
局限与待验证
该基准目前仍未完全攻克全部核糖体DNA(rDNA)阵列的内部复杂结构,全基因组残留的9处缺口均位于rDNA区域。此外,研究所用的GM24385永生化细胞系中存在约18%的四倍体细胞,且免疫球蛋白基因区存在体细胞V(D)J重组,因此无法单纯依赖亲本k-mer完全自动化判定单倍型,局部复杂重复序列仍需人工排查。
对我们的相关性
对于基因组学与算法研发人员,GQC软件和该全二倍体真值集可直接用于训练和测评从头组装器、长读段定相管线以及结构变异检测模型。对于从事单细胞与空间组学研究的学者,该高精度单倍型能极大改善等位基因特异性表达分析(ASE)的读段比对偏差。对于AI生信大模型开发者,该数据集提供了极其罕见的Q68以上二倍体端到端高质量标注语料,能有效训练更鲁棒的基因组基础模型。
术语速查
全文 PDF 已归档 Google Drive
04-学术文献/Paper/;原文版权归 Cell 及作者所有