科学问题
人类基因组学长期依赖单一参考基因组比对短读长数据,但复杂重复序列常因拼接困难而被遗漏。这导致近15%的基因组区域无法有效比对,难以准确解析非编码调控区与多拷贝变异。本文旨在探讨如何结合长读长测序算法突破与人工智能序列预测模型,构建包含完整单倍型相位的个人T2T基因组,进而实现从变异检测到功能预测的范式转变。
背景与领域脉络
人类基因组计划虽在2001年公布草图,但受限于当时的克隆与测序技术,遗漏了约8%富含高度重复序列的关键区域。此后二十年间,二代全基因组重测序虽成为主流,但短读长策略无法跨越着丝粒和片段重复,导致大量复杂变异被严重低估。直到纳米孔超长测序与高保真长读长技术融合,加之新型图组装算法的演进,研究人员才在2022年首次破译T2T-CHM13完整人类基因组。如今AI模型蓬勃发展,为彻底解读这些盲区的功能机制创造了前所未有的契机。
方法与技术路线
本文系统归纳了T2T基因组重建与下游功能建模的技术路线。在测序平台方面,研究整合了读长达兆碱基级别的牛津纳米孔超长测序,以及准确率超过99.9%的PacBio HiFi高保真测序。算法层面依托Verkko等双图组装工具,并结合Hi-C或家系三联体数据完成二倍体基因组定相。验证策略涵盖HG002、YAO和I002C等活体样本,以及RPE-1、KOLF2.1J和H9等细胞系。研究还将表观修饰、长读长转录组与AlphaGenome等AI大模型串联,以评估调控变异效应。
主要结果
攻克历史盲区与片段重复
传统参考基因组由于组装瓶颈,长期遗漏了约8%的高重复区域。短读长重测序受制于比对偏差,导致全基因组约15%的序列无法定位。T2T联盟在2018年启动后,于2022年发布了完整的T2T-CHM13无缝组装。该组装使一致性超过95%的配对片段重复序列碱基总量整整翻了1倍,成功填补了着丝粒与端粒的组装断裂。
二倍体定相与多物种图谱
组装算法由单倍体向二倍体快速演进。借助结合Hi-C与家系数据的双图算法,研究团队成功重构了HG002、YAO与I002C等高质量个人二倍体参考序列。同时,T2T测序拓展至小鼠、大鼠、拟南芥等至少7类模式生物及猿类物种。这揭示了既往难以解析的亚端粒卫星DNA,以及多拷贝基因家族的剧烈变异特征。
匹配细胞系解析单倍型调控
为消除功能基因组学的比对错位,研究人员在RPE-1、KOLF2.1J和H9这3种人类基准细胞系中,将长读长表观及转录组数据直接映射至各自的T2T二倍体基因组。这种匹配策略彻底消除了等位基因间的比对歧义。研究不仅完整解析了启动子与增强子的单倍型归属,还使复杂重复区内双等位变异的调控效应识别精度大幅提升。
驱动序列到功能AI模型
基于三联体密码规律,学界已能准确预测编码突变,但占基因组98%以上的非编码区长期难以解读。借鉴AlphaFold在蛋白质领域的成功,AlphaGenome等AI模型结合完整T2T数据开展序列到功能预测。该方法直接基于DNA序列推断转录与剪接改变,攻克了过去因参考盲区造成的调控变异评估瓶颈。
创新点
本文颠覆了依赖单一人类参考基因组(如GRCh38)比对变异的传统范式,提出了“以个体为中心”的个性化T2T全基因组分析路线。过去的二代短读长重测序难以跨越复杂重复区,导致约15%的关键功能区沦为盲区。本文主张直接完成个体的高精度二倍体无缝组装,并首次明确将T2T完整组装、单倍型定相多组学数据与序列到功能AI模型深度整合,为彻底解密非编码调控密码提供了全新的计算架构。
意义与影响
该路线将临床精准医学从粗放的已知靶向Panel筛查,升级为全基因组无盲区查询。这不仅能彻底检出致病性微卫星与串联重复扩增,还解决了复杂单倍型结构变异导致的误诊难题。在基础研究层面,无缝基因组消除了转录组与表观组比对歧义,使顺式调控元件与其靶等位基因的配对误差基本归零。这为开发通用型基因组基础AI模型铺平了道路,加速推动了生命蓝图由被动读取走向机制预测。
局限与待验证
目前全自动完成无差错二倍体T2T组装仍有技术难度,高同源性极度均一的串联卫星区仍可能残留拼接缺口与定相错误。其次,长读长测序与深层多组学联合采集成倍推高了检测成本,限制了其在临床大规模筛查中的即刻普及。此外,复杂环境与时间维度的远端基因调控规律极其繁复,AI模型目前的跨组织泛化预测精度依然有待严格验证。
对我们的相关性
做基因组学与遗传学的研究者可直接借鉴双图组装与超长长读长定相策略,将关注点从SNP转向此前无法检测的着丝粒重复扩增。单细胞与空间组学学者可借助个性化单倍型参考序列,精确将RNA读长或染色质可及性信号分配至父本或母本等位基因,规避比对偏差。对于生物AI开发者,本文指明了极具价值的训练底座:唯有采用完全对齐的完整单倍型组学数据,才能训练出不具系统性偏差的序列到功能大模型。
术语速查
全文 PDF 已归档 Google Drive
04-学术文献/Paper/;原文版权归 Cell 及作者所有