← 返回三刊速览 本月归档 Science · 2026-09-17 · 深度解读

SCIENCE · DEEP READ · 2026-09-17

CRISPR-Cas起源处“0”引导的“1”识别的非连续代码

A noncontiguous code for RNA-guided DNA recognition at the origin of CRISPR-Cas

第一作者 Peter H. Yoon 末位/资深 Jennifer A. Doudna 共 17 位作者 DOI 10.1126/science.aei0498
一句话结论
发现CRISPR祖先系统VIPR,其vrRNA通过跳跃1个碱基的非连续密码特异识别双链DNA。
记住这一句:RNA引导的DNA识别并非全靠连续配对,其进化原初形态是跳跃式三联体密码。
摘要图
图为文章官方摘要图(期刊网页 key image)

科学问题

CRISPR-Cas等RNA引导系统如何演化出可编程核酸识别能力,是生命科学领域的演化谜题。传统序列比对在此完全失效,因为核心效应蛋白序列分化极大。这使得领域长期无法追溯RNA引导效应蛋白的真正起源。本研究旨在回答:早期效应蛋白在演化中源自何处?它们最初使用何种逻辑编码靶标信息,又是如何介导核酸识别的?

背景与领域脉络

已知CRISPR-Cas系统通过向导RNA与靶标连续配对,实现双链核酸的精准定位。其中第1类系统依赖重复序列相关神秘蛋白(RAMP)寡聚组装。然而,RAMP家族序列高度分化,人们始终未能在细胞基因组中找到其共同祖先。近年蛋白质结构预测模型的成熟为跨越序列鸿沟提供了契机。研究团队此前利用AlphaFold结构聚类成功追踪了Cas13起源。这启发他们进一步在噬菌体暗物质中搜索具有保守折叠结构的原初效应蛋白,以解开适应性免疫系统诞生之谜。

方法与技术路线

作者利用DALI算法在含230万个预测结构的聚类AlphaFold数据库中,检索RAMP特异的核心折叠特征。随后在NCBI数据库中系统挖掘对应操纵子,并分析其在664个代表性位点中的基因组分布。针对大肠杆菌噬菌体SUSP1感染模型,团队通过小RNA测序(sRNA-seq)检测vrRNA转录。他们利用基因组语言模型Evo2评估基序保守性,并在4502个大肠杆菌全基因组中建立0至3个跳跃碱基的靶标搜索算法。最终,作者借助体外DNA竞争结合、ChIP-seq以及GFP阻遏与噬菌体侵染实验完成机制验证。

主要结果

鉴定出CRISPR RAMP的噬菌体祖先

通过结构挖掘,作者在数据库中鉴定出2664个全新RAMP同源蛋白,并命名为VIPR系统。在分析的664个代表性位点中,前噬菌体占比达56.0%,游离病毒占14.8%,宿主染色体仅占25.5%。系统发生分析证实,Vipr分枝早于Cas5、Cas6和Cas7的分化,呈现结构更简化的原初单结构域特征。

发现vrRNA交替串联重复结构

小RNA测序显示,SUSP1噬菌体感染大肠杆菌1小时后会表达4个长度约100核苷酸的vrRNA。利用语言模型Evo2解析137条同源序列发现,vrRNA包含9至16个串联重复单元。保守的GGY三联体与高信息熵的NN二联体在此交替排列。这些重复单元后方衔接一段保守发夹结构,与成熟crRNA的手柄区结构功能类似。

确立1核苷酸跳跃的非连续DNA识别法则

作者检索4502个大肠杆菌基因组,证实NN二核苷酸通过间隔1个碱基(xNN规则)精准识别DNA。在体外竞争结合中,面对10倍过量的非特异DNA,复合物仍仅特异结合该底物。在转录阻遏实验中,全基因组ChIP-seq显示预测靶位点在872个富集峰中排名第一。此外,4个重编程向导中有3个成功抑制GFP表达,且无需PAM参与。

证实VIPR系统调控噬菌体间冲突

靶标分析显示,SUSP1系统的20个靶标中有18个精准命中了长度为11 kb的共存卫星噬菌体。在活体防御实验中,靶向裂解因子cro使λ噬菌体噬斑形成率降低了整整5个数量级。突变向导中12个NN二联体的任何一个都会破坏保护效力。不仅如此,利用向导靶向溶源阻遏因子cI后,作者成功强制潜伏前噬菌体启动裂解程序,证实其具备双向干预能力。

创新点

过去学术界普遍认为RNA引导的核酸识别必须依赖连续碱基配对。本研究打破了这一定式,首次阐明了一种基于“三联体框架、跳跃二联体识别”的非连续碱基配对法则。在演化机制上,不同于既往将CRISPR视作宿主单向防御武器的观点,作者证实其效应蛋白起源于噬菌体间的冲突攻防。这种无需PAM基序、依靠周期性跳跃识别双链DNA的模式,代表了一种全新的核酸信息编码逻辑。

意义与影响

该工作重塑了CRISPR-Cas系统的演化叙事,补全了从病毒移动元件向原核适应性免疫系统过渡的关键缺环。在机制上,它证明了非连续配对足以稳定结合双链DNA并介导特异性转录沉默。这为开发下一代微型化基因调控工具开辟了全新路径。无PAM限制且可自由靶向DNA双链的特性,有望帮助研究者突破传统Cas酶的靶点识别盲区,为设计高特异性人造阻遏蛋白提供原型。

局限与待验证

本研究目前仅深入解析了II型VIPR系统,其余6个类型的生化细节与活性机制仍待系统实验验证。虽然作者证明该复合物能高效阻遏转录,但Vipr在天然状态下是否具有潜在的DNA剪切活性尚无定论。此外,该系统在哺乳动物等真核细胞复杂的染色质环境下能否维持结合活性与低脱靶率,仍需进一步评估。

对我们的相关性

对AI与生物信息学研究者而言,该研究确立了“结构聚类结合语言模型(如Evo2)”挖掘远源非编码RNA的新范式,该思路可直接用于宏基因组暗物质探索。对从事功能基因组学与合成生物学的同行,VIPR系统摆脱了PAM限制且仅需极短二联体编码,是开发超紧凑转录抑制器(新型CRISPRi)的天然支架,能为特定基因敲落或表观沉默工具设计提供全新可能。

术语速查

RAMP(重复序列相关神秘蛋白 / Repeat-Associated Mysterious Proteins)Class 1 CRISPR系统的核心蛋白家族,含RRM折叠,负责结合向导RNA并组装效应复合物。
VIPR系统(病毒干预可编程重复系统 / Viral Interference Programmable Repeat)主要编码于噬菌体中的原初RNA引导系统,由Vipr蛋白与vrRNA组成,用于调控病毒间竞争。
vrRNA(VIPR向导RNA / VIPR RNA)VIPR系统的特异性向导分子,由周期性GGY基序与超变NN二联体串联而成,引导复合物识别目标DNA。
1-nt跳跃规则(1-nt skip rule / 1-nt skip rule)VIPR识别双链DNA的独特密码规则,向导中的NN二核苷酸在目标DNA上每隔1个碱基配对一次(即xNN模式)。
Evo2(Evo2基因组语言模型 / Evo2)一种基于自监督深度学习的无对齐基因组大模型,通过预测核酸概率分布来评估序列保守性与信息熵。
本页由 ppt-rabbit 基于论文全文自动生成并人工校验 · 生成于 2026-09-24 08:14 · 全文约 2802 字
全文 PDF 已归档 Google Drive 04-学术文献/Paper/;原文版权归 Science 及作者所有