关键要点
- AlphaFold 数据库正式上线大流行防范门户,新增收录来自 23 个病毒家族的逾 8,000 个二聚体结构。
- 瑞士生物信息学研究所精准界定了多聚蛋白切割位点,助力团队解析约 2,800 种病毒的四万多条蛋白质序列。
- 研究团队利用 AlphaFold2 生成近 170 万个异源二聚体预测,经严苛质控后仅精选 5,279 个正式入库。
- 现有预测模型尚未包含协助免疫逃逸的聚糖修饰,且对于新冠刺突蛋白等三聚体结构的预测仍有待补全。
攻克多聚蛋白界定难题
AlphaFold 数据库目前拥有超过 300 万名全球用户,此前虽已涵盖绝大多数已知蛋白质,但病毒分子长期以来都是预测盲区。格拉斯哥大学分子病毒学家 Joe Grove 解释,登革病毒与寨卡病毒在宿主细胞内复制时,核糖核酸会先翻译成长链状的多聚蛋白(polyprotein,待剪切的前体蛋白)。这条长链随后裂解为具有独立功能的各个构件,机制上让算法很难仅凭基因序列推断单个蛋白质的起止位点,结构预测也因此残缺不全。
严苛质控遴选高精度结构
为突破这一瓶颈,瑞士生物信息学研究所精准定位了数千个剪切产物的序列。跨国科研团队随后汇总分析了约 2,800 种病毒的 41,774 个蛋白质序列,涵盖猴痘、麻疹与乙肝等常见病原体。研究人员调用 AlphaFold2 预测了 40,746 个同源二聚体(homodimer,两根相同链构成的复合结构)以及近 170 万个异源二聚体。由于执行了严格的质控筛选,最终仅有 2,749 个同源二聚体和 5,279 个异源二聚体被正式收纳入库,未入库的预测结果也向学界开源开放。
糖链缺失与高阶复合物挑战
这批预测成果虽然价值巨大,却依然存在现实局限。当前模型无法呈现包裹在蛋白质外表的聚糖修饰,而病毒正是依靠这些糖分子隐匿行踪、逃避宿主免疫识别。此外,众多病毒核心组件以三聚体乃至更高阶复合物的形式起效。例如新冠病毒的刺突蛋白与艾滋病毒的包膜蛋白均由三个单体聚成,二聚体预测精度往往不达标。欧洲生物信息学研究所的 Sameer Velankar 表示,后续会着手整合三聚体预测,但超大复合物究竟包含多少拷贝,目前在生物学上往往难以界定。
对研究者的意义
该进展为计算生物学与抗病毒药物研发打通了关键卡点。病毒常常通过蛋白二聚化或多聚化发挥侵染活性,高质量的相互作用界面模型能让研究人员跳过高难度的体外结晶实验,直接展开广谱中和抗体筛选和小分子抑制剂设计。对人工智能算法团队来说,这也是目前最系统、标准最严格的病毒蛋白质相互作用训练基准之一。
译介为忠实转述,非逐句直译;引用请以原文为准(版权归 Nature 及作者所有)