← 返回三刊速览 本月归档 Nature · 2026-09-14 · 新闻/评论中文译介

NATURE · NEWS · 中文译介 · 2026-09-14

药企私有数据加持:OpenFold3药物结合预测精度大涨

Drug firms’ secret data supercharge AI protein models

来源 Nature 栏目 新闻 / 评论DOI 10.1038/d41586-026-02882-x
导语
AbbVie与Astex等多家制药公司组建联盟,利用两万余个未公开的私有蛋白质结构微调开源模型OpenFold3。测试表明,聚合工业界专有数据大幅提升了AI预测药物相互作用的精度,显著超越仅基于公共数据训练的基线系统。
配图
Nature 新闻配图

关键要点

公共数据见顶制约AI制药

AlphaFold及其后续版本虽然彻底改变了结构生物学,但在药物发现领域却面临着严重的数据瓶颈。该领域极度依赖公共蛋白质数据库(Protein Data Bank,简称PDB),库中虽收录了20多万个结构,但真正与药物类似分子结合的样本仅有约1万个。这种数据匮乏直接制约了AI工具的实用价值。研究表明,一旦预测目标与模型训练集中的分子结构差异过大,共折叠模型的预测准确率便会出现断崖式下跌。

五家药企聚合专有结构微调

为了突破这一瓶颈,AbbVie与Astex等制药公司去年联合组建了AISB联盟(AI Structural Biology Network)。各大药企在长期的药物开发中,利用冷冻电镜和X射线晶体学积累了海量高精度蛋白质复合物结构,但这些资产过去大多作为商业机密被封存。此次合作中,五家公司拿出了20,167个与潜在药物分子结合的专有结构,在保证商业机密安全的前提下,对开源模型OpenFold3展开了联合微调。

盲测精度大幅超越开源基线

测试结果充分证实了聚合私有数据的价值。在预留的1,056个未参与训练的蛋白-配体结构测试集上,AISB微调模型的高精度预测比例超过了50%。相比之下,仅依赖公共数据训练的开源版OpenFold3准确率仅约33%,而另一款竞争开源模型Boltz-2也仅达到约40%。此外,该模型的效果同样优于各药企单独使用自有数据训练的版本,凸显出打破数据壁垒、联合建模的显著收益。

专有模型未开源催生公共呼吁

该项研究目前仅通过博客发布,尚未经过同行评审,且微调后的模型也暂不对外公开。参与该项目的哥伦比亚大学计算生物学家Mohammed AlQuraishi指出,这一成果有力证明了额外互作数据对模型性能的决定性作用,学界因而更需加速构建大规模的开放公共数据集。目前,获得英国政府高达800万英镑资助的OpenBind项目正在发力,该项目上月已发布数百个全新结构,未来将提供数千个开源结合位点数据。

对研究者的意义

对计算生物学与AI研究者而言,这项进展印证了高质量小样本结合数据对通用结构大模型的撬动效应。长期以来,药企内部的数据壁垒限制了AI在真实药物化学空间中的泛化能力;AISB的实验证明,在隐私安全框架下聚合私有数据能够有效攻克长尾结合模式的预测难题。这不仅为药物分子结合算法树立了新标杆,也为后续敏感生物数据的跨机构协同训练提供了关键范式。

本页由 ppt-rabbit 基于 Nature 原文自动译介并人工校验 · 生成于 2026-09-29 08:17 · 全文约 1421 字
译介为忠实转述,非逐句直译;引用请以原文为准(版权归 Nature 及作者所有)