BHF GRAND CHALLENGE · INTERNAL EOI

AIBCD 提案深度解读

Artificial Intelligence-Enhancement of Biobanks for Cardiovascular Diagnoses, Discovery and Delivery
申请人:Prabhat Jha (NDPH) + Trey Ideker (BDI)  |  牛津大学  |  £10M / 5年

上篇 提案全文逐段解读

一、研究挑战与变革性意义

提案开篇即锚定一个宏大命题:心血管疾病(CVD)——包括缺血性心脏病、中风、外周血管病、心力衰竭和血管性痴呆——仍是全球死亡、残疾和生产力损失的首要原因。尽管通过控制吸烟、血压和胆固醇等已知风险因素已大幅降低了CVD负担,但预防仍受限于一个根本问题:对驱动个体易感性和疾病进展的生物学通路理解不完整,尤其是在不同年龄、社会经济群体和种族中。

"AI、人群规模生物样本库、先进影像、数字健康监测和高维分子技术的融合,为转化心血管科学提供了前所未有的机遇。我们提出一个集成AI框架,将生物样本库从数据仓库转变为发现引擎。"

这段阐述的核心逻辑是:从"描述性流行病学"到"机制驱动的精准预防"。传统的多基因风险评分(PRS)只解释了部分遗传风险,AIBCD要做的是整合遗传+蛋白组+代谢组+影像+可穿戴+环境暴露的全维度数据,发现因果机制而非相关性。

牛津的独特优势在于其同时掌握五大前瞻性队列:UK Biobank、CKB(中国慢性病前瞻性研究)、Mexico City Prospective Study、Million Women's Study、EPIC-Oxford。提案特别强调CKB的全基因组测序和蛋白组学数据是"currently accessible only within NDPH"的稀缺资源。

二、领域现状与AIBCD的超越路径

提案坦承当前方法的三个局限性:

  • ① 各数据类型的分析碎片化(基因组学一种方法,影像一种方法,互不打通)
  • ② 跨人群整合不足(模型在UK Biobank做得好,到中国或墨西哥就失效)
  • ③ 预测模型难以转化为生物学理解和治疗发现("black-box"问题)

AIBCD的突破路径明确:

超越预测

不仅做风险预测,而是用AI发现血管疾病背后的生物网络,识别可修改的通路,发现治疗靶点。

超越PRS

提出Dynamic Precision Risk Scores (DPRS),替代静态多基因风险评分,整合实时蛋白组学、代谢组学、可穿戴生物标记。

超越黑箱

继承Trey Ideker在精准肿瘤学中开发的"透明AI"方法——将AI预测与严谨流行病学原则(孟德尔随机化、贝叶斯共定位、in silico knock-out)结合。

超越单人群

跨UK/中国/墨西哥多人群验证。利用WGS捕获罕见蛋白截断变异和调控变异,区分因果机制vs相关性标记。

三、四个 Work Stream 逐一分析

WS1
AI-Based Systems Biology
£2.5M
目标:利用AI识别未被发现的CVD机制。
方法:网络生物学+多组学整合,从群体数据中推断因果生物网络。
里程碑:(i)识别先前未知的疾病机制 (ii)建立由遗传证据支持的治疗靶点管线。该WS与Trey Ideker的BDI核心能力直接关联——网络生物学是其标志性方法。
WS2
Novel Therapeutic Targets
£3M
目标:从AI发现转化为可验证的药物靶点。
方法:AI预测+人遗证据+计算生物学验证的三级过滤。
里程碑:产出治疗靶点管线,支持人类遗传证据和计算预测的生物学相关性。这是四个WS中预算最大的,反映BHF对"可转化产出"的高度重视。
WS3
Multimodal Digital Phenotyping
£1.5M
目标:可穿戴+影像+组学融合的数字表型。
方法:Transformer+自监督预训练的可穿戴和影像基础模型。整合ECG、加速度信号等多连续数据流为临床级数字生物标记。
里程碑:(i)最大规模多模态血管数字表型资源库 (ii)第一代AI多模态数字生物标记验证。
WS4
Foundation Models for Risk Prevention
£3M
目标:构建多模态CVD基座模型。
方法:将基因组学、循环生物标记、代谢组学、蛋白组学、影像、EHR、生活方式、环境暴露和数字表型的特征嵌入统一模型。关键:明确提到"DNA foundation models"——通过DNA基座模型改进基因组层建模。
里程碑:(i)多模态CVD基座模型 (ii)跨多种族多环境验证优于现有风险评分 (iii)评估对CVD负担的影响。

四、患者参与与伦理框架(PPIE)

提案展现了成熟的公众参与架构,这在中国的科研提案中往往被低估:

  • 牛津拥有全球领先的生命伦理研究中心之一EthOx Centre,专门研究AI和数据科学中的实践伦理问题
  • 设立国际患者咨询委员会,由来自UK、中国和墨西哥的参与者组成
  • 联合全球各CVD学会讨论并传播研究发现
  • 围绕早期检测、预防、AI工具的公平实施、个人健康数据的适当使用与患者联合设计研究优先级

这一部分提示:如果华大参与合作,需要同等重视伦理治理和公众参与。

五、资金结构分析

项目金额来源说明
BHF申请£10MBHF Grand Challenge5年,四WS分配如上
蛋白组学£40M药企合作CKB、EPICO、MWS的大规模蛋白组学分析
牛津配套£5MOxford Health Hub (Trey Ideker)战略性研究基金
实物贡献in-kind各生物样本库现有数据、标本、基础设施、分析平台
总计杠杆>£55M多渠道BHF £10M撬动>5倍配套

关键信号:£40M药企蛋白组学资金覆盖CKB,意味着CKB的数据价值已经被国际药企认可并愿意重度投资。华大作为CKB数据的产出方,在这场生态中应占据更核心的地位。

下篇 拓展合作方案提议

六、华大与AIBCD的五个切入点

AIBCD 需求

WS4明确需要DNA Foundation Model进行基因组层建模。提案特别提到需要"improved modelling of the genomic layer via DNA foundation models"。

切入点一

Genos作为WS4的DNA基座模型。华大Genos已完成636个T2T基因组预训练,具备1Mb上下文窗口,可直接作为CVD基座模型的基因组编码器。牛津不需要从零训练DNA模型——节省至少£1M和一年时间。

AIBCD 需求

CKB全基因组测序和蛋白组学数据是牛津"仅NDPH可访问"的独特资源。但数据存储、管理和分析在PB级规模上是巨大挑战。

切入点二

CKB 50万人数据通过Genos压缩为.genos容器。将"锁-钥匙"安全共享方案在牛津部署,实现中国数据不出境、牛津可分析。这是解决中英人类遗传资源跨境合规的核心方案。

AIBCD 需求

WS2需要AI驱动的治疗靶点发现管线——"prioritisation of a pipeline of therapeutic targets, supported by human genetic evidence and computational prediction of biological relevance"。

切入点三

Cyto CoScientist用于CVD靶点发现。Cyto的递归ReAct+分层控制+多证据融合(文献+生信+知识图谱)能力直接匹配WS2需求。特别是在Mendelian Randomisation解读、蛋白截断变异功能推断等方面可产生独特价值。

AIBCD 需求

WS3需要可穿戴+影像的多模态AI。提案提到"BDI has built wearable and imaging foundation models based on transformer and self-supervised augmentation pre-trained models"。

切入点四

13311i实践作为WS3的中国验证场景。13311i的三样本(血尿便)+三影像(B超·核磁·CT)+一可穿戴构成天然的多模态数字表型资源。中国人群的数据可以补充牛津的UK/墨西哥队列。

AIBCD 需求

提案强调"the global nature of biobanks can enable discoveries relevant widely"。需要多种族、多环境的验证数据。牛津已有UK/Mexico,但需中国人群作为独立验证队列。

切入点五

STOC+HGP2+EBP等数据产出计划提供全球化验证。华大主导的五大数据产出计划覆盖多地域多人群,可作为AIBCD模型在不同人群中的外部验证数据集。

七、三级合作方案(递进式)

Level 1 · 基础合作:Genos + CKB 数据入模

内容:华大提供Genos基座模型作为AIBCD WS4的DNA Foundation Model组件,并将CKB 50万人全基因组数据压缩为.genos容器供牛津训练使用。

华大角色:数据与模型提供方(Named Collaborator)。交付物:Genos模型API + CKB .genos容器(锁)+ CKB蛋白组学嵌入。

价值:Genos获得BHF Grand Challenge的顶级学术背书。CKB数据通过模型方式实现国际科研利用,树立人遗资源合规出境的"模型替代数据"范式标杆。

Level 2 · 深度合作:Cyto CoScientist + 联合靶点发现

内容:将Cyto CoScientist部署为AIBCD WS2的AI科学发现引擎。联合发表CVD新靶点、新机制的发现论文和技术报告。

华大角色:Co-Investigator(联合PI级别)。交付物:Cyto CoScientist在CVD领域的优化版本 + 多个已验证的CVD靶点假设。

价值:Cyto获得国际顶级CVD项目的实战验证。华大从数据提供方升级为科学合作伙伴。WS2是预算最大(£3M)的stream,联合申请可争取华大的直接经费份额。

Level 3 · 战略合作:OPOM数字孪生 + 亚太队列

内容:华大主导AIBCD的亚洲分支——利用STOC·HGP2等数据产出计划建立独立的亚太验证队列。将CKB的OPOM(一人一模型)数字孪生范式拓展到CVD领域。与牛津联合建立中英双中心的CVD基座模型。

华大角色:平等PI(与牛津平行领导)。交付物:亚太CVD数字孪生平台 + 面向中国人群的DPRS模型 + 联合.genos标准。

价值:华大成为全球CVD AI研究的核心节点之一。牛津提供方法学框架,华大提供数据规模和模型能力。"中国数据→中国模型→全球验证"的路径。

八、推进路线图

时间动作关键产出
2026年8月通过CKB既有渠道正式接触Prabhat Jha团队,表达Level 1合作意向合作意向书(LoI)
2026年9月Genos-CKB技术演示:展示.genos容器 + 锁-钥匙安全共享方案的实际运行技术演示报告 + 性能基准
2026年10月确定合作层级(Level 1/2/3),签署合作框架协议框架协议
2026年11月联合撰写BHF正式申请中涉及华大的部分(WS4的DNA Foundation Model章节 + WS2的AI发现方法)BHF正式申请稿中华大部分
2027年(如获批)AIB CD正式启动,华大团队纳入项目管理委员会项目启动 + 人员部署

九、关键风险与应对

风险可能性影响应对措施
牛津已有DNA Foundation Model方案,不需要Genos中高提案提到DNA foundation model但可能指从头训练或使用其他模型。需尽快接触确认。Genos的636 T2T预训练+1Mb上下文优势明确。
CKB数据跨境合规限制高高.genos容器方案(锁-钥匙分离)是核心解法;可在DCS Cloud境内训练,牛津通过API访问模型推理。
牛津对华大作为合作伙伴的认知不足高中CKB已建立信任关系;9月Cyto Technical Report发布可作为华大AI能力的凭证。
BHF不批准该提案中中即使BHF不批,与牛津NDPH/BDI建立合作本身就有长期价值。蛋白组学的£40M药企投入不受影响。