提案开篇即锚定一个宏大命题:心血管疾病(CVD)——包括缺血性心脏病、中风、外周血管病、心力衰竭和血管性痴呆——仍是全球死亡、残疾和生产力损失的首要原因。尽管通过控制吸烟、血压和胆固醇等已知风险因素已大幅降低了CVD负担,但预防仍受限于一个根本问题:对驱动个体易感性和疾病进展的生物学通路理解不完整,尤其是在不同年龄、社会经济群体和种族中。
这段阐述的核心逻辑是:从"描述性流行病学"到"机制驱动的精准预防"。传统的多基因风险评分(PRS)只解释了部分遗传风险,AIBCD要做的是整合遗传+蛋白组+代谢组+影像+可穿戴+环境暴露的全维度数据,发现因果机制而非相关性。
牛津的独特优势在于其同时掌握五大前瞻性队列:UK Biobank、CKB(中国慢性病前瞻性研究)、Mexico City Prospective Study、Million Women's Study、EPIC-Oxford。提案特别强调CKB的全基因组测序和蛋白组学数据是"currently accessible only within NDPH"的稀缺资源。
提案坦承当前方法的三个局限性:
AIBCD的突破路径明确:
不仅做风险预测,而是用AI发现血管疾病背后的生物网络,识别可修改的通路,发现治疗靶点。
提出Dynamic Precision Risk Scores (DPRS),替代静态多基因风险评分,整合实时蛋白组学、代谢组学、可穿戴生物标记。
继承Trey Ideker在精准肿瘤学中开发的"透明AI"方法——将AI预测与严谨流行病学原则(孟德尔随机化、贝叶斯共定位、in silico knock-out)结合。
跨UK/中国/墨西哥多人群验证。利用WGS捕获罕见蛋白截断变异和调控变异,区分因果机制vs相关性标记。
提案展现了成熟的公众参与架构,这在中国的科研提案中往往被低估:
这一部分提示:如果华大参与合作,需要同等重视伦理治理和公众参与。
| 项目 | 金额 | 来源 | 说明 |
|---|---|---|---|
| BHF申请 | £10M | BHF Grand Challenge | 5年,四WS分配如上 |
| 蛋白组学 | £40M | 药企合作 | CKB、EPICO、MWS的大规模蛋白组学分析 |
| 牛津配套 | £5M | Oxford Health Hub (Trey Ideker) | 战略性研究基金 |
| 实物贡献 | in-kind | 各生物样本库 | 现有数据、标本、基础设施、分析平台 |
| 总计杠杆 | >£55M | 多渠道 | BHF £10M撬动>5倍配套 |
关键信号:£40M药企蛋白组学资金覆盖CKB,意味着CKB的数据价值已经被国际药企认可并愿意重度投资。华大作为CKB数据的产出方,在这场生态中应占据更核心的地位。
WS4明确需要DNA Foundation Model进行基因组层建模。提案特别提到需要"improved modelling of the genomic layer via DNA foundation models"。
Genos作为WS4的DNA基座模型。华大Genos已完成636个T2T基因组预训练,具备1Mb上下文窗口,可直接作为CVD基座模型的基因组编码器。牛津不需要从零训练DNA模型——节省至少£1M和一年时间。
CKB全基因组测序和蛋白组学数据是牛津"仅NDPH可访问"的独特资源。但数据存储、管理和分析在PB级规模上是巨大挑战。
CKB 50万人数据通过Genos压缩为.genos容器。将"锁-钥匙"安全共享方案在牛津部署,实现中国数据不出境、牛津可分析。这是解决中英人类遗传资源跨境合规的核心方案。
WS2需要AI驱动的治疗靶点发现管线——"prioritisation of a pipeline of therapeutic targets, supported by human genetic evidence and computational prediction of biological relevance"。
Cyto CoScientist用于CVD靶点发现。Cyto的递归ReAct+分层控制+多证据融合(文献+生信+知识图谱)能力直接匹配WS2需求。特别是在Mendelian Randomisation解读、蛋白截断变异功能推断等方面可产生独特价值。
WS3需要可穿戴+影像的多模态AI。提案提到"BDI has built wearable and imaging foundation models based on transformer and self-supervised augmentation pre-trained models"。
13311i实践作为WS3的中国验证场景。13311i的三样本(血尿便)+三影像(B超·核磁·CT)+一可穿戴构成天然的多模态数字表型资源。中国人群的数据可以补充牛津的UK/墨西哥队列。
提案强调"the global nature of biobanks can enable discoveries relevant widely"。需要多种族、多环境的验证数据。牛津已有UK/Mexico,但需中国人群作为独立验证队列。
STOC+HGP2+EBP等数据产出计划提供全球化验证。华大主导的五大数据产出计划覆盖多地域多人群,可作为AIBCD模型在不同人群中的外部验证数据集。
内容:华大提供Genos基座模型作为AIBCD WS4的DNA Foundation Model组件,并将CKB 50万人全基因组数据压缩为.genos容器供牛津训练使用。
华大角色:数据与模型提供方(Named Collaborator)。交付物:Genos模型API + CKB .genos容器(锁)+ CKB蛋白组学嵌入。
价值:Genos获得BHF Grand Challenge的顶级学术背书。CKB数据通过模型方式实现国际科研利用,树立人遗资源合规出境的"模型替代数据"范式标杆。
内容:将Cyto CoScientist部署为AIBCD WS2的AI科学发现引擎。联合发表CVD新靶点、新机制的发现论文和技术报告。
华大角色:Co-Investigator(联合PI级别)。交付物:Cyto CoScientist在CVD领域的优化版本 + 多个已验证的CVD靶点假设。
价值:Cyto获得国际顶级CVD项目的实战验证。华大从数据提供方升级为科学合作伙伴。WS2是预算最大(£3M)的stream,联合申请可争取华大的直接经费份额。
内容:华大主导AIBCD的亚洲分支——利用STOC·HGP2等数据产出计划建立独立的亚太验证队列。将CKB的OPOM(一人一模型)数字孪生范式拓展到CVD领域。与牛津联合建立中英双中心的CVD基座模型。
华大角色:平等PI(与牛津平行领导)。交付物:亚太CVD数字孪生平台 + 面向中国人群的DPRS模型 + 联合.genos标准。
价值:华大成为全球CVD AI研究的核心节点之一。牛津提供方法学框架,华大提供数据规模和模型能力。"中国数据→中国模型→全球验证"的路径。
| 时间 | 动作 | 关键产出 |
|---|---|---|
| 2026年8月 | 通过CKB既有渠道正式接触Prabhat Jha团队,表达Level 1合作意向 | 合作意向书(LoI) |
| 2026年9月 | Genos-CKB技术演示:展示.genos容器 + 锁-钥匙安全共享方案的实际运行 | 技术演示报告 + 性能基准 |
| 2026年10月 | 确定合作层级(Level 1/2/3),签署合作框架协议 | 框架协议 |
| 2026年11月 | 联合撰写BHF正式申请中涉及华大的部分(WS4的DNA Foundation Model章节 + WS2的AI发现方法) | BHF正式申请稿中华大部分 |
| 2027年(如获批) | AIB CD正式启动,华大团队纳入项目管理委员会 | 项目启动 + 人员部署 |
| 风险 | 可能性 | 影响 | 应对措施 |
|---|---|---|---|
| 牛津已有DNA Foundation Model方案,不需要Genos | 中 | 高 | 提案提到DNA foundation model但可能指从头训练或使用其他模型。需尽快接触确认。Genos的636 T2T预训练+1Mb上下文优势明确。 |
| CKB数据跨境合规限制 | 高 | 高 | .genos容器方案(锁-钥匙分离)是核心解法;可在DCS Cloud境内训练,牛津通过API访问模型推理。 |
| 牛津对华大作为合作伙伴的认知不足 | 高 | 中 | CKB已建立信任关系;9月Cyto Technical Report发布可作为华大AI能力的凭证。 |
| BHF不批准该提案 | 中 | 中 | 即使BHF不批,与牛津NDPH/BDI建立合作本身就有长期价值。蛋白组学的£40M药企投入不受影响。 |