汇报提纲 · 科技部

华大平台·数据·模型·应用四位一体

基因组多维解析技术全国重点实验室
从大规模数据产出到生命科学基座模型的贯穿闭环
Part 1

基因组多维解析技术全国重点实验室

企业全国重点实验室,依托华大生命科学研究院建设。以大规模数据产出和AI大模型为核心驱动力,构建基因组学、时空组学、单细胞组学等多维解析技术体系。

定位与目标

面向生命科学前沿和人民健康重大需求,以基因组多维解析技术为核心,构建从"读"(测序)到"存"(数据)到"写"(合成)的贯穿闭环。目标:建成世界一流的基因组多维解析技术创新策源地。

核心任务

  • 超高通量测序与多维组学技术研发
  • 大规模多模态数据产出与标准化
  • AI驱动的基因组解析与生命科学基座模型
  • 临床应用转化与精准医学示范

架构与团队

  • 依托华大研究院,工程化作战模式
  • 多个技术平台协同:测序·时空·单细胞·合成
  • 跨学科团队:基因组学×AI×工程×临床
  • 国际协作网络:STOC·HGP2·EBP等大科学计划
✅ 成果概要

建成全球最大通量的DNBSEQ测序平台(T系列)、Stereo-seq时空组学技术、DNBelab C单细胞平台;主导STOC/HGP2/EBP等5项国际大科学计划;累计产出数据量超EB级;Genos基因组基座模型发表GigaScience 2025;承担多项国家重点研发计划。

5 EB
五年数据产出目标
5+
国际大科学计划
5
国际大科学计划
3
基座模型
⚠️ 企业全重的特殊性 —— 需关注的核心问题

1. 人才帽子无优势
企业全重不享受高校/中科院的"杰青""长江"等帽子评审通道,人才引进和保留面临结构性劣势。考核体系应区别于学术机构,以工程化产出和产业转化为核心指标。

2. 有组织科研 vs 独立PI
企业全重是工程化作战——不突出单兵英雄、无独立PI制。而现有项目评审以PI制为核心,与企业的组织模式形成错配。

3. 国家项目竞争劣势
企业身份在部分项目申报中受限(如自然基金面上项目仅限依托单位),需要科技部在项目设置上给予企业全重独立赛道。

4. 自筹经费压力
企业全重自筹比例要求较高。大规模数据产出和AI模型训练计算成本持续攀升,需在经费评估中充分考虑企业全重的运营成本结构。

📋 诉求一:全重相关
① 企业全重考核体系差异化
建立区别于高校/中科院的独立考核指标:以数据产出、技术转化、产业应用为核心,弱化论文和帽子权重。
② 企业全重项目申报独立赛道
在国家重点研发计划中设立企业全重专项或给予单独申报通道,解决"有组织科研"与PI制评审的错配问题。
③ 适当降低自筹经费比例
考虑企业全重运营成本高企(设备·数据·计算),在大科学计划和平台建设类项目中适当降低自筹要求。
④ 人才政策支持
建议科技部协调:企业全重人员在国家级人才计划中享受与高校/中科院同等的评审资格。
Part 2

大平台 · 高质量数据集 · CNGBdb

华大已建成全球领先的"读写存"一体化生命科学平台——从超高通量测序到自动化智能化实验室,从五大国际数据计划到 CNGBdb 国家级数据库,形成了完整的数据基础设施。

读写存一体化平台

读:DNBSEQ-T系列超高通量测序矩阵,Stereo-seq 纳米级空间转录组,DNBelab C 超高通量单细胞平台

存:DCS Cloud 云端多组学分析平台,CNGBdb 国家级基因数据库,Genos 基因组基座模型

写:大规模DNA合成平台,噬菌体/细胞工厂工程化,基因编辑与合成生物学闭环

自动化 & 智能化实验室

  • 机器人自动化文库构建与样本处理
  • AI驱动的智能质控与流程优化
  • FluoXpert 自动化病理染色
  • 噬菌体筛选全流程自动化
  • MGI T系列测序矩阵——无人值守闭环
五大国际数据产出计划
计划全称数据规模核心产出
STOC时空组学国际联盟0.5 EBCancer / Brain / Plant / Infection 旗舰图谱
HGP2人类基因组计划二期1.5 EB百万人级全基因组+多组学,构建精准医学遗传基线
EBP地球生物基因组计划1 EB全球真核生物全基因组数字化蓝图
10BC百亿级单细胞图谱1 EB覆盖主要组织/发育阶段的虚拟细胞训练数据基础
100KPM十万例癌症病理多组学1 EB基因组+转录组+蛋白质组+病理影像,i3S葡萄牙节点

CNGBdb:国家基因库生命大数据平台

CNGBdb 是科技部、财政部认定的国家科技资源共享服务平台,已建成全球最大的综合性基因数据存储与共享平台之一。

  • 数据归档量超 10 PB,覆盖基因组、转录组、表观组、蛋白质组等多维数据类型
  • 已获国际核酸序列数据库联盟(INSDC)认可
  • 服务全球 200+ 国家和地区科研用户
  • 支撑 STOC/HGP2/EBP 等国际大科学计划的数据管理与开放共享
  • 集成 DCS Cloud 云端分析能力,实现"数据即分析"

全球影响力数据

10+ PB
数据归档总量
200+
服务国家/地区
  • INSDC 国际核酸序列数据库联盟成员
  • 科技部/财政部国家科技资源共享服务平台
  • 支撑多项 Nature/Science/Cell 级重大成果
📋 诉求二:平台与数据相关
① 组学EB级智能化数据产出平台纳入国家科技支持
将华大"读写存"一体化平台——特别是DNBSEQ超高通量测序矩阵、Stereo-seq空间组学、DNBelab C单细胞平台及DCS Cloud云端分析体系——整体纳入国家科技基础设施规划,给予稳定经费支持,确保EB级多模态数据产出的可持续性和标准化。
② 国内共享科研平台推广
推动 CNGBdb 和 DCS Cloud 成为全国科研机构多组学数据分析的公共基础设施,纳入科技部科学数据共享平台体系。
③ 五大计划专项支持
在重点研发计划中设立大科学数据专项,系统支持 STOC/HGP2/EBP/10BC/100KPM 的数据产出和标准化。
④ 将 CNGBdb 纳入科技部科学数据平台体系
将 CNGBdb 正式列入科技部国家科学数据中心序列,享受与同类国家平台同等的政策和经费支持。
Part 3

AI4S:生命科学基座模型

以5 EB高质量多模态数据为燃料,构建基因组基座模型、虚拟细胞模型、病理组织模型三大基座——最终融合大语言模型成为生命科学贯穿基座模型,垂直应用于疾病诊断、药物开发和农业育种。

Genos · 基因组基座模型

GigaScience 2025

  • MoE 架构,1 Mb 超长上下文
  • 636 个 T2T 人类基因组训练
  • DNA→RNA 表达 Pearson ~0.933
  • ATAC 可及性预测
  • ClinVar 变异致病性 AUC ~0.93
  • ATLAS 方法:无GWAS直接发现疾病位点

虚拟细胞模型

基于 10BC 数据训练

  • 多组学驱动的细胞状态模拟
  • 基因扰动效应预测
  • 药物响应与发育轨迹模拟
  • 细胞通讯与微环境建模
  • 单细胞分辨率的"数字孪生"

病理组织模型

基于 100KPM 数据训练

  • 融合空间转录组与病理图像
  • 组织层面疾病分型
  • 预后预测与药物靶点发现
  • 10 万病例驱动的临床级 AI
🧠 三大模型 + 大语言模型 = 生命科学贯穿基座模型

同时具备多模态理解与生成能力,垂直应用:遗传病诊断(Genos-AD)· 智能育种(基因组选择)· 基因编辑设计(CRISPR靶点预测)· 蛋白质药物开发(ProteinMPNN+RFdiffusion)· 细胞疗法(CAR-T优化)

华大的独特优势:为什么我们能做生命科学基座模型?

① 高质量数据供给

自有测序平台产出数据具有完全可控的质量标准、实验条件和元数据标注——这是公开数据无法比拟的训练数据优势。

② 以模型训练为目标的数据产出

五大计划不是"先有数据再想模型",而是以训练基座模型为导向来设计数据产出策略——采样方案、模态覆盖度、标注体系均为AI训练优化。

③ 应用导向的天然优势

从疾病诊断到农业育种、从药物开发到合成生物学——模型产出有直接的产业应用场景和验证闭环,不做"空模型"。

📋 诉求三:AI4S 相关
① 集中力量突破生命科学基座模型
建议科技部在国家层面设立"生命科学基座模型"重大专项,集中资源支持Genos等模型的规模化训练和迭代——避免分散投入、重复建设。
② 项目支持与引导
在重点研发计划中增设"AI for Life Science"方向,引导高校和企业形成"数据-模型-应用"协同创新链,华大可作为数据供给和模型训练的基础设施平台。
③ 计算基础设施支持
大模型训练需要超大规模GPU集群。建议将生命科学基座模型纳入国家算力平台支持范围,或给予专项算力补贴。
④ 高质量训练数据标准建立
建议科技部牵头制定生命科学AI训练数据的质量标准、共享规范和评估体系,华大可作为标准制定的主要技术支撑单位。
Part 4

从"华大三不"到全民三不

以华大员工健康实践为起点,推动"三不"(出生缺陷防控·远离肿瘤·远离心脑血管疾病)从企业行动走向全民工程——既有民生价值,也有科研价值,实现一数多用。

华大三不:从我做起

  • 出生缺陷防控 — 全基因组筛查、携带者筛查
  • 远离肿瘤 — 早筛早诊、甲基化液体活检
  • 远离心脑血管 — 遗传+代谢多维度风险评估

华大员工全员践行,形成"人人参与、人人受益"的健康管理模式。

13311i 健康数字化

  • 1 基因组基线 — 全基因组测序,建立遗传健康基线
  • 3 管样本 — 血·尿·便,多组学全景检测
  • 3 影像 — B超·核磁·CT,全身结构筛查
  • 1 内镜检查 — 唯一的侵入式检测,消化·呼吸内镜
  • 1 脑科学 — 认知·脑电·脑影像
  • 1 可穿戴 — 持续生命体征监测
  • i 指数(index)— 健康数字化,智能评价体系

美丽健康实践

从"不生病"到"更健康",覆盖全生命周期的健康管理:

  • 个性化营养方案(基于基因组+肠道菌群)
  • 运动处方与健康行为干预
  • 皮肤微生态与衰老干预
  • 心理健康与睡眠管理
  • 数字化健康档案与AI健康管家
一数多用:民生 × 科研双价值

同一份健康检测数据同时服务于三个目标:
① 民生:个体化健康管理与疾病预防
② 科研:大规模人群队列驱动的科学发现
③ 产业:筛查产品验证、药物靶点发现、健康管理模式优化
数据一次采集,多方复用——降低社会总成本。

💰 极致成本优势:数据产出的经济可行性

华大自主测序平台的核心壁垒在于极致成本控制:DNBSEQ 测序成本仅为国际主流平台的 1/3–1/5,Stereo-seq 空间组学芯片成本持续下降。
EB 级数据产出的前提是成本可行。五大计划的 5 EB 目标依赖持续的成本优化——只有当测序成本降至"全民可及"水平,三不工程的大规模人群筛查才有经济基础。

数据价值贯穿闭环:
① 平台产数据(低成本高通量)→
② 数据训模型(Genos/虚拟细胞)→
③ 模型赋能应用(疾病诊断·药物·育种)→
④ 应用验证回馈数据(临床队列·三不工程)
低成本数据生产是起点,贯穿闭环是价值兑现路径。

📊 华大做到 → 全国推广

华大员工健康实践是可复制、可推广的模式:华大先行验证可行性与卫生经济学效益 → 形成标准化方案 → 全国多中心实践推广。从万人级内部队列到千万级全民覆盖,实现科技惠民。

📋 诉求四:三不工程相关
① 科研项目支持
在重点研发计划中设立"科技惠民"健康队列专项,支持大规模人群多组学数据采集、治理与AI分析。华大已积累的员工健康实践数据可作为试点基础。
② 新科研模式支持(科技惠民)
当前科研项目以PAPER导向为主,建议设立"惠民导向"评价体系——以健康获益、疾病预防效果、卫生经济学指标作为项目考核标准,而非仅论文产出。
③ 全国多中心实践推广
支持华大与地方政府/医疗机构合作,建设全国多中心"三不"健康管理示范区。从华大内部万人实践扩展至区域百万级人群覆盖,形成可复制的"政府-企业-医疗机构"协同模式。
④ 科技惠民产品的审批与支付创新
推动多组学健康筛查产品纳入医保/公共卫生支付体系,探索"科技惠民"产品的快速审评审批通道和卫生经济学评估机制。