企业全国重点实验室,依托华大生命科学研究院建设。以大规模数据产出和AI大模型为核心驱动力,构建基因组学、时空组学、单细胞组学等多维解析技术体系。
面向生命科学前沿和人民健康重大需求,以基因组多维解析技术为核心,构建从"读"(测序)到"存"(数据)到"写"(合成)的贯穿闭环。目标:建成世界一流的基因组多维解析技术创新策源地。
建成全球最大通量的DNBSEQ测序平台(T系列)、Stereo-seq时空组学技术、DNBelab C单细胞平台;主导STOC/HGP2/EBP等5项国际大科学计划;累计产出数据量超EB级;Genos基因组基座模型发表GigaScience 2025;承担多项国家重点研发计划。
1. 人才帽子无优势
企业全重不享受高校/中科院的"杰青""长江"等帽子评审通道,人才引进和保留面临结构性劣势。考核体系应区别于学术机构,以工程化产出和产业转化为核心指标。
2. 有组织科研 vs 独立PI
企业全重是工程化作战——不突出单兵英雄、无独立PI制。而现有项目评审以PI制为核心,与企业的组织模式形成错配。
3. 国家项目竞争劣势
企业身份在部分项目申报中受限(如自然基金面上项目仅限依托单位),需要科技部在项目设置上给予企业全重独立赛道。
4. 自筹经费压力
企业全重自筹比例要求较高。大规模数据产出和AI模型训练计算成本持续攀升,需在经费评估中充分考虑企业全重的运营成本结构。
华大已建成全球领先的"读写存"一体化生命科学平台——从超高通量测序到自动化智能化实验室,从五大国际数据计划到 CNGBdb 国家级数据库,形成了完整的数据基础设施。
读:DNBSEQ-T系列超高通量测序矩阵,Stereo-seq 纳米级空间转录组,DNBelab C 超高通量单细胞平台
存:DCS Cloud 云端多组学分析平台,CNGBdb 国家级基因数据库,Genos 基因组基座模型
写:大规模DNA合成平台,噬菌体/细胞工厂工程化,基因编辑与合成生物学闭环
| 计划 | 全称 | 数据规模 | 核心产出 |
|---|---|---|---|
| STOC | 时空组学国际联盟 | 0.5 EB | Cancer / Brain / Plant / Infection 旗舰图谱 |
| HGP2 | 人类基因组计划二期 | 1.5 EB | 百万人级全基因组+多组学,构建精准医学遗传基线 |
| EBP | 地球生物基因组计划 | 1 EB | 全球真核生物全基因组数字化蓝图 |
| 10BC | 百亿级单细胞图谱 | 1 EB | 覆盖主要组织/发育阶段的虚拟细胞训练数据基础 |
| 100KPM | 十万例癌症病理多组学 | 1 EB | 基因组+转录组+蛋白质组+病理影像,i3S葡萄牙节点 |
CNGBdb 是科技部、财政部认定的国家科技资源共享服务平台,已建成全球最大的综合性基因数据存储与共享平台之一。
以5 EB高质量多模态数据为燃料,构建基因组基座模型、虚拟细胞模型、病理组织模型三大基座——最终融合大语言模型成为生命科学贯穿基座模型,垂直应用于疾病诊断、药物开发和农业育种。
GigaScience 2025
基于 10BC 数据训练
基于 100KPM 数据训练
同时具备多模态理解与生成能力,垂直应用:遗传病诊断(Genos-AD)· 智能育种(基因组选择)· 基因编辑设计(CRISPR靶点预测)· 蛋白质药物开发(ProteinMPNN+RFdiffusion)· 细胞疗法(CAR-T优化)
① 高质量数据供给
自有测序平台产出数据具有完全可控的质量标准、实验条件和元数据标注——这是公开数据无法比拟的训练数据优势。
② 以模型训练为目标的数据产出
五大计划不是"先有数据再想模型",而是以训练基座模型为导向来设计数据产出策略——采样方案、模态覆盖度、标注体系均为AI训练优化。
③ 应用导向的天然优势
从疾病诊断到农业育种、从药物开发到合成生物学——模型产出有直接的产业应用场景和验证闭环,不做"空模型"。
以华大员工健康实践为起点,推动"三不"(出生缺陷防控·远离肿瘤·远离心脑血管疾病)从企业行动走向全民工程——既有民生价值,也有科研价值,实现一数多用。
华大员工全员践行,形成"人人参与、人人受益"的健康管理模式。
从"不生病"到"更健康",覆盖全生命周期的健康管理:
同一份健康检测数据同时服务于三个目标:
① 民生:个体化健康管理与疾病预防
② 科研:大规模人群队列驱动的科学发现
③ 产业:筛查产品验证、药物靶点发现、健康管理模式优化
数据一次采集,多方复用——降低社会总成本。
华大自主测序平台的核心壁垒在于极致成本控制:DNBSEQ 测序成本仅为国际主流平台的 1/3–1/5,Stereo-seq 空间组学芯片成本持续下降。
EB 级数据产出的前提是成本可行。五大计划的 5 EB 目标依赖持续的成本优化——只有当测序成本降至"全民可及"水平,三不工程的大规模人群筛查才有经济基础。
数据价值贯穿闭环:
① 平台产数据(低成本高通量)→
② 数据训模型(Genos/虚拟细胞)→
③ 模型赋能应用(疾病诊断·药物·育种)→
④ 应用验证回馈数据(临床队列·三不工程)
低成本数据生产是起点,贯穿闭环是价值兑现路径。
华大员工健康实践是可复制、可推广的模式:华大先行验证可行性与卫生经济学效益 → 形成标准化方案 → 全国多中心实践推广。从万人级内部队列到千万级全民覆盖,实现科技惠民。