BGI RESEARCH · 2026 H2

研究院 2026 下半年
五项重点目标

数据 · 模型 · Token 应用闭环 × 五大数据计划 × 大模型标志成果 × CKB 专辑 × AI 原生组织
数据五大计划 · 5 EB
→
模型Genos · Cyto · OrionGeno
→
应用Token 商业化闭环
CKB 专辑 = 数据计划的代表成果 + Token 化的最佳试验场 | AI 原生组织 = 支撑这一切的管理生产关系变革
01

数据-模型-Token 应用闭环,形成 Token 商业化 Demo Case

贯穿全局的第一战略
突破"Sequencing, sequencing, sequencing"瓶颈的核心动作——从卖 Gb 到卖 Token,2026 启动试点 Token 定价模型(董事会路线图已明确,CKB 模式验证)。

CKB · Genos 数据安全共享 (最成熟)

50 万人数据训入模型 → 模型实现数据安全开放使用,"数据不出域、价值通过模型输出"。4 月已与北大李立明、之江实验室赵志峰达成三方合作。

原始数据→Genos 工具→Token 向量空间→流式 Token 服务

Genpilot · 10 万客户推广 (用户规模最大)

STOmics Cloud(华大时空云)AI 问答入口,拥有最大存量用户基盘,是 Token 计费最直接的落地场景。

  • 存量转化:10 万客户从免费问答 → Token 计费调用,分层收费,跑通第一个真实付费闭环
  • 能力升级:从"知识问答"升级为"数据+模型"服务——用户数据进、Token 结果出
  • 指标体系:付费客户数、人均 Token 调用量、Token 收入作为先行指标

OrionGeno 全物种注释

从人工注释到 AI 自动注释的范式转变,高价值付费 API 场景(详见目标 03)。

定价模型试点

Genpilot 10 万客户正可作为定价试点的试验田——按 Token 调用量计费,先跑通第一个付费场景。

下半年抓手Genpilot 存量客户 Token 化(10 万客户中先跑通 1 个分层付费场景)+ CKB / OrionGeno 选 1 个做端到端 demo:数据 → 模型 → Token 调用 → 计费 → 用户付费,全链路打通即"模式变革"的标志性证明。
02

五大计划的系统化推进,初步成果

合作 · 众筹模式打造全球最大生命科学数据集
五年累计 5 EB 多模态数据,为基座模型提供燃料。五大计划同步推进,下半年落地各自首个可量化里程碑。

STOC · 时空组学国际联盟 0.5 EB

时空细胞模型(STOC Model)。Cancer / Brain / Plant / Infection 四大旗舰图谱;米兰闭门会议已开(7 月),国际协作网络成型。

HGP2 · 人类基因组计划二期 1.5 EB

百万人级全基因组 + 多组学精准医学遗传基线;传承藏汉 / 140K / Meta / Life Index 华大人基因组历史。

EBP · 地球生物基因组计划 1 EB

全球真核生物全基因组数字化蓝图;EBP Phase II 规划已有,衔接 OrionGeno 全物种注释。

10BC · 百亿级单细胞图谱 1 EB

覆盖主要组织 / 发育阶段,时空细胞模型训练的数据基础。

100KPM · 十万例癌症病理多组学 1 EB

基因组 + 转录组 + 蛋白质组 + 病理影像,i3S 葡萄牙节点。

推进机制

每个计划定义 1-2 个可量化里程碑:STOC 首个旗舰图谱发布、EBP 完成 XX 个物种注释、100KPM 首批 XX 例数据入库。年底形成"五大计划进度总览"汇报页,把"初步成果"落到可展示的数据产出上。

下半年抓手每个计划 1-2 个可量化里程碑,年底形成 "五大计划进度总览"汇报页。
03

大模型的标志性成果

三大基座模型 · 任一突破都是顶刊级

Genos · 基因组基座模型

已发表 GigaScience 2025。配套安全压缩体系成熟(0.029 bit/base)。下半年发布可对外引用的基准测评。

Cyto CoScientist · 细胞科学家 (最可能出成果)

已完整复现 Google Co-Scientist(肝纤维化:BRG1–IGFBP5 轴 / p300-CBP–CCN2 / ASH1L)和 Stanford Biomni(骨骼发育:SOX5/SOX6/SP7/DLX6·SATB2)两大案例。正在寻找场景做干湿闭环验证——下半年最可能出标志性成果的点。

OrionGeno · 全物种基因组注释 (Orion + Genomics,猎户座)

5 分钟完成一个基因组注释;人类基因组注释出新基因;原生动物 / 植物等困难物种显著提升。目标不止 NCBI 数据库采纳,更要打造自身标志性成果——"全物种注释的 ImageNet 时刻"(30% → 100% 覆盖的范式跃迁)。

下半年抓手① Cyto 干湿闭环验证落地(找 1 个华大自己的场景闭环跑通)② Genos 发布可对外引用的基准测评 ③ OrionGeno 标志性成果 + NCBI 更新落地——三者任一都是顶刊级。
04

CKB 专辑

中国慢病遗传学里程碑
CKB = 51.2 万人大人群队列(2004-2008 基线),20+ 年长期随访、医保异动数据、低失访率、多组学逐步产出。4 月三方会议(北大 + 华大 + 之江)已明确合作框架。

数据层

TtoT(长读长 + 短读长)全基因组测序 300-500 例,构建中国人专属 Pangenome;多组学(基因组 / 蛋白组 / 代谢组)逐步产出。

方法层

Genos 工具在大人群数据 Token 化上的可行性评估(三方决议的下一步行动之一);pLoF 天然失活蛋白扫描 + 孟德尔随机化(配合短肽管线方向)。

成果层

慢病遗传关联系列论文(血脂 / 血糖 / 血压 / 炎症)+ 中国人群遗传基线数据发布。

组织机制

确定专辑主编 / 组织架构(北大 + 华大 + 之江三方),明确 6-12 篇目标论文清单与时间表,12 月前形成首批发稿。可对齐"中国慢病遗传学里程碑"定位。

下半年抓手确定专辑主编与三方组织架构,明确 6-12 篇论文清单 + 时间表,12 月前首批发稿。
05

AI 原生组织的初始化

管理层面 All in AI
核心内涵:在研究院管理层面实现 AI 原生——各种信息化系统(项目管理、财务、人事、审批、知识管理等)和内部管理方式全面 All in AI。不是单点工具应用,而是管理流程整体重构。

现有基础

L0-L4 智能体分级框架已建立(当前组织整体 L1、个别 L2);黑灯实验室(Lights-out Lab,L3)术语体系已统一;涌生智能归 L3。

改造路径

盘点现有信息化系统清单,逐项规划 AI 改造优先级——先选 1-2 个高频系统做 AI 原生试点(如项目管理系统 / 知识管理系统)。

量化指标

定义"AI 原生组织指数":AI 工具渗透率(每人日均 Token 调用)、AI 可承接管理任务清单、人机分工边界。

与年中议题衔接

呼应"AI 时代高效管理"议题——如何用 AI 实现组织的高效扁平化管理,先在研究院内部跑通再推广。

下半年抓手选 1-2 个高频管理系统做 AI 原生试点,定义 "AI 原生组织指数"(渗透率 / 可承接任务 / 分工边界),研究院内部先跑通。

🔗 五点内在逻辑

数据(五大计划)→ 模型(三大基座)→ 应用(Token 闭环)
← 技术方案目录 董事会思考 战略全景 CKB 方案 科技部汇报 AI 智能体分级