2026.07 · 董事会思考

从 Sequencing 到Token

突破"sequencing sequencing sequencing"瓶颈 —— 构建数据·模型·应用的价值闭环
问题与突破

瓶颈:"Sequencing, Sequencing, Sequencing"

上次董事会我提到,现在华大的瓶颈是"sequencing sequencing sequencing",但没有提出怎么解决,以下是我进一步的思考:

三大战略引擎
📡

数据

五大数据产出计划 — STOC·HGP2·EBP·10BC·100KPM — 以合作、众筹模式打造全球最大生命科学数据集。五年 5 EB 多模态数据,为基座模型提供燃料。

合作众筹5 EB多模态
🧠

模型

三大生命科学基座模型 — 基因组模型·时空细胞模型(STOC Model)·病理组织模型 — 融合大语言模型形成生命科学贯穿基座模型。数据即模型,模型即应用。

Genos时空细胞模型病理模型
🔄

应用

13311i 闭环实践 — 从一个基因组基线,到三样本·三影像·一内镜·一脑科学·一可穿戴。数据产出→模型训练→应用验证→反馈迭代的完整闭环。

三不工程闭环
模式变革

从卖测序到卖Token

测序只是手段,数据的价值在模型中释放。客户不再按 Gb 付费,而是按模型使用的 Token 量付费——价值在推理端兑现。以下三个案例展示模式变革的具体路径。

🔐

CKB · Genos 数据安全共享

50 万人数据训练模型 → 模型实现50 万人数据的安全开放使用。用模型替代直接数据共享,彻底解决隐私与合规瓶颈。数据不出域,价值通过模型输出。

50万人安全共享隐私计算Token
🤖

Cyto CoScientist · 细胞科学家

AI 自主科学发现平台。递归 ReAct + 分层控制,文献+生信+知识图谱多证据融合。已完整复现 Google Co-Scientist(肝纤维化靶点)和 Stanford Biomni(骨骼发育调控网络)案例,正在寻找场景做干湿实验闭环验证。

自主科学干湿闭环
🌍

OriGen · 全物种基因组注释

目前地球上仅约 30% 的基因组有功能注释。OriGen 模型实现所有物种的完整基因组自动注释——生命科学的"ImageNet 时刻",从人工注释到 AI 自动注释的范式转变。

全物种70%→100%范式转变
模式变革案例展开 · Cyto CoScientist

🤖 细胞科学家:自主科学发现

在可控递归循环中自主进化假设、并用干湿实验闭环验证的科研发现辅助平台。不是单纯的文献总结或生信工具,而是能提出可验证新假说的AI科学家。

竞品对比:Cyto CoScientist vs 全球同类平台

维度 Cyto CoScientist (华大) Google AI Co-Scientist Stanford Biomni Claude Science
定位可控·可追溯的科学发现平台科学发现平台生信工具平台科研助手平台
控制范式递归 ReAct + 分层控制Supervisor 调度,固定多Agent固定工作流,只调用工具ReAct
迭代演化✅ 自主进化假设✅❌❌
证据来源文献 + 生信工具 + 知识图谱文献生信工具文献 + 生信工具
状态溯源全程可审计上下文上下文阶段可审计

复现案例一:肝纤维化新治疗靶点发现

复现来源:Google AI Co-Scientist · Nature 2026

输入问题:"针对严重肝纤维化,哪些特定表观遗传改变促进肝星状细胞形成肌成纤维细胞,并识别可作用于相关表观遗传调控因子的药物。"

✅ Cyto 完整复现,并独立提出了更具体的机制假设:

  • BRG1–IGFBP5 表观遗传调控轴
  • p300/CBP–CCN2 组蛋白乙酰化通路
  • ASH1L 甲基转移酶介导的纤维化调控
📄 文献检索 → 知识图谱构建
↓
🧪 表观遗传靶点筛选
↓
🎯 药物-靶点匹配
↓
💡 3条可验证新假说

复现案例二:人类胚胎骨骼发育多组学分析

复现来源:Stanford Biomni · Science 2026

输入数据:人类胚胎骨骼发育的配对 snRNA-seq 和 snATAC-seq 数据。

任务:识别、优先排序并解析驱动骨骼谱系发育的关键转录因子–靶基因调控网络。

✅ Cyto 完整复现,关键发现:

  • SOX5/SOX6 — 最可信的软骨成熟调控因子
  • SP7 — 支持成骨和晚期骨骼成熟过程
  • DLX6·SATB2 — 明显的区域/谱系偏向调控
🧬 调控网络推断流程
snRNA-seq
基因表达矩阵
snATAC-seq
染色质可及性
↓ Cyto CoScientist ↓
Regulon 活性矩阵
SOX5/6 · SP7 · DLX6 · SATB2
OrionGeno

基因组结构的底层认知

22000 已经公开的参考基因组,70% 无基因注释!

⚡

无需转录组数据

突破传统注释依赖转录组证据的范式,直接从基因组序列完成注释。

⏱️

5 分钟一个基因组注释

注释速度从数周级压缩到分钟级,支撑海量基因组规模化处理。

🧬

重大突破

人的基因组上注释出新基因;原生动物、植物等困难物种都得到显著提升。

📢 NCBI 将根据我们的结果,更新整体数据库!

从人工注释到 AI 自动注释的范式转变——生命科学的"ImageNet 时刻"。

CKB · Genos 数据安全共享

Genos AI ready 的组学数据新生态

🔒🔑

锁-钥匙物理隔离

锁(Coder 码流):Range Coder 输出的白噪声残差码流,0/1 分布趋近完美随机,无任何生物学语义。

钥匙(Genos 模型):固化在受信节点中的神经网络权重,独立存在不含个人隐私。

碰撞解密:TEE/SGX 硬件级受信环境中锁+钥匙同时到位才可还原,单件无法逆推。

🧬

极致压缩:0.029 bit/base

Genos 对保守区预测准确率 >98%,香农熵 I=−log₂(P) 实现单碱基 ~0.029 bit。

传统 2-bit 压缩 → 近 100× 提升。

OPOM:一人一模型范式 — 数据体积压缩 90%~99%,无需还原即可隐空间直接计算。

📤

三种轻量化分发

16位 Key 口令:Base62/8汉字,移动端传输

动态哈希短链接:秒级唤起基因图谱

多色二维码:离线存 10万~80万 bp

📦 压缩凝练 Genos+RangeCoder → 📤 极轻量分发 Key/链接/二维码 → 🔓 可信计算 锁+钥匙碰撞解密
当前突破点

① 完整闭环路径规划

五大数据计划 → 三大基座模型 → 13311i 应用验证 → Token价值变现。不是散点突破,而是端到端贯通的系统工程。

② 最低成本大规模数据产出

DNBSEQ极致成本 + 众筹合作模式 + 自动化智能化实验室。只有成本降下来,EB级数据产出才有经济可行性。

③ 商业价值落地

Token 模式的核心是找到第一个付费场景——疾病风险预测、药物靶点发现、个性化健康管理。从科学价值到商业价值的惊险一跃。

④ 组织方式突破

以具体科研目的的研究项目模式,转向为规模化高质量数据产出、模型训练、应用落地的工程模式。

科研模式转型

非盈利机构的Token 价值逻辑

在不大规模影响现有上市公司业务体系的前提下,研究院全面转向 Token 价值变现。

2026
启动试点
Token定价模型
CKB模式验证
2027
规模化
三大模型商用
首个付费场景
2028
全面转型
评价指标切换
Token收入>测序收入

📊 评价指标全面转变(3年目标)

  • 从:测序通量(Gb)·论文数量·项目经费
  • 到:Token调用量·模型能力指标·付费用户数
  • 从:"我们测了多少数据"
  • 到:"我们的模型为多少用户创造了多少价值"
从 Sequencing³ 到 Tokenⁿ
从卖"数据"到卖"智惠"
1 / 1