在有限的资源和竞争窗口下,必须明确研究院的核心定位和发展边界——不是什么都做,而是聚焦在真正有壁垒、能规模化的方向上集中突破。
不是这些不重要——而是这些不是我们的优势,也不应成为我们的主方向。
大学和传统实验室更适合逐点深挖,研究院的核心竞争力在别处。
研究院的核心竞争力 = 数据规模 × AI能力 × 工程化效率
这是大学做不了、AI公司没有数据、测序公司没有模型的三重壁垒。
核心判断:把资源从"搞清楚某一个生物学细节"转向"用大规模数据和AI自动发现规律"。
不是不做生物学验证——下游验证交给临床和合作伙伴,我们专注于上游的生产和建模能力。
以「人人种种世世代代」为使命,构建「读·写·存」贯穿闭环——大规模读数据、基座模型存知识、合成生物学写创造,形成生命科学从观察到设计的范式跃迁。
五大国际大科学合作项目,五年系统性产出 5 EB 多模态数据,覆盖基因组、时空组、单细胞、病理影像等全维度。
时空组学国际联盟。纳米级分辨率空间转录组与空间多组学,绘制发育、疾病、脑科学全景观图谱。Cancer / Brain / Plant / Infection 四大旗舰方向。
人类基因组计划二期。百万人级全基因组+多组学测序,覆盖全球人群多样性,构建精准医学遗传基线。联合全球顶级研究机构。
地球生物基因组计划。对地球已知真核生物进行全基因组测序,构建地球生命数字化蓝图。物种鉴定、进化生物学、生物多样性保护。
百亿级单细胞图谱。基于DNBelab C平台超高通量单细胞测序,覆盖主要组织器官与发育阶段,为虚拟细胞模型提供训练数据基础。
十万例癌症病理多组学。整合病理影像、基因组、转录组、蛋白质组,构建癌症分子分型与预后预测知识库。i3S 葡萄牙节点已启动。
从5 EB多模态数据中训练,逐层抽象——从DNA序列到细胞状态,从细胞到组织。最终与LLM融合成为生命科学贯穿基座模型。
MoE架构,1 Mb超长上下文,636个T2T人类基因组训练。从DNA序列直接预测RNA表达(Pearson ~0.933)、ATAC可及性、变异致病性(ClinVar AUC ~0.93)。
多组学驱动的细胞状态模拟。预测基因扰动效应、药物响应、发育轨迹与细胞通讯。单细胞分辨率下的「数字孪生」。
融合空间转录组与病理图像。组织层面疾病分型、预后预测与药物靶点发现。10万病例驱动的临床级 AI。
三大模型 + 大语言模型整合 → 生命科学贯穿基座模型
同时具备多模态理解与生成能力,垂直应用于疾病诊断 · 药物开发 · 农业育种
基座模型的生成能力与大规模合成平台结合,实现「数据学习 → 模型优化 → 生成设计 → 合成测试 → 数据验证」的读写贯穿迭代闭环。
基因组调控网络、蛋白质互作模体、细胞行为模式、物种进化约束。ATLAS方法(注意力差异分析)可无需GWAS直接发现疾病位点。
Genos → 五组学Post-Training(基因组+转录+表观+甲基化+蛋白组)。虚拟细胞模型 → 时序扰动预测。病理模型 → 临床级诊断。
大模型驱动基因模块、基因回路、最小基因组设计。ProteinMPNN + RFdiffusion 辅助蛋白质工程与新型药物开发。
大规模DNA合成、组装、细胞转化与功能验证。噬菌体自动化筛选+合成全流程。已发表 Cell Reports Methods:跨属跨目噬菌体工程化重启平台(90+噬菌体)。
合成序列的功能实测数据回到训练池中,形成自加速闭环。基因模块和人造生命体系持续优化。
应用场景:遗传病诊断 · 智能育种 · CRISPR基因编辑 · 细胞疗法 · 蛋白质药物 · 噬菌体疗法 · 人造细胞工厂
以AI系统性重塑研究院全链条——从实验台到服务器,从数据分析到管理决策。
云端一体化多组学分析平台,AI驱动的自动化流程编排与智能质控。
机器人自动化 + 计算机视觉 + 强化学习调度。样本处理到上机全自动。
基因组基座模型、蛋白质语言模型、多组学融合模型。
AI Copilot 嵌入全流程:会议纪要、报告生成、知识库问答、项目管理。
数据生产和AI能力的最终价值,体现在对人类健康、精准医学和产业转化的实际推动。从基础科研到临床落地,从实验室到人人健康。
过去十年,生命科学从实验室里的小众探索,一步步走到大健康的前沿阵地。曾经遥不可及的科学想象,正变成触手可及的健康选择。