Genome Foundation Models · Strategy Analysis

基因组大模型四策略对比
杜然(植物目级覆盖)· Evo2 · AlphaGenome · GENOS

2026-08 · 基于杜然报告转述(自述效果好,未经独立验证)、Evo2(Arc Institute, Nature 2026)、AlphaGenome(Google DeepMind)、GENOS(华大,ATLAS 跨模型基准)公开信息,从「数据策略—信号可学性—任务适配」三个框架分析各策略的差别与可能的效果差异。

策略对比基因组大模型Evo2AlphaGenomeGENOS植物育种
核心判断:四种策略不是竞争关系,而是「广度 × 深度 × 配对组学」三角上的四个极点——Evo2 是最大广度、AlphaGenome 是单物种深度、GENOS 是人群配对多组学深度,而杜然的「植物目级覆盖」是第四条路:结构化广度(用最少物种数覆盖最大系统发育多样性),在跨物种注释任务上天然占优,但缺少种质级分辨率与因果解释能力。

1四种策略全景对比

维度杜然(植物目级)Evo2(Arc)AlphaGenome(DeepMind)GENOS(华大)
数据策略系统发育结构化采样:植物全部目各选代表物种最大广度:9.3T 核苷酸、12.8 万基因组 + 宏基因组,全生命域单物种深度:人类基因组 + ENCODE 功能数据大人群 + 配对多组学:CKB 50 万人、CIMA 等
架构 / 规模对标 100M–1B 级40B 参数,1Mb 上下文卷积 + Transformer,Enformer 进化MoE 架构,1Mb 上下文
核心任务跨物种功能注释、顺式调控预测通用序列建模与设计人类调控变异效应(24 track + 24 变异任务)致病突变识别 + 理性解释 + 下游效应预测
核心验证自述效果好(未经独立验证)跨域设计能力强人类调控任务 SOTARNA-seq Pearson 0.933 · ClinVar AUC 0.93 · ATLAS 第一
关键实证:ATLAS 跨模型基准显示,人类疾病定位任务上 Genos-v2 AUPRC = 0.265,而 Evo2-40B 仅 0.093 —— 通用底座在具体任务上表现平庸,「物种特异性预训练 + 模型容量协同」才是关键。这为理解杜然策略的效果提供了同构证据。

2框架一:广度 × 深度 × 配对组学——信号可学性的三角

🧬 纯广度(Evo2)

128k 基因组揉在一起,跨域保守序列反复出现被充分学习,但类群特异信号被稀释。通用强、具体任务弱。

🎯 纯深度(AlphaGenome)

单物种 + 海量监督数据,人类调控预测最强,但无法迁移到植物——这是它的明确边界。

🌳 结构化广度(杜然)

「每个进化单元都采样」,类似 LLM 的语系均衡采样:用最少物种数覆盖最大多样性,保留跨目保守的调控逻辑(RY 元件、ABRE 等顺式元件跨目高度保守),又避免稀释。

👥 配对组学深度(GENOS)

大人群配对多组学,学到个体级、等位基因级分辨率,能做因果推理——目级代表策略天然欠缺的粒度。

关键推论(预期,非实证):植物基因组数据总量远小于微生物(TB 级 vs 9T+),40B 参数在植物域可能过参数化;目级结构化采样配合适中参数量(100M–1B 级),理论上可能是植物域的「性价比更优解」。该预期基于数据/参数比的经验规律,杜然报告自述效果好与此一致,但仍需独立评测验证。

3框架二:进化距离 vs 应用分辨率——「语系共性」≠「方言」

目级覆盖(≈ 覆盖所有「语系」)擅长学共性规律:基因结构、顺式元件语法、跨物种注释迁移。但育种要的是「方言」——品种级/种质级的变异效应(驯化位点、单倍型、拷贝数多态)。

粒度缺口:一个目一个代表物种,目内的驯化分化学不到——水稻的驯化选择位点不会出现在「禾本目代表」的共性里。GENOS 的 CKB 50 万人配对数据学到的是个体级分辨率,这正是「目级代表」策略的天然边界。

4框架三:任务决定数据,数据决定天花板

下游任务杜然(目级)Evo2AlphaGenomeGENOS
跨物种基因注释(新基因组)最强中无弱(人类专用)
调控元件 / 变异效应强(顺式保守)中人类最强人类强
育种 / 种质改良中(缺种质粒度)弱无可迁移(配作物人群数据)
疾病 / 表型因果解释弱弱人类中最强(中心法则推理)

5「效果差别」的可能归因

① 结构化采样防稀释

按目均衡 → 拟南芥/水稻等模式物种不会垄断训练集,模型学到更「植物通用」的表征。

② 进化保守性 = 天然监督信号

跨目比对隐含纯化选择信号,自监督自动学到「哪些序列位置重要」——随机采样或单物种训练给不了。

③ 规模匹配

植物域数据量决定 1B 级模型可能优于 40B(数据/参数比更健康)。

⚠️ 评测基准之问

「自述效果好」的评测基准是什么?若为跨物种注释/功能预测 → 目级策略在理论上占优(尚待独立验证);若评测具体作物育种决策 → 大概率不如「种质级 + 配对组学」。

6战略启示:四策略是「分层底座」,不是竞争

Evo2 — 全生命域通用底座通用
└── 层 2
杜然式 — 植物域底座(目级覆盖)广度
└── 层 3
AlphaGenome 式 — 单物种深度深度
GENOS — 人类人群 + 配对多组学底座(华大独有,另一条轴)配对组学
华大的差异化机会:把 GENOS 的「大人群 + 配对多组学 + 因果推理」哲学平移到植物——用 T20 通量 + 种质资源做「作物种质 × 转录组/时空组 × 表型」配对数据,训练「植物版 GENOS」:
· 杜然有目级广度,但没有配对多组学深度和因果解释;
· 华大有 Stereo-seq 时空组这个别人没有的数据武器;
· 组合拳 = 目级覆盖(广度底座)+ 重点作物种质配对组学(深度底座),即植物领域既广又深、还能解释的第一模型。