← 返回三刊速览 本月归档 Cell · 2026-09-17 · 深度解读

CELL · DEEP READ · 2026-09-17

老龄化生物学中人工智能的开放基准和语言模型

An open benchmark and language models for AI in aging biology

第一作者 Alex Zhavoronkov 末位/资深 Fedor Galkin 共 13 位作者 DOI 10.1016/j.cell.2026.08.026
一句话结论
研究构建了首个跨5大组学维度的衰老AI评测基准,并证明9B小模型可击败前沿大模型。
记住这一句:通用大模型读不懂复杂组学,经衰老多组学微调的轻量模型反而表现更优。
摘要图
图为文章官方摘要图(期刊网页 key image)

科学问题

衰老研究长期依赖表观遗传时钟等专用统计工具,这类方法局限于单一数据模态,无法整合异构组学信息。近年来通用大语言模型展现了强大的推理能力,但传统评测多集中在生物医学文本问答,极易因训练集记忆而虚标性能。学术界始终缺乏一套基于真实底层实验测量值、能系统检验AI是否真正理解多组学衰老生物学机制的标准基准。

背景与领域脉络

过去二十年间,DNA甲基化、转录组、蛋白质组与临床表型等海量数据揭示了衰老的系统性变化。然而现有衰老时钟仅能输出单一预测年龄,既缺乏可解释性,也无法直接泛化到新数据类型。虽然单细胞基础模型学习了组学表征,却欠缺自然语言交互能力与通用推理灵活性。通用大语言模型虽擅长文献归纳,但在处理高通量底层组学测量时常出现事实幻觉,其跨模态生物学推理能力一直未被系统量化。

方法与技术路线

作者整合了美国国家健康与营养检查调查(NHANES)、基因表达综合数据库(GEO)、基因型-组织表达图谱(GTEx)、公共Olink血浆蛋白质组及OpenGenes/SynergyAge遗传学数据库,构建出包含17项任务、共计25457条提示词的开源评测基准LongevityBench。提示词长度从120至26000个词元不等,涵盖二分类、成对比较、多分类与连续回归4类题型。团队以此评测了来自6家开发机构的18款前沿大模型,并利用特定衰老多模态数据,监督微调了5款0.6B至9B参数的紧凑型衰老多任务语言模型(L-LLMs),涵盖Qwen3/3.5与LFM2架构。

主要结果

基准任务全景与提示词特征

基准覆盖5大生物数据领域与17项任务,总计包含25457条提示词。其词元长度跨度极大,涵盖从遗传扰动任务的中位数120个词元,到包含数百个CpG位点注释信息的甲基化任务中位数逾26000个词元。作者通过预先保留子集构建提示词,有效杜绝了模型微调阶段的数据泄露。

前沿商业大模型表现参差不齐

评测涵盖18款前沿系统,其中o3与o4-mini因有效解析答复率不足80%(任务平均交付率分别为0.77和0.70)被移出主榜。在符合标准的16款前沿模型中,Gemini-3.1-Pro平均排名最高,其95%置信区间为6.7至9.5。但该表现与Claude Opus-4.6及Kimi-K2.5等无显著统计学优势,且在GTEx成对预测上所有前沿模型的一致性指数均未超过0.56。

专业组学任务对AI构成严峻挑战

在GEO甲基化成对任务中,包含160个差异甲基化位点的输入使得朴素贝叶斯分类器仅获0.61的一致性,而最佳前沿模型Kimi-K2.5亦仅达到0.69。在包含1615个样本的Olink蛋白质组年龄比较中,传统蛋白衰老时钟达到0.749的一致性,显著优于最佳商业模型Gemini-3.1-Pro的0.703,GPT-4.1的表现甚至不优于随机猜测。

轻量微调模型全面反超前沿巨兽

微调获得的5款L-LLMs包揽了LongevityBench评测的前三名。其中L-Qwen3.5-9B夺得总体榜首,平均排名达4.4且95%置信区间为3.5至5.1,与所有其他系统均无重叠。即便是仅有6亿参数的L-Qwen3-0.6B也位列第6名,在综合排名上击败了参数量远大数十倍的Claude Opus-4.5、Kimi-K2.5与GPT-5.2。

创新点

本研究确立了首个直接利用底层异构组学实验数据评测AI推理能力的衰老基准,摆脱了以往仅测试生物医学文本问答的局限。不同于依赖专用结构或从头训练的组学模型,作者证实直接将结构化组学数据语言化,并对开源轻量大语言模型进行多任务监督微调,即可在零修改模型架构的前提下匹敌甚至超越庞大的闭源前沿系统。配套推出的Longevity Claw平台,进一步将该推理能力与经典生物学工具无缝连接。

意义与影响

该工作重塑了生物医学大模型的技术路线预期,打破了前沿大模型尺度定律在专业组学分析中的神话。研究证实通用语言模型具备直接读取复杂矩阵数据的表征潜力,无需耗费巨资训练超大规模模型,即可通过高质量领域数据蒸馏出实用工具。此外,该开源基准为衰老时钟开发、抗衰靶点筛选与个性化干预模拟提供了标准化的定量评估基石。

局限与待验证

基准评测主要基于现存人类公共队列,对罕见组织类型、单细胞空间分辨率及非人灵长类数据的覆盖度依然有限。此外,成对比较和分类任务经过了特征筛选预处理,尚不能完全代表实验生物学家直接获取的未经清洗的原始测序读长。轻量语言模型在长上下文下的复杂链式生物学因果推理鲁棒性,仍有待在湿实验中进行更大规模的前瞻性验证。

对我们的相关性

对组学和计算生物学研究者而言,该成果验证了将基因芯片、质谱和表达谱矩阵直接转化为文本提示词的可行性。研究者无须从头搭建深度时钟模型,可以直接借鉴论文的提示词模板,将公开大模型转化为本地化运行的多组学特征解算器。利用开源的Longevity Claw智能体架构,研究者还能将差异分析、富集分析和靶点预测串联进自动化工作流,显著缩短靶标发现周期。

术语速查

衰老时钟(Aging clock)基于甲基化或蛋白质组等组学指标构建的数学预测模型,用于量化个体的生物学真实衰老程度。
LongevityBench本研究构建的衰老生物学AI基准套件,涵盖5个数据领域与17项任务,用于评测大模型在组学数据上的推理能力。
CpG位点(CpG site)DNA序列中胞嘧啶通过磷酸二酯键与鸟嘌呤相连的区域,其甲基化修饰状态是表观遗传衰老的核心标志。
Olink蛋白质组学(Olink proteomics)一种基于邻位延伸分析的高通量蛋白质检测技术,能在极微量体液样本中精确测定数百至数千种低丰度蛋白。
智能体研究平台(Agentic research platform)一种以大模型为调度核心,能自主规划步骤、调用生物信息学外部工具并处理多步骤复杂科研任务的交互系统。
本页由 ppt-rabbit 基于论文全文自动生成并人工校验 · 生成于 2026-10-01 08:22 · 全文约 2702 字
全文 PDF 已归档 Google Drive 04-学术文献/Paper/;原文版权归 Cell 及作者所有