科学问题
衰老研究长期依赖表观遗传时钟等专用统计工具,这类方法局限于单一数据模态,无法整合异构组学信息。近年来通用大语言模型展现了强大的推理能力,但传统评测多集中在生物医学文本问答,极易因训练集记忆而虚标性能。学术界始终缺乏一套基于真实底层实验测量值、能系统检验AI是否真正理解多组学衰老生物学机制的标准基准。
背景与领域脉络
过去二十年间,DNA甲基化、转录组、蛋白质组与临床表型等海量数据揭示了衰老的系统性变化。然而现有衰老时钟仅能输出单一预测年龄,既缺乏可解释性,也无法直接泛化到新数据类型。虽然单细胞基础模型学习了组学表征,却欠缺自然语言交互能力与通用推理灵活性。通用大语言模型虽擅长文献归纳,但在处理高通量底层组学测量时常出现事实幻觉,其跨模态生物学推理能力一直未被系统量化。
方法与技术路线
作者整合了美国国家健康与营养检查调查(NHANES)、基因表达综合数据库(GEO)、基因型-组织表达图谱(GTEx)、公共Olink血浆蛋白质组及OpenGenes/SynergyAge遗传学数据库,构建出包含17项任务、共计25457条提示词的开源评测基准LongevityBench。提示词长度从120至26000个词元不等,涵盖二分类、成对比较、多分类与连续回归4类题型。团队以此评测了来自6家开发机构的18款前沿大模型,并利用特定衰老多模态数据,监督微调了5款0.6B至9B参数的紧凑型衰老多任务语言模型(L-LLMs),涵盖Qwen3/3.5与LFM2架构。
主要结果
基准任务全景与提示词特征
基准覆盖5大生物数据领域与17项任务,总计包含25457条提示词。其词元长度跨度极大,涵盖从遗传扰动任务的中位数120个词元,到包含数百个CpG位点注释信息的甲基化任务中位数逾26000个词元。作者通过预先保留子集构建提示词,有效杜绝了模型微调阶段的数据泄露。
前沿商业大模型表现参差不齐
评测涵盖18款前沿系统,其中o3与o4-mini因有效解析答复率不足80%(任务平均交付率分别为0.77和0.70)被移出主榜。在符合标准的16款前沿模型中,Gemini-3.1-Pro平均排名最高,其95%置信区间为6.7至9.5。但该表现与Claude Opus-4.6及Kimi-K2.5等无显著统计学优势,且在GTEx成对预测上所有前沿模型的一致性指数均未超过0.56。
专业组学任务对AI构成严峻挑战
在GEO甲基化成对任务中,包含160个差异甲基化位点的输入使得朴素贝叶斯分类器仅获0.61的一致性,而最佳前沿模型Kimi-K2.5亦仅达到0.69。在包含1615个样本的Olink蛋白质组年龄比较中,传统蛋白衰老时钟达到0.749的一致性,显著优于最佳商业模型Gemini-3.1-Pro的0.703,GPT-4.1的表现甚至不优于随机猜测。
轻量微调模型全面反超前沿巨兽
微调获得的5款L-LLMs包揽了LongevityBench评测的前三名。其中L-Qwen3.5-9B夺得总体榜首,平均排名达4.4且95%置信区间为3.5至5.1,与所有其他系统均无重叠。即便是仅有6亿参数的L-Qwen3-0.6B也位列第6名,在综合排名上击败了参数量远大数十倍的Claude Opus-4.5、Kimi-K2.5与GPT-5.2。
创新点
本研究确立了首个直接利用底层异构组学实验数据评测AI推理能力的衰老基准,摆脱了以往仅测试生物医学文本问答的局限。不同于依赖专用结构或从头训练的组学模型,作者证实直接将结构化组学数据语言化,并对开源轻量大语言模型进行多任务监督微调,即可在零修改模型架构的前提下匹敌甚至超越庞大的闭源前沿系统。配套推出的Longevity Claw平台,进一步将该推理能力与经典生物学工具无缝连接。
意义与影响
该工作重塑了生物医学大模型的技术路线预期,打破了前沿大模型尺度定律在专业组学分析中的神话。研究证实通用语言模型具备直接读取复杂矩阵数据的表征潜力,无需耗费巨资训练超大规模模型,即可通过高质量领域数据蒸馏出实用工具。此外,该开源基准为衰老时钟开发、抗衰靶点筛选与个性化干预模拟提供了标准化的定量评估基石。
局限与待验证
基准评测主要基于现存人类公共队列,对罕见组织类型、单细胞空间分辨率及非人灵长类数据的覆盖度依然有限。此外,成对比较和分类任务经过了特征筛选预处理,尚不能完全代表实验生物学家直接获取的未经清洗的原始测序读长。轻量语言模型在长上下文下的复杂链式生物学因果推理鲁棒性,仍有待在湿实验中进行更大规模的前瞻性验证。
对我们的相关性
对组学和计算生物学研究者而言,该成果验证了将基因芯片、质谱和表达谱矩阵直接转化为文本提示词的可行性。研究者无须从头搭建深度时钟模型,可以直接借鉴论文的提示词模板,将公开大模型转化为本地化运行的多组学特征解算器。利用开源的Longevity Claw智能体架构,研究者还能将差异分析、富集分析和靶点预测串联进自动化工作流,显著缩短靶标发现周期。
术语速查
全文 PDF 已归档 Google Drive
04-学术文献/Paper/;原文版权归 Cell 及作者所有