关键要点
- 研究团队在《细胞》(Cell)发表了首个集成专有模型与评测基准的衰老AI系统。
- 该系统设立17项评测任务,用来量化AI在长寿科学领域的推理能力。
- 专属模型在多数衰老基准测试中,表现超过OpenAI与DeepSeek的商业通用模型。
- 哈佛与剑桥学者指出,衰老与疾病的边界模糊,仍是AI理解衰老机制的最大挑战。
长寿科研迎来专属AI套件
解析衰老机制、延缓衰老进程,始终是生命科学的核心课题。最新发表在《细胞》(Cell)上的一项研究,给出一套专为长寿研究定制的人工智能系统。它由三部分构成。第一部分是基于衰老生物学数据训练的大语言模型(Large Language Models,LLMs),负责理解并回答衰老领域的专业问题。第二部分是包含17项任务的基准测试集,用来量化各类模型在衰老课题上的推理能力。第三部分是一个集成界面,能把专有模型、衰老研究工具与AI智能体(agent)串在一起,协助科研人员完成分析。
专用模型对决商业大模型
研究团队用这套基准,把自研的衰老专属模型和行业领先的通用商业模型做了对比。受测的通用模型来自OpenAI、DeepSeek等机构,参数量更大,训练数据也更丰富多样。结果显示,专属模型并未在全部测试中胜出,但在多数衰老任务上的表现超过了这些庞大的对手。哈佛医学院(Harvard Medical School)计算机科学家Marinka Zitnik评价说,这项成果为长寿与衰老领域做出了关键贡献。他同时指出,相关评测也能为下一代AI模型的开发提供明确指引。
衰老缺乏统一定义成AI瓶颈
这项研究直面了该领域最棘手的问题:科学家自己都还没厘清衰老的本质定义,又该如何训练AI去理解它。Zitnik指出,在癌症等特定疾病领域,算法的目标和边界往往很清楚。衰老则是一个复杂的生物过程,至今难以被精确概括。过去几十年里,研究者积累了海量数据来量化这个过程,并开发出多种测量「生物学年龄(biological age)」的衰老时钟。这些时钟依据面部特征、蛋白质水平、基因活性和脑部扫描来估算身体机能,判断一个人的衰老速度快于还是慢于实际年龄。
时钟读数难以厘清因果机制
生物学时钟的精细度在不断提升,但科学家对时钟读数的解读依然分歧很大。近期一项针对肺部疾病实验性药物的小型临床试验显示,受试者在六种衰老时钟上测出的生物学年龄都有所下降。研究者却难以断定,药物究竟是逆转了衰老的根本机制,还是仅仅改善了受试者的整体健康状况。剑桥大学(University of Cambridge)表观遗传学家Chiara Herzog强调,衰老在何处终止、疾病又从何处开始,两者在生物学上难以明确剥离。这一困境至今制约着长寿干预研究的深入推进。
对研究者的意义
对基因组学、单细胞与AI交叉领域的研究者来说,这项研究说明,深耕垂直生物学领域的模型可以在特定任务上超过通用大模型。17项基准任务的设立,为多组学数据与衰老计算模型的结合提供了标准化评测规范。不过,生物学时钟在机制解释上的局限也提醒我们,单纯依赖数据驱动的预测,还不足以回答衰老的本质问题。AI工具需要与高精度的因果组学实验结合,才能把相关性推进到机制层面。
译介为忠实转述,非逐句直译;引用请以原文为准(版权归 Nature 及作者所有)