科学问题
单细胞转录组学研究亟需海量、多样的标准化数据来训练细胞状态基础AI模型,但目前公共资源严重受限。美国国家生物技术信息中心(NCBI)维护的序列读取档案库(SRA)虽坐拥最庞大的原始测序数据,其元数据却极度混乱、缺乏统一标注。此外,不同实验室采用的比对工具与计数参数各异,导致严重的批次混杂。现有优质数据库主要依赖人工贡献与手动标注,耗时极长且覆盖度狭窄。如何实现全自动化的原始数据挖掘、元数据标准化校准与统一重分析,是当前生物信息学领域的重大瓶颈。
背景与领域脉络
单细胞测序彻底改变了细胞生物学研究。为整合分散的实验数据,国际上相继建立了人类细胞图谱(Human Cell Atlas)以及CZ CELLxGENE等策展型数据库。这些平台有效促进了细胞类型注释与差异分析,但受限于人工录入机制,数据规模仅停留在千万至上亿级细胞量级。更关键的是,它们无法及时收录SRA中爆发式增长的公开原始数据。此前,针对大块转录组的ReCount项目曾证实,采用统一流程重新比对计数可大幅消除技术噪音。受此启发,若能借助大语言模型智能体替代繁杂的手工标注,便有望直接对SRA中所有单细胞测序原始读段展开规模化再处理。
方法与技术路线
研究团队开发出名为SRAgent的分层式AI智能体框架。该系统基于LangGraph架构,采用“主管-工蜂”协同模式异步调用NCBI工具链、BigQuery及抓取工具,自主检索、分类并提炼SRA中的元数据信息。针对确认的10x Genomics文库,自动化分析流scRecounter会截取部分读段预判建库化学试剂版本与条形码结构,随后调用STAR比对器对全量原始读段展开统一比对。该流程对每份样本同时输出涵盖内含子、外显子及非编码转录本的多种计数矩阵。研究人员还将SRAgent自动提取的组织与疾病标注,与CZ CELLxGENE人工策展结果进行交叉比对以完成精度验证。
主要结果
数据规模跃居首位
SRAgent累计检索了208,939项SRA实验记录,成功识别出105,343个10x文库。当前数据库scBaseCount已完成61,381个文库的统一重分析,囊括来自27个物种、75类组织的5.02亿个细胞。这一体量不仅远超CZ CELLxGENE的1.23亿细胞,也大幅领先人类细胞图谱的6,500万细胞。平均每个细胞测得6,052个唯一分子标识符(UMI)。
揭示测序领域演进趋势
元数据统计显示,3'端测序技术在过去7年占据主导地位,占细胞总数的77%。近两年5'端测序出现增长,在2024至2025年间占到13%。物种构成上,人与小鼠细胞分别占60%与32%。从2023年到2025年,小鼠细胞的相对占比提高了24%,人源细胞则下滑了29%。在疾病分类中,肿瘤相关样本占比最高,达到30.7%。
单细胞测序深度保持稳定
尽管公共数据库中细胞总量呈现爆发式攀升,但单细胞平均测序深度未见显著变化。在将细胞测序读段数做归一化处理后,每个细胞检出的基因数与UMI数量在2018至2025年间始终保持平稳。这表明随着测序通量提升与成本下降,研究人员普遍倾向于测定更多的细胞,而非单方面追求更高的单细胞测序深度。
元数据标注高精度与省力
自动化标注对比显示,SRAgent提取的组织与疾病标签与CZ CELLxGENE高度吻合。在部分案例中,它甚至能准确修正人工标注中的泛化归类。大模型置信度评估显示,51.5%的记录(对应1.07亿细胞)达到高置信度。智能体预筛单细胞文库为后续重处理节省了超过50万个CPU小时,耗费13.2万亿Token与1.7万美元成本,相当于节省了人工录入所需的3,482小时。
创新点
与CZ CELLxGENE等依赖研究者主动上传、人工逐条校验元数据的传统数据库不同,scBaseCount首次实现以AI智能体为核心的无死角全网抓取与自主解析。该系统颠覆了以往零散下载处理数据的模式。它直击SRA底层原始FASTQ文件,借助统一比对参数输出包含内含子和非编码RNA的全谱计数矩阵。这种架构不仅消除了不同软件流程引入的批次假象,还建立了无需人工干预的自动化增量更新流水线,彻底突破了传统生物信息数据中心的人力扩展瓶颈。
意义与影响
scBaseCount彻底打破了单细胞生物学领域数据整合的体量与标准化壁垒,构筑起全球规模最大的统一单细胞转录组基准库。超过5亿细胞的庞大多样性表型,为生物学AI大模型的无监督预训练提供了高质量“燃料”。同时,该工作确立了AI智能体统筹生物大数据的系统范式。它证明自主智能体能够胜任极其复杂的公共元数据治理与重分析工程,对后续空间多组学与表观基因组的大规模整合具有直接指导意义。
局限与待验证
该数据库当前仅处理了识别出的61,381项10x Genomics文库,仍有近四成文库处于排队重分析阶段。同时,由于SRAgent依赖提交者填写的原始文本,部分冷门组织或复杂临床表型的推理置信度评级较低,可能存在标签偏差。此外,数据主要集中于人和小鼠,非模式生物以及非10x测序技术(如Smart-seq、BD Rhapsody等)的数据尚未被完全纳入统一管线。
对我们的相关性
对单细胞与AI研究者而言,该数据库可直接作为单细胞基础模型预训练的大规模标准语料。研究人员不仅能免去下载海量原始读段与配置计算集群的繁琐步骤,还能直接调用其内含子与非编码RNA定量矩阵开展RNA速率推断或调控分析。此外,生物信息算法开发者亦可借鉴SRAgent的LangGraph智能体设计,将其应用于GEO或ENA等其他公共数据库的自动化元数据挖掘与质控清洗。
术语速查
全文 PDF 已归档 Google Drive
04-学术文献/Paper/;原文版权归 Cell 及作者所有