关键要点
- 美国能源部与 Arcee AI 合作开发专为科研定制的开源模型 GS1,预计今年底前发布。
- DOE 独家开放全美国家实验室自1950年代起积淀的数万亿级专业实验数据。
- GS1 旨在打破 OpenAI 与 Anthropic 等商业闭源模型的黑盒限制,提升实验可复现性。
- 科研智能体可联动多组学数据与自动化实验平台,将数月的研发流程大幅缩短至数小时。
破除商业闭源与外部依赖
科学界当前正面临关键抉择。以 OpenAI 和 Anthropic 为代表的商业闭源大模型虽然性能领先,但企业并不公开模型的底层参数权重(Weights,即决定模型如何响应输入的数十亿核心数值)。这种黑盒状态不仅限制了科学家针对具体课题微调模型,还因版本更替频繁而破坏了科研的可复现性。与此同时,目前全球最具实力的开源权重模型主要来自中国企业,引发了美国在敏感领域的国家安全顾虑。为此,美方启动 Genesis 项目,致力于为科研人员提供可深度掌控的本土开源方案。
激活数十年国家科研资产
开发这款名为 Genesis-Science-1(GS1)的模型由美国本土初创公司 Arcee AI 牵头负责。为了加快研发步伐,DOE 向其独家开放了旗下国家实验室网络的海量数据库。全球绝大多数有价值的高质量专业数据都沉淀在私有数据库中,未曾公开在互联网上。DOE 自1950年代起就系统归档每一次科学实验,积淀了数以万亿计、从未参与现有商业大模型训练的专业词元(Tokens)。GS1 将全面汲取这些从核物理到粒子对撞机的科研资产,深刻理解科学家的真实工作流。
驱动从假设到实验的自主闭环
GS1 的核心目标是扮演科学研究的协调者与执行者。以工程化改造微生物生产生物燃料为例,科学智能体(Agent)能够融合 Berkeley 联合基因组研究所的数据,以及 PNNL 环境分子科学实验室的蛋白质组和代谢组数据。它能够自主发现技术瓶颈并设计验证实验,随后在超算中心发起计算机模拟,同时调用国家实验室的自动化设备完成湿实验。原本需要科研团队耗费半年到一年的探索周期,在智能体调度下可以缩短至数小时,科学家则专注于提出问题与最终验证。
严控安全并规划多元生态
研发团队目前正全力冲刺,目标在今年底前正式发布 GS1 模型,但确切日期仍取决于安全评估的进展。负责人强调,作为向科学界开放的开源模型,发布时必须确保核心数据与权重分发的绝对安全。PNNL 专家透露,GS1 只是构建科学开源生态的第一步。未来能源部将引入更多行业伙伴,逐步推出针对文本、图像以及多模态融合的专用模型。这些模型将放弃追求通用泛化,转而专注于深耕细分科学领域,推动基础研究范式的智能化变革。
对研究者的意义
对生命科学与组学研究者而言,GS1 的推出标志着科学大模型从通用问答走向复杂工作流调度。该模型打通跨机构的基因组学、蛋白质组与代谢组数据,有望成为连接干实验模拟与湿实验自动化的核心纽带。开源权重特性允许研究者在本地安全微调自有单细胞或空间组学数据,既消除了数据泄露顾虑,又为高通量筛选与细胞表型解析提供了全流程智能体范式。
译介为忠实转述,非逐句直译;引用请以原文为准(版权归 Science 及作者所有)