← 返回三刊速览 本月归档 Nature · 2026-09-30 · 新闻/评论中文译介

NATURE · NEWS · 中文译介 · 2026-09-30

大模型虚构幽灵专家造假论文,数百篇已获正规DOI

Elena, Aris, Marcus: AI-generated ‘ghosts’ are polluting the scientific literature

来源 Nature 栏目 新闻 / 评论DOI 10.1038/d41586-026-02991-7
导语
波兰华沙的三星人工智能中心(Samsung AI Center Warsaw)的研究者发现,主流大模型生成虚拟专家时会反复偏爱特定虚构名字。不法分子借此伪造了数百篇学术论文并挂上正规数字对象唯一标识符(DOI),严重威胁学术文献的真实性。
配图
Nature 新闻配图

关键要点

虚构专家流入学术文库

Elena Vasquez 与 Marcus Chen 曾被网络文章塑造成资深火山学家,但二人纯属大语言模型(LLM)虚构的「幽灵专家」。三星人工智能中心(Samsung AI Center Warsaw)的研究团队发现,这类 AI 虚构人物已被大量用于炮制虚假学术成果。他们在 Zenodo 和 ResearchGate 等平台上查出数百篇署名包含幽灵作者的伪造论文。令人担忧的是,许多假论文已取得真实的数字对象唯一标识符(DOI),极易被学术检索系统收录并扩散。

幽灵名字绑定模型版本

研究团队设计了生成科研搭档故事的测试提示,系统评估了 2024 年至 2026 年间发布的 9 个 Claude 版本、10 个 GPT 版本及 1 个 Gemini 模型。测试表明,虚构名字的出现与具体模型版本高度相关。Anthropic 的 Claude Sonnet 4 在约 23% 的测试中固定输出 Vasquez 与 Chen 组合;Google 的 Gemini 在 37% 的情况下绑定使用 Thorne 与 Petrova;而 OpenAI 的 GPT 序列则反复偏爱 Elara Voss。更有甚者,部分伪造论文将不同模型虚构的角色拼凑成了合作作者。

训练偏差诱发人设偏好

针对模型反复固守特定虚构名字的原因,研究者认为这源于模型后期训练中的微调印记。OpenAI 此前披露过类似问题:为营造极客感与活泼语气,模型微调阶段曾无意奖励了奇幻生物词汇,导致 GPT-5.1 中 goblin 一词使用率激增 175%。即便开发方移除了极客设定并加入提示词拦截,这类用词偏差在后续版本中依然偶有浮现。研究者推测,幽灵专家名字的反复出现,很可能同样是模型对齐与奖励微调阶段遗留的行为漏洞。

对研究者的意义

这项发现给依赖文献检索的生命科学与 AI 交叉研究者敲响了警钟。当前生物医学与计算科研高度依赖跨学科预印本库与自动化知识图谱构建。一旦大模型工业化炮制的虚假论文利用正规 DOI 渗入学术数据库,不仅会污染文献计量与元分析结果,还可能在自动化数据清洗和模型再训练中引入严重噪音,干扰真实的科学发现。

本页由 ppt-rabbit 基于 Nature 原文自动译介并人工校验 · 生成于 2026-10-01 08:22 · 全文约 1301 字
译介为忠实转述,非逐句直译;引用请以原文为准(版权归 Nature 及作者所有)