关键要点
- Frontiers调查显示,2025年逾半数受访学者已在审稿中使用AI工具。
- 斯坦福团队测试发现,GPT-5能检出2500篇论文中83%已确认的细节错误。
- 卡耐基梅隆大学对比显示,主流大模型在代码自主执行与事实核查上超越部分人类审稿人。
- AAAI大会在2025年动用AI团队协助处理3万篇投稿,并由人类评委保留最终决定权。
投稿激增引发审稿危机,学者暗中拥抱AI
随着生成式AI大幅拉低写作门槛,2025年全球学术发文量突破800万篇。编辑平均需发出4.5次邀请才能锁定一位审稿人,审稿周期因此大幅拖长。出版商Frontiers调研发现,超半数受访科研人员已在评审中使用AI辅助,较前一年大幅跃升。尽管多数期刊明令禁止,私下借助模型撰写意见已成普遍现象。学术界开始探索将这一暗流转化为规范的辅助机制。
抓漏找错表现亮眼,例行核查甚至超越人类
AI在繁琐的形式与事实核验中展现出显著优势。斯坦福大学团队利用OpenAI的GPT-5评估2500篇机器学习论文,发现约三分之一存在影响复现的细节错误,经人类复核准确率达83%。卡耐基梅隆大学针对82篇Nature系列预印本的对比测试也显示,主流大模型能自主运行论文代码,并在事实比对上发现许多人类遗漏的破绽。谷歌与bioRxiv等平台已相继向作者开放预审工具以优化初稿。
偏见短板与常识盲区,机器难下终局定论
但AI评审的硬伤同样明显。大模型工作记忆受限,容易忽视补充材料里的关键细节,甚至误判粒子物理等细分领域的惯例。亚利桑那州立大学的研究还指出,模型倾向于给顶尖名校作者更高的评价,放大了学术不平等。此外,AI评语往往过于冗长且吹毛求疵,甚至提出耗时巨大的非必要实验要求。伦敦大学学院的测试表明,核对AI建议的准确性往往抵消了省下的时间,实际效率并未显著提升。
顶会与期刊先行试点,人机协同探索新规范
部分顶会与期刊正率先把AI引入真实评审流程。2025年AAAI大会利用大模型辅助处理3万篇投稿,为每篇论文提供一份AI评语配合两位人类审稿人。医学期刊NEJM AI则启动7天快速通道,结合编辑自身判断与模型分析以加速录用。虽然试点普遍受到作者关注,但组织者强调AI绝非人类专家的直接替代品。学术界未来的共识在于人机协同,核心价值评判仍须牢牢保留在人类手中。
对研究者的意义
对生命科学与AI交叉领域的研究者而言,生信分析与多组学数据高度依赖代码与复杂统计。AI自动化校验工具可帮助作者在投稿前提前拦截格式错漏与代码复现缺陷。但面对单细胞与空间组学等前沿领域,大模型缺乏深层生物学直觉与上下文常识,研究者在引入AI辅助同行评审时仍需防范过度解读与算法偏见。
译介为忠实转述,非逐句直译;引用请以原文为准(版权归 Science 及作者所有)