在学术界,尤其是在人工智能和机器学习领域,利用大语言模型(LLM)生成低质量、甚至包含虚假信息的论文和评审意见的现象日益严重。这种情况不仅浪费了评审员大量宝贵时间,也侵蚀了同行评审体系的公信力。两位研究人员分享了他们作为评审员的痛苦经历,揭示了从虚构参考文献到伪造作者名单的种种学术不端行为,并讨论了问题的规模、识别方法以及潜在的解决方案,最后还发布了一款名为 bib-audit 的工具,旨在自动化地审计和验证论文的参考文献。
AI 生成内容的泛滥
大量证据表明,由 AI 生成的低质量内容(俗称“AI 废料”)正污染着科学文献。
- 普遍存在的虚假引用: 一项《自然》杂志的分析发现,数以万计的出版物可能包含无效的 AI 生成参考文献。另一项研究估计,仅 2025 年一年,arXiv 等预印本服务器上就出现了近 15 万条虚构引用。
- 评审系统失灵: 研究发现,包含虚假引用的预印本论文在最终发表时,其中 85.3% 的虚假内容依然存在,这表明同行评审未能有效发现这些问题。
- 问题迅速恶化: 在生物医学领域,包含虚假引用的论文比例在两年内增长了六倍。在顶会 NeurIPS 2025 上,有 53 篇被录用的论文包含虚假引用,且都通过了 3 到 5 位专家评审员的审核。
- 评审意见也受污染: 不仅论文本身,评审意见也大量由 AI 生成。ICLR 2026 会议中,高达 21% 的评审意见被认为是完全由 AI 生成的。ICML 2026 的一项调查也发现,即使在明确禁止使用 LLM 的情况下,仍有数百名评审员违规使用。
这种乱象对整个学术体系都构成了威胁。例如,研究发现可以通过对抗性手段改写摘要,在不改变科学内容的情况下,欺骗 AI 评审员,从而提高论文的得分。
评审员的视角:在“泥潭”中挣扎
同行评审是一项无偿的志愿工作,其价值在于维护学术质量。当评审员花费大量时间审阅一篇充满问题的论文时,会感到极度沮丧。
- 浪费宝贵时间: 评审员在审阅了数小时后,才发现论文的参考文献是虚构的,这让他们感觉自己的时间被完全浪费了。
- 质疑作者的初衷: 如果作者连核对引用的时间都不愿意花,评审员不禁会问:
- 为什么我们还要花时间为你评审?
- 你提交这篇论文究竟想达成什么目的?
如果作者没有花时间阅读自己的论文,我为什么要花时间读呢?含有虚构引用的论文应该被直接拒绝(desk reject),因为它们显然没有准备好被接收。
最令人震惊的是,两位作者举报了两篇伪造了真实论文作者名单的投稿,但会议组织者在要求作者“修正引用”后,最终将这两篇论文都录用为口头报告(oral presentations)。
如何识别 AI 生成的内容?
尽管 AI 生成的内容越来越难以辨别,但仍有一些常见的迹象。
- 常见的语言风格:
- 使用“不是 X,而是 Y”这类刻板句式。
- 滥用粗体和破折号。
- 句子结构异常密集,难以解析。
- 过度吹嘘研究结果。
- 内容上的不一致:
- 论文正文中的数据或指标与表格中的不符。
- 讨论部分只是简单地重复表格中的数据,而没有任何深入的思考或见解。
如何负责任地使用大语言模型
作者们强调,他们并不反对使用 LLM,他们自己也每天都在使用。关键在于如何使用。
我们确实每天都在用 Claude。这篇文章的大部分内容也是由 AI 初步起草的,但我们对所有输出都进行了彻底的审查:验证、编辑、甚至完全重写。
负责任的使用意味着将 LLM 作为一个辅助工具,而不是内容的直接生产者。这包括:
- 亲自阅读和验证: 仔细阅读 AI 生成的文献综述,并查找原始研究,确保信息准确。
- 保持个人风格: 避免使用 AI 默认的、听起来不像自己的“营销式”语言。了解你的读者,并调整写作风格以适应他们。
- 反复修改: 准备好在写作过程中彻底修改草稿,确保最终成果清晰、易于人类理解。
谁应该为此负责?
解决这个问题需要多方共同努力。
- 作者: 不要提交低质量、未经思考的论文。
- 导师: 不要让你的学生提交低质量的论文。
- 组织者: 需要建立有效机制来筛除低质量的投稿。
我们真正需要的是一个直接拒稿(desk-reject)机制,或者至少是一个能捕捉常见 LLM 错误的标记工具,用以判断一篇论文是否已准备好进入评审环节。目前,评审员正在被迫承担本该由编辑部完成的筛选工作,这对那些真诚的评审员来说非常不公平。
一个自动化解决方案:bib-audit 工具
为了解决验证参考文献的繁琐工作,作者开发并发布了一款名为 bib-audit 的开源工具。
- 功能: 该工具可以自动化地审计论文的参考文献,检查以下问题:
- 不存在的引用: 检查引用的论文是否真实存在。
- 虚构的作者或标识符: 核对作者列表、DOI 等元数据是否与官方记录一致。
- 元数据错误: 发现年份不匹配、作者列表不完整等问题。
- 格式问题: 标记常见的文献格式错误。
- 工作方式: 该工具将论文中的参考文献与 Crossref、arXiv 等多个数据库进行比对,并生成一份详细的差异报告。
- 使用建议: 建议作者在提交论文前自行运行此工具,以确保参考文献的准确性,从而避免在评审阶段被标记。
注意: 评审员在使用此工具时需注意会议的保密政策,因为该工具需要将部分文献信息发送给 LLM 服务进行处理。