文章摘要
两位审稿人今夏审阅22篇论文,发现68%存在完全虚构的引用、作者列表或明显由AI生成的内容,包括幻觉术语和无关引用。他们抱怨这是浪费时间,并发布了用于检测此类问题的工具。
文章总结
好的,这是根据您的要求,对原文主要内容进行的中文重述,已保留关键细节并删减了与主题无关的内容。
标题:来自“AI垃圾稿件”前线的问答——地理空间机器学习领域的审稿困境
核心问题:AI生成的虚假内容正在严重污染学术评审流程。
两位审稿人(Caleb和Isaac)在2025年夏季为NeurIPS、WACV和TerraBytes等会议/研讨会审阅了22篇论文。他们发现,其中高达68%(15篇)的稿件存在完全捏造的引用、为真实论文编造作者名单,或明显由大语言模型(LLM)生成(例如,充斥着幻觉技术术语、无意义的文字和不相关的引用)。
问题规模:
- 普遍性: 这不是个别现象。一项《自然》杂志的分析发现,2025年至少有数万篇出版物“可能”包含无效的AI生成参考文献。另一项针对arXiv等预印本平台的审计估计,仅2025年一年就存在约14.69万个幻觉引用。
- 未被发现: 审稿过程未能有效拦截这些问题。一项追踪研究发现,85.3%的幻觉引用在预印本发表后依然存在。《柳叶刀》的一项审计显示,在两年内,至少包含一个捏造参考文献的论文比例从1/2828飙升至1/458,到2026年初更是达到1/277。
- 双向污染: 不仅论文本身,审稿意见也大量使用AI。有分析发现,21%的ICLR审稿意见完全由AI生成,超过一半的审稿有AI参与。ICML 2026通过“提示注入”测试发现,约1%的审稿意见违反了禁止使用LLM的规定。
审稿人的亲身经历与愤怒:
- Caleb: 审了11篇,其中5篇有捏造的引用。有论文的参考文献[1](即第一条)就列出了真实论文的虚构作者。还有一篇53页的论文充斥着幻觉术语,毫无审阅价值。
- Isaac: 审了11篇,其中9篇(82%)有问题。最糟糕的经历是,他指出了两篇论文存在捏造作者的问题并建议拒稿,但这两篇论文最终竟被接收为口头报告,条件仅仅是“修正幻觉引用”。这让他感到荒谬。
识别AI生成论文的“三大特征”:
- 语言模式: 使用LLM的惯用句式(如“不是X,而是Y”),滥用粗体、破折号和分号。
- 数据矛盾: 正文中描述的性能指标与表格中的数据不一致,这通常是作者使用AI写作后未更新结果所致。
- 内容空洞: 讨论部分只是机械地复述表格中的指标,缺乏原创性思考。
审稿人的应对与反思:
- 工作流程改变: 两人现在都会在阅读摘要后立即检查参考文献。Isaac表示,他现在默认假设大多数论文是“恶意提交”的,花费大量时间寻找AI痕迹,这让他感到疲惫。
- 对LLM使用的态度: 他们并不反对使用LLM辅助写作,但强调作者必须亲自、彻底地审阅和修改AI生成的内容,确保其准确性和原创性。使用LLM的关键在于“驾驭它”,而不是“被它驾驭”。
- 责任归属: 作者、导师、会议组织者都有责任。作者不应提交低质量稿件;导师应阻止学生这样做;会议需要建立有效的“直接拒稿”机制,而不是让审稿人承担本应由编辑完成的筛选工作。
解决方案:发布开源工具bib-audit
为了应对捏造引用的问题,两位作者开发并发布了一个名为bib-audit的MIT许可开源工具。该工具可以:
- 自动审计参考文献: 将论文的参考文献与Crossref、arXiv、DataCite、Semantic Scholar等权威数据库进行逐字段比对。
- 检测各类问题: 能够发现不存在的论文、捏造的DOI或作者、真实论文的错误元数据(如作者名单被截断)以及格式错误。
- 使用方式: 可作为Claude Code的技能安装,或通过
npx命令集成到其他AI编码工具中。作者建议在提交论文前自行运行该工具进行自查。
重要警告: 审稿人在使用此类工具时,必须注意所在会议关于LLM使用的政策,因为该工具需要将论文的部分内容发送给托管LLM进行处理,这可能违反某些会议的保密规定。
结论: 学术出版正面临AI生成“垃圾稿件”的严峻挑战,这不仅浪费了审稿人的宝贵时间,也侵蚀了学术评审的诚信基础。需要作者、审稿人和会议组织者共同努力,建立更有效的筛选和应对机制。
评论总结
根据评论内容,主要观点和论据如下:
观点一:AI正在全面渗透学术出版流程(评分:None,作者:nneonneo) - 论文由AI撰写、AI审稿、AI阅读总结,人类正被快速排除在学术出版循环之外。 - 关键引用:"papers are written by AI... papers are reviewed by AI... papers are read, summarized and digested by AI" - "We are very rapidly automating humans out of the academic publication loop here."
观点二:学术开放性问题加剧了AI滥用(评分:None,作者:dghlsakjg) - 若论文不被期刊“门禁”,验证引用和引文存在将变得简单。 - 关键引用:"If all these papers were not gatekept by journals, it would be trivially easy to validate..."
观点三:AI生成内容应被视为抄袭(评分:None,作者:DarkUranium) - 应给予类似抄袭的后果,但可能只是理想。 - 关键引用:"I feel like this should be treated as, and have consequences similar to, plagiarism."
观点四:AI生成论文被接受引发担忧(评分:None,作者:tolugenius) - 即使论文存在虚构引用,仍被有条件接受,这为侥幸逃脱树立先例。 - 关键引用:"if even one paper with such an error is accepted it sets the precedent you hopefully get lucky to not get caught"
观点五:对使用AI起草论文的质疑(评分:None,作者:jsw97) - 作者表示从未想过用LLM起草,认为那是学生行为。 - 关键引用:"My voice is my voice and it's literally never occurred to me to have an LLM do a first draft."
观点六:AI内容激增将催生验证工具需求(评分:None,作者:jeffmanu) - 认为Eversaid.co等工具将因AI生成内容爆发而更有用。 - 关键引用:"This is why Eversaid.co is going to be even more useful as ai generated content explodes."
总结:评论者普遍担忧AI在学术出版中的滥用,认为其正在取代人类角色、破坏学术诚信,并呼吁加强验证与问责。同时,也有观点指出学术开放性问题加剧了此现象,而AI内容激增可能催生新的验证工具。