文章摘要
对12,750篇arXiv论文全文评分发现,约三分之一新论文读起来像机器撰写。文章介绍了方法、结果并诚实说明了局限性,指出检测器存在误报问题。
文章总结
我们分析了12,750篇arXiv论文的全文,发现约三分之一的新论文读起来像是机器撰写的。以下是研究方法、结果以及对其局限性的坦诚说明。
假阳性基准
许多声称“X%的内容是AI生成的”标题并不值得信赖,因为检测工具也会误判部分人类写作。例如,若某工具标记40%的新论文为机器撰写,但同时也标记了20%的ChatGPT出现前的论文,那么真正的故事在于那未被提及的20%误报率。因此,我们围绕这一质疑设计了研究。我们的检测器针对学术写作校准,在0.4%的假阳性率下,能正确识别99.6%的LLM出现前的真实科学文本,并恢复85%的AI学术文本。我们将此假阳性率作为基准。我们选取了2021和2022年(ChatGPT出现前)提交的论文作为真实人类写作样本,并设定标记阈值,使得恰好0.4%的此类论文被触发。这一阈值是底线。我们报告的每个数字都是超过该阈值的论文比例,而在此阈值下,LLM出现前的真实写作比例被设定为0.4%。因此,ChatGPT出现前的年份作为内置对照:如果上升趋势是检测器的伪影,那么2021和2022年的标记率应与2026年一样高。第一张图显示并非如此。
测量方法
我们从2023年1月至2026年7月,每月从十个领域组各抽取约25篇论文,加上2021和2022年的八个对照月,共12,750篇论文。每篇论文我们提取其第一版PDF,以确保2026年修订的论文不会将现代文本泄露回其2023年的版本。我们评分的是全文正文而非摘要,因为摘要会低估信号:我们曾见过同一篇论文的摘要得分低于20%,而正文得分超过70%。每个报告的数字都附有bootstrap 95%置信区间。
结果
标记比例在2021和2022年稳定在0.4%,在ChatGPT出现后数月内开始上升,并在两个波次中攀升至最近完整季度的约32%,2026年初峰值接近39%。各领域间的差异很大,具体数据见表格和第二张图。下表是各领域在截至2026年7月的12个月内的标记比例,以及其LLM出现前的对照水平。
| 领域组 | LLM出现前对照 | 近期标记比例 | 95%置信区间 | | --- | --- | --- | --- | | 计算机科学 | 0.2% | 65.0% | [59.3, 70.3] | | 定量生物学 | 3.5% | 56.3% | [51.0, 61.7] | | 电气工程与系统 | 1.7% | 51.3% | [46.0, 57.0] | | 经济学与金融 | 2.5% | 47.0% | [41.3, 52.7] | | 应用物理学 | 1.3% | 34.0% | [29.0, 39.7] | | 统计学 | 1.8% | 31.3% | [26.0, 36.7] | | 凝聚态物理 | 0.0% | 24.0% | [19.3, 29.0] | | 高能物理 | 0.5% | 14.0% | [10.0, 18.0] | | 天体物理学 | 0.0% | 10.7% | [7.3, 14.3] | | 数学 | 0.0% | 0.7% | [0.0, 1.7] |
计算机科学以约65%领先。数学最低,接近0.7%,局限性部分解释了为何其低值难以解读。对照列是各领域2021至2022年在三种灵敏度设置下的平均标记率;上升幅度最大的领域并非LLM出现前对照水平最高的领域,因此高起点并不能解释上升趋势。
局限性
对照样本量。 每个领域的ChatGPT出现前对照样本为200篇论文。在0.4%的标记率下,整个2000篇论文的对照样本中仅有8篇被标记,分散在十个领域,因此单一阈值下的各领域对照率较为粗略。整体基准估计良好,是研究的基础,但各领域对照水平仅为近似值。扩大对照样本也无法解决此问题:要精确确定每个领域百分之零点几的标记率,需要每个领域数千篇对照论文,而2023年前的arXiv数据量无法满足。
低分可能意味着低采用率或检测器盲区。 数学是最明显的例子。数学论文以符号和定理证明结构为主,一旦移除公式和参考文献,剩余散文部分稀疏且与检测器训练所用的科学英语不同。一篇大量使用模型辅助撰写的数学论文可能因散文部分不符合检测器的分布而得分较低,因此数学领域的低分并不能有力证明论文由人类撰写。这一结果与两种截然不同的解释一致:采用率较低,或检测器在该领域灵敏度降低,而本数据无法区分二者。散文密集的领域(即最符合检测器分布假设的领域)也是上升幅度最大的领域,因此这一混淆因素无法解释整体趋势。但在低分领域,排名应被视为采用率的下限。
检测器覆盖范围。 检测器对某些生成器更敏感,我们无法针对作者实际使用的、私有的模型和提示组合进行评估。不完整的覆盖范围会降低标记率,因此报告的流行率是下限:真实比例至少与我们测量的结果相当。检测器文档报告了各生成器的性能。
标记不等于作者身份。 检测器估计的是文本是否读起来像机器撰写,基于校准的概率和已知的错误率。它无法区分轻度编辑的文档和完全生成的文档,单个分数绝不能作为指控特定个人的依据。我们报告的是机器式写作的流行率,这包括大量AI辅助编辑的情况。
尝试使用
该检测器运行成本低廉,我们不从中获利。你可以在此处免费测试任何arXiv论文,或在此处测试你自己的文本。
评论总结
根据评论内容,总结如下:
主要观点与论据:
AI检测率显著上升(评论1,评分None):作者对2021-2026年12,750篇arXiv论文进行检测,发现2026年1月约39%的论文被标记为AI生成,计算机科学领域峰值达65%,而数学领域仅0.7%。关键引用:"in Jan of 2026 about 39% of papers got flagged as AI written";"Mathematics barely moved away from 0.7%"
对AI检测准确性的质疑(评论10、14、18,评分None):多位评论者指出检测方法存在偏差,如可能误判人类写作风格(评论10:"nearly every sentence is highlighted as red 'machine-leaning'"),或混淆术语变化(评论14:"could it be possible that the detector is simply learning to recognize words and jargon used more in the literature post 2022 as 'AI'?")。评论18基于实际运营经验表示:"The numbers are not nearly this high"
AI辅助写作的合理性(评论11、15、19,评分None):非母语者认为AI帮助提升学术写作质量(评论11:"With LLMs, we can write in basic sentences and tell the LLM the idea and it converts that to nice writing");评论15主张:"Papers probably should be written by AI so that they're clear and well presented";评论19说明使用AI进行语法修正:"This helps correct grammar and improves accessibility"
对学术写作影响的担忧(评论7、9,评分None):评论7抱怨:"I don't want to read slop generated by AI. AI written articles are generally low effort";评论9提出深层问题:"if more papers' are written with AI, or the shape of knowledge of converging?"
对AI检测必要性的质疑(评论2、3,评分None):评论2反问核心问题:"So what? ... when a human reads it, do they -- or society -- get something good out of it?";评论3指出风格同质化风险:"your writing will be influenced by the AI style"
平衡性总结: - 支持方:认为AI可提升写作效率与清晰度,尤其对非母语者有益 - 反对方:担忧质量下降、风格同质化,质疑检测准确性 - 中立派:强调应关注内容实质而非写作工具,呼吁改进检测方法