Hacker News 中文摘要

RSS订阅

使用“经典”机器学习检测LLM生成的文本 -- Detecting LLM-Generated Texts with “Classical” Machine Learning

文章摘要

截至2026年初,主流大语言模型生成的文本具有明显统计特征,可用传统机器学习模型有效区分。作者怀疑许多AI查重工具正是基于此原理工作,并提供了在线演示和开源代码。

文章总结

截至2026年初,主流大语言模型生成的文本存在明显的统计规律,传统机器学习模型就能有效区分其与人类写作内容。我怀疑许多所谓的“AI查重工具”底层正是采用这种原理。

我开发了一个在线演示工具,其模型并非基于通用数据训练,也未经过严格优化,在测试集上单句检测准确率约85%。核心代码和模型文件已开源在GitHub上。

半年前写论文时,我就发现一些AIGC检测平台能较准确地区分手写文本和AI生成内容,这激发了我的好奇心。但当时忙于其他爱好,直到最近在Lofter上看到大量低质量AI同人文,才决定重启这个项目。

我尝试过基于文本困惑度的检测方法,但效果不佳,存在大量误报和漏报,且推理成本高、跨模型泛化能力差。最终我选择了传统机器学习路线,使用scikit-learn的LinearSVC和朴素贝叶斯分类器。

数据方面,我收集了2023年从某平台爬取的2010-2022年间发布的文章作为人类样本,再用多个LLM生成对应数量的AI样本。通过多种渠道获取API访问,最终使用了gemini-3-flash生成摘要,七种不同模型生成AI样本。

训练时,我将文本按中文标点切分为句子,清理非中英文字符,应用TF-IDF和LinearSVC。单句分类准确率达85%左右,远超预期。我还训练了七个独立的二分类器,采用多数投票机制:若两个以上模型判定某句为AI,则标记为可疑。

为方便使用,我将模型导出为JSON,在浏览器中用JavaScript实现TF-IDF和SVM推理。最终版本保留了50万个特征,压缩后约38MB,准确率仅下降约1%。

测试显示,该检测器对训练集内模型准确率很高,对未见过的模型(如Claude、GPT)也能保持70%以上检测率。对2022年前的人类文本,误报率极低:以60%为阈值时仅0.04%,70%时几乎为零。但在Lofter热门榜单中,32.22%的文章AI评分超过50%,且无一主动声明使用AI。

我测试了常见的规避方法,如翻译往返、提示词改写等,检测率虽有下降但仍能有效识别。要真正绕过这种检测,可能需要微调模型或构建复杂规则系统,但这已超出本文范围。

最后,我认为AI生成内容在娱乐领域难以被视为真正的创作,其文本模式过于可预测,缺乏深度。虽然LLM带来了创新,但滥用现象在各行业蔓延。无论如何,我对未来持开放态度。

评论总结

根据评论内容,总结如下:

主要观点与论据:

  1. 检测LLM文本的可行性争议

    • 支持方:评论3(Krssst)认为“如果互联网被LLM文本淹没,需要像广告拦截器一样的自动检测工具”,评论13(arjie)表示“不完美的检测在社交网络(如HN)中也有用”。
    • 反对方:评论5(akersten)指出“文本信息密度不足以解码来源信号,检测如同‘塔罗牌占卜’”,评论7(teeray)强调“假阳性会摧毁人类创作(如论文被误判)”,评论11(40four)认为“唯一可行的是‘工作量证明’系统”。
  2. 技术局限与军备竞赛

    • 评论8(gleenn)指出“检测模型成本低,但训练方会利用检测结果改进模型,形成军备竞赛”。
    • 评论2(unfocso)分享实践:“用GLM-OCR处理数据时,仍需忍受幻觉和模型不遵循模式”。
  3. 替代方案与本质问题

    • 评论9(docheinestages)建议“评估写作投入度而非作者身份”,评论10(metalman)认为“人类会混淆LLM输出,需降低数据容忍度”。
    • 评论14(connorboyle)指出翻译偏差:中文“糊弄”可能被误译为“欺诈”,需注意文化语境。

平衡性总结:
- 支持检测者强调实用价值(如过滤垃圾信息),反对者聚焦技术不可靠性(假阳性风险、信号稀疏性)。
- 部分评论提出替代路径(工作量证明、写作质量评估),或质疑检测本身的意义(评论12:richard_chase认为LLM输出“比人类作品更令人愉悦”)。
- 评论1(cyanydeez)警示长期影响:“LLM将训练人类思维模式,扭曲自然写作”。