Hacker News 中文摘要

RSS订阅

AI公司销毁实体书——趁为时未晚,扫描稀有书籍吧 -- AI companies destroy physical books – let's scan rare books before it's too late

文章摘要

AI公司通过中间商大量收购二手书籍,扫描后销毁,用于训练AI模型,防止竞争对手获取数据。安娜档案呼吁全球志愿者在文化遗产消失前,紧急扫描并上传这些书籍。

文章总结

中文重述:AI公司销毁实体书,安娜的档案呼吁全球志愿者扫描稀有书籍

核心观点:AI公司正秘密购买、扫描并销毁数百万册实体书,以获取训练数据,导致人类知识被永久封锁在企业私有服务器上。安娜的档案紧急呼吁全球志愿者在文化遗产消失前,扫描并上传这些书籍。

背景与问题: - 多家AI公司通过中间商大量收购二手书,扫描后销毁,目的是获取2022年前“未经机器处理”的训练数据。 - 以Anthropic的“巴拿马计划”为例:该公司在2024年初启动高度机密项目,花费数千万美元购买数百万册纸质书,扫描后用于训练Claude大语言模型,随后全部销毁。此举虽合法,但被批评为“反人类罪行”。

销毁实体书的原因: 1. 防止竞争对手扫描这些书用于训练。 2. 规避法律风险。 3. 销毁成本低于无损扫描。

后果:AI公司成为全球唯一拥有这些数字副本的实体,知识被永久垄断在私有服务器上。公众可能获得更智能的AI助手,但代价是大量知识资源从公共领域消失。

安娜的档案的应对: - 作为全球最大的影子图书馆,安娜的档案计划联合其他影子图书馆,构建“数字亚历山大图书馆”,保存人类知识。 - 呼吁全球志愿者扫描图书馆、档案馆中的书籍、期刊、报纸、古籍等易流失资料,并上传至影子图书馆。 - 奖励机制:小规模扫描上传可获得认可和终身会员资格;大规模扫描上传可报销扫描费用并提供其他奖励。

紧迫性: - 自2025年初,AI生成内容已占新发布互联网内容的一半以上。未来若大量书籍和论文由AI生成,人类将难以区分真伪。一旦AI吸收完人类最后的手写文字,互联网将只剩AI的自我复制,人类文明如何保存? - 影子图书馆提供最佳解决方案:打破知识垄断,让后代免费阅读人类财富,避免出版商牟利而作者收入微薄。

行动呼吁: - 扫描上传书籍、购买书籍和论文后扫描上传、或捐款。 - 目标:在出版商完全封锁知识、AI公司销毁所有书籍和论文之前,扫描上传全球所有出版物。

结语:这是一场与时间的赛跑。每个人的努力都能打破知识垄断,创造历史。

评论总结

根据评论内容,主要观点和论据如下:

1. 版权法导致书籍被毁(高认可度) - 评论1:版权持有者限制书籍流通,迫使AI公司销毁扫描后的书籍("the copyright holders are the ones locking these books up... force AI companies to shred books") - 评论26:这是版权法荒谬后果("disgusting consequence of copyright law... 100% the consequence of stupid laws")

2. AI公司实际销毁书籍数量微不足道(中等认可度) - 评论10:专业书商每年销毁数百万册,AI销毁量极小("professional specialized book dealers pulp books by the millions... infinitesimal fraction") - 评论21:这些书本可能被填埋,AI公司反而延长了其寿命("These books were probably going into a landfill without AI companies getting them")

3. 对知识私有化的担忧(中等认可度) - 评论27:AI公司正在私有化人类知识,令人想起《华氏451度》("privatizing human knowledge... reminds me of Fahrenheit 451") - 评论24:担心信息垄断和订阅制知识("monopoly on information... exclusive subscription based knowledge")

4. 对书籍实际被毁的质疑(低认可度) - 评论18:缺乏证据表明书籍被毁,扫描设备通常不会破坏书籍("What evidence do we have that they are 'destroying' books?") - 评论19:要求提供被毁稀有书籍的具体案例("Can someone name a rare book that was destroyed as part of AI scanning?")

5. 对安娜档案的争议(低认可度) - 评论4:支持安娜档案,认为信息应自由("Information wants to be free") - 评论27:批评安娜档案是盗版,会摧毁作家创作动力("shadow libraries are killing the incentive to write")

6. 对AI公司保留数字副本的猜测(中等认可度) - 评论20:AI公司很可能保留数字副本用于未来训练("I highly doubt they destroy digital copies... What prevents them from making these digital copies available to the public? Copyright!") - 评论23:肯定AI公司会保留扫描件("I'm sure the AI companies will retain scans of the books for training on newer models")