Hacker News 中文摘要

RSS订阅

AI公司销毁实体书——趁为时未晚,扫描稀有书籍吧 -- AI companies destroy physical books – let's scan rare books before it's too late

文章摘要

AI公司通过中间商大量收购二手书籍,扫描后销毁,用于训练AI模型,防止竞争对手获取数据。安娜档案库呼吁全球志愿者在文化遗产永久消失前,紧急扫描并上传这些书籍。

文章总结

以下是对原文主要内容的中文重述,保留了关键细节,删减了与主题无关的表述:


AI公司秘密购买、扫描并销毁大量实体书籍,以获取训练数据。安娜的档案呼吁全球志愿者在文化遗产彻底消失前,扫描并上传这些书籍。

多家AI公司通过中间商大量收购二手书,扫描后销毁,目的是获取2022年之前“未被机器触碰过”的训练数据。例如,Anthropic的“巴拿马计划”在15亿美元版权和解案中被曝光:该公司投入数千万美元,购买数百万本纸质书,扫描后用于训练其Claude大语言模型,随后全部销毁。这种行为在法律上可行,但在道德上是对人类文明的严重犯罪。

销毁实体书的原因有三:防止竞争对手获取数据、规避法律风险、以及销毁比无损扫描更便宜。AI公司大规模扫描销毁后,成为全球唯一拥有数字副本的实体,知识被永久垄断在私人服务器上。

这场争夺旧书的战争揭示了一个悖论:AI公司一边承诺“让人类知识触手可及”,一边却在拆除人类知识最坚实的载体。公众或许能获得更智能的AI助手,但代价是大量知识资源从公共领域消失。

影子图书馆的应对

作为全球最大的影子图书馆,安娜的档案需要对抗AI公司对实体书的破坏。影子图书馆是21世纪知识共享的最大奇迹,我们正与其他影子图书馆一起,建造一座数字化的亚历山大图书馆——人类不灭的光明。

我们急需全球志愿者扫描并上传来自各地图书馆和档案馆的资料(包括书籍、期刊、报纸、杂志、古籍、善本等),尤其是那些容易流失的文献。如果全球有1000万志愿者,每人扫描一本书,就能获得1000万份无价财富。

  • 小规模扫描上传者,通常可获得安娜的档案的认可和终身会员资格。
  • 大规模扫描上传者,我们可帮助支付扫描费用及其他奖励。

时间紧迫

自2025年初起,AI生成内容已占新发布互联网内容的一半以上。一个可怕的事实是:如果未来大量内容由AI生成,人类还能分辨吗?一旦AI吸收了人类写在纸上的最后一句话,互联网上将只剩下AI自己的语言。在这样的世界里,人类文明如何保存?

影子图书馆提供了最佳答案。如果你希望人类文明的记忆不再被垄断,希望后代能免费阅读全人类的财富,不希望出版商暴利而作者微薄,请帮助我们。无论扫描上传书籍、购买书籍和论文上传,还是捐款,每一份贡献都能打破知识垄断。我们每个人都能创造历史。

这是一场与时间的赛跑。我们的理想是:在出版商完全封锁知识、AI公司扫描销毁全世界所有书籍和论文之前,扫描并上传所有出版物。

——安娜的档案志愿者“u”

评论总结

根据评论内容,主要围绕AI公司(如Anthropic)扫描并销毁实体书籍的行为展开讨论,观点分歧明显。以下是总结:

支持/理解扫描销毁行为的观点: - 书籍是商品,所有者有权处置,且扫描后数字化更耐久(评论2、6) - 稀有书籍未必有价值,多数内容过时或可替代(评论9、11、12、26) - 法律上可能属于“合理使用”(评论16),且图书馆和出版商本身也会销毁书籍(评论26) - 关键引用:eulgro: "Companies are paying for the books now, great! And destroying a book is really the best way to scan it." / JsonDemWitOster: "Rare does not automatically mean it has some obscure knowledge nor does it mean culturally/historically significant."

批评/担忧扫描销毁行为的观点: - 此举破坏知识保存,类似亚历山大图书馆焚毁(评论4) - AI公司应公开扫描结果,而非独占(评论21) - 版权问题导致大量书籍未被数字化,而AI公司却可规避(评论8、14) - 关键引用:ziyadb: "this is akin to the burning of the library of Alexandria" / spwa4: "Courts have failed to provide authors and inventors with exclusive rights... this decision goes against both the spirit and letter of the law"

对AI公司动机的质疑: - 扫描可能为AI训练数据,但未公开分享(评论1、3) - 可能通过销毁实体书来阻碍竞争对手(评论19) - 关键引用:warkdarrior: "Isn't this just doing the work for the AI companies???" / shevy-java: "they also destroy rare books to sabotage competitors"

对政府/机构角色的讨论: - 政府(如美国国会图书馆)应承担数字化责任(评论10) - 美欧政府在版权问题上选择偏袒AI公司(评论14) - 关键引用:ryandvm: "It seems like it would be well within the charter of the Library of Congress to archive a complete scan" / spwa4: "US and EU governments obviously want AI models to make everything... this is a conscious choice"

对安娜档案(Anna's Archive)的关联: - 部分评论认为安娜档案与AI公司行为类似,均涉及版权问题(评论1、15、22) - 但也有支持者认为应资助此类项目(评论24) - 关键引用:warkdarrior: "Then the AI companies can simply download a copy of Anna's Archive." / branon: "we can push forward too by ensuring important institutions (legal or otherwise) remain funded"

总体来看,评论者主要争议点在于: 扫描销毁实体书是否真正威胁知识保存?AI公司是否应公开扫描数据?版权法是否被扭曲?以及政府是否失职。支持者强调书籍可替代性和数字化优势,批评者则担忧知识垄断和文化遗产损失。