Hacker News 中文摘要

RSS订阅

保护我们的FLOSS公共资源免受LLM侵害 -- Protecting our FLOSS commons from LLMs

文章摘要

Codeberg协会通过两项决议,承诺不使用用户数据训练大型语言模型,并解释了对“氛围编码”项目的服务条款变更,认为LLM威胁自由软件生态系统。

文章总结

保护我们的FLOSS公共资源免受大语言模型侵害

核心要点

  • Codeberg e.V.成员投票通过了两项关于"人工智能"和大语言模型的提案
  • 我们承诺不会使用任何用户数据训练大语言模型,并解释计划中的使用条款变更对"氛围编码"项目的影响
  • 我们认为大语言模型对整个自由/开源软件生态系统构成威胁

大语言模型的代价

大语言模型是一项成本高昂的技术,且成本持续攀升。这些成本不仅由使用和订阅服务的用户承担,还通过大规模外部化转嫁给非用户和整个社会——硬件价格上涨、能源消耗增加、环境破坏,最终都由我们共同买单。

无意义爬取导致服务器压力

Codeberg的基础设施经常因那些计划抓取所有代码用于训练大语言模型的网络爬虫而承受重压。这些爬虫试图读取Codeberg的每一个页面,包括各种问题筛选变体、Git历史记录以及历史记录中的实际文件,即使内容完全相同。这些无意义的访问产生昂贵的数据库查询,降低服务质量,消耗系统管理员大量精力,迫使我们花费时间构建防御机制而非开发新功能。

零开发团队

使用大语言模型编码能带来肾上腺素飙升的快感,仿佛拥有一个大型团队。但实际上你常常是独自一人,与一个将能源转化为代码的统计机器合作。许多"氛围编码者"没有意识到他们实际上没有社区支持,却像有社区一样消耗资源。我们看到一些项目拥有大量代码活动、频繁的CI/CD测试和大型发布二进制文件,有时支持的平台数量甚至超过实际用户数。单个开发者、几乎没有用户的项目消耗的资源竟然比Codeberg上一些最大的社区项目还要多,这显得荒谬可笑。

硬件采购成难题

大语言模型的训练和部署大幅推高了硬件采购成本,特别是SSD和内存。几年前700欧元就能买到的硬盘现在涨到3700欧元,还经常缺货。虽然我们拥有自己的硬件,不受云端租赁成本膨胀的直接影响,但更换或扩展硬件的成本已大幅增加。

数字鸿沟扩大

价格上涨导致数字鸿沟扩大:小型甚至大型运营商都面临成本上升的威胁,只有最大的云公司才能获得可靠的硬件协议。网站托管、存储或计算等服务成本上升,给许多小型非政府组织、本地合作社和研究项目带来挑战。甚至连基本的数字工具如电脑和智能手机也受到影响,使个人计算重新变成奢侈品。

公共基础设施、用户和环境受损

专门为大语言模型训练建造的数据中心消耗大量能源和水资源,许多社区已经面临电力和饮用水价格上涨。居住在数据中心附近的居民直接受到空气和噪音污染加剧的影响。为了给这些数据中心供电,相关公司正在积极游说,要求豁免环境法规。

协作面临危险

自由/开源软件生态系统是一个以协作为中心的社会现象,依赖于自由分享和相互学习。而采用大语言模型的人们倾向于从头编写"一次性软件",导致共享代码增加,但这些代码既不是由任何人"编写",也没有人维护。

信任危机

大语言模型在自由/开源软件中的广泛使用正在多维攻击贡献者之间的信任和协作理念。维护者因收到大量低质量、大语言模型生成的贡献而工作量增加,同时越来越难以区分哪些项目由经验丰富的开发者维护,哪些是大语言模型生成且缺乏有意义的人工监督。在版权保护项目中,大语言模型还导致"许可证洗白"——通过从训练数据中"生成"代码来剥离其互惠要求。

我们观察到相互不信任的趋势日益加剧,甚至到了真正付出努力分析问题或分享建议的人被错误指控使用大语言模型的地步。同时,其他人指示他们的大语言模型隐藏痕迹,避免常见模式,促使他人更仔细地审查贡献和沟通中的机器生成迹象。

恶性循环

这些力量共同使协作不仅更加困难,而且回报更少:随着协作的交易成本增加,人们越来越不愿意为创建高质量软件项目做贡献,而更倾向于"氛围编码"一次性软件。我们陷入一个恶性循环:协作回报越来越少,而无人维护、永远不会改进的一次性软件数量却在增加。

尽管意图良好,但分享提示结果并称之为"自由软件"并不能让世界变得更好。Codeberg不是也不希望成为倾倒这种无人问津的一次性软件的地方。我们是人们协作改进软件的地方。最近的投票可以理解为对这些原则的再次确认:我们希望以人类协作为中心,不会积极支持或参与大语言模型的创建,也不会将有限资源用于存储会污染我们自由/开源软件公共资源的一次性软件。

使用条款演变

更改使用条款传递了关于我们使命和希望支持项目的强烈信号。但不会在几天内大规模删除内容。我们的审核团队将根据具体案例逐步实施新规则。

初步非正式指南

以下情况不太可能受到影响: - 拥有活跃社区关心和维护的项目 - 在大语言模型出现前就有重要历史的项目 - 维护者无意或有意接受了大语言模型生成的贡献,但项目本身不涉及大量使用大语言模型

以下情况虽不鼓励但可能被容忍: - 资源使用量小的副项目和实验 - 即使不是大语言模型生成也不太可能找到社区的特定工具和自定义脚本

以下情况可能不再受欢迎: - 由大语言模型"代理"自主创建的项目 - 大量使用大语言模型编写和维护的项目 - 资源消耗远超参与人数手工创作能力的项目 - 与大语言模型生态系统紧密相关的项目 - 违反项目自定义政策发送大语言模型贡献的用户

评论总结

根据评论内容,总结如下:

支持方观点(评分:无,但认可度较高): - 严格审核能营造安全社区,是平台进步的重要一步(jaredcwhite: "Safe spaces and healthy communities are borne from enforcing strict moderation") - 决策经社区民主投票,结果合理(TheChaplain: "they were voted on by the active members of Codeberg, simply a democratic outcome") - 反对LLM生成代码是原则性立场,值得赞赏(BrenBarn: "Kudos to them and others who take a principled stance against LLM crapola") - 长期看,Codeberg可能成为非AI生成项目的信号(wongarsu: "a project being on codeberg might end up as a strong signal that the project is not ai-slop")

反对方观点(评分:无,但批评尖锐): - 禁止LLM代码与资源浪费问题无关(nylonstrung: "This seems fully orthogonal to whether LLMs are used or not") - 批评Codeberg是“激进供应商”,市场变化不应归咎于LLM(kstenerud: "Activist vendors are among the most dangerous because of their capriciousness") - 民主投票可能压制少数派意见(grokcodec: "pure democracy can lead to suppression of minority views") - 检测LLM代码标准模糊,难以执行(arkwin: "There isn't a good way to detect LLM usage... seems like a losing battle")

中立/质疑观点: - 用户可轻松迁移至其他平台(superdisk: "if Github ultimately does die I can just point my repos at a new server") - 感谢区分“LLM”与“AI”的表述(endre: "thanks for addressing the source of the problems as LLMs and not AI in general") - 对开源科研项目是否适合使用Codeberg存疑(hamburgererror: "would you advise me using this platform instead of Github?")

关键引用: - 支持方:jaredcwhite "Safe spaces and healthy communities are borne from enforcing strict moderation" - 反对方:kstenerud "Activist vendors are among the most dangerous because of their capriciousness" - 中立:superdisk "if Github ultimately does die I can just point my repos at a new server"