Codeberg 协会通过投票决定,承诺不使用用户数据训练大型语言模型(LLM),并修订使用条款以限制完全由 AI 生成且缺乏社区维护的“氛围编码”项目。此举旨在应对 LLM 对自由/开源软件(FLOSS)生态系统构成的威胁,包括其高昂的资源成本、对服务器基础设施的压力,以及对协作信任文化的侵蚀。新规旨在保护 FLOSS 公共资源,确保其用于支持真实的社区协作项目。
两项关键决议
Codeberg 的年度大会投票通过了两项关于大型语言模型(LLM)的提案,以明确其官方立场。
- 保护用户数据: 明确承诺 Codeberg 及其相关服务 不会使用 项目或用户的代码及数据来训练任何“人工智能”工具。此举重申了其“我们不想要你的数据”的隐私政策核心。
- 限制“氛围编码”项目: 修订使用条款,以禁止那些主要由 LLM 生成、缺乏真实社区参与和维护的项目。这项更具争议的提案最终以 358 票赞成对 144 票反对的结果通过。
大型语言模型(LLM)带来的代价与风险
LLM 是一项成本高昂的技术,其代价并不仅仅由直接用户承担,而是被大规模地转嫁给了整个社会。
硬件价格飙升: 训练和部署 LLM 导致固态硬盘(SSD)和内存等关键硬件成本急剧上升。例如,几年前售价 700 欧元的驱动器现在已涨至 3,700 欧元,并且时常缺货。这使得 Codeberg 维护和扩展硬件的成本远超以往。
服务器不堪重负: 为训练模型,各大公司的网络爬虫会进行 毫无意义的抓取,试图读取 Codeberg 上的每一个页面,包括各种历史版本和问题过滤器变体。这会产生大量昂贵的数据库查询,降低了所有用户的服务质量,并迫使管理员投入精力构建防御机制,而非开发新功能。
资源浪费的“幽灵项目”: 一些开发者利用 LLM 快速生成大量代码,创建出看似活跃但 实际上没有用户和社区 的项目。这些项目消耗着与大型社区项目相当甚至更多的持续集成/持续部署(CI/CD)和存储资源。Codeberg 认为,将宝贵的捐赠资金投入到托管这类大型“幽灵项目”上是不合理的。
加剧数字鸿沟: 硬件和云服务价格的上涨,威胁到小型非政府组织、本地合作社和研究项目的生存。个人计算也可能再次变为一种奢侈品,迫使用户依赖算力和存储能力有限的设备,并陷入云服务商的成本陷阱。
数据中心巨大的能源和水资源需求,已经导致许多社区的电费和饮用水价格上涨,同时还带来了空气和噪音污染。
对协作文化与信任的侵蚀
LLM 的影响超越了基础设施层面,直接威胁到自由/开源软件生态系统的核心——协作。
鼓励一次性代码: 人们倾向于使用 LLM 从头开始编写一次性软件,而不是在现有工具的基础上进行协作与复用。这导致“共享”的代码量虽多,但大多是无人创作也无人维护的代码。
破坏贡献者之间的信任: LLM 的广泛使用正在成为对协作信任的多维度攻击。
- 维护者需要花费大量时间审查由 LLM 生成的、善意但低质量的贡献。
- 人们越来越难以分辨哪些项目由经验丰富的开发者维护,哪些则是由 LLM 生成且缺乏人类监督。
- 在“左版”(copyleft)项目中,LLM 还可能导致 “许可证清洗”,即通过“重新生成”代码来剥离其互惠共享的要求。
我们正进入一个恶性循环:协作的交易成本增加,使得人们越来越不愿意为高质量项目做贡献,反而更倾向于编写一次性、无人维护的软件。
新条款的实际影响与指南
修改使用条款是为了明确 Codeberg 的使命和希望支持的项目类型,但这并不意味着会立即进行大规模内容删除。
不太可能受影响的项目
- 拥有一个 关心并维护软件的活跃社区 的项目。
- 在 LLM 时代之前就有重要历史的项目。
- 维护者在不知情或知情的情况下,接受了其他贡献者少量由 LLM 生成的贡献。
可能不再受欢迎的项目
尽管一些实验性或资源占用小的个人项目可能会被容忍,但以下情况可能不再适合 Codeberg:
- 由 LLM “代理”以自主方式创建的项目。
- 大量使用 LLM 编写和维护的项目。
- 项目消耗的资源(如存储、CI/CD)远超 参与人数手工所能创造的合理范围。
- 与 LLM 生态系统紧密相关的项目(例如,用 LLM 编写的工具来简化 LLM 的使用)。
Codeberg 的目标是成为人们协作和共同改进软件的场所,而不是一个倾倒由 AI 生成、无人问津的一次性软件的地方。这些新规旨在重新确认这一核心原则。