Synth Daily

Codeberg 更新服务条款:严厉禁止 LLM 滥采行为

Codeberg 已更新其服务条款,明确禁止托管主要由大型语言模型(LLM)生成的代码项目。这项决策的核心驱动力是 AI 生成内容模糊不清的版权状态以及其训练数据背后存在的伦理问题,这给作为非营利组织和开源社区的 Codeberg 带来了潜在的法律风险。尽管社区对“主要构成”等具体措辞的界定存在争议,但该提案最终通过投票,表明了平台在维护代码质量和伦理标准上的坚定立场。

新增服务条款的核心内容

新条款明确规定,用户不得在 Codeberg 上分享特定类型的项目。

禁止分享主要由大型语言模型(LLM)生成的代码所构成的项目。这类项目不仅版权状态不明,而且在防止数据清洗和剽窃等伦理问题上几乎没有保障。

做出此项变更的主要原因

该决议的背后有多重考量,主要集中在法律风险、伦理立场和代码质量上。

  • 版权风险: AI 生成代码的版权归属是一个法律灰色地带。作为非营利组织,Codeberg 难以承担由此引发的潜在法律纠纷。
  • 伦理问题: LLM 的训练数据来源广泛,常涉及未经授权的代码,这与 Codeberg 作为“伦理替代方案”的定位相悖。
  • 维护代码质量: 社区成员认为,大量 AI 生成的代码会降低项目质量。审核这些代码既耗时又容易出错,正如一位成员所说:“一项贡献为项目带来的价值,应该超过审核它所需的时间。”

社区讨论中的关键争议点

关于这项新规,社区成员表达了支持、疑虑和具体的修改建议。

对模糊措辞的担忧

  • “主要构成” (mostly) 的定义: 有用户指出,“主要”这个词过于模糊,难以界定。一个项目包含 49% 的 AI 代码是否合规?建议使用“重要部分” (in significant part) 等更明确的术语。
  • “分享” (share) 的范围: 用户不清楚“分享”具体指什么行为。是指提交 PR、在 Codeberg 之外分享代码,还是包括授权他人访问私有仓库?

对应用场景的疑虑

  • 教育用途: 有人担心这项规定过于严格,可能会禁止用于教育目的的代码分享。
  • 人工审核的可行性: 对于简短的代码,开发者完全可以阅读、理解并测试后再分享。新规可能会限制这种合理的使用场景。然而,支持者反驳称,现实情况是审核大量 AI 代码会让人产生疲劳,导致草率地通过(“LGTM, merge”)。

伦理与法律的权衡

“法律问题是不可避免的,但它们并非唯一的考量。”

一些成员认为,讨论不应仅仅局限于版权问题。作为伦理平台,Codeberg 更应关注 AI 带来的“思维外包”和低质量“垃圾代码” (slop) 等更广泛的伦理挑战。

最终结论

尽管存在关于具体措辞和执行细节的讨论,但这项旨在限制 LLM 生成代码的提案已经获得投票通过。Codeberg 团队将准备一篇官方博客文章,详细阐述这一决定以及平台对 AI 使用的总体立场。此举措再次强调了 Codeberg 对于项目质量、法律稳健性和社区伦理的重视。