Synth Daily

用版权图书训练AI模型究竟合不合法?这事儿真没那么简单

使用受版权保护的图书来训练人工智能模型是否合法,这一问题的答案远比表面看起来复杂。当前,法律界对此没有明确共识,判决结果也相互矛盾。核心争议点在于这种行为是否构成版权法中的“合理使用”,特别是当AI的产出与其训练材料形成直接竞争时,法院更倾向于认定其侵权。尽管已有AI公司因使用盗版书籍训练模型而被处以巨额罚款,但法官同时也将AI“学习”的过程类比为人类的阅读,这又为AI公司的行为提供了一定的合法性基础。最终,由于相关法律自1976年以来未曾更新,整个行业仍在等待一系列关键诉讼的结果来指明方向。

法律的灰色地带

目前,人工智能技术与现有版权法之间存在巨大的鸿沟。法律专家指出,这是一个极其复杂且充满争议的领域,因为现行法律是在近50年前制定的,完全没有预见到今天的技术发展。

  • 法律滞后: 版权法自1976年以来未做重大更新,导致法官只能用几十年前的规则来审视全新的AI问题。
  • 情绪与利益交织: 无论是创作者还是科技公司,各方都对正在发生的事情抱有强烈的情感和利益诉求,使得问题更加复杂化。

“这个法律和技术领域的一个问题是,事情太多了……它非常复杂,而且对于正在发生的事情,无论是支持还是反对,都有很多原始的情绪。”

关键判例与矛盾解读

最近的一些判决为这个模糊地带提供了初步的参照,但并未形成统一标准。

一个里程碑式的案件中,Anthropic公司被判向作家支付巨额赔偿。然而,判决的细节揭示了其复杂性:

  • 罚款原因: 罚款并非因为“训练”行为本身,而是因为该公司从非法的网络“影子图书馆”获取了盗版书籍
  • 法官的类比: 法官将AI模型学习海量文本的过程,比作一位有抱负的作家通过大量阅读来学习创作,而不是为了抄袭或取代原作。这一观点实际上对AI公司有利。
  • “阅读”与“复制”: 法律专家认为,该判决将AI训练类比为“阅读”而非“复制”,这对AI行业是好消息,因为版权法主要限制复制行为,而不是使用或体验作品。

“合理使用”是核心争议点

大多数案件的核心都围绕着“合理使用”原则,即未经许可使用受版权保护作品是否合法。

“合理使用”允许在特定情况下(如评论、模仿、教育等)使用版权材料。法官在判断时会考虑几个因素,其中市场影响至关重要。

“版权始终是为了保护和发展市场。”

法院的判决逻辑越来越倾向于一个标准:是否构成直接竞争

  • 如果AI的目的是直接竞争:当一家公司使用他人内容来训练一个旨在与内容提供者直接竞争的产品时,法院倾向于判定其侵权。例如,Ross Intelligence公司因使用汤森路透的内容来构建一个与之竞争的AI法律平台而被判败诉。
  • 如果AI的目的不是竞争:如果AI的使用不会与原作市场形成竞争,法院则更倾向于认定其为合理使用。

尽管作家们可以主张聊天机器人通过学习他们的作品来生成新的“合成书籍”,从而构成竞争,但这一论点在法庭上尚未取得成功。

另一难题:AI生成内容能受版权保护吗?

除了训练数据的问题,AI生成内容的版权归属是另一个难题。

  • 完全由AI生成的作品不受保护:Thaler v. Perlmutter 案中,法院裁定,如果一个作品是100%由AI生成的,它就不能获得版权。
  • 界限模糊: 这引发了新的问题:我们如何确定一个作品中AI参与的比例?使用AI工具辅助创作(如用Word进行拼写检查)与完全由AI生成之间的界限在哪里?

“(AI)正迫使我们审视一堆我们一度忽略的决定。”

未知的未来

目前,大多数AI公司仍深陷于相关的法律诉讼之中,这意味着我们短期内不会得到明确的答案。最初的判决正在塑造行业的发展方向,但这些结果并非最终定论,随时可能被其他法院的裁决推翻。在此期间,AI公司别无选择,只能密切关注这些司法动态,并在此基础上做出决策。