Synth Daily

除非你主动拒绝,否则亚马逊可以使用你的 Twitch 内容来训练其 AI

亚马逊旗下的 Twitch 平台默认使用主播的内容来训练其人工智能模型,现在提供了一个主动退出的选项。这一做法是在设置更新后才被用户发现的,引发了创作者对大型科技公司如何处理用户数据的普遍担忧。此事不仅暴露了 Twitch 的默认数据使用策略,也揭示了整个 AI 行业在发展过程中面临的高质量训练数据短缺问题,以及将用户内容作为解决方案的普遍趋势。

默认开启的 AI 训练与如何退出

Twitch 更新了其账户设置,允许主播选择不将自己的内容用于训练亚马逊的 AI 模型。然而,这一功能是默认开启的,意味着除非用户主动更改,否则其内容会被自动用于此目的。

你可以通过以下简单步骤禁用此功能:

  • 在 Twitch 网站或移动应用中,点击你的账户头像,选择 设置
  • 进入 安全与隐私 菜单。
  • 找到 “生成式 AI 训练” 选项,并将其关闭。

需要注意的是,禁用此选项并不妨碍 Twitch 和亚马逊将你的频道内容用于其他目的,例如用于平台内的 AI 功能,如 AutoMod 内容审核、观众推荐以及赞助活动支持。

官方回应引发更多争议

这项更新的推出在创作者社区引发了强烈反弹。超过 16,000 名创作者表示反对自己的内容被默认用于训练亚马逊的 AI 系统。

在一次直播中,Twitch 的产品负责人 Mike Minton 对此做出了他所称的 “坦率的回应”

他承认,将此选项默认开启是必要的,因为 “否则就没人会参与” 这个过程。

Minton 还补充说,这种数据抓取行为并非 Twitch 独有。他认为,其他开发 AI 系统的公司很可能也在从 Twitch 和其他服务中提取内容来训练它们的模型。

  • 他表示:“我不能百分之百确定,但我认为可以合理地假设,几乎所有公开内容都在以某种方式被用于训练模型,无论是否获得许可。”
  • 他还说:“所以我认为我们还需要承认,这里有很多事情甚至超出了我们的直接控制范围。”

这些言论引发了新的疑问:Twitch 从何时开始使用用户内容训练 AI?除了亚马逊,是否还有其他公司参与其中?创作者的署名权在多大程度上得到了尊重?

AI 训练数据短缺的行业困境

这一事件凸显了 AI 系统开发者面临的一个主要挑战:高质量训练数据的日益短缺

随着技术进步和数据需求的增加,可用的数据源正在减少。因此,科技公司开始采取各种方式获取数据,这也再次引发了关于训练过程的道德和透明度辩论。

  • Meta: 一直在使用用户在 Facebook 和 Instagram 上分享的帖子和图片来训练其 AI 模型。
  • Google: 其旗下的 YouTube 也被发现存在类似的数据使用情况。

高质量的训练数据已成为继芯片、内存和电力之后的又一战略资源。所有迹象都表明,这种需求的一部分正由用户自己生成的信息来满足,而他们获得的回报仅仅是免费使用日常的数字服务。