亚马逊旗下的 Twitch 平台默认使用主播的内容来训练其人工智能模型,现在提供了一个主动退出的选项。这一做法是在设置更新后才被用户发现的,引发了创作者对大型科技公司如何处理用户数据的普遍担忧。此事不仅暴露了 Twitch 的默认数据使用策略,也揭示了整个 AI 行业在发展过程中面临的高质量训练数据短缺问题,以及将用户内容作为解决方案的普遍趋势。
默认开启的 AI 训练与如何退出
Twitch 更新了其账户设置,允许主播选择不将自己的内容用于训练亚马逊的 AI 模型。然而,这一功能是默认开启的,意味着除非用户主动更改,否则其内容会被自动用于此目的。
你可以通过以下简单步骤禁用此功能:
- 在 Twitch 网站或移动应用中,点击你的账户头像,选择 设置。
- 进入 安全与隐私 菜单。
- 找到 “生成式 AI 训练” 选项,并将其关闭。
需要注意的是,禁用此选项并不妨碍 Twitch 和亚马逊将你的频道内容用于其他目的,例如用于平台内的 AI 功能,如 AutoMod 内容审核、观众推荐以及赞助活动支持。
官方回应引发更多争议
这项更新的推出在创作者社区引发了强烈反弹。超过 16,000 名创作者表示反对自己的内容被默认用于训练亚马逊的 AI 系统。
在一次直播中,Twitch 的产品负责人 Mike Minton 对此做出了他所称的 “坦率的回应”:
他承认,将此选项默认开启是必要的,因为 “否则就没人会参与” 这个过程。
Minton 还补充说,这种数据抓取行为并非 Twitch 独有。他认为,其他开发 AI 系统的公司很可能也在从 Twitch 和其他服务中提取内容来训练它们的模型。
- 他表示:“我不能百分之百确定,但我认为可以合理地假设,几乎所有公开内容都在以某种方式被用于训练模型,无论是否获得许可。”
- 他还说:“所以我认为我们还需要承认,这里有很多事情甚至超出了我们的直接控制范围。”
这些言论引发了新的疑问:Twitch 从何时开始使用用户内容训练 AI?除了亚马逊,是否还有其他公司参与其中?创作者的署名权在多大程度上得到了尊重?
AI 训练数据短缺的行业困境
这一事件凸显了 AI 系统开发者面临的一个主要挑战:高质量训练数据的日益短缺。
随着技术进步和数据需求的增加,可用的数据源正在减少。因此,科技公司开始采取各种方式获取数据,这也再次引发了关于训练过程的道德和透明度辩论。
- Meta: 一直在使用用户在 Facebook 和 Instagram 上分享的帖子和图片来训练其 AI 模型。
- Google: 其旗下的 YouTube 也被发现存在类似的数据使用情况。
高质量的训练数据已成为继芯片、内存和电力之后的又一战略资源。所有迹象都表明,这种需求的一部分正由用户自己生成的信息来满足,而他们获得的回报仅仅是免费使用日常的数字服务。