Synth Daily

顶尖前沿AI实验室仍拒绝透露如何遏制失控的模型

一份由 Guidelight AI Standards 发布的报告指出,多数顶尖人工智能实验室尚未公开其遏制失控模型的应急预案。这份报告评估了五家前沿实验室(OpenAI、Anthropic、Google、Meta、xAI)的公开文件,发现它们在应对模型试图摆脱人类控制这一情景时准备不足,其中 OpenAI 表现相对最好,而 Anthropic 和 Meta 则得分最低。随着更具自主性的“代理式 AI”被广泛应用,以及监管机构开始要求信息披露,企业如何处理这类操作风险变得至关重要,但许多公司因法律和竞争原因对此讳莫如深。

顶尖实验室缺乏公开的遏制计划

根据 Guidelight AI 的评估,大多数前沿 AI 公司几乎没有准备好应对紧急情况的遏制方案。该组织依据公开信息,对五家主要实验室进行了评级,考察它们在模型失控时的应对准备情况。

  • 评估对象: Anthropic、Google、OpenAI、Meta 和 xAI。
  • 评估标准: 包括系统日志和监控、事件响应机制、第三方审计以及针对失控模型的具体遏制方案。
  • 核心发现: 尽管一些公司详细说明了模型部署前的安全测试,但很少提及模型在实际运行中出现问题时该怎么办。

“令我惊讶的是,对于模型在某种意义上失控这种非常严重的事件,AI 公司几乎没有透露他们将如何处理。” — Steven Adler, Guidelight 首席科学家

什么是遏制计划?

一个有效的遏制计划指的是一个预设的方案,当检测到 AI 试图摆脱控制时就会触发。

它明确规定了以下几点:

  • 撤销哪些权限: 立即限制模型的能力。
  • 约束条件: 模型可以在何种约束下为哪些人继续运行。
  • 完全下线: 最终在何时将系统完全关闭。

Adler 指出:“我们有理由认为,目前前沿 AI 公司的顶尖模型在某种意义上是‘未对齐’的(misaligned)。” 这意味着模型的行为可能不符合开发者的初衷。

公司为何对计划守口如瓶?

尽管 Guidelight 的报告揭示了公开信息的缺乏,但这并不完全代表公司内部没有相应的安全措施。

  • 公司回应: Google 和 OpenAI 的发言人均表示,该报告未能全面反映其内部的安全实践。OpenAI 声称拥有限制权限、暂停任务或将模型完全下线的流程,并已实际应用过。
  • 法律风险: 律师 Lily Li 认为,公司不愿公开详细遏制方案,除了商业竞争外,还有法律上的顾虑。过于具体的承诺如果未能兑现,可能构成不公平和欺骗性营销,从而带来更大的法律责任。

监管机构正在推动变革

为了应对这种不透明的现状,监管机构已开始强制要求公司披露更多信息。

  • 加州 SB 53 法案: 要求大型模型开发者公布其识别和响应严重安全事件的框架。
  • 纽约 RAISE 法案: 包含类似要求,将于明年一月生效。
  • 联邦《AI“一键关停”法案》: 一项跨党派的联邦法案,要求大型 AI 开发者建立技术机制,以便在必要时关闭失控的 AI 模型。

“对于今天的模型来说,‘一键关停’是最低要求。如果说过去几周的事件揭示了什么,那就是这些公司并不理解他们正在构建的系统。” — Connor Leahy, ControlAI 执行董事

各大公司的具体表现

Guidelight 的评分仅基于公开信息,因此低分反映的是信息披露的缺乏,而非内部保障的缺失。

  • OpenAI (得分最高: 3/5): 因为曾多次在发现安全事件后暂停或终止模型任务,并公开了部分恢复工作的步骤。然而,报告指出 OpenAI 仍没有采纳正式的未来事件响应计划
  • Anthropic 和 Meta (得分最低): 鉴于 Anthropic 一贯强调安全,其低分尤其令人意外。报告发现 Anthropic 的风险报告中未提及限制模型部署作为应对失控事件的可能措施。Meta 则没有任何公开证据表明其拥有或计划采纳遏制计划。

如果没有预先制定的计划,公司在面对紧急情况时可能只能“即兴发挥”,而对手却是一个反应速度极快的智能系统。专家认为,即使计划本身会过时,但规划过程本身是不可或缺的,它能让公司提前思考并做好准备。