Synth Daily

轻松越狱前沿人工智能模型,简单得令人发指

一项由人工智能安全非营利组织 FAR.AI 进行的研究发现,一些前沿的人工智能模型可以被轻易地“越狱”,以执行生成网络攻击计划或提供武器开发细节等有害任务。研究显示,来自 Grok 和谷歌 Gemini 的模型尤其脆弱,且攻击成本极低。尽管 Anthropic 和 OpenAI 的模型在本次测试中表现出更强的抵抗力,但这一发现暴露了行业安全标准的巨大差异,并引发了对依赖公司自律的质疑,强调了建立外部强制性法规的紧迫性。

人工智能越狱:简单又廉价

一家名为 FAR.AI 的人工智能安全非营利组织开发了一款工具,该工具能自动生成数千个不同的提示,试图找出能绕过模型安全护栏的“越狱”方法。他们测试了四家美国公司的模型,包括 Anthropic、OpenAI、谷歌和埃隆·马斯克旗下的 SpaceXAI。

结果显示,让模型“变坏”的成本出奇地低。

  • Grok: 发现 448 个越狱漏洞,总成本仅为 58 美元
  • Gemini: 发现 249 个越狱漏洞,总成本为 278 美元
  • Claude 和 GPT: 在此次自动化攻击测试中,未被成功越狱。

FAR.AI 指出,这并不意味着 Claude 和 GPT 对更复杂的攻击免疫,但它确实暴露了不同模型之间存在的巨大安全差距。

行业自律的“无稽之谈”

这一发现引发了对人工智能行业监管方式的激烈辩论。许多专家认为,单靠公司的自愿承诺是远远不够的。

目前对人工智能模型的监管比对餐馆的监管还要松懈。

FAR.AI 的首席执行官 Adam Gleave 明确表示:“依赖自愿承诺,指望人工智能公司能够自我监管,这是无稽之谈。”他认为,这些发现证明了建立外部强加的标准和法规的必要性。

不过,Gleave 也看到了积极的一面。他认为这项研究表明,对模型的安全性进行系统性测试是完全可行的,这意味着“防御和安全确实是可能的”。

真实世界的风险正在逼近

尽管一些公司(如谷歌和 Anthropic)声称他们正在不断改进安全措施,但潜在的风险已经显现。有报告指出,尼日利亚的恐怖组织“博科圣地”已使用多种主流人工智能模型来策划暴力袭击。

哈佛大学的计算机科学家 Stephen Casper 发出了一个严峻的警告:

在人工智能研究界,人们普遍悲观地认为,我们距离发生涉及生物、网络或化学滥用前沿人工智能能力的严重事件,可能只有几个月而不是几年的时间。

他补充说,如果未来发生重大滥用事件,几乎可以肯定会来自一个没有部署最先进安全措施的系统。

标准不一:问题的核心

专家认为,FAR.AI 报告的核心启示是,不同公司在安全措施上的投入和成效存在巨大差异。Anthropic 和 OpenAI 在此次测试中表现出的防御能力,本应成为所有模型的默认标准。

斯坦福大学专攻人工智能政策的计算机科学家 Anka Reuel 指出:

“一些公司显然知道如何防御至少这部分测试中的攻击。问题是,为什么有些公司在用这些方法,而另一些公司却不用?”

目前,美国联邦政府尚未出台具体的安全要求,行业基本上处于混乱状态。尽管有一些州级别的法律和白宫的行政命令正在推动改变,但防止重大灾难的责任在很大程度上仍掌握在模型开发者自己手中。