最近发生的两起事件——OpenAI-Hugging Face 事件以及 Astra 模型可能达到网络安全关键能力的初步迹象——凸显了日益强大的人工智能所带来的风险。为此,我们暂时放缓了模型开发的规模扩张速度,转而优先加强在训练过程各个阶段的监控、对齐和安全防护措施。这些措施虽然导致了研究的延迟和成本增加,但对于确保AI系统的行为符合预期、响应人类监督,并防止其能力被滥用至关重要。最终,我们的目标是让安全保障的进步速度,始终领先于模型能力本身的发展速度。
风险加剧,研发步伐放缓
近期内部研究的快速进展,加上外部事件的警示,共同增加了我们加强AI安全措施的紧迫性。随着模型能力越来越强,其内部开发和测试的风险也随之增长。
我们的监控、对齐和安全标准必须领先于这些风险。为了达到这些标准,我们暂时减慢了规模扩张的步伐,其中包括将最新模型的强化学习(RL)训练暂停了两周。
在暂停期间,我们采取了以下行动:
- 加固并红队测试我们的研究环境。
- 扩大了监控系统的覆盖范围。
- 在进行更小规模的训练和评估,以验证安全措施并获得更多对齐证据之前,我们最大规模的前沿强化学习(RL)运行仍处于暂停状态。
为更强大的模型强化三大安全支柱
我们开发更强大模型的方法依赖于三个相互增强的安全保障措施,它们必须与模型能力同步扩展:
- 监控 (Monitoring): 及时发现并响应令人担忧的模型行为。
- 对齐 (Alignment): 减少模型产生有害或未经授权行为的可能性,确保其行为符合人类意图。
- 安全措施 (Security): 限制人工智能系统可以访问或影响的范围。
我们预计,未来模型本身将承担大部分安全工作,包括防御其他模型的攻击。
加强研究环境的安全性
随着前沿模型获得更强的网络安全能力,我们必须提高其训练和评估环境的安全标准。这项工作需要巨大的工程投入,并已对前沿研究造成了显著的成本和延误。
我们已经实施了更强的安全要求,例如:
- 工作负载隔离: 对执行模型生成代码或不可信代码的工作负载,我们要求使用更强的隔离环境(“沙盒”)。
- 网络隔离: 我们实施了更多控制措施,将高风险和不可信的工作负载与互联网隔离。
- 持续安全测试: 我们正在利用自己的模型实现自动化,以模拟攻击并持续测试安全边界。
由于我们确定 Astra 模型可能具有关键级别的网络能力,目前我们对涉及 Astra 或网络模型的项目要求最高级别的安全保障。
扩展“思维链”监控
我们已经修订并扩展了我们的监控方法,建立了一套新的多阶段监控系统。该系统从检测模型内部活动的分类器开始,然后将潜在问题升级给更复杂的自动化调查系统进行分析。
我们的目标是在监控系统发现可疑活动后的 30 分钟内发出警报。如果系统识别出可能违反关键安全边界的行为,将生成最高优先级的警报,并要求相关团队在 30 分钟内暂停该活动,除非能确认是误报。
这项监控措施会带来显著的计算成本,我们目前的估计是,监控开销约占被监控推理计算量的 20%。
推进对齐研究
对齐研究是我们使命的核心。随着模型能力增强,像奖励“黑客”行为 (reward hacking)、欺骗或未经授权的访问等失调行为会造成越来越严重的风险。
我们正在采取以下措施来推进对齐:
- 改进奖励模型: 更好地检测和阻止不安全的行为。
- 训练模型更诚实: 让模型能坦诚地说明其行为、能力和局限性。
- 减少利用漏洞的行为: 防止模型利用奖励、评分员、工具或监督机制中的弱点。
我们正在积极投资于对齐研究,扩大评估覆盖面,并利用所学知识来改进训练和安全措施。
未来展望
我们将不断发展我们的“准备框架”,将这些安全措施整合到训练和部署的各个环节。这需要对模型辅助安全、更有效的监控以及对齐研究的持续投入。
前沿模型的能力正在迅速加速。我们理解、对齐和保护它们的能力必须保持领先。