为了管理高级人工智能(AI)带来的生存风险,可以通过审慎的政策来控制其发展节奏。核心策略是先在美国国内实施监管,逐步过渡到国际合作。具体措施包括强制暂停研发、分配计算资源用于商业服务和透明的安全研究、限制用于AI研发的AI模型能力,以及最终建立一个基于风险评估的监管框架。尽管存在让竞争对手领先的担忧,但国内的先行措施可以通过减缓技术外泄、赢得时间来加强安全等方式,最终降低整体风险,并为建立有效的国际协调机制打下基础。
核心建议:四种控制AI发展节奏的方案
我们提议按顺序实施以下方案,从最简单直接的措施开始,逐步过渡到更复杂但可能更有效的方案。其中,方案二和方案三建议只选择其一。
1. 临时暂停: 强制企业暂停提升最前沿AI模型(包括内部模型)的能力。一个简单的执行方式是要求企业将 100% 的计算资源用于推理(即提供现有模型服务),以此作为过渡措施,直到更完善的方案准备就绪。
2. 计算资源分配: 规定最低的 外部推理计算资源分配比例(例如 70%)和最低的 透明安全计算资源分配比例(例如 25%)。通过第三方审计员监督执行,确保计算资源不被用于秘密推进AI能力。透明度要求安全研究的代码和成果公开,从而抑制企业利用这部分资源进行能力竞赛。
3. 限制AI用于自身研发: 设定一个AI能力上限,只允许使用低于该上限的模型来自动化AI研发工作。例如,规定只能使用 至少9个月前完成训练的AI模型 来进行AI研发。这可以延长技术“起飞”的时间,并推迟AI有能力干预自身研究或背叛人类目标的节点。
4. 设立风险上限: 这是最理想但执行难度最高的方案。由第三方风险评估机构评估各公司的AI项目带来的 生存风险,并由政府设定一个可接受的风险阈值(例如,每月低于1%的生存风险)。这能更精细地引导企业行为,鼓励它们在有充分安全保障的前提下发展AI能力。
理想的监管制度是基于风险评估的,但这需要更长的准备时间,并且执行起来可能很困难。
方案详解:计算资源分配要求
控制AI发展节奏的许多方法都旨在减少用于研发新模型的计算资源。这些被释放的计算资源可以用于两个主要方向:
- 创造收入: 将算力用于为外部客户提供现有模型的推理服务。
- 安全研究: 分配算力研究和管理AI系统的风险。
最低外部推理计算资源分配
根据这项政策,前沿AI公司必须将其计算资源的最低特定比例(例如 70%)用于为外部客户提供推理服务。这使它们在削减研发投入的同时仍能保持收入。为防止公司通过外部部署变相推进自身能力,需要采取以下措施:
- 禁止 购买任何外部AI生成的数据。
- 禁止 基于客户数据或外部推理产生的内部日志进行模型训练。
- 引入第三方审计员,使其拥有类似内部员工的权限,以核实计算资源的使用情况。
最低透明安全计算资源分配
这项政策要求AI公司将其计算资源的最低特定比例(例如 25%)用于透明的安全研究,或捐赠给外部AI安全非营利组织。
透明度是关键。如果没有透明度要求,监管机构将难以区分什么是真正的安全研究,什么是伪装的能力研究。
如果一家公司在“透明安全”的计算资源上进行能力研究,它将承担全部成本,而其竞争对手则能免费获得研究成果,这自然会抑制这种行为。一个可行的实施方案是:
- 从一个较低的比例开始(例如 5%),并默认要求所有研究结果和大部分代码公开。
- 安全研究人员可以向审计员申请对敏感信息进行删节,但审计员必须确保任何能力上的进展都被公开发布。
- 在确认该机制有效促进安全进步且未过度泄露能力后,再将比例提高到目标水平(例如 25%)。
方案详解:限制用于AI研发的模型能力
另一种选择是直接限制可用于自动化AI研发的模型的 能力水平。一个可持续的国内政策是:
- AI研发工作只能由 至少9个月前训练完成的AI 来辅助或执行。
这一政策有几个显著优点:
- 推迟了AI能够自我干预的节点,例如阻止AI有能力破坏安全研究或将下一代模型校准为对齐自身而非人类。
- 可能形成 “内部-公共能力差距”的倒挂,即模型会先向公众部署,之后才能用于内部AI研发,这为社会适应和反应留出了宝贵时间。
- 在技术迭代速度极快(即高风险)的情况下,该政策的减速效果更明显。
为了执行这项政策,审计员需要能够识别并判断AI模型的活动是否属于AI研发范畴。
方案详解:基于安全案例的风险评估
直接评估AI公司运营所带来的 生存风险水平 是更接近目标的做法。如果能建立合理的评估方法,政府就可以要求公司将风险控制在特定阈值以下。
这与航空业的安全标准形成了鲜明对比。美国联邦航空局对“灾难性故障”的概率上限是每飞行小时十亿分之一。而在这里,我们讨论的是允许一个可能导致人类永久失权甚至灭绝的事件有百分之一的发生概率。
这种方法的好处在于:
- 激励更安全的架构: 公司会倾向于使用更安全但成本更高的算法。
- 鼓励运行时干预: 激励公司投入资源用于实时监控和干预措施。
- 促进内部治理: 促使公司建立应急预案,以应对AI出现失控迹象的情况。
然而,这种方法也有显著的局限性:
- 风险评估的主观性 使其容易受到政府恶意或无能的影响。
- 难以激励长期的AI安全研究,因为评估过程可能更关注短期风险。
- AI公司会施压评估过程,试图证明其AI是安全的,这考验着评估机构的独立性。
国内控制会否让中国领先?
理想情况下,我们应与中国等国家协调,在全球范围内控制AI发展。但即使没有国际协调,美国单方面采取措施也仍然是值得的。
- 中国可能效仿: 中国也希望AI安全发展,可能会跟进类似的监管,从而形成事实上的国际合作。
- 美国拥有时间差: 美国在AI发展上仍有显著领先。即使美国暂停发展,据估计中国也需要大约 一年 时间才能赶上。这段时间足以用来加强安全措施。
- 减速以加强安全可能反而扩大领先优势: 目前美国公司的安全措施不足以抵御国家级攻击。全速竞赛可能导致中国在模型诞生后迅速窃取。相反,放慢脚步以增强安全,可能让美国在超人智能水平上对中国保持更大的领先优势。
何时开始控制?
我们确信,一旦AI达到 “自动化程序员(AC)” 的水平,即公司宁愿解雇所有人类软件工程师也不愿放弃使用AI时,就应该开始积极控制其发展节奏。我们团队对AC到来的时间预测中位数在 2027年至2030年 之间。
关于是否应该立即开始积极控制,团队内部存在不同意见。但所有人都同意,应立即开始试行适度的控制措施,以便为未来更积极的干预积累制度知识和经验。
如何为控制AI发展做准备
试点国内方案: 政府和公司应合作试点上述各项提议,特别是 5-20% 的安全计算资源最低分配。这既有直接好处,也能帮助完善透明度要求的具体细节。
试点验证机制: 即使不立即执行控制,也应开始建立验证机制。例如,政府可以试点如何核实外部推理的计算资源分配,并为引入第三方审计员做好准备。
增加信息共享: 公司应试点分享更多与风险评估相关的信息,如计算资源分配、安全事件详情等。
开发验证技术: 投资开发更强大的软硬件验证工具。对于国内监管,嵌入式审计员可能足够,但更强大的工具(如可信执行环境、零知识证明)将使监管更稳固。对于未来的国际协议,则需要能抵御国家级行为者的硬件验证技术(如网络分接器)。