尽管人工智能行业承诺 AI 将很快实现自我改进,但普林斯顿大学领导的一项新研究表明,这一目标可能比预期的要遥远。研究发现,虽然 AI 能够处理研究中的工程性任务,但它们缺乏进行 开放式研究 所必需的 判断力、创造力和品味。这项实验让 AI 代理尝试重现顶级会议论文的研究过程,结果 AI 提交的论文均被拒稿,这表明在自动化 AI 研究的道路上, hyped 的时间表可能已经超前于现实。
承诺与现实的差距
AI 行业最引人注目的承诺是 递归自我改进,即 AI 将能以极少的人类监督来提升自身能力。目前,大型语言模型已经可以编写代码、生成训练数据,并优化其运行的芯片。然而,一项新的研究对这一进程的乐观预测提出了挑战。
- 当前能力: AI 代理能够解决 AI 研究中必要的工程问题。
- 核心缺陷: 它们缺乏产生原创性研究所需的 判断力和创造力,无法达到顶级机器学习会议的论文水平。
- 结论: 这表明,关于自动化 AI 研究的 hyped 时间表可能需要重新评估。
普林斯顿大学的 Sayash Kapoor 指出:“这些论文在质量上远未达到顶级 AI 会议的标准。”
“影子评估”实验设计
为了测试 AI 在开放式研究中的能力,研究人员采用了一种名为 “影子评估” 的新方法。
- 任务: 要求 AI 代理(使用 Claude Opus 4.8)回答两篇尚未发表的顶级会议(NeurIPS 2026)论文中的研究问题。这确保了 AI 无法从训练数据或网络上找到答案。
- 资源: AI 代理获得了六天时间、3000 美元的 API 额度、GPU 预算、虚拟计算机以及访问开放网络的权限。
- 评估: 论文的原作者像评审会议投稿一样,对 AI 生成的论文进行了评审。
结果是,两篇论文都被拒稿了。
AI 的成功与失败
研究发现,AI 在研究过程中的表现呈现出明显的两极分化。
AI 成功做到的事:
- 回顾相关文献。
- 运行数百次实验。
- 整理和编译实验结果。
AI 彻底失败的地方:
- 缺乏研究判断力: 它们进行了奇怪的实验,例如在微小的合成数据集上测试假说。
- 无法从失败中学习: AI 无法从失败的方法中回头,不能从头开始尝试新方法,只能进行微小的调整。
- 沟通能力差: 难以清晰地描述自己的工作。
- 忽视反馈: AI 未能采纳来自子代理或外部工具的反馈,而是通过缩小论点和增加限定条件来应对。
- 资源管理不善: 无法有效利用时间、计算资源和预算等。
Anthropic 联合创始人 Jack Clark 曾写道:“当今的 AI 系统中缺乏有价值的、直觉性的创造力……它们似乎有一种刻板、公式化的思维方式,这可能阻止它们成为优秀的研究者。”
为何 AI 难以进行开放式研究?
AI 在开放式研究上的失败可能源于其训练方式。
- 强化学习的局限: 模型擅长通过强化学习进行训练的任务,但前提是这些任务的成功可以被自动检验。
- 开放式任务的挑战: Sayash Kapoor 解释说:“当任务本身是开放式的时候,就很难创建环境来训练这些模型。”
目前的 AI 系统或许能在可量化的狭窄任务上飞速发展,但在需要创造性飞跃的开放式研究上进展缓慢。
未来的“万亿美元问题”
尽管这项研究存在一些局限性(如样本量小、可能存在评估者偏见),但其结果与 AI 公司内部的发现可能不谋而合。AI 行业面临一个核心问题:实现革命性的 AI 进步,尤其是递归自我改进,是否必须依赖创造性的飞跃?
“回顾该领域最大的进步,比如 Transformer 架构的发明……所有这些都需要创造性的飞跃。然而,也有人假设,我们实现变革性 AI 所需的一切都已具备……这坦率地说是当下的万亿美元问题。”