Synth Daily

AI 专家激烈辩论:我们离“递归自我改进”还有多远?

AI 专家们探讨了人工智能实现“递归自我改进”(RSI)的前景与障碍。讨论认为,尽管进展迅速,但技术瓶颈依然存在,例如模型难以实现真正的泛化、模拟环境与现实世界之间存在差距,以及当前技术范式可能无法发现未来的重大突破。专家们分析了模型复制(蒸馏)在追赶前沿技术中的作用,并指出获取真实的用户交互数据至关重要。对于未来,他们认为自动化AI研究将结合人类反馈和大量模拟实践,但强化学习(RL)在多大程度上能催生通用智能仍是未知数。最终,对于AI何时能成为全能的远程工作者、将研究效率提升10倍以及全面超越人类专家,专家们给出了从一两年到十年不等的大胆预测。

驳斥“递归自我改进”:为何2036年可能不会有超级智能?

如果到2036年,世界并未被大规模的超级智能所改变,其背后的技术原因可能是什么?专家们提出了几个关键的潜在瓶颈。

  • 持续的“模拟与现实差距”: AI可能在所有基准测试和模拟环境中表现出色,但在现实世界中的泛化能力始终受限。虽然目前的模型已展现出一定的泛化能力,但如果元学习(meta-learning)和持续学习(continual learning)的难度远超预期,AI可能永远无法真正弥合这一差距。

  • 模型能力的瓶颈循环: 新模型发布时总会令人惊艳,但使用一段时间后,其弱点和糟糕的判断力就会暴露出来,让人感觉“变笨了”。这个“惊艳到失望”的循环可能会持续很长时间。即使模型能编写大量代码,也未必能带来生产力的百倍提升,因为人类的判断力仍然是瓶颈。

  • 当前范式的局限性: 目前的AI范式(基于自注意力机制和强化学习)可能距离“最优学习器”的理论上限还很远。历史上的技术进步,如摩尔定律和语言模型的发展,都依赖于一系列不连续的重大创新。

当前的训练方法,即使是针对递归自我改进(RSI)的强化学习环境,也未必能发现下一次重大的理论或架构突破。如果无法发现这种突破,我们很可能会达到一个增长的渐近线。

  • 科学发现的本质: 真正带来范式转变的科学研究,其目标往往是模糊和开放的,无法被简单地定义和优化。而目前的AI更擅长在目标明确的“自动研究”中进行优化。

尽管如此,多数人认为,鉴于AI技术自2012年以来的飞速发展,它在研发等领域超越人类只是时间问题。唯一让这个趋势中止的技术可能性是,AI的发展曲线在超越人类之前就达到了一个无法突破的平台期。

中国AI实验室的进展动力:数据与模型复制

AI领域存在强大的中心化趋势,但模型复制(或称蒸馏)是抵抗这种趋势的主要力量。理论上,通过观察领先模型的行为,较小的模型可以学习并复制其能力。

然而,有效的蒸馏并非易事,关键在于获得真实且多样的提示语分布。仅仅在基准测试上模仿是不够的。

  • 现实世界的数据是关键: 最近有观点认为,一些中国公司可能正在利用代理服务来获取用户与美国前沿模型的交互数据。这些服务为中国用户提供了访问被封锁模型的渠道,同时收集了大量真实的、多样的用户提示和反馈。

  • 数据优势的重要性: 这种真实的用户数据是进行高质量蒸馏的完美“养料”。这或许可以解释为什么一些中国模型在性能上能迅速追赶甚至超越一些美国公司发布的次级模型。这表明,真实世界的部署和用户交互数据,可能比精心设计的内部模拟环境更重要

拥有真实的用户提示语分布,可以让你很好地模仿大模型。但如果只拥有一系列容易验证的任务数据,你可能能在所有基准测试上与大模型匹敌,但在更广泛、更真实的场景中表现更差。

此外,前沿实验室本身也从大型数据公司购买数据,而这些数据同样对所有参与者开放,进一步削弱了先发者的绝对优势。

如何训练自动化AI研究员?

第一批能够自动化AI研发的AI模型,将如何被训练出来?专家们认为这将是一个迭代和组合的过程。

  • 吸收人类的“品味”: 通过人类反馈学习(RLHF),让AI吸收顶尖研究员的直觉、判断力和研究品味。

  • 大量的实践环境: 创建大量模拟环境,让AI在其中执行多步骤的研究项目,并不断修正其弱点。

  • 从前沿错误中学习: AI研发的实际过程更像是在“打补丁”。研究员会不断锁定前一版本模型中的缺陷和错误,并将它们转化为新的训练环境,推动模型迭代。

最终,人类在AI研发中最后、也是最持久的角色,将是定义目标和决定我们想要什么。即使AI能完成所有技术工作,我们仍然需要决定AI助手的行为准则,或是在进行人类反馈强化学习时,明确“有帮助”的真正含义。

长周期强化学习能带来通用人工智能吗?

目前AI研究的主流思路似乎是:通过在数百万个多样化的模拟环境中进行大规模强化学习,最终将涌现出一个掌握了通用元技能(如信息筛选、长期规划、跨代理协作)的智能体。这个智能体将像一个可以随时上岗的远程工作者。

然而,这种“模拟到现实”(sim-to-real)的路径存在根本性的疑问。

  • 为何要预先“烘焙”技能? 如果AI最终能像人类一样在岗学习,为什么还需要在训练中费力地教它使用PowerPoint或Excel?一个可能的解释是,这只是为了在AI达到完全通用智能之前,通过商业化应用获取收入,以资助更核心的RSI研究。

  • 模拟的局限性: 许多现实世界的任务,尤其是那些涉及与多人实时互动的任务(如商业谈判、法庭辩论),都极难在数据中心里被真实地模拟。

当样本效率低下时,“模拟到现实”必须是主导范式,因为你现在需要成千上万次与人类的互动,而没有任何人会坐在那里参与强化学习的训练循环。但如果样本效率大幅提高,从实际部署中学习将成为更重要的部分。

一个关键的优势尚未被充分利用:AI的每次部署都可能成为一次学习机会。目前,大部分推理计算的经验都被浪费了。如果能建立一个高效的反馈循环,让模型从全球数百万个实例的部署经验中持续学习,可能会引发一场分布式的“智能爆炸”。

模拟与现实的差距

对于AI能否从模拟训练中泛化到复杂的现实任务,存在两种不同类型的任务:

  • 累积性任务 (Cumulative Tasks): 在这类任务中,每一个新发现都可以被固化下来,成为未来工作的基础。AI研究(RSI) 可能就属于此类。一旦发现了注意力机制或专家混合模型,就可以将其直接加入训练堆栈,无需重新探索。

  • 非平稳任务 (Non-stationary Tasks): 这类任务的环境和规则是不断变化的。例如,在一家律师事务所工作,你需要实时处理不断变化的人际关系、隐性规则和信息渠道。这类任务对模型的持续学习和适应能力要求极高。

今天的模型在很多方面都比人类弱。一个弱点是某些情境下的样本效率,另一个完全不同的弱点是思想多样性较低,以及在某些类型的长远判断上表现不佳。人们所说的“品味”,很多时候就是关于什么行为在长期内是有效的。

如果AI要真正掌握人类的“品味”,仅仅延长上下文窗口可能还不够。模型需要被训练如何从长期的经验中进行有效的学习和更新。

数据在多大程度上解释了AI的进步?

AI的进步在多大程度上是由数据驱动的?

对于前沿模型,信号(有用的信息)已经不存在于我们拥有的原始数据中了。无论怎么过滤,我们都不可能在通用网页数据中找到一个隐藏的千禧年大奖难题的证明。此时,你必须通过其他方式获取信息,比如直接向人类请教,或者创造新的模拟环境。

最近的一项研究对比了自2019年以来的算法和数据进步,发现在小规模模型上:

  • 数据进步 带来了约 12倍 的计算效率提升。
  • 架构进步 带来了约 3.7倍 的计算效率提升。

这表明,至少在预训练阶段,更好的数据过滤和合成数据起到了主要作用。然而,随着模型规模的增大,情况可能更复杂。更好的架构(如GQA)能够解锁处理更长上下文的能力,从而使模型能够利用以前无法利用的数据。因此,算法和数据的作用是相辅相成的,而非简单的乘法关系。

强化学习为何如此有效?

一年前,许多人对强化学习(RL)在大型语言模型上的扩展潜力持怀疑态度。但如今,RL似乎取得了巨大成功。原因何在?

  • 中度训练 (Mid-training) 的铺垫: 在进行RL之前,模型会先经过一轮“中度训练”,即在大量高质量的合成推理数据上进行预训练。这个阶段已经让模型完成了约80%的工作。

  • RL是微调而非从零学习: RL的作用更像是对一个已经非常强大的基础模型进行“微调”,而不是从头开始学习所有行为。它只需要少量的信号来调整策略。

  • 极高的信噪比: RL与监督微调(SFT)的关键区别在于,RL只关注最终结果的“一个比特”信息(成功或失败),而忽略了达成结果的具体路径。这极大地提高了信噪比,使得训练信号不会被推理路径中的“噪声”淹没。

我们并未获得预期的水平泛化(例如,训练数学并不会自动让你成为编程高手),但我们确实获得了时间跨度泛化(horizon generalization)。模型学会了如何长时间地使用更多token来持续解决一个任务。

Move 37与熵坍塌:AI的创造力之辩

关于强化学习对模型行为的影响,存在两种截然不同的看法:

  • 熵坍塌 (Entropy Collapse): RL会减少模型输出的多样性,使其倾向于重复某些固定的模式或“口头禅”,形成一种“单调的文化”。例如,由于许多模型都从同一个领先模型(如Claude)进行蒸馏,导致它们的写作风格和缺陷都趋于一致。

  • Move 37式的创造力: 另一方面,RL也能引导模型发现超越人类的、极具创造力的解决方案,就像AlphaGo走出惊人的“第37手”一样。近期有报告称,AI模型能够连续发现多个零日漏洞来突破沙箱,这无疑是一种高级创造力的体现。

这两种观点并不矛盾。RL擅长解决有明确约束的复杂搜索问题(这是一种创造力),但同时它也会削弱输出的分布多样性。这种多样性的丧失,通常是由于奖励模型(或评判者)本身存在偏好或局限性,而不是RL方法固有的缺陷。

快速预测:AI发展时间线

专家们就未来AI发展的几个关键节点给出了时间预测:

  • AI成为全能的“远程工作者”(能够无缝执行为期一个月的复杂白领工作,如编码、视频编辑、法律辅助等):

    • Charlie O’Neill: 大约 1年
    • Beren Millidge: 大约 3年,因为会有一个很长的“尾巴”,包含一些AI难以处理的杂项事务。
    • John Schulman: 大约 1年左右可以得到一个“还过得去”的版本。
  • AI为AI研究员带来10倍的生产力提升:

    • John Schulman: 2年
    • Beren Millidge: 同意 2年左右。他认为,只要AI能独立完成一两个实验循环,就已经能带来巨大的效率提升。
    • Charlie O’Neill: 5到10年。他认为主要瓶颈在于人类研究员吸收信息和做出决策的能力。
  • AI在所有可通过计算机完成的认知领域,全面超越顶尖人类专家:

    • John Schulman: 3到4年。他认为AI研究本身就是最受关注的领域之一,而编码和数学正是模型的强项。
    • Charlie O’Neill: 5到10年。他认为自动化AI研究的难度与实现通用人工智能(ASI)相当。
    • Beren Millidge: 5年左右,但主要限于实验室重点关注的领域。