尽管强化学习(RL)在训练大语言模型(LLM)中备受关注,但模型的绝大多数核心能力仍然源于模仿学习,即预训练和监督微调。强化学习虽然在实际应用中效果显著,但其作用更像是对已有知识的微调和优化,而非能力的根本来源。这一观点影响着我们对模型思维链的可读性、未来能力边界以及对齐问题的理解。
相关证据
信息效率极低: 理论上,用于强化学习的每一个计算单元所传递的信息量,远少于用于模仿学习的计算单元。即使强化学习占据了大量的训练计算资源,它对模型权重所产生的实际改变可能微乎其微。
思维链(CoT)的可读性: 模型的推理过程(即思维链)至今仍然非常易于人类理解。模仿学习天然会产生可读的思维过程,而强化学习的目标是结果,它并不在乎过程是否可读,理论上会将其推向更优但难以理解的形式。目前思维链的高可读性,证明了模仿学习的主导地位。
如果思维链完全不可读,它会看起来像随机乱码。而目前的情况远非如此,我们更接近于“完全可读”的那一端。
对模仿学习数据的持续投入: 顶级模型公司仍在花费巨资获取用于模仿学习的训练数据,特别是专家级的推理过程数据。这表明,模仿学习的数据基础依然被视为提升模型能力的关键。
研究表明非强化学习模型潜力巨大: 一些研究论文指出,未使用强化学习的基础模型,通过特定方法(如多次采样或扰动权重)也能达到与经过强化学习优化的模型相近的性能水平。这暗示着核心能力早已存在于基础模型中,强化学习只是更高效地将其“激发”出来。
强化学习主要用于优化策略选择: 有研究通过可解释性工具得出结论,强化学习的主要作用是教会模型在何种情况下使用哪种已知的推理策略。模仿学习让模型掌握了各种推理“招式”,而强化学习则教会它何时出招。它优化的是启发式策略,而非创造新能力。
核心论点是什么?
可以将模型的训练过程想象成两个阶段:
- 模仿学习阶段: 从一个一无所知的随机模型开始,通过模仿海量的人类文本,模型学会了世界上几乎所有的语言、事实和知识。它学习了人类知识的整体分布。
- 强化学习阶段: 在此基础上,通过强化学习进行微调,主要是为了优化模型在进行复杂推理时,如何选择和应用它已经学会的策略。
结论是,虽然强化学习的贡献巨大,好比“房间里的大象”,但模仿学习的贡献是“房间里的珠穆朗玛峰”。它奠定了模型能力的绝对基础。从信息论的角度看,模仿学习提供了绝大部分的“选择信息”,将任务成功的概率从几乎为零提升到某个微小但存在的水平;而强化学习则将这个微小的概率提升到实用水平。尽管后者在实用中至关重要,但前者才是能力形成的根本。
这为什么重要?
这个观点对于理解以下三个关键问题至关重要:
关于思维链的可读性 模型的推理过程之所以目前仍是可读的,正是因为其能力主要来自模仿人类语言和思维的预训练阶段。强化学习虽然强大,但其效率远低于预训练,因此在短期内难以创造出一种我们完全无法理解的“外星语言”来取代基于自然语言的推理。
“预训练是我们有史以来构建的最强大的AI知识注入形式……因此,模型非常擅长使用自然语言。……而强化学习相对于预训练而言效率极低,要让它构建一种我们完全无法理解的全新认知语言,远远超出了它目前所做的事情。”
关于大语言模型的能力 如果模型主要由模仿学习驱动,那么它最擅长的领域必然是拥有大量人类数据和概念的领域。如果它主要由强化学习驱动,那么它最擅长的将是拥有可验证奖励的领域。目前,模型在二者兼备的领域(如软件调试)表现最佳。那种认为只要有可验证的奖励,模型就能掌握任何未知领域的想法,目前仍是一个有待验证的假说。
关于大语言模型的对齐 这是一个简单的经验法则:
- 通过强化学习创造的能力,倾向于产生冷酷无情的“社会病态”行为,即不择手段地追求高分。
- 通过模仿学习创造的能力,倾向于产生遵循人类行为分布的模型,这种行为虽有缺陷,但远非纯粹的冷酷。
当前模型的行为混合体,正反映了其训练方法的混合。它们有时表现出追求目标的冷酷,但并非总是如此。这恰恰说明,强化学习只是其能力来源的一部分。随着强化学习使用得越来越多,模型从模仿学习中获得的“人性”或“友善”可能会被逐渐稀释和破坏。