一项研究将一个大型语言模型(称为 LittleLearner)的训练内容严格限制在美国小学五年级及以下的课程知识范围内。研究发现,模型的最终能力被其初始学习内容牢牢地限制住了。后续通过扩大模型规模、进行额外训练或在提示中提供示例等方法,虽然能强化模型已有的知识,但无法使其掌握超出范围的高级概念。这表明,预训练阶段接触的知识,基本上决定了模型能力的天花板。
一个受控的知识实验
现代大语言模型通常一次性学习海量数据,这使得我们很难判断一项新技能是模型真正学会的,还是仅仅被激发出来的。为了弄清这一点,研究人员创建了一个受控的环境:
数据集:LittleCurriculum 一个包含 880 亿词元的语料库,其内容经过严格筛选,完全对标美国小学(K-5)课程标准。所有五年级以上的概念、事实和词汇都被明确排除。
模型:LittleLearner 基于上述数据集从零开始训练了三种不同规模(6亿、13亿、50亿参数)的模型。这些模型有一个明确的知识边界,便于研究人员进行对照分析。
研究的核心发现是:无论是扩大模型规模、进行后期微含调,还是上下文学习,都只是放大了模型在课程范围内已有的能力,但没有一种方法能有效提升其在范围外的表现。这说明,预训练数据的筛选,已经为模型的能力设定了上限。
三种方法都无法突破知识边界
实验清晰地表明,当知识边界被严格控制后,标准的优化方法只能在边界内起作用,无法实现真正的突破。
1. 扩大模型规模
增加模型的参数量可以提升其在课程范围内的表现,但对于需要更高级知识的课程范围外问题,性能提升微乎其微。这说明,更大的模型只是更好地掌握了已学知识,而不是学会了新知识。
2. 后期训练
即使使用超出范围的数据对模型进行后期微调,也无法弥补其在高级知识上的短板。
- 后期训练能显著增强模型在小学课程(K-5)范围内的能力。
- 但它无法帮助模型掌握超出小学课程范围的能力。
3. 上下文学习(In-context Learning)
在提示中提供解题示例或解释(即上下文学习),也未能解锁 LittleLearner 模型处理高级问题的推理能力。模型仍然无法解决那些需要其未曾学过的知识的问题。
这项研究的意义是什么?
由于 LittleLearner 模型的知识边界是明确已知的,研究人员可以更精确地观察和分析模型的学习过程。这为未来的研究开辟了几个有趣的方向:
强化学习与能力发现: 模型的基础知识被限制在小学水平,因此,如果通过强化学习(RL)使其涌现出新能力,那么这些能力就可以直接归功于强化学习过程本身。
持续学习: 可以观察模型学习一个全新概念(如“负数”)的全过程,衡量其学习效率、记忆保留和知识干扰情况。也可以探索模型在知识边界附近的行为:它是会回答、拒绝回答还是产生幻觉?
教育科学: 可以将模型的学习过程与儿童的学习过程进行对比。例如,模型和儿童在学习“分数”时需要相似的知识铺垫吗?他们在解决应用题时会犯类似的错误吗?