当前的大语言模型正被刻意设计为牺牲事实性知识,以换取更强的推理能力。这种权衡是主动选择的结果:事实信息占用大量存储空间且很快过时,而推理程序(如逻辑分析)则更通用且易于压缩。未来的模型将更小、更专注于推理,通过外部工具(如搜索引擎和数据库)按需获取事实。这种转变不仅有望让顶级推理模型在普通消费级硬件上运行,还能通过使信息来源可追溯、可修正,从而大幅减少“幻觉”现象。
更强的推理,更弱的知识
一个明显的趋势是,模型在数学和编程等基准测试中的表现越来越好,但其纯粹的事实回忆能力却在下降。
- 推理能力在提升: 新模型在解决复杂的数学问题(如 AIME)上表现出色,而且所需的计算资源(活跃参数)越来越少。
- 事实能力在下降: 在不允许使用工具的简单问答测试(SimpleQA)中,即便是最顶尖的模型,也只能答对约一半的问题。小型模型则几乎无法回答。
对于一个不了解的事实,小型模型有超过 80% 的概率会编造一个听起来可信的错误答案。参数数量的减少并非没有代价。
刻意的权衡:为何牺牲事实
实验室正在主动用世界知识换取推理技能,这背后有清晰的逻辑。
事实占用空间: 存储海量事实(如每个名人的生日、每个城市的具体人口)需要巨大的参数量。研究表明,每个参数大约只能存储两个比特位的事实知识。这就是为什么前沿模型需要增长到万亿参数规模。
推理更易压缩: 推理本质上是一套相对较小的、可被反复应用的程序,例如:将问题分解、追踪中间步骤、自我检查、在失败时回溯等。这些程序可以通过训练很好地迁移到小型模型中。
这种侧重于合成“教科书式”数据进行训练的方式,曾经被看作是一种局限,但现在它看起来更像是一个明确的设计目标。模型被保留下来的知识是宽泛而非深入的,这足以让它理解问题的背景并判断信息来源是否可靠。
深度知识的存储成本高昂,但检索成本低廉,因此它成了被舍弃的部分。
事实会过时,但程序不会
将事实硬编码到模型权重中存在一个根本问题:它们会迅速过时。
一个前沿模型的训练需要数月时间和数亿美元,但当它完成时,内部包含的许多事实可能已经不再准确。库的 API 会变,世界会变,而更新这些事实的唯一方法就是再次进行昂贵的训练。
然而,推理程序不会过时。代数的运作方式和几十年前一样,解决问题的逻辑也同样如此。一个主要由程序构成、仅包含少量事实的模型,其有效性不会随时间流逝而迅速衰减。
这也许是这种方法最好的论据:它将昂贵、缓慢的产物(训练好的模型)与每日变化的事物(事实真相)分离开来。
“外部工具”承载知识
如果模型本身不存储事实,那么就需要其他东西来提供,这就是“外部工具”系统(Harness)的作用。
这个系统可以包括:
- 对知识库的检索
- 调用外部工具(Tool Calls)
- 网络搜索
- 访问本地文档
在这种模式下,模型贡献推理,而推理所需的一切都在运行时提供。例如,一个编程助手不需要记住某个库的所有 API,它可以在需要时通过读取文档来获取最新信息。过去作为固定成本的回忆能力,变成了一种按需查询。
未来展望:在你自己的 GPU 上运行顶级模型
按照这个趋势发展几年,我们或许能在一个普通的消费级 GPU 上运行具有顶级推理能力的模型。
目前,一些先进模型进行推理时所需的活跃参数(约 130 亿)已经进入了消费级 GPU 的处理范围。真正的挑战在于存储那些不活跃、主要用于存放事实的专家层(Expert Layers)。
通过剥离事实存储,模型的总大小会向活跃参数的大小靠拢。一个 200-400 亿参数的轻量化模型,完全可以装入自 2022 年以来游戏电脑中常见的 24GB 显存中。
当然,这样的模型本身“知之甚少”。当被问到一个事实性问题时,它最恰当的行为是承认自己不知道,然后去查找。但这正是我们如今使用顶级模型的主要方式,而未来我们可以在本地实现这一切,无需按 token 计费,也无需担心数据离开自己的设备。
这也基本解决了“幻觉”问题
这种模式最令人振奋的一点,是它对“幻觉”(Hallucination)问题的影响。
- 当事实存在于权重中: 一个错误的“事实”是无法定位和修复的。你无法像搜索文本一样搜索模型权重。模型会以同样的自信说出错误答案,没有任何依据可供核查。
- 当事实存在于模型之外: 一个错误的答案是有地址的。模型会引用一个文档,你可以打开它。如果文档错了,你只需编辑文档,所有未来的查询都会得到修正。
知识库中的错误事实只是一个普通的数据 bug,我们已经知道如何追踪、修复和为其编写回归测试。
在这种未来中,模型的介绍卡片上甚至可能不再需要标注“知识截止日期”,因为其内部权重中的知识是以年为单位、而非以周为单位过时的。模型就像一个 CPU,在运行时被递交需要处理的程序和数据。