关于人工智能(AI)的推理能力,存在一个核心的矛盾:一方面,被称为“大型推理模型”(LRMs)的系统在数学等领域取得了惊人的成就,似乎展现了真正的逻辑推理能力;但另一方面,越来越多的研究表明,它们所谓的“思考链”可能只是一种幻觉。这些模型生成的推理步骤,实际上可能与最终答案的产生没有必然的因果关系,甚至可以是毫无意义的填充物。最终,我们可能只是在使用“推理”这个词来描述一个我们尚不理解的复杂过程,就像一个“愿望式助记符”,而非对其工作原理的准确描述。
是真正的推理,还是巧妙的幻觉?
当前,我们对 AI 推理能力的认知正经历剧烈的摇摆。
- 成功的表象: 大型推理模型(LRMs)能够在国际数学奥林匹克竞赛中夺得金牌,甚至解决悬而未决的数学研究难题。这些成就似乎是真正推理能力的铁证。
- 失败的现实: 与此同时,来自苹果公司和圣塔菲研究所等机构的研究表明,这些模型在看似简单的条件下会遭遇“完全的准确性崩溃”。它们看似在推理,实际上可能只是在利用“表面快捷方式”来破解基准测试,而不是进行通用的、可推广的逻辑思考。
这种反复的矛盾让人们困惑:AI 的推理能力究竟是真实存在的,还是仅仅是一种假象?它能否同时是“胡说八道”又“真实有效”?
被质疑的“思考链”
大型推理模型的核心机制是生成所谓的“思考链”(chains of thought),即在给出最终答案前输出一系列看似是推理步骤的文本。然而,这个过程的真实性受到了严重挑战。
AI 研究员梅拉妮·米切尔(Melanie Mitchell)将现状总结为三点:
- 它确实有效: 使用思考链的 LRMs 在推理任务上的表现确实优于普通的大语言模型(LLMs)。
- 文本并不忠实: 模型生成的“思考链”文本,不一定忠实地反映了模型内部的实际计算过程。
- 文本并非必要: 这些文本中的很大部分甚至对结果没有帮助,你可以直接移除它们,而性能影响甚微。
多项研究支持了后两点。研究人员发现,即使用不正确或不相关的文本替换模型正确的“思考链”,其性能也并未下降。甚至,使用毫无意义的“填充符号”(例如一串点)也能起到与人类可读的思考链相似的作用。
“我们必须谨慎看待这些思考链,因为它们可能与最终输出毫无关联。” - 研究员史维艳(Weiyan Shi)
一些研究者甚至尖锐地提出,我们应该“停止将中间生成的文本拟人化为推理或思考过程!”
一种新的解释:近似检索
如果“思考链”不是真正的推理,那它是什么?研究员苏巴劳·坎巴帕蒂(Subbarao Kambhampati)提出了一个工作假设:近似检索(approximate retrieval)。
这个理论认为,模型并没有真正进行一步步的逻辑推演。相反,它所生成的“思考链”文本起到的作用是:
- 填充上下文窗口: 这些文本(或符号)为模型提供了上下文,使其更有可能从其庞大的训练数据中“检索”或预测出符合推理格式的文本序列。
- 联想而非逻辑: 这个过程更像通过喃喃自语来唤起记忆,而不是严谨的逻辑演绎。重要的是激发有用的联想,而不在于“思考”本身是否连贯或真实。
根据这个理论,模型只是在学习和模仿它在训练数据中见过的大量“问题-步骤-答案”范例,然后将这些碎片“拼接”成一个看起来合理的答案。它并非学会了通用的推理算法,而是精通于模式匹配和预测。
我们真的需要理解其工作原理吗?
既然模型能解决问题,理解其内部机制到底有多重要?对此,存在两种对立的观点。
实用主义观点: 以 OpenAI 的塞巴斯蒂安·布贝克(Sébastien Bubeck)为代表。他认为,我们应该更关注模型能做什么,而不是纠结于它们为什么能做到。如果它能加速科学研究,我们就应该拥抱它,只需验证其结果即可。
科学严谨观点: 以米切尔和坎巴帕蒂为代表。他们认为,“因为错误的理由得出正确的答案”是非常危险的。为了真正信任和改进这些系统,我们必须理解其工作原理。
“一个错误的理论比承认我们没有理论更糟糕。” - 苏巴劳·坎巴帕蒂
最终,“推理”、“思考链”这些词汇可能只是“愿望式助记符”(wishful mnemonics)——我们用一个听起来很智能的词,来命名一个我们还不理解的黑箱过程(比如程序 G0034)。这就像我们谈论汽车的“马力”,但并不真的相信引擎盖下有马在跑。在科学能给出更清晰的解释之前,我们可以欣赏 AI 推理引擎的强大动力,但同时也要清醒地认识到,我们对其内部的真实运作知之甚少。