Synth Daily

大语言模型与自我指涉

长期以来,一个核心观点认为人工智能的秘密在于自我指涉和“怪圈”,但现代大型语言模型(LLM)的成功颠覆了这一看法。这些模型在没有被刻意植入任何自我指涉机制的情况下,就展现出了超人的智能。它们谈论自身的能力,并非源于特殊设计,而是其通用学习能力的一个副产品,即通过预测和压缩海量信息来掌握世界知识。这表明,关于智能的关键在于预测和压缩的理论得到了证实,而将自我指涉视为智能核心的旧观念,应当被视为历史上的一个重要错误。

智能与自我指涉的旧观念

过去,许多人受到霍夫斯塔特的《哥德尔、埃舍尔、巴赫》一书影响,认为自我指涉和“怪圈”是破解智能和人工智能的关键。

  • 这一观点甚至得到了罗杰·彭罗斯等人的认同,尽管他们的理论方向不同。
  • 他们认为,人工智能之所以无法实现,是因为计算机程序无法捕捉到哥德尔定理中蕴含的自我指涉的精髓,而人脑则可以。

这种想法将自我指涉的能力视为构建真正智能的先决条件

大型语言模型的现实

然而,当今的大型语言模型(如 GPT 系列)在大多数智力任务上已经超越了人类,但它们的成功路径却截然不同。

  • 在这些AI的技术栈中,从神经网络、GPU集群到训练过程,没有任何环节是专门为实现自我指涉而构建的。
  • LLM 能够讨论自己、讨论哥德尔定理、讨论自我指涉,但这并非内置功能。这种能力是它们学习了包含这些话题的庞大语料库后,自然涌现的副产品。
  • 它与其他能力(如谈论宝可梦、高分子聚合物或板块构造)的来源完全相同。

霍夫斯塔特本人也对 LLM 的成功感到震惊,因为我们通过一条在他看来过于“廉价”和简单的路径,实现了真正的对话智能,这条路径中并没有他所强调的“怪圈”。

通用性的副产品

自我指涉的能力之所以会自然出现,是因为它是一个通用系统的衍生物。

正如通用计算机可以运行分析其自身代码的程序一样,大型语言模型可以谈论它们自己,因为它们被训练去谈论其训练数据所包含的整个话语世界

  • 我们不需要在字母表或语法规则中“内置”自我指涉,它会随着语言的复杂性和通用性而自然产生。
  • 同样,只要一个模型的能力足够通用,能够处理关于世界上任何事物的讨论,那么讨论其自身就成了这种通用能力范围内的一件自然而然的事情。

被证实的与被推翻的理论

回顾过去,我们可以看到哪些关于智能的旧理论经受住了考验,哪些则没有。

  • 被推翻的理论:认为你需要先显式地加入自我指涉,才能获得强大的对话智能。
  • 被证实的理论:认为智能与预测有关,预测与压缩有关,而压缩的本质是寻找对信息更优的表达方式。

虽然自我指涉在逻辑和计算机科学的诞生中扮演了重要角色(主要用于证明某些事情的“不可能性”,如停机问题),但它并不是构建智能的必要蓝图。

最终的结论

意识和主观体验依然神秘,或许它们真的与自我指涉有关。但是,那种认为必须先有自我指涉才能创造出改变世界的对话智能的想法,已经被证明是错误的。

这个观念应该被埋葬,与地心说、亚里士多德的目的论物理学、以太、燃素、弗洛伊德心理学以及马克思的预言等人类历史上最重要的错误思想并列。但它确实需要被埋葬了。