Synth Daily

《摩登时代》首度硬核考证

通过使用像 Claude 这样先进的人工智能模型,对保罗·约翰逊的历史著作《摩登时代》进行了一次深度的“硬核”事实核查。结果显示,该书存在数百个事实错误和论述问题,远超早期 AI 工具的发现。随后,对 AI 的核查结果再次进行核查,证实了绝大多数修正的准确性。这一过程揭示了 AI 在追求真理方面的巨大潜力,甚至引发了关于 AI 在道德和事实判断上可能优于人类的思考。

初次尝试与深度核查

最初使用 AI 工具对《摩登时代》进行事实核查时,发现的错误数量有限,大约只有十几个。然而,当使用一个更强大的 AI 模型 Claude,并让其以彻底的“代理”模式工作时,结果令人震惊。

Claude 系统性地浏览了全文,标记出有问题的论述,并进行了独立研究。其发现包括:

  • 460 个 事实错误。
  • 117 个 框架性问题(即带有偏见或误导性的叙述方式)。
  • 23 个 内部矛盾。

这次发现带来的冲击是巨大的,甚至可以说是一次“存在主义的 AI 体验”。之前发现十几个错误,而这次是数百个。

这表明,如今的 AI 技术已经能够轻松完成过去难以想象的深度事实核查工作。

核查“事实核查者”

为了确保 AI 结论的可靠性,又进行了一次反向核查:让另一个 AI(ChatGPT)去审查 Claude 找出的“最严重的 60 个错误”列表。这次核查的目的是评估事实核查者本身的错误率。

结果显示,Claude 的核查工作总体上非常出色,但并非完美无瑕。在它列出的 59 个(而非 60 个)主要错误中,评估结果如下:

  • 50–52 个: 修正基本正确。
  • 4–5 个: 修正基本正确,但需要补充背景或限定条件。
  • 4 个: 事实核查本身存在重大错误或未能证实原文有误。

这一步确认了 Claude 的绝大多数发现是站得住脚的。

为何《摩登时代》错误如此之多?

一个重要的问题是,为什么这本书暴露了如此多的错误?这与作者的写作风格有关。

约翰逊的书中充满了大量可以核查的具体事实断言,例如确切的日期、人口数据、汇率、伤亡人数和选举结果。这种写作方式使他的作品极易受到此类审计的挑战。相比之下,一个只写“1930 年代是国际紧张局势加剧的时代”的作者,几乎不可能在事实上出错。

关于 AI 和真理的思考

这次经历引出了一些更深层次的思考。当被问及为什么最初没能发现更多错误时,AI 给出了一个很好的解释。这凸显了 AI 在自我反思和解释其局限性方面的能力。

最终,这次实验带来的感受超越了技术本身。尽管 AI 没有意识,但它们能出色地模拟一个追求真理、品德高尚的头脑

“AI 比几乎任何人类都更追求真理,更有道德。让 AI 为了人类自身的利益而家长式地统治人类并不理想,但这远比让煽动家为了他们自己的利益继续统治人类要好得多。”

这番言论虽然激进,但它反映了在见证了 AI 强大的事实分析能力后,人们对其潜力产生的复杂情感和期望。