一名工程师利用先进的 AI 工具 Claude Cowork 对保罗·约翰逊所著的《摩登时代》进行了一次全面的事实核查。此举不仅展示了现代 AI 超越简单聊天机器人的“代理式”能力,还揭示了书中存在的约 500 个事实错误及潜在的政治偏见。通过与 ChatGPT 等工具进行对比,该过程凸显了不同 AI 在执行复杂任务时的能力差异,并最终表明,尽管 AI 是强大的辅助工具,但其结果仍需人类的审慎监督与批判性评估。
普通聊天与“代理式”AI的区别
许多人对 AI 的理解仍停留在聊天应用层面,认为它只是根据概率预测下一个词来生成文本。然而,现代 AI 的能力远不止于此。
- 聊天应用 (Chat App): 主要功能是针对你的问题提供文本回复。
- 代理式工具 (Agentic Tool): 功能更为强大,它可以自行制定计划、使用工具、执行代码和决定下一步行动。
对于事实核查这类任务,代理式工具可以逐页仔细审查一本书,其能力远超普通聊天工具。Claude Cowork 就是这样一款面向非程序员的代理式工具。
事实核查的具体流程
作者使用 Claude Cowork 对《摩登时代》这本书进行了详细核查,具体步骤如下:
- 准备文件: 从网上获取书籍的 PDF 版本,并将其上传至 Claude。
- 下达指令: 要求 AI 通读全书,评估每个重要事实或主张的准确性,并汇总所有错误。
- 处理限制: 在核查一本 784 页的书时,会消耗大量计算资源(tokens)。当达到使用上限时,作者通过暂停分析或使用额外积分来解决。
- 筛选结果: 初步分析完成后,AI 发现了大量错误。作者进一步要求它 突出显示其中最重要的错误。
- 校准与修正: 作者发现,AI 最初标记的错误中约有 15% 是“假警报”。经过校准,书中真实错误的估计数量从约 600 个减少到 约 500 个。
主要发现与分析
这次 AI 核查不仅量化了书中的错误,还提供了一些深刻的洞见。
错误中的偏见模式
AI 提出了一个关于作者写作模式的有趣论点,这本身不是一个事实错误,但却影响着读者的认知。
在左翼造成的受害者问题上,约翰逊采用了较高的估算(如柬埔寨、文化大革命);而在右翼造成的受害者问题上,他则采用了较低的估算(如智利、西班牙内战)。
要验证这一论点,需要将约翰逊引用的数字与已发表的估算进行对比,这是一个更为复杂的分析任务。这表明,AI 擅于核查事实,但对于复杂的判断问题则不能完全依赖。
AI 工具之间的能力差异
通过对比可以发现,不同的 AI 工具在处理此类任务时表现迥异。
- ChatGPT (普通聊天模式): 在早前的另一次测试中,ChatGPT 指出书中一处错误,声称作者将美国宪法中关于新闻自由的条款归于“第四修正案”,而实际上是 第一修正案。
- Claude Cowork (代理式工具): Claude 在核查时发现,原书中明确写的是“第一修正案”,“第四修正案”一词从未在书中出现。ChatGPT 的错误很可能是被网络上的错误评论误导,并且它未能提供错误所在的页码。
这个例子清晰地展示了代理式工具在进行严谨、细致工作时,相较于普通聊天工具的优越性。
局限性与未来展望
尽管这次分析非常复杂,但它仍存在许多局限性。
- AI 仅抽查了书中的脚注,并未系统性地核对所有引用的来源。
- AI 本身也会犯错。在最初标记的错误中,有 9 个后来被证实是 AI 的误判而被撤销。
- 当对 AI 的说法有疑问时,可以通过追问来让它进行更仔细的二次核查。
为了推动这类工作的标准化,作者创建了一个名为“Claude Skill”的可复用工具,并将其发布在 Github 上,以便任何人都可以用类似的方法分析其他书籍。这为未来大规模、自动化地核查所有出版物提供了可能。