政策辩论常因专家意见与主流看法冲突而陷入僵局,而指出冲突的专家又容易被指责有政治偏见。为了解决这个问题,可以引入大语言模型(LLM)作为辩论的“裁判”。尽管 LLM 最初可能持有常规观点,但它们也掌握了与之矛盾的专家知识。通过一个结构化的多轮辩论过程,辩手可以迫使 LLM 面对并分析这些矛盾,最终作出的裁决将更侧重于专家知识与逻辑,而非仅仅是流行的普遍看法。
政策辩论的困境
在许多政策领域,都存在一个核心的矛盾,导致讨论停滞不前。
- 普遍流行的政策常识,实际上与 专家所知的具体细节 存在巨大冲突。
- 当专家试图指出这些冲突时,他们通常会被指责 带有政治偏见,其观点也因此被忽视。
- 结果就是,我们被困在基于错误常识的辩论中,无法取得进展。
我们之所以停滞不前,是因为揭示真相的专家被贴上了偏见的标签。
大语言模型(LLM)作为解决方案
LLM 为打破这种僵局提供了一个独特的机会,其优势在于:
- 同时掌握两种信息:LLM 既了解主流的常规观点,也存储了与之冲突的专业细节知识。
- 不易被指责偏见:至少在目前,当 LLM 在分析中指出事实冲突时,它远比人类专家更不容易被贴上“政治偏见”的标签。
- 可以被引导:虽然 LLM 不会主动发现其观点与专家事实之间的冲突,但只要辩手在辩论中明确指出这些冲突,它们就能够进行分析和回应。
这为设计一个由 LLM 裁决的政策辩论流程创造了可能性。
一个由 LLM 裁决的辩论流程草案
这个流程旨在通过多轮互动,迫使 LLM 审视其初始观点与专家知识之间的矛盾。
准备阶段:
- 选定一个明确的政策主张、两名同意参与的辩手,以及一个作为裁判的 LLM。
- 三方(两名辩手和 LLM)各自撰写并分享自己的初始立场。
第一轮辩论:
- 两名辩手在规定时间内提交一份详细的分析报告,报告需引用专家来源或研究结果。
LLM 的回应:
- LLM 阅读并分析两名辩手的报告,然后发布一份它自己的分析,并更新其立场。
多轮迭代:
- 每位辩手针对 LLM 的新立场,再次提交回应分析和更新后的立场。
- LLM 再次进行分析并更新其立场。
- 这个循环可以重复进行,例如总共进行三轮。
最终裁决:
- 在最后一轮回应后,LLM 给出其最终的分析和裁决立场。
三轮循环足以让辩手引导 LLM 充分接触和理解那些与常规智慧相悖的专家知识。
最终目标与潜在优化
通过这一过程,辩论的核心将发生转变。
最终,LLM 的裁决将更少地依赖于常规的普遍看法,而更多地依赖于 专家知识与政策主张之间的逻辑关系。
为了让这个过程更高效,还可以进行一些优化:
- 统一分析框架:可以考虑在一个所有参与者都同意的特定政策分析框架(例如,经济效率分析)上对 LLM 进行预训练。
- 避免重复争论:这样做的好处是,辩论各方不必再就最基本的分析方法论进行争论,可以更专注于具体问题本身。