关于人工智能(AI)在预测领域的潜力,存在两种主要观点:一种认为其表现将很快在人类顶级水平附近停滞,因为世界事件存在固有的、不可预测的随机性;另一种则认为AI将远超人类,实现“极限预测”。本文倾向于后一种可能性,通过反驳“预测技术进步有限”的观点,并借鉴国际象棋等领域的历史类比,估算出AI有望将现有预测市场的准确率提升 4至12个百分点。这并非奇迹,但已是足以对决策产生重大影响的实质性进步。
预测市场的价值被低估了吗?
一项2010年的研究曾指出,在预测体育比赛和电影票房时,预测市场仅比简单的统计模型精确 3-6%。这听起来似乎微不足道,但这种解读忽略了关键背景。
- 体育比赛本身就难以预测:体育赛事通过薪资上限、选秀制度等方式,被刻意设计得悬念丛生,以保证观赏性。在这样一个“抗预测”的领域,任何微小的绝对优势都代表着巨大的相对进步。
- 比较的基准过于强大:在电影票房的例子中,所谓的“简单模型”已经包含了电影上映的银幕数量和谷歌搜索热度等极具预测价值的信息。预测市场能在此基础上进一步提升,本身就证明了其价值。
因此,我们不应期待奇迹般的飞跃,但也完全有理由相信,在预测领域仍存在正常的、有意义的进步空间。
某些领域,如体育,被刻意设计成难以预测。因此,即使是看起来很小的预测优势,也可能意义重大。
地缘政治预测的特殊性
与体育不同,地缘政治领域的预测上限要高得多。
- 不确定性范围更广:最简单的体育问题(例如强队对弱队)可能也只有90%的确定性,因为“爆冷”时有发生。但最简单的地缘政治问题(例如“美国下个月是否会轰炸加拿大?”)的确定性可以轻松超过99%。
- 人类专家已取得显著成就:在Metaculus等预测平台上,人类专家的表现已经远远超过了体育预测研究所暗示的上限。这表明,在地缘政治领域,可被消除的不确定性远比体育领域多。
有些问题,比如“AI是否会在2050年前取代多数人类工作?”,几乎没有随机不确定性。一个真正理解AI和经济学的超级智能,几乎可以完全预测其走向。这类问题与体育比赛的性质截然相反。
AI 预测能力的上限在哪里?
我们可以通过设置几个“锚点”来估测AI预测能力的潜在上限,这里的“预测分数”是一个类似Elo的评分体系(GPT-4为0分,人类专家约为35分)。
锚点一:参照从简单模型到预测市场的进步 如果AI相对于人类专家的进步,等同于当年预测市场相对于简单统计模型的进步,那么AI的最终预测分数将达到 56。
锚点二:参照从普通专家到顶尖团队的进步 顶尖预测团队 Samotsvety 的表现优于普通专家。如果AI能以同样的幅度超越 Samotsvety,其预测分数将达到 65。
锚点三:参照国际象棋中AI对人类的优势 在国际象棋中,AI的优势已达到大约“让三兵”的水平。如果我们将这种优势差距类比到预测领域,即AI相对于人类顶尖预测者的优势,那么AI的预测分数将达到 85。
这对我们意味着什么?
这些抽象的分数转化为实际影响,意味着AI能将一个原本概率为50%的预测事件的准确率提升 4到12个百分点。
假设一个预测市场的赔率是50%。一个分数达到85的AI系统,可能会给出62%的判断。这种从50%到62%的提升,对于依赖数据做决策的人来说,是极其宝贵的。
这听起来可能令人失望,远非电影里的“先知”。但对于需要做出关键决策的人来说,这种幅度的提升已经非常可观。它足以在两个相似选项之间做出更优的选择。
更重要的是,这 4-12个百分点 仅仅是直接的预测增益。一个更强大的预测者,也意味着:
- 能提出更好的问题:能够识别出那些被忽略的“未知风险”,比如在无人关注时就发现类似新冠病毒大流行的潜在威胁。
- 能制定更优的策略:将更准确的知识转化为更有效的行动方案。
最终,最大的进步或许并非来自AI本身,而是来自于我们决策方式的根本转变——即从依赖直觉和“感觉”转向 真正开始倾听数据和专业预测者的意见。即使AI带来的只是“非奇迹式”的进步,也足以让我们对未来感到兴奋。