Synth Daily

Artificial Analysis 智能指数 v4.2

为了跟上人工智能技术发展的步伐并防止评测被“刷分”,智能指数 v4.2 版本引入了更复杂、更贴近现实世界的任务,并增加了私有测试集的比重。此次更新旨在更真实地衡量模型的实际能力。评测结果显示,Anthropic 和 OpenAI 的模型处于领先地位,其中 Anthropic 的 Claude Fable 5.1 排名第一。

应对快速变化,确保评测公正

人工智能领域在过去几周发展迅猛,为了确保指数的现实参考价值,团队决定发布一个临时的 v4.2 更新。这次更新是为即将到来的 v5 大版本所做的铺垫。

本次更新通过引入更具挑战性、更复杂和更真实的评测任务,以及使用私有测试集,使指数更接近模型的真实世界用例,并有效防止刷分行为。

未来,团队计划进行更多增量发布,并正全力开发 v5 版本。

v4.2 的核心变化

此次更新包含多项重要调整,旨在提高评测的真实性和稳健性。

  • 新增 AA-Briefcase 评测: 这是一项内部开发的评测,使用 私有测试集。它模拟了专家构建的复杂项目,要求模型完成持续数周、包含多个关联任务和数千个源文件的知识工作。这项评测从任务成功率、分析质量和呈现质量等多个维度综合评估模型的代理能力。

  • 新增 GDP.pdf 评测: 由 Surge AI 创建,这项评测考察模型在单轮对话中对专业文档的推理能力。模型需要从分布在 4,592 页 PDF 文件中的文本、图表、表格等信息中综合提取证据。评分标准极为严格,只有满足所有细分标准才能算作通过。

  • 加大私有测试集权重: 为了 防止实验室针对性地优化模型以“刷分”,私有、非公开测试集的权重已从 v4.1 的 20% 翻倍至 40%。这一比例在未来的 v5 版本中还将进一步提高。

  • 升级评分基础设施: 对评分系统进行了多项改进,包括修正答案中的错误和模糊之处、优化评分算法,并增强了代码评测沙盒的稳健性,确保正确但运行较慢的代码不会被误判为失败。

关键结果:模型表现概览

  • 领先者梯队: Anthropic 和 OpenAI 在指数中处于领先地位。Anthropic 的 Claude Fable 5.1 位居榜首,其次是 OpenAI 的 GPT-6 Astra。Meta、SpaceXAI、月之暗面 (Kimi)、Z.AI 和 Google 紧随其后。

  • 性价比前沿: 在综合考虑 成本与任务性能 的维度上,Anthropic、OpenAI、Meta 和 Z.AI 的模型占据了最佳位置。

  • 输出效率之王: GPT-6 Astra 在输出令牌效率上表现卓越,几乎超过了所有其他前沿模型。这意味着它在完成任务时生成的文本更精简、高效。

  • 具体评测表现:

    • AA-Briefcase 评测中,Anthropic 的 Claude Fable 5.1Opus 5 表现最佳。
    • GDP.pdf 文档理解评测中,OpenAI 的 GPT-6 Astra 以 33.2% 的通过率领先。