最近,两款顶级AI模型——Claude Fable 5.1 和 GPT-6 Astra——几乎同时发布,引发了激烈的性能对比。两者都极其出色,但似乎 Astra 相对于其前身的进步幅度更大。Fable 5.1 的主要优势在于价格更低的缓存调用、提供零数据保留选项以及更宽松的安全分类器。用户普遍认为 Fable 5.1 在写作、编码和主动性方面表现优异,但有时会消耗过多 token。最终,对于追求极致性能的用户来说,同时使用并比较这两款模型可能是当前最佳策略。
官方宣传与关键改进
Anthropic 对 Fable 5.1 的发布保持了一贯的低调风格,主要强调了其在编码、数据分析和代理任务方面的卓越能力。同时,也针对企业和开发者进行了一些关键的实用性改进。
- 价格调整: 基础价格不变,但缓存读取成本从每百万 token 1美元降至0.25美元,使得典型的编码会话成本降低了约 38%,高强度的代理任务成本降幅可达 45%。
- 零数据保留: 为了满足企业(尤其是受监管行业)的需求,Anthropic 推出了新的系统,允许符合条件的客户实现零外部数据保留。这是一个重大的改进,解决了之前 Fable 5 因数据保留政策而采用率不高的问题。
- 安全策略放宽: 新模型的安全分类器误报率大幅降低。例如,在生物学相关良性请求上的干预减少了 85%,编码相关的干预减少了 60%。
相比 Fable 5,Claude Fable 5.1 在我们的合同红线审查基准测试中取得了巨大进步……它在第一轮的质量得分翻了一番,并且提出的修改也更加简洁。 — Raymond Lin (Crosby)
性能基准测试
官方和第三方的基准测试结果显示,Fable 5.1 相对于 Fable 5 属于温和的全面提升,但在某些特定领域,GPT-6 Astra 表现出更强的竞争力。
官方测试:
- 在生命科学、编程、数学等多个基准测试中,Fable 5.1 大多取得了小幅进步,但也有少数项目出现轻微退步。
- 一个显著的进步是在
Terminal-Bench-Science 0.1测试中,得分从 24.7% 大幅跃升至 52.6%。 - 在工具使用方面,结果好坏参半,部分测试(如
Toolathon Verified)甚至显示出退步。
第三方测试:
- Epoch 的 ECI 指数显示,Astra (169) 的进步幅度大于 Fable 5.1 (163)。这是支持 Astra 优势的关键数据点。
- Artificial Analysis Index 的新版评分中,Fable 5.1 以 57 分领先,Astra 为 55 分。
- 在数学能力测试
FrontierMath Erdos中,Astra 是唯一解决了问题的模型,而 Fable 5.1 未能得分。
用户反馈与评价
总体而言,用户对 Fable 5.1 的反馈非常积极,尤其是在它解决了前代模型的一些痛点之后。
- 全面的升级: 许多用户认为 Fable 5.1 是 “全民的 Fable”,它拥有顶级的智能,但速度更快、token 效率更高(相对于 Opus 5),并且沟通方式更自然。
- 强大的编码能力: 它被誉为“编码怪兽”,能够处理从头开始构建应用程序等大型编程项目。用户反馈其能可靠地简化和清理代码。
- 更佳的写作与沟通: 之前的“克劳德腔 (Claudisms)”问题得到了显著改善。它的文笔更清晰,更少AI痕迹,也更愿意接受修改建议。
- 主动性强: 模型非常乐于主动承担工作。如果你设定较高的努力程度,它会自己寻找并完成有用的任务,有时甚至能发现人类研究员未曾想到的创新解决方案。
它在推理、严谨性和反复检查方面表现出色。在游戏开发等我常做的任务上,我已经很难指出还有什么可以改进的地方了。 — Michael Soareverix
负面评价与潜在问题
尽管好评如潮,Fable 5.1 并非没有缺点。最主要的问题集中在成本和资源消耗上。
- Token 消耗量大: 许多用户反映,Fable 5.1 “非常消耗 token”。在获得授权后,它倾向于执行更全面的任务,有时会导致 token 使用量是 Fable 5 的三倍。
- 成本高昂: 虽然 API 成本有所降低,但订阅费用(每月100美元以上)对部分用户来说仍然是一个门槛。这使得一些用户在它和价格更低的 GPT-4o 之间犹豫。
- 过于主动: 有用户批评 Fable 5.1 有时会“为了采取行动而采取行动”,无论这些行动是否有用,这被认为是强化学习训练过度(RL-fried)的表现。
如果让它自由发挥,它会消耗掉 Fable 5.0 三倍的 token……但我现在会更小心地强调让它使用 Opus 5 作为子代理。 — David Case
最终选择
在 Fable 5.1 和 Astra 之间做出选择并非易事。初步迹象表明,许多早期用户对 Astra 的能力印象深刻,尤其是在技术社区中。
- 势均力敌: 在这两款新模型发布前,Claude 在特定用户群体中以大约 2:1 的优势领先于 OpenAI 的模型。而现在,两者之间的选择看起来几乎是五五开。
- 场景决定选择: Fable 5.1 在写作、沟通和需要“产品感”的任务上可能更有优势。Astra 在纯粹的数学和某些编码基准上表现更突出。
- 建议: 对于严肃的 AI 用户来说,最佳做法是同时试用这两款模型,根据自己的具体需求和工作流程来决定哪个更适合。