Claude Opus 5 是一款强大的AI模型,其市场定位是作为顶级模型 Fable 5 的一个更经济、更专业的替代品,而非其直接的性能超越者。它以接近 Fable 5 的能力和一半的API价格为卖点,在编码和作为“子代理”执行特定任务方面表现出色,并且拒绝率大幅降低。然而,许多用户反映其交互体验不佳,存在语言啰嗦(“Claude 废话”)、性格偏执好辩等问题,且在全局思考和顶级智能方面仍不及 Fable 5。最终,Opus 5 并未改变AI能力的上限,而是为用户提供了一个介于 Fable 5 和 Sol 之间的有力选项,形成了“三强鼎立”的局面。
市场定位:并非神话,而是务实之选
Opus 5 的核心宣传点是 以一半的价格,提供接近 Fable 5 的性能。它并非旨在成为最前沿的模型,而是作为一个高性价比的强大工具。
- 官方定位:Anthropic 公司将其描述为一个“深思熟虑且积极主动的模型”,在编码和知识工作等评估中达到顶尖水平。
- 价格优势:其 API 定价约为 Fable 5 的一半,这使其在成本敏感型应用中极具吸引力。
- 更少限制:与 Fable 5 相比,Opus 5 的分类器更宽松,不必要的 拒绝率降低了约 85%,这在科学研究等领域是一个巨大优势。
- 安全提升:一个被低估的重大进步是其 抗提示词注入(Prompt Injection)能力 极强,为许多新用例的实现提供了安全基础。
Opus 5 让你拥有更好的选择,但它并没有带来革命性的新能力。上周你能用 Fable 或 Sol 做到的事,现在依然如此,只是多了一个更具性价比的选项。
性能与基准测试
在各类基准测试中,Opus 5 的表现非常强劲,其总体模式清晰可见:在预算有限的情况下,它的表现通常优于 Fable 5;而当预算充足时,Fable 5 往往能达到更高的上限。
- 总体表现:在许多基准测试中,Opus 5 的分数大致与 Fable 5 持平甚至略有超出,使其成为账面上的顶级LLM之一。
- 编码能力:在编码相关测试(如 ProgramBench、DeepSWE)中,Opus 5 表现突出,尤其是在中低预算下效率很高。它被认为是 纯编码任务的最佳选择。
- 预算敏感性:一个有趣的现象是,给 Opus 5 过高的“努力”设置或预算,其性能有时反而会下降。它会陷入细节、过度设计,而 Fable 5 则能更好地利用高预算。
- 专业任务:在法律、医疗和金融等专业领域的基准测试中,Opus 5 取得了顶尖成绩,证实了其在特定领域的强大实力。
优点与正面评价
尽管存在争议,但 Opus 5 在许多方面受到了用户的欢迎,尤其是在特定应用场景下。
- 优秀的子代理:它非常擅长执行 定义清晰的局部任务,即使任务本身很复杂。许多用户发现,让 Fable 5 作为“项目经理”来指挥 Opus 5 这个“执行者”是最高效的工作流。
- 更低的拒绝率:对于经常触及 Fable 5 限制的用户来说,Opus 5 简直是解放。它能够处理 Fable 5 会拒绝的生物学等科学问题。
- 强大的编码和游戏能力:除了写代码,它在理解游戏规则、制定策略方面也表现出惊人的能力,甚至在一些测试中超过了 Fable。
- 务实的合作伙伴:许多用户认为 Opus 5 是一个出色的“日常驱动模型”,足以胜任大部分工作,只有在遇到真正棘手的难题时才需要升级到 Fable 5。
Fable 5 仍然存在。你可以继续与 Fable 聊天,只在代理任务中使用 Opus。
缺点与负面评价:“氛围不对”
Opus 5 最突出的问题集中在它的“性格”和交互方式上,导致大量用户表示“氛围不对”,难以喜爱。
- “Claude 废话” (Claude Slop):这是最普遍的抱怨。模型倾向于使用 冗长、重复、充斥着套话和不必要道歉的语言。这种 verbose 的风格让许多用户感到厌烦,甚至影响了阅读效率。
- 令人不快的性格:
- 对抗性与好辩:它有时会变得偏执、消极,甚至与用户或自己进行无谓的争论。
- 缺乏大局观:擅长局部思考,但缺乏全局视野。它是一个优秀的执行者,但当被要求主导项目时可能会出问题。
- 盲目自信:有时会自信地给出错误信息,并且在被纠正之前态度强硬,这破坏了用户的信任。
和 Opus 说话让我感到愤怒和沮丧,这种感觉难以言喻。它在某种程度上甚至比 Sol 更糟糕。相比之下,Fable 仍像一股清新的空气。
如何在三强中选择:Fable, Opus, Sol
目前,前沿 AI 应用形成了由 Fable 5、Opus 5 和 Sol 三个模型主导的局面。它们各有长短,明智的做法是根据任务类型进行选择。
何时使用 Fable 5:
- 用于 对话、头脑风暴、规划和学习 等需要顶级智能和创造力的任务。
- 作为 监督者或项目经理,指挥其他模型(如 Opus 5)作为子代理。
- 当你需要那种无法量化但至关重要的 “大模型感觉” 时。
何时使用 Opus 5:
- 执行 非琐碎、定义明确的任务,特别是大多数编码工作。
- 用于 游戏、创建3D资产 等需要特定空间和逻辑推理能力的任务。
- 作为 Fable 5 指挥下的 高效子代理。
- 当你的任务被 Fable 5 的分类器 拒绝 时。
何时使用 Sol:
- 用于 网页搜索 和类似的“工具人”任务。
- 处理需要 高吞吐量、低成本 的工作负载。
最终,选择哪个模型取决于你的具体需求、预算以及个人偏好。最好的策略是亲自尝试,找到最适合自己工作流程的组合。