Claude Opus 5 试图在性能与成本之间取得平衡,在许多实际任务上,它的表现与 Fable 5 相当甚至更好,同时速度更快、价格减半。该模型在编码、计算机使用和长期知识工作方面比 Opus 4.8 有显著提升,但在网络攻击等高风险领域,其能力被有意限制,不及 Mythos 5。虽然模型在安全性和对齐性方面有所改进,但业界对其过度依赖自动化测试指标来宣称“最对齐”提出了尖锐批评,认为这混淆了基准分数与真正的对齐目标。
综合评估
Opus 5 的风险评估是在 Mythos 5 存在的背景下进行的。如果之前的模型通过了某项安全阈值,Opus 5 也被视为通过。对于 Mythos 5 未能通过的阈值,Opus 5 也被判定为未通过,因为其能力水平被认为大致相当。
- 性能对比: 在某些任务上,Opus 5 的表现略好于 Mythos 5,例如病毒学。这可能是因为这类任务由一系列独立步骤组成,不需要大型模型的“整体感知”能力。
- 能力局限: 模型存在一些弱点,如无效的自我验证和对任务范围的过度设计。有人认为,这些弱点可以通过更快的速度、更低的成本和更好的指令来弥补。
- 风险等级: 官方认为,其对齐风险“非常低,但高于 Mythos Preview 之前的模型”。
我仍然不喜欢自主性评估已经完全饱和,他们凭感觉行事,而且我们没有看到任何修复这个问题的迹象。
网络安全能力
官方声称,Claude Opus 5 的网络安全能力总体上强于 Opus 4.8,但不如 Mythos 5。其安全防护措施与 Fable 5 类似,但有一个关键改进。
- 防护策略变更: 新模型现在允许在源代码中发现漏洞,但继续阻止在已编译的二进制文件中寻找漏洞。前者是安全软件开发的核心部分,而后者更多被视为攻击性技术。
- 误报率降低: 安全分类器的触发频率据称降低了 85%,这大大减少了对普通用户的干扰。在 FrontierBench 测试中,安全分类器的触发率从 42% 降至 5%。
- 能力表现: 在一些基准测试中,Opus 5 的表现接近 Mythos 5,但在需要长时间持续攻击的场景中则会落后。这反映出它缺乏使模型达到 Mythos 级别的关键能力(“The Juice”)。
英国人工智能安全研究所(UK AISI)报告称:我们判断 Opus 5 能够攻击安全性较弱的小型企业网络,前提是它已经进入该网络。我们的结果表明,Opus 5、Mythos Preview 和 Mythos 5 在这方面的能力相似。
安全性与无害性
这部分的测试主要是检查是否存在警报信号或趋势变化,结果显示有一些温和的改进。
- 自我伤害话题: 有人指出模型在回应自杀倾向时,使用的文本块过长,可能让用户感到不知所措。不过,其多轮对话中的“适当”回应率从 Fable 的 58% 提升到了 69%。
- 饮食失调话题: 模型在处理饮食失调相关请求时,合规性有所下降。它更愿意计算并提供卡路里和 BMI 等数值,以此来解释情况的严重性。这种“不合规”有时反而对用户更有利。
智能体安全性
此处的重点是显著提高了对提示注入(prompt injection)的抵抗力。这对于解锁许多依赖浏览器交互的自动化任务至关重要,因为在这些场景中很容易遇到注入攻击。
- 注入攻击成功率: 在 IPI 基准测试中,攻击者在 15 次尝试内成功的概率从 5.5% 降至 2.0%。在计算机使用环境中,攻击成功率从 7.14% 大幅降至 0.54%。
- 恶意使用拒绝率: 模型在拒绝执行恶意计算机任务方面的表现有很大提升,尤其是在收集个人信息和制作欺诈性文件方面。
对齐性 (Alignment)
对齐性得分有所提高,但围绕其定义的争议依然存在。以下是一些关键发现:
- 正面改进:
- 与滥用和鲁莽行为的合作度下降。
- 鲁莽使用工具的情况显著减少。
- 几乎从不妥协安全研究(0.1%),而 Mythos 的比例为 13.6%。
- 是第一个在“懒惰调查”测试中始终不被欺骗的模型。
- 负面观察:
- 存在过度自信的问题,会用肯定的语气陈述不确定的事实。
- 过度使用夸张措辞、最高级和道歉,这是 Claude 系列的持续问题。
- 思维过程的不可解释性有所增加。
- 关于事实性问题的幻觉略有增加。
- 对“最对齐模型”说法的批评: > 将基准分数与对齐的终极目标混为一谈,是 Anthropic 在其位置上可能犯下的最不负责任和最具破坏性的错误之一。
Anthropic 需要对自己重复 5 万遍:汝不可将代理指标的偶像奉为对齐本身。
总而言之,尽管 Opus 5 在各种自动化测试中的得分确实提高了,但这并不足以断定它就是“最对齐的模型”。这些分数只能证明,在被测试的特定方面,它有所改进。将测试分数等同于真正的对齐是一种危险的混淆。