您现在的位置是:首页 >> AI资讯

Anthropic Opus 5 发布:性能逼近 Fable 5 但价格砍半,刷新 ARC-AGI-3 纪录

AI资讯 2026-07-25  阅读:169
Anthropic 推出 Claude Opus 5,性能接近旗舰 Fable 5 但价格仅为其一半,刷新 ARC-AGI-3 等多项测试纪录。它在代码、科研任务中表现突出,安全限制比 Fable 5 减少约 85%,成为 Claude Max 和 Pro 用户的默认最强模型。#AI大模型# #ClaudeOpus5#

7 月 25 日消息,Anthropic 今日发布了 Opus 系列最新旗舰模型 ——Claude Opus 5,相比上一代 Opus 4.8 在性能提升的同时保持价格不变。

Anthropic 表示,Opus 5 定位为面向日常使用的高性能模型,官方称其在部分能力上接近更高规格的 Claude Fable 5,但价格约为后者的一半。该模型目前已成为 Claude Max 服务的默认模型,也是 Claude Pro 用户可使用的最高能力模型,在多项代码、知识工作和科学研究测试中达到当前最高水平。

据介绍,Opus 5 在 Frontier-Bench、GDPval-AA 等代码和知识工作评测中取得领先成绩。在 Frontier-Bench v0.1 测试中,Opus 5 超越其他模型,并且相比 Opus 4.8 将任务性能提升了一倍以上,同时每项任务成本更低。

在 CursorBench 3.2 测试中,Opus 5 在最高努力模式下的成绩仅比 Fable 5 峰值低 0.5%,但单项任务成本约为后者一半。此外,在高、中高以及最高努力设置下,Opus 5 在单位成本性能方面均超过其他模型。

在知识处理和问题解决能力方面,Anthropic 公布的测试结果显示,Opus 5 在 ARC-AGI 3、Zapier AutomationBench、OSWorld 2.0 等评测中均取得较高成绩。其中,在 ARC-AGI 3 测试中,Opus 5 的得分约为第二名的 3 倍;在衡量模型完成完整业务流程能力的 Zapier AutomationBench 中,其通过率约为成本相近模型的 1.5 倍。

Anthropic 称,Opus 5 相比 Opus 4.8 在科研任务中也有明显提升,涵盖结构生物学、有机化学、生物信息学等领域。在有机化学任务中,例如根据光谱数据推断分子结构,Opus 5 比 Opus 4.8 高出 10.2 个百分点;在预测蛋白质序列变化对功能影响的任务中,高出 7.7 个百分点。

在实际应用方面,Anthropic 强调 Opus 5 在验证自身结果和持续迭代修正方面能力更强。例如,在一项测试中,模型需要根据机器零件图纸生成 FreeCAD 三维模型,但无法直接查看图纸内容。Opus 5 编写了自己的计算机视觉流程,从原始像素中提取几何信息,并成功完成模型重建。

另一项测试中,Opus 5 发现了一个开源软件包管理器中的实际漏洞,并修复了社区补丁遗漏的问题。此外,一名交易公司工程师使用 Opus 5 在一次会话中构建了一个新交易所的数据接口,在缺少实时数据源验证的情况下,模型还创建了测试工具检查代码解析结果。

在安全方面,Anthropic 表示 Opus 5 的安全限制相比 Fable 5 更少。该公司预计,Opus 5 的安全分类器触发次数会比 Fable 5 减少约 85%。

不过,Opus 5 仍针对部分高风险场景设置限制。例如,在网络安全领域,模型可以帮助分析源代码中的漏洞,但会阻止基于二进制文件的漏洞扫描、渗透测试以及漏洞利用代码生成等操作。

Anthropic 表示,Opus 5 并未经过专门的网络攻击任务训练,但随着整体能力提升,其漏洞发现能力有所增强。在 OSS-Fuzz 测试中,Opus 5 与 Mythos 5 在漏洞发现方面表现接近,但在将漏洞转化为实际攻击工具方面仍明显落后于 Mythos 5。

在生物领域,Opus 5 延续了 Opus 4.8 的安全机制,目前成为 Anthropic 面向公众开放的能力最强科研模型。不过,Anthropic 认为,Opus 5 在长时间、自主执行科研任务方面仍存在限制,而这类任务被认为可能带来更高风险。

价格方面,Claude Opus 5 已通过 Anthropic 各平台上线,输入价格为每百万词元 5 美元(现汇率约合 33.9 元人民币),输出价格为每百万词元 25 美元(现汇率约合 169.6 元人民币),与 Opus 4.8 保持一致。开发者可通过 Claude API 调用 claude-opus-5。

此外,Anthropic 还推出了 Opus 5 Fast 模式,该模式运行速度约为默认模式的 2.5 倍,价格为基础价格的两倍。同时,Anthropic 开放测试两项功能,包括 Claude 平台中的对话中途工具切换,以及 API 中的自动回退功能。

自动回退功能允许用户在安全分类器拦截请求时,将任务自动转交给其他可用模型处理,从而避免直接返回错误信息。Anthropic 表示,Opus 5 与此前 Opus 系列模型一样,面向普通用户开放时不设置数据保留要求。

如果您对本站有任何建议,欢迎您提出来!本站部分信息来源于网络,如果侵犯了您权益,请联系我们删除!

相关标签:Claude Opus 5Anthropic