Anthropic 又选在周五发模型了。
Claude Opus 5 上线,定价没变——输入 5/百万 tokens,输出 25/百万 tokens,和 Opus 4.8 一模一样。但这次它摸到了 Fable 5 的高度,而价格只有后者的一半。
先说编码,这是 Opus 5 最不讲道理的地方。

Frontier-Bench v0.1 上,Opus 5 拿了 43.3%。Fable 5 是 33.7%。Opus 4.8 只有 21.1%。翻了一倍不止。
CursorBench 3.2 上,Opus 5 用 max effort 跑出来的成绩跟 Fable 5 峰值只差 0.5 个百分点,但 token 消耗少了 40%。Artificial Analysis 的 Coding Agent Index 上,Opus 5 配合 Claude Code 也拿了并列第一。
有个开发者用一句话 prompt——“Build a wolfenstein 3d style fps game in three.js”——一把生成了一个可玩的 3D 游戏。之前没有模型能做到。
编码之外,Opus 5 在知识工作和推理上也相当能打。
Artificial Analysis 的 Intelligence Index 上,Opus 5 拿了 61 分,微弱领先 Fable 5 的 60 和 GPT-5.6 Sol 的 59。代理知识工作基准 AA-Briefcase 上,Opus 5 以 1720 Elo 领先 Fable 5 多达 146 分。GDPval-AA v2 上更是超出 Fable 5 超过 100 分。

有一项数据特别值得拿出来说:ARC-AGI-3,测的是解决新颖问题的能力。Opus 5 得分 30.2%,是第二名 GPT-5.6 Sol(7.8%)的三倍多。Opus 4.8 只有 1.5%。这个差距大到不像同一代模型。
OSWorld 2.0(计算机使用基准)上,Opus 5 以 70.6% 登顶,成本只有 Fable 5 最佳成绩的三分之一。AutomationBench(端到端业务流程)上,通过率是次优模型的约 1.5 倍。

但也不是全胜。DeepSWE v1.1 上 GPT-5.6 Sol 仍以 72.7% 领先 Opus 5 的 68.8%。法律和健康领域,Fable 5 仍有微弱优势。而且 Opus 5 在 AA-Omniscience 知识准确性上虽然比 Opus 4.8 提升了 7 个点,幻觉率却也跟着涨了 14 个点,到了 50%——它在不确定时更倾向于回答而非拒绝。这是个需要留意的取舍。
速度方面,Opus 5 不算快。输出 56.3 tokens/秒,低于同类中位数的 73.6。首次 token 延迟 64.52 秒(主要是思考时间),在同类中偏高。如果你用 Fast 模式,速度能提到默认的 2.5 倍,但价格翻倍。
效率上有一个有意思的设计:Opus 5 提供五个 effort 等级(low、medium、high、xhigh、max)。从 low 到 max,GDPval-AA v2 得分跨度达 407 Elo 分,输出 token 用量相差约 8 倍。简单任务省 token,复杂任务全力输出,你说了算。
平均每个 Intelligence Index 任务成本 2.03,低于 Fable 5 的 2.75。在高 effort 等级下,Opus 5 能以更低成本超越 Opus 4.8 和 Sonnet 5。
安全方面,Anthropic 称这是其最对齐的模型。自动化行为审计中,不当行为评分 2.3,低于 Opus 4.8、Sonnet 5 和 Fable 5。安全分类器比 Fable 5 宽松约 85%,允许发现源码漏洞但阻止二进制扫描和渗透测试。生物学安全防护与 Opus 4.8 类似,不会像 Fable 5 那样过度拦截合法科研请求。
上下文窗口 100 万 tokens,没变。今天已上线所有平台,是 Claude Max 的默认模型和 Claude Pro 的最强模型。API 端以 claude-opus-5 名称提供。同时推出了两个 beta 功能:对话中工具变更和 API 自动 fallback。
一句话:K3逼出了更便宜的Fable5,如果你需要接近 Fable 5 的能力但预算不够,或者主要做编码和代理任务,Opus 5 可能是目前最划算的选择。
Anthropic 官方公告 :https://www.anthropic.com/news/claude-opus-5