← 返回全部文章
Verdict · 2026年7月28日 · 9 分钟阅读

Claude Opus 5 对比 Fable 5:更便宜的模型赢了多数评测,那 Fable 还剩什么价值?

Anthropic 7 月 24 日的发布说明说,Opus 5 以半价接近 Fable 5。看 Anthropic 自己放出的主评测,它不只是接近,而是赢了。但标价反而是最不重要的差异:一项实测显示 Opus 5 为完成同一任务多花了 30% token,而真正决定你能不能用某个模型的因素——零数据留存、知识截止时间、思考能否关闭——根本不会出现在评测图上。

Anthropic 在 2026 年 7 月 24 日发布了 Claude Opus 5,并用一句话给它定性:一个“a thoughtful and proactive model that comes close to the frontier intelligence of Claude Fable 5 at half the price.”

同一周再看 Anthropic 自己的文档,读到的又是另一种说法。模型概览仍把 Claude Fable 5 称为 “Anthropic’s most capable widely released model”,并建议把它用于 “workloads that need the highest available capability”;同时又把 Opus 5 推荐给 “complex agentic coding and enterprise work.”

这两种说法不能同时作为默认选择。所以我们沿用Fable 5 发布评测里的方法:回到数字本身,确认每个分数到底属于哪个模型,再把评测上能看到的差异和实际决定能不能用的限制分开。来源统一放在文末。

30 秒结论

  1. 主评测上,更便宜的模型赢了。 Frontier-Bench v0.1Opus 5 43.3%Fable 5 33.7%SWE-bench Verified96.0%95.0%。在 OSWorld 2.0 上,Anthropic 说 Opus 5 用略高于三分之一的成本超过了 Fable 的最好结果。
  2. Fable 还领先的地方很窄。 SWE-bench Pro80.0% 对 79.2%CursorBench 3.2 上,Anthropic 自己说 Opus 5 在 max effort(用力档位)下距离 Fable 峰值不到 0.5%。除了排名顺序,这些更像平手。
  3. 半价标价不等于账单减半。 一项实测里,Opus 5 每任务约消耗 698K tokenFable537K,也就是多约 30%;同时工具调用更多、实际耗时更长。两个编码任务合计成本是 $106.69 对 $118.46。还是便宜,但便宜的是约 10%,不是 50%。
  4. 真正关键的差异不在评测图上。 Fable 5 强制 30 天数据留存,零数据留存(ZDR)组织会被直接拒绝;Opus 5 不会。Opus 5 的知识截止时间晚四个月(2026 年 5 月对 2026 年 1 月)。Opus 5 可以关闭思考,Fable 不行。Priority Tier 支持 Fable,不支持 Opus 5
  5. Fable 仍有更多安全分类器。 如果你想要更多拒绝,这是功能;如果你的工作贴近安全,这是成本。Fable 自己的系统卡记录:在 Terminal-Bench 2.1 运行中,20.9% 触发了安全拒绝。
  6. 默认选择已经反过来了。 Opus 5 现在是 Claude Max 默认模型,也是 Claude Pro 上最强的模型。Fable 5 不再是困难任务的显然答案;它只适合特定约束下的特定选择。

评测表

Anthropic 把 Opus 5 的对比放在图里,而不是可读表格里,所以多数报道只能复述形容词。下面把数字列出来,并标清每一项来自哪里:

评测Opus 5Fable 5Opus 4.8说明
Frontier-Bench v0.143.333.718.7Anthropic 新的代理评测
SWE-bench Verified96.095.088.6Opus 5 5 次试验平均值(系统卡)
SWE-bench Pro79.280.069.2Fable 唯一清楚领先的评测
CursorBench 3.2~33.2~33.7Opus 5 max effort,“within 0.5%”
ARC-AGI 330.2未公布1.5GPT-5.6 Sol:7.8
OSWorld 2.0超过 Fable成本“just over one-third the cost”
Opus 5Fable 5 的数字来自 Anthropic 发布材料和系统卡(2026 年 7 月 24 日、6 月 9 日);Frontier-BenchCursorBenchARC-AGI 数字来自第三方分析者对 Anthropic 图表的整理,ARC-AGI 3 来自 ARC Prize Foundation。GDPval-AA 被故意排除在外:Opus 5 报的是该评测的 v2Fable 5 报的是更早版本。两个 Elo 分数不可比,把它们并排印出来就是编造结论。

最明显的是两件事。第一,Opus 5 的提升没有主要落在已经接近上限的评测上。SWE-bench Verified 只动了 1 分,因为也没剩多少空间可动。真正拉开差距的是 Frontier-Bench:它比价格 2x 的模型高 28%;还有 ARC-AGI 3,Anthropic 说它达到“three times the next-best model”,ARC Prize Foundation 自己的数字也对得上。这更像是真能力提高,而不是只调排行榜。我们在Fable 刚发布时用的也是同一条判断标准。

第二,更值得注意的是缺失项。Fable 5 没有公布 ARC-AGI 3 结果,所以表里最大的差距其实是数据缺口,不是已经测出的失败。按我们的评测原则,如果这个数字出现,我们会更新。

半价标价不等于账单减半

只看定价页,对比很简单,也很容易误导:

模型输入 /MTok输出 /MTok
Claude Opus 5$5$25
Claude Opus 5(快速模式)$10$50
Claude Fable 5$10$50

每个任务的成本等于 token 单价乘以消耗的 token 数,而第二项并不相同。一项公开实测把两个模型放进工具调用评测和两段式编码构建里,测到的是:

指标Opus 5Fable 5
每任务平均运行 token698K537K
平均工具调用次数9.47.6
每任务平均实际耗时146.8s130.7s
工具调用评测通过数20/2321/23
2 个编码任务合计成本$106.69$118.46
2026 年 7 月的第三方实测:一个工作负载上的小样本,不是正式评测。方向上和 Anthropic 自己的延迟评级一致:文档把 Fable 标为较慢(原文: “Slower”),把 Opus 5 标为中等(原文: “Moderate”)。

Opus 5 仍然更便宜,但只便宜 约 10%,不是价目表暗示的 50%。原因也清楚:它花了更多力气才完成任务,跨更多工具调用多消耗了约 30% token。单次 API 调用里,定价页基本就是答案;但长时间代理运行会把 token 消耗摊到几十次工具调用里,这时要先看自己的调用轨迹,再判断折扣是否仍然成立。这和 Claude Code 的 token 开销是同一个坑:每 token 单价是真的,但它不是你月底付的钱。

表里还有一行单独值得看:Claude Opus 5 的快速模式正好和 Fable 5 同价,都是 $10/$50,换来约 2.5x 的默认速度。这和Fable 5 发布时拿它对比 Opus 4.8 快速模式时是同一笔交易,只是现在能力对比的方向变了。用 Fable 的钱,你可以买一个在多数评测上追平或超过它、同时快 2.5x 左右的 Opus 5

真正做决定的是这些差异,不是能力

如果只比分数,很容易选错模型。下面这些限制在常见场景里会直接排除其中一个:

Claude Opus 5Claude Fable 5
数据留存组织默认值 — 可用于 ZDR最低 30 天,不支持 ZDR
训练数据截止时间2026 年 5 月2026 年 1 月
关闭思考可以,effort ≤ high不行 — 返回 400
effort 档位lowmaxlowmax
Priority Tier不支持支持
上下文 / 最大输出1M / 128K1M / 128K
额外安全分类器cybercyberbioreasoning-extraction
相对延迟中等较慢

数据留存这一条会直接结束争论。 Fable 5 是受限模型(Covered Model):最低 30 天数据留存,而且完全不能用于 ZDR 协议。签了 ZDR 的组织调用 claude-fable-5,拿到的是 400 invalid_request_error,不是降级服务,而是拒绝。Opus 5 没有模型级数据留存要求。如果你的环境要求 ZDR,这个对比从来不接近:Fable 本来就不能用,Opus 5 可以。

知识截止时间是安静但重要的差异。 Opus 5 的训练数据到 2026 年 5 月,Fable 到 2026 年 1 月。这个“低一档”的模型反而多知道 4 个月的生态变化。对要处理库、框架版本和今年春天发布的 API 的代理来说,这个差距可能比 SWE-bench 上 1 分更有用。

思考控制是真正的 API 分叉。 两个模型默认都会跑自适应思考,也都不会返回原始思维链。但 Opus 5 在 effort 为 high 或更低时接受 thinking: {type: "disabled"},这能帮你压低简单高频调用的延迟。Fable 会拒绝这种设置;关闭思考和旧的 budget_tokens 写法都会返回 400。你买不到快速、少思考的 Fable 回复。

Priority TierFable 还剩下的真实优势,而且范围正在变小。 Priority Tier 支持 Fable 5,并明确不支持 Opus 5Sonnet 5。但 Anthropic 已经不再销售新的 Priority Tier 承诺,现有合同到期为止。所以这只影响已经买了容量的组织;合同到期后,这条也会消失。

拒绝这件事有两面

两个模型都有安全分类器,都会拒绝某些请求。机制相同:HTTP 200 响应里返回 stop_reason: "refusal",并带上 stop_details.category,例如 cyberbioreasoning_extraction。如果拒绝在任何输出前触发,输入 token 不收费;如果在流式输出中途触发,只按已经输出的内容计费。如果你已经为这条路径写过处理逻辑,可以继续沿用;完整分支见我们的 Fable 5 拒绝处理指南

差异在于有多少分类器在看。Fable 5Opus 5cyber 类多了几个分类器,而且这不是理论问题:Fable 自己的系统卡记录,在 20.9% 的 Terminal-Bench 2.1 运行里触发了安全拒绝,导致任务中途回退并明显丢分。如果你的工作贴近安全,比如阅读 exploit 代码、写检测规则、审查认证流程,Fable 会更频繁地打断你。你多付的钱,买到的是这些打断。

Opus 5 增加了一件 Fable 发布时没有的东西:服务端回退现在可以用一个参数选择启用。在测试版请求头后面加 fallbacks: "default",遇到 cyber 类拒绝时,同一次调用内会改路由到另一个模型。它不支持 Batch API,也不支持 Amazon BedrockGoogle CloudMicrosoft Foundry,所以这些渠道仍然需要你自己写重试逻辑。

如果你的部署很保守,比如面对不可信终端用户的产品,Fable 的额外分类器可能值得付钱。对做防御性安全工作的工程师来说,它们就是额外负担。同一套机制,对不同的人是功能还是成本,取决于你在做什么活。

Fable 5 还适合什么?

诚实列出来,比 6 月时短了很多:

  • 长时间编排,且效率会累积的任务。 实测 token 和工具调用差异都偏向 Fable。在多小时代理运行里,30% 的 token 差异可能比 50% 的单价差更重要。这是它现在最强的理由,也最应该拿你自己的工作负载实测,而不是直接相信通用结论。
  • 已经存在的 Priority Tier 承诺。 Opus 5 用不了它。如果你已经在为保证容量付费,这部分容量只落在 Fable 上。
  • 希望安全过滤尽可能强的部署。 分类器更多,拒绝更多,终端用户把模型带到你不想要的方向的机会更少。
  • Anthropic 自己的标签。 文档仍把 Fable 称为最强的广泛发布模型。如果你的采购流程在意“顶级模型”这个说法,理由是这句话,不是分数表。

不在清单上的是原始编码能力。那是 Fable 6 月时的全部卖点,现在基本变成 2x 价格下的接近平手。6 月的结论是:当一次失败会浪费你一个下午时,Fable 是第一个值得付 2x 的模型。六周后,同一条逻辑指向 Opus 5:理由一样,答案更便宜。

实际怎么选

默认用 Opus 5 它已经是 Claude Max 默认模型,也是 Claude Pro 上最强的模型;发布当天就进入了 Claude Code;几乎所有已发布评测都追平或超过 Fable;每 token 单价只有一半;知识新 4 个月;还能用于 ZDR。对一般编码和代理工作来说,这条根本不用纠结。

只有带着明确理由时才切到 Fable 这些理由包括:你已经量到编排工作负载里的 token 效率确实值回差价;你有现存的 Priority Tier 合同;或者你的部署就是想要更多安全分类器。“它是顶级模型”不是理由;从 7 月 24 日开始,它就不是最高分的模型了。

迁移前重新调参。Opus 4.8 迁过来,有两处会踩坑:请求里不写 thinking 字段时,现在默认会跑自适应思考,所以要重新看 max_tokens,它仍然同时限制思考和最终文本;thinking: {type: "disabled"} 如果和 xhighmax effort 搭配,现在会返回 400,要么重新打开思考,要么降到 high。Anthropic 的建议是重新扫一遍 effort,而不是沿用 Opus 4.8 的设置;如果用 xhighmaxmax_tokens 先从 64K 开始。

用自己的调用轨迹算成本。 2x 的单价差是真实的,一次实测任务里的差距约为 10% 也是真实的。你的工作负载落在哪边,定价页不会告诉你。

配套阅读

来源

  1. Anthropic — 介绍 Claude Opus 5
  2. Anthropic — Claude Opus 5 系统卡(2026 年 7 月 24 日)
  3. Anthropic 文档 — 模型概览(Fable 5Opus 5 规格、截止时间、延迟)
  4. Anthropic 文档 — 从 Claude Opus 4.8 迁移到 Claude Opus 5
  5. Anthropic 文档 — 服务档位:Priority Tier 支持的模型
  6. Vellum — 从 Anthropic 图表整理出的 Claude Opus 5 评测
  7. Composio — Claude Opus 5 对比 Fable 5:编码与工具调用实测
  8. TechCrunch — Anthropic 发布 Claude Opus 5

常见问题

Claude Opus 5Claude Fable 5 更好吗? 多数已发布评测上,是的,而且标价只有一半。Opus 5 在 Anthropic 的 Frontier-Bench v0.1 上是 43.3%,Fable 5 是 33.7%;SWE-bench Verified 是 96.0% 对 95.0%;Anthropic 还说它在 OSWorld 2.0 上用略高于三分之一的成本超过了 Fable 的最好结果。FableSWE-bench Pro 上仍小幅领先(80.0% 对 79.2%),在 CursorBench 3.2 上也保持领先,但 Anthropic 说 Opus 5 max effort 下距离峰值不到 0.5%。直白说,两者能力很接近,Opus 5 赢下最难的新评测,Fable 每任务更省;而 Anthropic 文档仍把 Fable 5 列为最强的广泛发布模型,所以官方标签和分数表已经不一致。

Claude Opus 5 真的是 Fable 5 半价吗? 是每 token 单价减半,不是账单减半。Opus 5 每百万输入 token $5、输出 token $25;Fable 5 是 $10 和 $50。但每任务成本还取决于模型花掉多少 token。一项公开实测里,Opus 5 每任务约用 698K 运行 token,Fable 约 537K,也就是前者多约 30%,同时工具调用更多、实际耗时更长。两个编码任务合计成本是 $106.69 对 $118.46:Opus 仍然便宜,但大约便宜 10%,不是 50%。预算要看自己的调用轨迹,不要只看定价页。

Claude Fable 5 能用于零数据留存吗? 不能。Fable 5 是受限模型(Covered Model),有最低 30 天数据留存要求,并且不能用于零数据留存(ZDR)安排。在 Claude API 上,签了 ZDR 的组织调用 claude-fable-5 会被 400 invalid_request_error 拒绝。Claude Opus 5 没有模型级留存要求,会继承组织默认设置,所以可以用于 ZDR。对受监管团队来说,这一条在任何评测之前就决定了选择:Fable 根本不是选项,Opus 5 才是。

Opus 5Fable 5 的 API 差异是什么? 有四个真正重要。第一是思考:两者默认都会自适应思考,但 Opus 5 在 effort 为 high 或更低时允许 thinking: {type: "disabled"}Fable 5 会拒绝关闭思考,也会拒绝旧的 budget_tokens 写法,返回 400。第二是留存:Fable 要求 30 天数据留存并阻断 ZDR;Opus 5 不会。第三是 Priority Tier:支持 Fable 5,不支持 Opus 5Sonnet 5;但 Anthropic 已不再销售新的承诺,所以只影响已有合同。第四是知识:Opus 5 的训练数据到 2026 年 5 月,Fable 到 2026 年 1 月。两者都共享 1M 上下文窗口、128K 最大输出和相同的拒绝语义。

Claude Code 里该用哪个模型? 默认用 Opus 5。它已经是 Claude Max 默认模型,也是 Claude Pro 上最强的模型,并且发布当天就进入了 Claude Code。只有在少数场景保留 Fable:长时间编排里它更低的 token 消耗会累积成优势;你已有 Priority Tier 承诺;或者你的部署确实想要额外安全分类器。还有一条价格计算要先知道:Opus 5 快速模式是每百万输入 $10、输出 $50,正好等于 Fable 5 标准价;同样的钱,要么买 Fable 的能力,要么买 Opus 5 约 2.5x 的速度。

这篇对你有帮助吗?

相关阅读


文章独立产出 · 编辑政策

继续阅读 →