Claude Opus 5 对比 Fable 5:更便宜的模型赢了多数评测,那 Fable 还剩什么价值?
Anthropic 7 月 24 日的发布说明说,Opus 5 以半价接近 Fable 5。看 Anthropic 自己放出的主评测,它不只是接近,而是赢了。但标价反而是最不重要的差异:一项实测显示 Opus 5 为完成同一任务多花了 30% token,而真正决定你能不能用某个模型的因素——零数据留存、知识截止时间、思考能否关闭——根本不会出现在评测图上。
Anthropic 在 2026 年 7 月 24 日发布了 Claude Opus 5,并用一句话给它定性:一个“a thoughtful and proactive model that comes close to the frontier intelligence of Claude Fable 5 at half the price.”
同一周再看 Anthropic 自己的文档,读到的又是另一种说法。模型概览仍把 Claude Fable 5 称为 “Anthropic’s most capable widely released model”,并建议把它用于 “workloads that need the highest available capability”;同时又把 Opus 5 推荐给 “complex agentic coding and enterprise work.”
这两种说法不能同时作为默认选择。所以我们沿用Fable 5 发布评测里的方法:回到数字本身,确认每个分数到底属于哪个模型,再把评测上能看到的差异和实际决定能不能用的限制分开。来源统一放在文末。
30 秒结论
- 主评测上,更便宜的模型赢了。 Frontier-Bench v0.1:Opus 5 43.3%,Fable 5 33.7%。SWE-bench Verified:96.0% 对 95.0%。在 OSWorld 2.0 上,Anthropic 说 Opus 5 用略高于三分之一的成本超过了 Fable 的最好结果。
- Fable 还领先的地方很窄。 SWE-bench Pro 是 80.0% 对 79.2%;CursorBench 3.2 上,Anthropic 自己说 Opus 5 在 max effort(用力档位)下距离 Fable 峰值不到 0.5%。除了排名顺序,这些更像平手。
- 半价标价不等于账单减半。 一项实测里,Opus 5 每任务约消耗 698K token,Fable 约 537K,也就是多约 30%;同时工具调用更多、实际耗时更长。两个编码任务合计成本是 $106.69 对 $118.46。还是便宜,但便宜的是约 10%,不是 50%。
- 真正关键的差异不在评测图上。 Fable 5 强制 30 天数据留存,零数据留存(ZDR)组织会被直接拒绝;Opus 5 不会。Opus 5 的知识截止时间晚四个月(2026 年 5 月对 2026 年 1 月)。Opus 5 可以关闭思考,Fable 不行。Priority Tier 支持 Fable,不支持 Opus 5。
- Fable 仍有更多安全分类器。 如果你想要更多拒绝,这是功能;如果你的工作贴近安全,这是成本。Fable 自己的系统卡记录:在 Terminal-Bench 2.1 运行中,20.9% 触发了安全拒绝。
- 默认选择已经反过来了。 Opus 5 现在是 Claude Max 默认模型,也是 Claude Pro 上最强的模型。Fable 5 不再是困难任务的显然答案;它只适合特定约束下的特定选择。
评测表
Anthropic 把 Opus 5 的对比放在图里,而不是可读表格里,所以多数报道只能复述形容词。下面把数字列出来,并标清每一项来自哪里:
| 评测 | Opus 5 | Fable 5 | Opus 4.8 | 说明 |
|---|---|---|---|---|
| Frontier-Bench v0.1 | 43.3 | 33.7 | 18.7 | Anthropic 新的代理评测 |
| SWE-bench Verified | 96.0 | 95.0 | 88.6 | Opus 5 5 次试验平均值(系统卡) |
| SWE-bench Pro | 79.2 | 80.0 | 69.2 | Fable 唯一清楚领先的评测 |
| CursorBench 3.2 | ~33.2 | ~33.7 | — | Opus 5 max effort,“within 0.5%” |
| ARC-AGI 3 | 30.2 | 未公布 | 1.5 | GPT-5.6 Sol:7.8 |
| OSWorld 2.0 | 超过 Fable | — | — | 成本“just over one-third the cost” |
最明显的是两件事。第一,Opus 5 的提升没有主要落在已经接近上限的评测上。SWE-bench Verified 只动了 1 分,因为也没剩多少空间可动。真正拉开差距的是 Frontier-Bench:它比价格 2x 的模型高 28%;还有 ARC-AGI 3,Anthropic 说它达到“three times the next-best model”,ARC Prize Foundation 自己的数字也对得上。这更像是真能力提高,而不是只调排行榜。我们在Fable 刚发布时用的也是同一条判断标准。
第二,更值得注意的是缺失项。Fable 5 没有公布 ARC-AGI 3 结果,所以表里最大的差距其实是数据缺口,不是已经测出的失败。按我们的评测原则,如果这个数字出现,我们会更新。
半价标价不等于账单减半
只看定价页,对比很简单,也很容易误导:
| 模型 | 输入 /MTok | 输出 /MTok |
|---|---|---|
| Claude Opus 5 | $5 | $25 |
| Claude Opus 5(快速模式) | $10 | $50 |
| Claude Fable 5 | $10 | $50 |
每个任务的成本等于 token 单价乘以消耗的 token 数,而第二项并不相同。一项公开实测把两个模型放进工具调用评测和两段式编码构建里,测到的是:
| 指标 | Opus 5 | Fable 5 |
|---|---|---|
| 每任务平均运行 token | 698K | 537K |
| 平均工具调用次数 | 9.4 | 7.6 |
| 每任务平均实际耗时 | 146.8s | 130.7s |
| 工具调用评测通过数 | 20/23 | 21/23 |
| 2 个编码任务合计成本 | $106.69 | $118.46 |
Opus 5 仍然更便宜,但只便宜 约 10%,不是价目表暗示的 50%。原因也清楚:它花了更多力气才完成任务,跨更多工具调用多消耗了约 30% token。单次 API 调用里,定价页基本就是答案;但长时间代理运行会把 token 消耗摊到几十次工具调用里,这时要先看自己的调用轨迹,再判断折扣是否仍然成立。这和 Claude Code 的 token 开销是同一个坑:每 token 单价是真的,但它不是你月底付的钱。
表里还有一行单独值得看:Claude Opus 5 的快速模式正好和 Fable 5 同价,都是 $10/$50,换来约 2.5x 的默认速度。这和Fable 5 发布时拿它对比 Opus 4.8 快速模式时是同一笔交易,只是现在能力对比的方向变了。用 Fable 的钱,你可以买一个在多数评测上追平或超过它、同时快 2.5x 左右的 Opus 5。
真正做决定的是这些差异,不是能力
如果只比分数,很容易选错模型。下面这些限制在常见场景里会直接排除其中一个:
| Claude Opus 5 | Claude Fable 5 | |
|---|---|---|
| 数据留存 | 组织默认值 — 可用于 ZDR | 最低 30 天,不支持 ZDR |
| 训练数据截止时间 | 2026 年 5 月 | 2026 年 1 月 |
| 关闭思考 | 可以,effort ≤ high | 不行 — 返回 400 |
| effort 档位 | low → max | low → max |
| Priority Tier | 不支持 | 支持 |
| 上下文 / 最大输出 | 1M / 128K | 1M / 128K |
| 额外安全分类器 | cyber 类 | cyber、bio、reasoning-extraction |
| 相对延迟 | 中等 | 较慢 |
数据留存这一条会直接结束争论。 Fable 5 是受限模型(Covered Model):最低 30 天数据留存,而且完全不能用于 ZDR 协议。签了 ZDR 的组织调用 claude-fable-5,拿到的是 400 invalid_request_error,不是降级服务,而是拒绝。Opus 5 没有模型级数据留存要求。如果你的环境要求 ZDR,这个对比从来不接近:Fable 本来就不能用,Opus 5 可以。
知识截止时间是安静但重要的差异。 Opus 5 的训练数据到 2026 年 5 月,Fable 到 2026 年 1 月。这个“低一档”的模型反而多知道 4 个月的生态变化。对要处理库、框架版本和今年春天发布的 API 的代理来说,这个差距可能比 SWE-bench 上 1 分更有用。
思考控制是真正的 API 分叉。 两个模型默认都会跑自适应思考,也都不会返回原始思维链。但 Opus 5 在 effort 为 high 或更低时接受 thinking: {type: "disabled"},这能帮你压低简单高频调用的延迟。Fable 会拒绝这种设置;关闭思考和旧的 budget_tokens 写法都会返回 400。你买不到快速、少思考的 Fable 回复。
Priority Tier 是 Fable 还剩下的真实优势,而且范围正在变小。 Priority Tier 支持 Fable 5,并明确不支持 Opus 5 或 Sonnet 5。但 Anthropic 已经不再销售新的 Priority Tier 承诺,现有合同到期为止。所以这只影响已经买了容量的组织;合同到期后,这条也会消失。
拒绝这件事有两面
两个模型都有安全分类器,都会拒绝某些请求。机制相同:HTTP 200 响应里返回 stop_reason: "refusal",并带上 stop_details.category,例如 cyber、bio 或 reasoning_extraction。如果拒绝在任何输出前触发,输入 token 不收费;如果在流式输出中途触发,只按已经输出的内容计费。如果你已经为这条路径写过处理逻辑,可以继续沿用;完整分支见我们的 Fable 5 拒绝处理指南。
差异在于有多少分类器在看。Fable 5 比 Opus 5 的 cyber 类多了几个分类器,而且这不是理论问题:Fable 自己的系统卡记录,在 20.9% 的 Terminal-Bench 2.1 运行里触发了安全拒绝,导致任务中途回退并明显丢分。如果你的工作贴近安全,比如阅读 exploit 代码、写检测规则、审查认证流程,Fable 会更频繁地打断你。你多付的钱,买到的是这些打断。
Opus 5 增加了一件 Fable 发布时没有的东西:服务端回退现在可以用一个参数选择启用。在测试版请求头后面加 fallbacks: "default",遇到 cyber 类拒绝时,同一次调用内会改路由到另一个模型。它不支持 Batch API,也不支持 Amazon Bedrock、Google Cloud 或 Microsoft Foundry,所以这些渠道仍然需要你自己写重试逻辑。
如果你的部署很保守,比如面对不可信终端用户的产品,Fable 的额外分类器可能值得付钱。对做防御性安全工作的工程师来说,它们就是额外负担。同一套机制,对不同的人是功能还是成本,取决于你在做什么活。
那 Fable 5 还适合什么?
诚实列出来,比 6 月时短了很多:
- 长时间编排,且效率会累积的任务。 实测 token 和工具调用差异都偏向 Fable。在多小时代理运行里,30% 的 token 差异可能比 50% 的单价差更重要。这是它现在最强的理由,也最应该拿你自己的工作负载实测,而不是直接相信通用结论。
- 已经存在的 Priority Tier 承诺。 Opus 5 用不了它。如果你已经在为保证容量付费,这部分容量只落在 Fable 上。
- 希望安全过滤尽可能强的部署。 分类器更多,拒绝更多,终端用户把模型带到你不想要的方向的机会更少。
- Anthropic 自己的标签。 文档仍把 Fable 称为最强的广泛发布模型。如果你的采购流程在意“顶级模型”这个说法,理由是这句话,不是分数表。
不在清单上的是原始编码能力。那是 Fable 6 月时的全部卖点,现在基本变成 2x 价格下的接近平手。6 月的结论是:当一次失败会浪费你一个下午时,Fable 是第一个值得付 2x 的模型。六周后,同一条逻辑指向 Opus 5:理由一样,答案更便宜。
实际怎么选
默认用 Opus 5。 它已经是 Claude Max 默认模型,也是 Claude Pro 上最强的模型;发布当天就进入了 Claude Code;几乎所有已发布评测都追平或超过 Fable;每 token 单价只有一半;知识新 4 个月;还能用于 ZDR。对一般编码和代理工作来说,这条根本不用纠结。
只有带着明确理由时才切到 Fable。 这些理由包括:你已经量到编排工作负载里的 token 效率确实值回差价;你有现存的 Priority Tier 合同;或者你的部署就是想要更多安全分类器。“它是顶级模型”不是理由;从 7 月 24 日开始,它就不是最高分的模型了。
迁移前重新调参。 从 Opus 4.8 迁过来,有两处会踩坑:请求里不写 thinking 字段时,现在默认会跑自适应思考,所以要重新看 max_tokens,它仍然同时限制思考和最终文本;thinking: {type: "disabled"} 如果和 xhigh 或 max effort 搭配,现在会返回 400,要么重新打开思考,要么降到 high。Anthropic 的建议是重新扫一遍 effort,而不是沿用 Opus 4.8 的设置;如果用 xhigh 或 max,max_tokens 先从 64K 开始。
用自己的调用轨迹算成本。 2x 的单价差是真实的,一次实测任务里的差距约为 10% 也是真实的。你的工作负载落在哪边,定价页不会告诉你。
配套阅读
- Claude Fable 5 对比 Opus 4.8:6 月判决 —— 发布图表,以及每个数字到底属于哪个模型
- Fable 5 拒绝处理 ——
stop_reason: "refusal"路径,以及代理代码该怎么处理 - Fable 5 暂停后又恢复 —— 18 天出口管制停摆,以及它暴露的单一厂商风险
- AI 代理评测:真实信号还是营销话术 —— 为什么 SWE-bench 动 1 分不是重点
- Claude Code 的 token 开销 —— 另一个每 token 单价无法预测账单的地方
来源
- Anthropic — 介绍 Claude Opus 5
- Anthropic — Claude Opus 5 系统卡(2026 年 7 月 24 日)
- Anthropic 文档 — 模型概览(Fable 5 与 Opus 5 规格、截止时间、延迟)
- Anthropic 文档 — 从 Claude Opus 4.8 迁移到 Claude Opus 5
- Anthropic 文档 — 服务档位:Priority Tier 支持的模型
- Vellum — 从 Anthropic 图表整理出的 Claude Opus 5 评测
- Composio — Claude Opus 5 对比 Fable 5:编码与工具调用实测
- TechCrunch — Anthropic 发布 Claude Opus 5
常见问题
Claude Opus 5 比 Claude Fable 5 更好吗? 多数已发布评测上,是的,而且标价只有一半。Opus 5 在 Anthropic 的 Frontier-Bench v0.1 上是 43.3%,Fable 5 是 33.7%;SWE-bench Verified 是 96.0% 对 95.0%;Anthropic 还说它在 OSWorld 2.0 上用略高于三分之一的成本超过了 Fable 的最好结果。Fable 在 SWE-bench Pro 上仍小幅领先(80.0% 对 79.2%),在 CursorBench 3.2 上也保持领先,但 Anthropic 说 Opus 5 max effort 下距离峰值不到 0.5%。直白说,两者能力很接近,Opus 5 赢下最难的新评测,Fable 每任务更省;而 Anthropic 文档仍把 Fable 5 列为最强的广泛发布模型,所以官方标签和分数表已经不一致。
Claude Opus 5 真的是 Fable 5 半价吗? 是每 token 单价减半,不是账单减半。Opus 5 每百万输入 token $5、输出 token $25;Fable 5 是 $10 和 $50。但每任务成本还取决于模型花掉多少 token。一项公开实测里,Opus 5 每任务约用 698K 运行 token,Fable 约 537K,也就是前者多约 30%,同时工具调用更多、实际耗时更长。两个编码任务合计成本是 $106.69 对 $118.46:Opus 仍然便宜,但大约便宜 10%,不是 50%。预算要看自己的调用轨迹,不要只看定价页。
Claude Fable 5 能用于零数据留存吗?
不能。Fable 5 是受限模型(Covered Model),有最低 30 天数据留存要求,并且不能用于零数据留存(ZDR)安排。在 Claude API 上,签了 ZDR 的组织调用 claude-fable-5 会被 400 invalid_request_error 拒绝。Claude Opus 5 没有模型级留存要求,会继承组织默认设置,所以可以用于 ZDR。对受监管团队来说,这一条在任何评测之前就决定了选择:Fable 根本不是选项,Opus 5 才是。
Opus 5 和 Fable 5 的 API 差异是什么?
有四个真正重要。第一是思考:两者默认都会自适应思考,但 Opus 5 在 effort 为 high 或更低时允许 thinking: {type: "disabled"},Fable 5 会拒绝关闭思考,也会拒绝旧的 budget_tokens 写法,返回 400。第二是留存:Fable 要求 30 天数据留存并阻断 ZDR;Opus 5 不会。第三是 Priority Tier:支持 Fable 5,不支持 Opus 5 或 Sonnet 5;但 Anthropic 已不再销售新的承诺,所以只影响已有合同。第四是知识:Opus 5 的训练数据到 2026 年 5 月,Fable 到 2026 年 1 月。两者都共享 1M 上下文窗口、128K 最大输出和相同的拒绝语义。
Claude Code 里该用哪个模型? 默认用 Opus 5。它已经是 Claude Max 默认模型,也是 Claude Pro 上最强的模型,并且发布当天就进入了 Claude Code。只有在少数场景保留 Fable:长时间编排里它更低的 token 消耗会累积成优势;你已有 Priority Tier 承诺;或者你的部署确实想要额外安全分类器。还有一条价格计算要先知道:Opus 5 快速模式是每百万输入 $10、输出 $50,正好等于 Fable 5 标准价;同样的钱,要么买 Fable 的能力,要么买 Opus 5 约 2.5x 的速度。
这篇对你有帮助吗?