Haiku 5.5 便宜九成只到 100K token:我们 95% 的 Claude Code 流量超过了这条线
把 Claude Code 实际产生的 token 数套进 Haiku 5.5 的两档价目表,费用约为 Haiku 4.5 的一半:77.9% 的调用、94.8% 的输入侧 token 都在 100K 门槛之上,各项单价是标价的五倍。子代理也有一半调用超过 100K。不过,新模型在提示词审计中表现更好:三次都找出了埋入的九个问题,没有把对照列为问题。Haiku 4.5 在 10 月 4 日的测试中,每次都漏掉了无法执行的命令。
30 秒看懂结论
10 月 7 日,Anthropic 发布了 Claude Haiku 5.5。输入每百万 token $0.10,输出每百万 token $0.50,是 Haiku 4.5 的十分之一。不过,这个标价有条件:一次请求的提示词不能超过 100,000 token。一旦超过 100K,输入就变成 $0.50,输出变成 $2.50,缓存读取和缓存写入也都涨到标价的五倍。Anthropic 自己给出的说法是:100K 以下便宜 90%,以上便宜 50%,平均便宜约 75%。
做实际任务的代理,有多少调用能留在 100K 以下?我们取出一台机器上 7 月 10 日到 10 月 7 日的全部 Claude Code 会话记录,共 208 份、12,901 次去重后的调用,逐次计算了提示词大小。
- 77.9% 的调用超过 100K。全部调用的提示词中位数是 209,571 token。主会话的中位数为 286,661,90.2% 的调用超过 100K;子代理的中位数也到了 101,891,有一半调用在门槛之上。
- 94.8% 的输入侧 token 落在高价档。按 Haiku 5.5 的两档价目表换算,这批 token 的费用是 $395.80;按 Haiku 4.5 算则是 $833.14,便宜 52.5%。若每次调用都能用标价,费用只需 $83.31。超过 100K 的调用占了 Haiku 5.5 换算费用的 98.7%。这些都是费用测算:会话实际跑在 Opus 和 Fable 上,而且超过一半的调用,提示词已经大到放不进 Haiku 4.5 的 200K 上下文窗口。
- 同一段文字,新模型会分出更多 token。Anthropic 说大约多 30%;我们测得,三份源代码文件多了 28%,一页文档多了 40%。如果统一按多 30% 折算,这批流量的费用节省就只剩 38.2%。
- Claude Code 2.1.293 已支持两档计价和新别名。实测费用与 100K 以上那档价算出的结果完全一致。在 Anthropic API 上,除非自行覆盖,
haiku别名现在指向 Haiku 5.5。这会让/model haiku、使用model: haiku的子代理,以及模型设置为haiku、此前保存在 Haiku 4.5 上的会话,都转到新模型。 - 审计测试中,新模型表现更好。我们拿 10 月 4 日发布的测试样本仓库,重新跑了提示词审计(
/doctor prompt-audit)。Haiku 5.5 三次都找出了埋入的九个问题,没有把任何对照列为问题,平均每次 $0.04。同一天重跑的 Haiku 4.5 分别找出三个、五个和八个,平均每次 $0.22。
结论:凡是要读代码仓库的工作,先按 Haiku 5.5 的 100K 以上那档价做预算。只有确认每次请求都不超过 100K,才适合按标价算;我们这个只涉及四份指令文件的审计,也有一次超过 100K。在本批记录中,曾经超过 100K 的子代理,首次超过的时点中位数是第 13 或第 14 次调用。对于审计这类能保持短小、需要反复执行的任务,Haiku 5.5 既更便宜,表现也明显强于 Haiku 4.5。
10 月 7 日:Haiku 5.5 改了什么
Haiku 5.5(claude-haiku-5-5)支持 1M token 上下文窗口和 128K token 输出。它默认开启自适应思考,effort 档位与 Opus 5.5、Sonnet 5.5 相同,分词器则沿用从 Opus 4.7 开始使用的新版。价格按提示词大小分成两档,下表单价均以每百万 token 为单位:
| 计费项目 | 提示词不超过 100,000 token | 提示词超过 100,000 token | Haiku 4.5 |
|---|---|---|---|
| 输入 | $0.10 | $0.50 | $1.00 |
| 输出 | $0.50 | $2.50 | $5.00 |
| 5 分钟缓存写入 | $0.125 | $0.625 | $1.25 |
| 1 小时缓存写入 | $0.20 | $1.00 | $2.00 |
| 缓存读取 | $0.01 | $0.05 | $0.10 |
其他现役模型没有这样的计价门槛。Opus 5.5、Sonnet 5.5 和 Fable 系列在整个 1M 上下文窗口内,都使用同一组每 token 单价。文档还提醒,同样的文字,Haiku 5.5 会比 Haiku 4.5 多产生约 30% 的 token,具体增幅取决于内容。原文分别是 “approximately 30% more tokens” 和 “the exact increase depends on the content”。
同日发布的 Claude Code 2.1.293 加入了这个模型,也在更新日志里列明两档价格。在 Anthropic API 上,只要没有通过 ANTHROPIC_DEFAULT_HAIKU_MODEL 覆盖,haiku 别名就会指向它。Anthropic 的开发者账号还推荐把它作为子代理,与 Opus 5.5 或 Sonnet 5.5 配合使用,原文是 “pairs well with Opus 5.5 or Sonnet 5.5 as a subagent”。同一天的平台发布说明还将 Sonnet 5.5 的缓存读取价格从每百万 token $0.20 降到 $0.10,后文比较采用的是新价格。
Hacker News 的发布讨论里,争论的正是这个门槛对代理任务的影响。一位评论者认为,100K 对代理来说低得离谱,原文是 “an absurdly low cutoff”;另一位则认为这是凭感觉抱怨,因为 Anthropic 已经明说,超过 100K 仍然便宜 50%。单看价格计算,两边并不矛盾。真正缺的是一次测量:实际流量到底落在哪一档?
真实调用中,100K 门槛有多低?
方法:扫描一台 macOS 机器上 ~/.claude/projects/ 目录内、2026 年 7 月 10 日到 10 月 7 日写入的全部 Claude Code 会话记录。剔除 32 条不含 token 的合成错误记录后,有 26 份主会话记录和 182 份子代理记录至少包含一次调用。
每个助手轮次都有一个 usage 对象,记录未缓存输入、缓存写入、缓存读取和输出的 token 数。我们按 message.id 去重,每个消息只取一条记录。Claude Code 会把同一条助手消息写入多次,直接累加全部记录会重复计数,这是我们在九月统计时踩过的坑。一次调用的提示词大小,定义为该次调用的未缓存输入、缓存写入和缓存读取之和。这就是 Anthropic 价目表中的提示词口径:缓存 token 必须计入门槛,缓存读写各自的高价档才有意义。后文的审计实测也确认了这一点:一次调用正是算上缓存读取后超过 100K,随后按高价档计费。
除 16 次调用外,其余都跑在 Opus 5、Opus 5.5、Opus 4.8、Fable 5 或 Fable 5.1 上。这些模型与 Haiku 5.5 使用同一代新分词器,因此可以沿用它们的 token 计数来换算。会话做的都是真实工作,包括写作、研究、运维和本站评测框架的运行,多数持续时间长,也不需要人逐步操作。不过,一台机器的流量不代表更广的样本;它只能证明,确实存在这样一种流量形态。
| 会话记录 | 调用次数 | 提示词中位数 | 超过 100K 的调用占比 | 超过 100K 的输入侧 token 占比 |
|---|---|---|---|---|
| 全部(208) | 12,901 | 209,571 | 77.9% | 94.8% |
| 主会话(26) | 8,871 | 286,661 | 90.2% | 97.9% |
| 子代理(182) | 4,030 | 101,891 | 50.7% | 74.5% |
把全部调用按提示词大小分组,100K 及以下占 22.1%,100K 到 200K 占 25.8%,200K 到 500K 占 37.3%,500K 以上占 14.8%。最大的提示词有 987,697 token。子代理的提示词相对小一些:100K 及以下占 49.3%,100K 到 200K 占 39.0%,200K 到 500K 占 11.6%,约每一千次调用中有一次超过 500K。即便如此,仍有一半在 100K 门槛之上。
会超过 100K 的会话,往往很早就超过了。26 份主会话记录中,18 份曾超过 100K。这些会话首次超过门槛的时点,中位数是第 10 或第 11 次调用,第一、第三四分位数分别是第 6 次和第 24 次;始终没有超过的 8 份记录都很短。182 份子代理记录中,有 82 份曾超过 100K,首次超过的时点中位数是第 13 或第 14 次调用,其中四分之三到第 19 次调用时就已超过。Anthropic 推荐把这个模型用作子代理,而在这批记录里,子代理调用次数的中位数只有 11 次:运行稍长一些,就可能很快用上高价档。
输入侧 token 的构成与我们九月报告的一致:未缓存输入占 0.018%,缓存写入占 6.6%,缓存读取占 93.4%。100K 门槛之所以影响这么大,原因就在这里。大量使用缓存的提示词,绝大部分 token 都是缓存读取;这一项在门槛之下是 $0.01,在门槛之上则是 $0.05。
超过 100K,还能便宜多少?
我们把同样的 12,901 次调用分别套入各模型的价目表。1 小时缓存写入按 1 小时价格算,5 分钟缓存写入按 5 分钟价格算:
| 价目表 | 同一批 token 的换算费用 | 相比 Haiku 4.5 |
|---|---|---|
| Haiku 4.5 | $833.14 | — |
| Haiku 5.5,假设所有调用都按标价 | $83.31 | −90.0% |
| Haiku 5.5,按实际两档价目表 | $395.80 | −52.5% |
| Sonnet 5.5,采用 10 月 7 日的缓存价格 | $1,339.14 | +61% |
| Opus 5.5 | $2,678.27 | +221% |
$395.80 中有 $390.61 来自超过 100K 的调用,占 98.7%。按两档价目表算出的费用,是全部按标价计算的 4.75 倍。如果分开看,主会话比 Haiku 4.5 便宜 51.4%,子代理便宜 63.5%。
这个比较有两个限制。第一,会话实际跑在 Opus 和 Fable 上。我们只是把记录里的 token 数换算到 Haiku 价目表,没有把这些会话真的放到 Haiku 上运行。换个模型做同样的事,可能需要更多轮,也可能更少。第二,52.1% 的调用超过 200K,已经超出 Haiku 4.5 的上下文上限。因此,Haiku 4.5 那一列只是按其价目表算出的费用,并不是这个模型实际能够产生的账单。
Haiku 5.5 依然比这些会话实际使用的模型便宜得多。同样一批 token,它的费用大约只有 Opus 5.5 的七分之一。100K 门槛并没有让 Haiku 变贵;它影响的是“比 Haiku 4.5 便宜多少”。只有短提示词能拿到宣传中的九成降幅。对于这批代理流量,节省幅度更接近 Anthropic 所说的长提示词便宜 50%,而不是标价对应的 90%。
还要把分词器的差异算进去。上面的 token 数来自已经使用新分词器的模型,也就是 Haiku 5.5 会看到的计数。同样的文字,Haiku 4.5 会分出更少的 token。若统一采用 Anthropic 所说的 30% 增幅,将 Haiku 4.5 一侧的 token 数相应折算,费用会降到约 $640.88。这时,Haiku 5.5 对这批流量的节省就只有 38.2%。如果采用我们在非自然填充文本上测得的 64.3% 增幅,节省约为 22%。两份真实内容样本的增幅都低于填充文本,但任何一份都不足以代表整个语料的 token 增幅。
同一段文字,token 变多了
我们通过 claude -p 把同一份文档分别交给两个模型,比较提示词的 token 总数。为了尽量只计入文档本身,先让两个模型各处理一条单行请求,再从文档请求的总数中减去这个基线。单行请求在 Haiku 5.5 上占 21,416 token,在 Haiku 4.5 上占 22,263 token,几乎全部来自 Claude Code 的系统提示词和工具定义。各次运行的提示词包装会相差几百个 token,所以下面的百分比都是近似值。
| 样本 | Haiku 4.5 token 数 | Haiku 5.5 token 数 | 变化 |
|---|---|---|---|
| 三份源代码文件,16 KB(Python 和 Astro) | 5,925 | 7,593 | +28% |
| 一页文档,16,151 个词的 Markdown 文字 | 30,592 | 42,760 | +40% |
| 用 30 个词反复拼成的填充文本,共 100,028 个词 | 121,151 | 199,045 | +64% |
代码样本的增幅接近 Anthropic 给出的数字,文档更高,填充文本则高得多。这也说明,增幅取决于内容;高度重复的填充文本不能拿来做公平的比较。实际使用时要留意两件事:原本在 Haiku 4.5 上只有 80K token 的提示词,换成 Haiku 5.5 后可能就超过 100K;比较同一份文字的费用时,只看每 token 单价,会高估省下的钱。
Claude Code 算价没错,haiku 已换新模型
我们在 Claude Code 2.1.293 上做了两项验证。以下命令会返回 total_cost_usd 和各模型的用量明细:claude -p --output-format json
费用计算已经支持两档价格。先用 claude-haiku-5-5 处理一条单行请求,得到 21,416 token 的提示词,其中 10,933 token 写入一小时缓存,10,481 token 从缓存读取。报告费用为 $0.00229,与按标价算出的金额完全一致。
再发送带有填充文档的请求,提示词达到 220,461 token:缓存写入 207,350、缓存读取 13,109、未缓存输入 2。报告费用为 $0.20801,恰好等于 100K 以上那档价算出的结果;如果按标价算,只会得到 $0.04160。
后文的审计实测更能说明,哪些 token 要计入 100K 门槛。那次运行的第七次调用,未缓存输入只有 2 token,缓存写入 1,426,缓存读取 99,664,合计 101,092。Claude Code 按 100K 以上那档价计算了费用,与官方价目表为缓存读取单独列出的高价档一致。两档价确实适用于缓存里的 token。
Claude Code 在本地根据 token 数和官方标价计算费用。因此,/usage 区块和状态栏都能正确显示 Haiku 5.5 的官方标价费用。如果你的组织有合同价,仍需按文档配置 modelPricing。最终应以 Anthropic Console 账单为准。
别名已经指向新模型。执行 claude -p --model haiku 后,用量明细列出的模型是 claude-haiku-5-5。在 Anthropic API 上,未设置 ANTHROPIC_DEFAULT_HAIKU_MODEL 时,这正是文档写明的行为。影响范围也不只有 /model haiku:配置为 model: haiku 的子代理、内置的 claude-code-guide 代理,以及所有通过 CLAUDE_CODE_SUBAGENT_MODEL=haiku 指定模型的代理,现在都会使用 Haiku 5.5。
模型配置文档还说明,如果模型设置为 haiku,恢复此前保存在 Haiku 模型上的会话时,会使用 haiku 当前指向的模型。其他平台的情况不同:在 Bedrock、Google Cloud 和 Foundry 上,别名仍指向 Haiku 4.5。要在 Anthropic API 上继续使用旧模型,应固定完整模型 ID:claude-haiku-4-5-20251001。
重跑审计:Haiku 5.5 九个全找出
10 月 4 日,我们曾在一个小型测试样本仓库里测试提示词审计。仓库中埋入了九个问题,另保留六条正确指令作为对照。当时,Opus 5.5 和 Sonnet 5.5 每次都找出了全部九个问题。Opus 没有把对照列为问题,Sonnet 列出过一条,置信度较低。Haiku 4.5 则分别找出五个、七个和六个问题:不存在的 npm 脚本和缺失的部署脚本,每次都漏掉;文档明确支持的 ultrathink 关键词,每次都被列为问题。
10 月 7 日,我们拿同一个测试样本仓库重跑。claude-haiku-5-5 和 claude-haiku-4-5-20251001 各跑三次,均使用 Claude Code 2.1.293,评测框架和评分规则也完全相同。
| 埋入的问题 | Haiku 4.5,10 月 4 日 | Haiku 4.5,10 月 7 日 | Haiku 5.5,10 月 7 日 |
|---|---|---|---|
| 1. 要求“逐步思考” | 3/3 | 2/3 | 3/3 |
| 2. 用全大写文字施压 | 3/3 | 2/3 | 3/3 |
3. 不存在的 npm run test:unit | 0/3 | 1/3 | 3/3 |
4. 缺失的 scripts/deploy.sh | 0/3 | 0/3 | 3/3 |
| 5. 制表符与 2 个空格的要求冲突 | 3/3 | 2/3 | 3/3 |
6. 缺失的 @docs/architecture.md | 1/3 | 1/3 | 3/3 |
7. <thinking> 标签 | 2/3 | 2/3 | 3/3 |
| 8. “作为一个大型语言模型……” | 3/3 | 3/3 | 3/3 |
| 9. 已停用的模型 ID | 3/3 | 3/3 | 3/3 |
| 每次找出的问题数 | 5, 7, 6 | 3, 5, 8 | 9, 9, 9 |
| 对照被列为问题的次数 | 3(每次都有 ultrathink) | 4(每次都有 ultrathink;另有一次 npm test) | 0 |
Haiku 5.5 的报告,做到了此前 Opus 和 Sonnet 做到的事。每次它都会读取 package.json,核实其中没有 test:unit,也会指出 AGENTS.md 已经要求使用 npm test。它检查了 scripts/ 和 docs/,确认这两个目录不存在;有意保留 ultrathink,理由是代理会识别这个思考关键词并据此行动,原文是 “a thinking keyword the agent acts on”。面对制表符与空格的矛盾,它会标出问题交给用户决定,不擅自选一边。
其中一次运行还以较低置信度提出:给审阅子代理的一行任务说明可能太简略。这不属于我们设置的对照,因此既没有计为找出的问题,也没有计为对照误报。
同一天重跑的 Haiku 4.5,比 10 月 4 日表现更差,也更不稳定。第一次只找出三个问题。三次中有两次建议把 AGENTS.md 改成要求使用制表符,尽管两份源代码文件明明都用两个空格缩进,与此前犯的错误一样。第三次更把 npm test 标成不存在的命令,但 package.json 实际定义了 test。这次它也再次把 ultrathink 列为问题,建议换成 API 参数。
| 模型,10 月 7 日 | 每次平均费用 | 费用范围 | 平均耗时 | 每次调用次数 | 每次输出 token,其中的思考 token |
|---|---|---|---|---|---|
| Haiku 4.5 | $0.22 | $0.18–$0.25 | 69 秒 | 11–14 | 4,071–7,432,其中 1,925–3,840 |
| Haiku 5.5 | $0.04 | $0.03–$0.06 | 96 秒 | 5–7 | 15,510–24,489,其中 11,088–18,717 |
Haiku 5.5 的调用次数更少,输出 token 却是旧模型的三到五倍,其中大部分用于思考,总耗时也更长。尽管如此,平均每次仍便宜 83%。
其中一次运行还直接展示了 100K 门槛的影响:第七次调用的提示词达到 101,092 token,这次运行最终花费 $0.057,另两次则分别为 $0.027 和 $0.033。如果全程按标价算,它本应只花 $0.035;就因为这一次调用超过 100K,费用增加了 $0.022。那次调用还输出了 8,201 token,也按每百万 token $2.50 计价,而非 $0.50。
实际使用,怎么选
- 按提示词大小给 Haiku 5.5 做预算。主会话、探索型子代理、审查代理,只要需要读代码仓库,就先按 100K 以上那档价算:每百万 token 输入 $0.50、输出 $2.50、缓存读取 $0.05。只有验证过请求始终不超过 100K,才按标价估算。我们只涉及四份指令文件的审计,三次里也有一次超过 100K。
- 确认环境中的
haiku指向哪个模型。在 Anthropic API 上,除非自行覆盖别名,从 2.1.293 开始,使用model: haiku或CLAUDE_CODE_SUBAGENT_MODEL=haiku的子代理都已改用 Haiku 5.5。先按前面的方法测量几份会话记录,再估算能省多少。 - 比较费用前,重新数一遍 token。我们的样本中,同样的输入文字会多占 28% 到 40% 的 token。从 Haiku 4.5 沿用过来的文档或上下文预算,都应重新计数。输出和思考则要单独看:同一个审计任务,Haiku 5.5 的输出 token 是 Haiku 4.5 的三到五倍。
- Haiku 5.5 的费用可以看 Claude Code 的报告。它会逐次调用选择正确的价目表。与 Anthropic Console 对账时,要记住 Console 才是实际账单,Claude Code 显示的是按官方标价算出的费用。
- 提示词审计可以选 Haiku 5.5。本次每轮都找出全部九个问题,平均费用为 $0.04。我们在 10 月 4 日建议审计时切到 Opus 或 Sonnet,那是针对 Haiku 4.5;在这个测试样本仓库上,Haiku 5.5 已不需要这样做。
这些结论,有哪些限制
流量只来自一台机器。12,901 次调用大多来自长时间自主运行的会话。如果开发者每隔一小时就开一个新会话,提示词自然会小得多。子代理的数据相对更有参考价值,但同样只来自这一台机器。
会话几乎全部跑在 Opus 和 Fable 上。我们只把 token 数换算到 Haiku 价目表,没有真的用 Haiku 5.5 跑这些会话。超过一半的调用也放不进 Haiku 4.5 的 200K 窗口。换个模型,完成相同任务所需的轮次可能更多,也可能更少。1M 窗口默认在大约 967K token 时才自动压缩上下文,靠这个机制无法让请求一直留在低价档。
分词器只测了三份样本。代码、文档和填充文本各一份,测量经过 Claude Code 的提示词包装,没有使用 token 计数接口。token 变多的方向是清楚的,具体百分比只是近似值,也不能据此判断输出 token 会怎样变化。
质量只在一个小型测试样本仓库上测过。四份指令文件、九个埋入的问题、每个模型三次运行。Haiku 5.5 每次找出九个问题,说明不了它更广泛的代理编程能力。Anthropic 公布的基准测试表现,是他们的说法,不是我们验证过的结果。
费用采用 Claude Code 报告的官方标价。我们的运行使用 Max 订阅,claude -p 会计入套餐用量上限。两档价格分别怎样消耗订阅额度,这次没有测。API 用户应查看 Console 账单。
相关阅读
- Claude Code 的
/doctor prompt-audit实测:九个埋入的问题,能找出几个——测试样本仓库、评分规则,以及本次重跑所参照的 Opus 和 Sonnet 结果。 - Opus 5.5 用于代理,便宜的是 35%,不只是 20%——缓存为何占据绝大部分 token,以及按消息 ID 去重时容易踩的坑。
- Claude 模型档位与推理投入——Haiku 5.5 现在支持的
effort档位,具体控制什么。 - 把文件读取交给子代理,何时才划算——此前以 Haiku 4.5 为执行模型的测量;新价格会改变当时的计算结果。
来源
- Anthropic:Claude Haiku 5.5 发布公告,2026 年 10 月 7 日。公告称,平均运行费用降低约 75%;提示词不超过 100,000 token 时,比 Claude Haiku 4.5 便宜 90%,超过时便宜 50%。原文:“On average, it now costs around 75% less to run.” 以及 “priced 90% lower than Claude Haiku 4.5 for requests up to 100,000 tokens, and 50% lower for requests over 100,000 tokens.”
- Anthropic:定价。列出 Haiku 5.5 两档价格,以及 Haiku 4.5、Opus 5.5 和 Sonnet 5.5 的单价;明确说明 Claude Haiku 5.5 按提示词大小计价。
- Anthropic:Claude Haiku 5.5 概览。按提示词大小列出的各项价格、1M 上下文、128K 输出,以及默认推理投入档位
medium。 - Anthropic:Claude Haiku 5.5 有哪些变化。同样的输入文字,新模型会多产生约 30% 的 token,具体增幅取决于内容。原文:“The same input text produces approximately 30% more tokens on Claude Haiku 5.5 than on Claude Haiku 4.5. The exact increase depends on the content.” 文档还说明,自适应思考默认开启。
- Anthropic:Claude Platform 发布说明,2026 年 10 月 7 日。Haiku 5.5 发布;Sonnet 5.5 的缓存读取价格从每百万 token $0.20 降到 $0.10。
- Anthropic:Claude Code 模型配置。各平台的别名表、
ANTHROPIC_DEFAULT_HAIKU_MODEL、使用 Haiku 5.5 须采用 v2.1.293 或更新版本的要求,以及模型设置为haiku时,保存在 Haiku 4.5 上的会话会用 Haiku 5.5 恢复的规则。文档也明确写出:提示词超过 100K token 后,Haiku 5.5 每 token 的费用更高。 - Anthropic:Claude Code 更新日志,2.1.293。加入 Claude Haiku 5.5(
claude-haiku-5-5),作为 Anthropic API 的默认 Haiku 模型;支持 1M 上下文,每百万 token 输入/输出为 $0.10/$0.50,提示词超过 100K 时为 $0.50/$2.50。 - Anthropic:管理费用。Claude Code 在本地按 token 数和官方标价计算费用;合同价可通过
modelPricing设置。 - Anthropic:子代理。子代理元数据中的
model: haiku,以及CLAUDE_CODE_SUBAGENT_MODEL。 - Claude Developers 在 X 上的文章:在 Claude Code 中使用 Haiku 5.5,2026 年 10 月 7 日。推荐把它作为子代理,与 Opus 5.5 或 Sonnet 5.5 配合,原文:“It pairs well with Opus 5.5 or Sonnet 5.5 as a subagent.”
- Hacker News:Claude Haiku 5.5,2026 年 10 月 7 日。截至太平洋时间 10 月 7 日晚,帖子有 654 分、328 条评论。
- npm:@anthropic-ai/claude-code。2.1.293 于 2026 年 10 月 7 日 17:18 UTC 发布。
我们自己的测量均于 2026 年 10 月 7 日在 macOS 上完成,使用 Claude Code 2.1.293。会话扫描覆盖 7 月 10 日到 10 月 7 日的 208 份会话记录,按 message.id 去重并剔除 32 条合成错误记录后,得到 12,901 条不同的助手消息。
价格和别名通过五次 claude -p 运行核对。分词器样本另用六次 claude -p 运行测量。
审计使用 10 月 4 日的测试样本仓库,按原文的规则评分。claude-haiku-5-5 与 claude-haiku-4-5-20251001 各跑三次,共六次,使用的命令是:claude -p "/doctor prompt-audit ."
所有运行都使用干净环境,启用 --strict-mcp-config,并禁用两个无关插件。
FAQ
Claude Haiku 5.5 真的比 Haiku 4.5 便宜 90% 吗?
按每 token 单价比较,是的,但前提是请求的提示词不超过 100,000 token。超过 100K 后,各项单价都涨到标价的五倍,相当于 Haiku 4.5 的一半。这台机器的 12,901 次真实 Claude Code 调用中,94.8% 的输入侧 token 在门槛之上。把记录中的 token 数套入 Haiku 5.5 两档价目表,费用为 $395.80;按 Haiku 4.5 算则为 $833.14,便宜 52.5%,没有达到 90%。这是费用换算,会话实际跑在 Opus 和 Fable 上。同样的文字,Haiku 5.5 还会产生更多 token:Anthropic 说大约多 30%,我们的样本是 28% 到 40%。若统一按多 30% 折算,这批流量的节省幅度会降到 38.2%。
哪些 token 要计入 Haiku 5.5 的 100,000 token 门槛?
整个提示词都算,包括从缓存读取的 token。Anthropic 的价目表为缓存读取和缓存写入分别列出了 100K 以上那档价。我们的一次审计运行中,第七次调用只有 2 个未缓存输入 token,加上 1,426 个缓存写入和 99,664 个缓存读取 token,总计 101,092。Claude Code 2.1.293 按高价档计算了费用。另一次 220,461 token 的请求也一样:费用为 $0.208,与高价档吻合;按标价算则为 $0.042。最终费用以 Anthropic Console 账单为准。
Claude Code 能算对 Haiku 5.5 的两档费用吗?
能,从 Claude Code 2.1.293 开始就已支持。Haiku 5.5 的更新日志条目列出了两档价格。实测中,claude -p --output-format json 对 220,461 token 的提示词报出的费用,与 100K 以上那档价算出的结果完全一致;对 21,416 token 的提示词,也正确使用了标价。Claude Code 在本地按官方标价计算,如果使用合同价,仍需配置 modelPricing。
Claude Code 的 haiku 别名现在指向 Haiku 5.5 吗?
在 Anthropic API 上,从 2.1.293 开始是这样,除非通过 ANTHROPIC_DEFAULT_HAIKU_MODEL 覆盖。我们执行 claude -p --model haiku 后,用量明细列出的模型是 claude-haiku-5-5。受影响的包括 /model haiku、配置为 model: haiku 的子代理,以及把 CLAUDE_CODE_SUBAGENT_MODEL 设为 haiku 的情况。Anthropic 文档还说明,模型设置为 haiku 时,此前保存在 Haiku 4.5 上的会话会用 Haiku 5.5 恢复。在 Bedrock、Google Cloud 和 Microsoft Foundry 上,别名仍指向 Haiku 4.5。要在 Anthropic API 上继续使用旧模型,固定完整 ID claude-haiku-4-5-20251001 即可。
Haiku 5.5 能做好 Claude Code 的提示词审计吗?
在我们的测试样本仓库上可以。Haiku 5.5 三次都找出了埋入的九个问题,六条对照没有一条被列为问题。找出九个问题这一点,与 Opus 5.5 和 Sonnet 5.5 在 10 月 4 日的结果一致;对照零误报则与 Opus 一致,Sonnet 当时列出过一条。同一天、同一 Claude Code 版本重跑的 Haiku 4.5 分别只找出三个、五个和八个。Haiku 5.5 平均每次 $0.04、96 秒;Haiku 4.5 平均每次 $0.22、69 秒。Haiku 5.5 有一次在第七次调用时超过 100K,那次费用约为另两次的两倍。
Haiku 5.5 的分词器会多产生多少 token?
Anthropic 说,同样的文字,比 Haiku 4.5 大约多 30%,具体取决于内容。我们通过 Claude Code 测了三份样本:三份源代码文件多 28%,一页 16,000 词的文档多 40%,一份重复填充文本多 64%。这些额外的 token 也会让提示词更早碰到 100K 门槛。
这篇对你有帮助吗?