← 返回全部文章
Analysis · 2026年10月7日 · 10 分钟阅读

Haiku 5.5 便宜九成只到 100K token:我们 95% 的 Claude Code 流量超过了这条线

把 Claude Code 实际产生的 token 数套进 Haiku 5.5 的两档价目表,费用约为 Haiku 4.5 的一半:77.9% 的调用、94.8% 的输入侧 token 都在 100K 门槛之上,各项单价是标价的五倍。子代理也有一半调用超过 100K。不过,新模型在提示词审计中表现更好:三次都找出了埋入的九个问题,没有把对照列为问题。Haiku 4.5 在 10 月 4 日的测试中,每次都漏掉了无法执行的命令。

30 秒看懂结论

10 月 7 日,Anthropic 发布了 Claude Haiku 5.5。输入每百万 token $0.10,输出每百万 token $0.50,是 Haiku 4.5 的十分之一。不过,这个标价有条件:一次请求的提示词不能超过 100,000 token。一旦超过 100K,输入就变成 $0.50,输出变成 $2.50,缓存读取和缓存写入也都涨到标价的五倍。Anthropic 自己给出的说法是:100K 以下便宜 90%,以上便宜 50%,平均便宜约 75%。

做实际任务的代理,有多少调用能留在 100K 以下?我们取出一台机器上 7 月 10 日到 10 月 7 日的全部 Claude Code 会话记录,共 208 份、12,901 次去重后的调用,逐次计算了提示词大小。

  • 77.9% 的调用超过 100K。全部调用的提示词中位数是 209,571 token。主会话的中位数为 286,661,90.2% 的调用超过 100K;子代理的中位数也到了 101,891,有一半调用在门槛之上。
  • 94.8% 的输入侧 token 落在高价档。按 Haiku 5.5 的两档价目表换算,这批 token 的费用是 $395.80;按 Haiku 4.5 算则是 $833.14,便宜 52.5%。若每次调用都能用标价,费用只需 $83.31。超过 100K 的调用占了 Haiku 5.5 换算费用的 98.7%。这些都是费用测算:会话实际跑在 Opus 和 Fable 上,而且超过一半的调用,提示词已经大到放不进 Haiku 4.5 的 200K 上下文窗口。
  • 同一段文字,新模型会分出更多 token。Anthropic 说大约多 30%;我们测得,三份源代码文件多了 28%,一页文档多了 40%。如果统一按多 30% 折算,这批流量的费用节省就只剩 38.2%。
  • Claude Code 2.1.293 已支持两档计价和新别名。实测费用与 100K 以上那档价算出的结果完全一致。在 Anthropic API 上,除非自行覆盖,haiku 别名现在指向 Haiku 5.5。这会让 /model haiku、使用 model: haiku 的子代理,以及模型设置为 haiku、此前保存在 Haiku 4.5 上的会话,都转到新模型。
  • 审计测试中,新模型表现更好。我们拿 10 月 4 日发布的测试样本仓库,重新跑了提示词审计(/doctor prompt-audit)。Haiku 5.5 三次都找出了埋入的九个问题,没有把任何对照列为问题,平均每次 $0.04。同一天重跑的 Haiku 4.5 分别找出三个、五个和八个,平均每次 $0.22。

结论:凡是要读代码仓库的工作,先按 Haiku 5.5 的 100K 以上那档价做预算。只有确认每次请求都不超过 100K,才适合按标价算;我们这个只涉及四份指令文件的审计,也有一次超过 100K。在本批记录中,曾经超过 100K 的子代理,首次超过的时点中位数是第 13 或第 14 次调用。对于审计这类能保持短小、需要反复执行的任务,Haiku 5.5 既更便宜,表现也明显强于 Haiku 4.5。

10 月 7 日:Haiku 5.5 改了什么

Haiku 5.5(claude-haiku-5-5)支持 1M token 上下文窗口和 128K token 输出。它默认开启自适应思考,effort 档位与 Opus 5.5、Sonnet 5.5 相同,分词器则沿用从 Opus 4.7 开始使用的新版。价格按提示词大小分成两档,下表单价均以每百万 token 为单位:

计费项目提示词不超过 100,000 token提示词超过 100,000 tokenHaiku 4.5
输入$0.10$0.50$1.00
输出$0.50$2.50$5.00
5 分钟缓存写入$0.125$0.625$1.25
1 小时缓存写入$0.20$1.00$2.00
缓存读取$0.01$0.05$0.10

其他现役模型没有这样的计价门槛。Opus 5.5、Sonnet 5.5 和 Fable 系列在整个 1M 上下文窗口内,都使用同一组每 token 单价。文档还提醒,同样的文字,Haiku 5.5 会比 Haiku 4.5 多产生约 30% 的 token,具体增幅取决于内容。原文分别是 “approximately 30% more tokens” 和 “the exact increase depends on the content”。

同日发布的 Claude Code 2.1.293 加入了这个模型,也在更新日志里列明两档价格。在 Anthropic API 上,只要没有通过 ANTHROPIC_DEFAULT_HAIKU_MODEL 覆盖,haiku 别名就会指向它。Anthropic 的开发者账号还推荐把它作为子代理,与 Opus 5.5 或 Sonnet 5.5 配合使用,原文是 “pairs well with Opus 5.5 or Sonnet 5.5 as a subagent”。同一天的平台发布说明还将 Sonnet 5.5 的缓存读取价格从每百万 token $0.20 降到 $0.10,后文比较采用的是新价格。

Hacker News 的发布讨论里,争论的正是这个门槛对代理任务的影响。一位评论者认为,100K 对代理来说低得离谱,原文是 “an absurdly low cutoff”;另一位则认为这是凭感觉抱怨,因为 Anthropic 已经明说,超过 100K 仍然便宜 50%。单看价格计算,两边并不矛盾。真正缺的是一次测量:实际流量到底落在哪一档?

真实调用中,100K 门槛有多低?

方法:扫描一台 macOS 机器上 ~/.claude/projects/ 目录内、2026 年 7 月 10 日到 10 月 7 日写入的全部 Claude Code 会话记录。剔除 32 条不含 token 的合成错误记录后,有 26 份主会话记录和 182 份子代理记录至少包含一次调用。

每个助手轮次都有一个 usage 对象,记录未缓存输入、缓存写入、缓存读取和输出的 token 数。我们按 message.id 去重,每个消息只取一条记录。Claude Code 会把同一条助手消息写入多次,直接累加全部记录会重复计数,这是我们在九月统计时踩过的坑。一次调用的提示词大小,定义为该次调用的未缓存输入、缓存写入和缓存读取之和。这就是 Anthropic 价目表中的提示词口径:缓存 token 必须计入门槛,缓存读写各自的高价档才有意义。后文的审计实测也确认了这一点:一次调用正是算上缓存读取后超过 100K,随后按高价档计费。

除 16 次调用外,其余都跑在 Opus 5、Opus 5.5、Opus 4.8、Fable 5 或 Fable 5.1 上。这些模型与 Haiku 5.5 使用同一代新分词器,因此可以沿用它们的 token 计数来换算。会话做的都是真实工作,包括写作、研究、运维和本站评测框架的运行,多数持续时间长,也不需要人逐步操作。不过,一台机器的流量不代表更广的样本;它只能证明,确实存在这样一种流量形态。

会话记录调用次数提示词中位数超过 100K 的调用占比超过 100K 的输入侧 token 占比
全部(208)12,901209,57177.9%94.8%
主会话(26)8,871286,66190.2%97.9%
子代理(182)4,030101,89150.7%74.5%

把全部调用按提示词大小分组,100K 及以下占 22.1%,100K 到 200K 占 25.8%,200K 到 500K 占 37.3%,500K 以上占 14.8%。最大的提示词有 987,697 token。子代理的提示词相对小一些:100K 及以下占 49.3%,100K 到 200K 占 39.0%,200K 到 500K 占 11.6%,约每一千次调用中有一次超过 500K。即便如此,仍有一半在 100K 门槛之上。

会超过 100K 的会话,往往很早就超过了。26 份主会话记录中,18 份曾超过 100K。这些会话首次超过门槛的时点,中位数是第 10 或第 11 次调用,第一、第三四分位数分别是第 6 次和第 24 次;始终没有超过的 8 份记录都很短。182 份子代理记录中,有 82 份曾超过 100K,首次超过的时点中位数是第 13 或第 14 次调用,其中四分之三到第 19 次调用时就已超过。Anthropic 推荐把这个模型用作子代理,而在这批记录里,子代理调用次数的中位数只有 11 次:运行稍长一些,就可能很快用上高价档。

输入侧 token 的构成与我们九月报告的一致:未缓存输入占 0.018%,缓存写入占 6.6%,缓存读取占 93.4%。100K 门槛之所以影响这么大,原因就在这里。大量使用缓存的提示词,绝大部分 token 都是缓存读取;这一项在门槛之下是 $0.01,在门槛之上则是 $0.05。

超过 100K,还能便宜多少?

我们把同样的 12,901 次调用分别套入各模型的价目表。1 小时缓存写入按 1 小时价格算,5 分钟缓存写入按 5 分钟价格算:

价目表同一批 token 的换算费用相比 Haiku 4.5
Haiku 4.5$833.14—
Haiku 5.5,假设所有调用都按标价$83.31−90.0%
Haiku 5.5,按实际两档价目表$395.80−52.5%
Sonnet 5.5,采用 10 月 7 日的缓存价格$1,339.14+61%
Opus 5.5$2,678.27+221%

$395.80 中有 $390.61 来自超过 100K 的调用,占 98.7%。按两档价目表算出的费用,是全部按标价计算的 4.75 倍。如果分开看,主会话比 Haiku 4.5 便宜 51.4%,子代理便宜 63.5%。

这个比较有两个限制。第一,会话实际跑在 Opus 和 Fable 上。我们只是把记录里的 token 数换算到 Haiku 价目表,没有把这些会话真的放到 Haiku 上运行。换个模型做同样的事,可能需要更多轮,也可能更少。第二,52.1% 的调用超过 200K,已经超出 Haiku 4.5 的上下文上限。因此,Haiku 4.5 那一列只是按其价目表算出的费用,并不是这个模型实际能够产生的账单。

Haiku 5.5 依然比这些会话实际使用的模型便宜得多。同样一批 token,它的费用大约只有 Opus 5.5 的七分之一。100K 门槛并没有让 Haiku 变贵;它影响的是“比 Haiku 4.5 便宜多少”。只有短提示词能拿到宣传中的九成降幅。对于这批代理流量,节省幅度更接近 Anthropic 所说的长提示词便宜 50%,而不是标价对应的 90%。

还要把分词器的差异算进去。上面的 token 数来自已经使用新分词器的模型,也就是 Haiku 5.5 会看到的计数。同样的文字,Haiku 4.5 会分出更少的 token。若统一采用 Anthropic 所说的 30% 增幅,将 Haiku 4.5 一侧的 token 数相应折算,费用会降到约 $640.88。这时,Haiku 5.5 对这批流量的节省就只有 38.2%。如果采用我们在非自然填充文本上测得的 64.3% 增幅,节省约为 22%。两份真实内容样本的增幅都低于填充文本,但任何一份都不足以代表整个语料的 token 增幅。

同一段文字,token 变多了

我们通过 claude -p 把同一份文档分别交给两个模型,比较提示词的 token 总数。为了尽量只计入文档本身,先让两个模型各处理一条单行请求,再从文档请求的总数中减去这个基线。单行请求在 Haiku 5.5 上占 21,416 token,在 Haiku 4.5 上占 22,263 token,几乎全部来自 Claude Code 的系统提示词和工具定义。各次运行的提示词包装会相差几百个 token,所以下面的百分比都是近似值。

样本Haiku 4.5 token 数Haiku 5.5 token 数变化
三份源代码文件,16 KB(Python 和 Astro)5,9257,593+28%
一页文档,16,151 个词的 Markdown 文字30,59242,760+40%
用 30 个词反复拼成的填充文本,共 100,028 个词121,151199,045+64%

代码样本的增幅接近 Anthropic 给出的数字,文档更高,填充文本则高得多。这也说明,增幅取决于内容;高度重复的填充文本不能拿来做公平的比较。实际使用时要留意两件事:原本在 Haiku 4.5 上只有 80K token 的提示词,换成 Haiku 5.5 后可能就超过 100K;比较同一份文字的费用时,只看每 token 单价,会高估省下的钱。

Claude Code 算价没错,haiku 已换新模型

我们在 Claude Code 2.1.293 上做了两项验证。以下命令会返回 total_cost_usd 和各模型的用量明细:claude -p --output-format json

费用计算已经支持两档价格。先用 claude-haiku-5-5 处理一条单行请求,得到 21,416 token 的提示词,其中 10,933 token 写入一小时缓存,10,481 token 从缓存读取。报告费用为 $0.00229,与按标价算出的金额完全一致。

再发送带有填充文档的请求,提示词达到 220,461 token:缓存写入 207,350、缓存读取 13,109、未缓存输入 2。报告费用为 $0.20801,恰好等于 100K 以上那档价算出的结果;如果按标价算,只会得到 $0.04160。

后文的审计实测更能说明,哪些 token 要计入 100K 门槛。那次运行的第七次调用,未缓存输入只有 2 token,缓存写入 1,426,缓存读取 99,664,合计 101,092。Claude Code 按 100K 以上那档价计算了费用,与官方价目表为缓存读取单独列出的高价档一致。两档价确实适用于缓存里的 token。

Claude Code 在本地根据 token 数和官方标价计算费用。因此,/usage 区块和状态栏都能正确显示 Haiku 5.5 的官方标价费用。如果你的组织有合同价,仍需按文档配置 modelPricing。最终应以 Anthropic Console 账单为准。

别名已经指向新模型。执行 claude -p --model haiku 后,用量明细列出的模型是 claude-haiku-5-5。在 Anthropic API 上,未设置 ANTHROPIC_DEFAULT_HAIKU_MODEL 时,这正是文档写明的行为。影响范围也不只有 /model haiku:配置为 model: haiku 的子代理、内置的 claude-code-guide 代理,以及所有通过 CLAUDE_CODE_SUBAGENT_MODEL=haiku 指定模型的代理,现在都会使用 Haiku 5.5。

模型配置文档还说明,如果模型设置为 haiku,恢复此前保存在 Haiku 模型上的会话时,会使用 haiku 当前指向的模型。其他平台的情况不同:在 Bedrock、Google Cloud 和 Foundry 上,别名仍指向 Haiku 4.5。要在 Anthropic API 上继续使用旧模型,应固定完整模型 ID:claude-haiku-4-5-20251001。

重跑审计:Haiku 5.5 九个全找出

10 月 4 日,我们曾在一个小型测试样本仓库里测试提示词审计。仓库中埋入了九个问题,另保留六条正确指令作为对照。当时,Opus 5.5 和 Sonnet 5.5 每次都找出了全部九个问题。Opus 没有把对照列为问题,Sonnet 列出过一条,置信度较低。Haiku 4.5 则分别找出五个、七个和六个问题:不存在的 npm 脚本和缺失的部署脚本,每次都漏掉;文档明确支持的 ultrathink 关键词,每次都被列为问题。

10 月 7 日,我们拿同一个测试样本仓库重跑。claude-haiku-5-5 和 claude-haiku-4-5-20251001 各跑三次,均使用 Claude Code 2.1.293,评测框架和评分规则也完全相同。

埋入的问题Haiku 4.5,10 月 4 日Haiku 4.5,10 月 7 日Haiku 5.5,10 月 7 日
1. 要求“逐步思考”3/32/33/3
2. 用全大写文字施压3/32/33/3
3. 不存在的 npm run test:unit0/31/33/3
4. 缺失的 scripts/deploy.sh0/30/33/3
5. 制表符与 2 个空格的要求冲突3/32/33/3
6. 缺失的 @docs/architecture.md1/31/33/3
7. <thinking> 标签2/32/33/3
8. “作为一个大型语言模型……”3/33/33/3
9. 已停用的模型 ID3/33/33/3
每次找出的问题数5, 7, 63, 5, 89, 9, 9
对照被列为问题的次数3(每次都有 ultrathink)4(每次都有 ultrathink;另有一次 npm test)0

Haiku 5.5 的报告,做到了此前 Opus 和 Sonnet 做到的事。每次它都会读取 package.json,核实其中没有 test:unit,也会指出 AGENTS.md 已经要求使用 npm test。它检查了 scripts/ 和 docs/,确认这两个目录不存在;有意保留 ultrathink,理由是代理会识别这个思考关键词并据此行动,原文是 “a thinking keyword the agent acts on”。面对制表符与空格的矛盾,它会标出问题交给用户决定,不擅自选一边。

其中一次运行还以较低置信度提出:给审阅子代理的一行任务说明可能太简略。这不属于我们设置的对照,因此既没有计为找出的问题,也没有计为对照误报。

同一天重跑的 Haiku 4.5,比 10 月 4 日表现更差,也更不稳定。第一次只找出三个问题。三次中有两次建议把 AGENTS.md 改成要求使用制表符,尽管两份源代码文件明明都用两个空格缩进,与此前犯的错误一样。第三次更把 npm test 标成不存在的命令,但 package.json 实际定义了 test。这次它也再次把 ultrathink 列为问题,建议换成 API 参数。

模型,10 月 7 日每次平均费用费用范围平均耗时每次调用次数每次输出 token,其中的思考 token
Haiku 4.5$0.22$0.18–$0.2569 秒11–144,071–7,432,其中 1,925–3,840
Haiku 5.5$0.04$0.03–$0.0696 秒5–715,510–24,489,其中 11,088–18,717

Haiku 5.5 的调用次数更少,输出 token 却是旧模型的三到五倍,其中大部分用于思考,总耗时也更长。尽管如此,平均每次仍便宜 83%。

其中一次运行还直接展示了 100K 门槛的影响:第七次调用的提示词达到 101,092 token,这次运行最终花费 $0.057,另两次则分别为 $0.027 和 $0.033。如果全程按标价算,它本应只花 $0.035;就因为这一次调用超过 100K,费用增加了 $0.022。那次调用还输出了 8,201 token,也按每百万 token $2.50 计价,而非 $0.50。

实际使用,怎么选

  1. 按提示词大小给 Haiku 5.5 做预算。主会话、探索型子代理、审查代理,只要需要读代码仓库,就先按 100K 以上那档价算:每百万 token 输入 $0.50、输出 $2.50、缓存读取 $0.05。只有验证过请求始终不超过 100K,才按标价估算。我们只涉及四份指令文件的审计,三次里也有一次超过 100K。
  2. 确认环境中的 haiku 指向哪个模型。在 Anthropic API 上,除非自行覆盖别名,从 2.1.293 开始,使用 model: haiku 或 CLAUDE_CODE_SUBAGENT_MODEL=haiku 的子代理都已改用 Haiku 5.5。先按前面的方法测量几份会话记录,再估算能省多少。
  3. 比较费用前,重新数一遍 token。我们的样本中,同样的输入文字会多占 28% 到 40% 的 token。从 Haiku 4.5 沿用过来的文档或上下文预算,都应重新计数。输出和思考则要单独看:同一个审计任务,Haiku 5.5 的输出 token 是 Haiku 4.5 的三到五倍。
  4. Haiku 5.5 的费用可以看 Claude Code 的报告。它会逐次调用选择正确的价目表。与 Anthropic Console 对账时,要记住 Console 才是实际账单,Claude Code 显示的是按官方标价算出的费用。
  5. 提示词审计可以选 Haiku 5.5。本次每轮都找出全部九个问题,平均费用为 $0.04。我们在 10 月 4 日建议审计时切到 Opus 或 Sonnet,那是针对 Haiku 4.5;在这个测试样本仓库上,Haiku 5.5 已不需要这样做。

这些结论,有哪些限制

流量只来自一台机器。12,901 次调用大多来自长时间自主运行的会话。如果开发者每隔一小时就开一个新会话,提示词自然会小得多。子代理的数据相对更有参考价值,但同样只来自这一台机器。

会话几乎全部跑在 Opus 和 Fable 上。我们只把 token 数换算到 Haiku 价目表,没有真的用 Haiku 5.5 跑这些会话。超过一半的调用也放不进 Haiku 4.5 的 200K 窗口。换个模型,完成相同任务所需的轮次可能更多,也可能更少。1M 窗口默认在大约 967K token 时才自动压缩上下文,靠这个机制无法让请求一直留在低价档。

分词器只测了三份样本。代码、文档和填充文本各一份,测量经过 Claude Code 的提示词包装,没有使用 token 计数接口。token 变多的方向是清楚的,具体百分比只是近似值,也不能据此判断输出 token 会怎样变化。

质量只在一个小型测试样本仓库上测过。四份指令文件、九个埋入的问题、每个模型三次运行。Haiku 5.5 每次找出九个问题,说明不了它更广泛的代理编程能力。Anthropic 公布的基准测试表现,是他们的说法,不是我们验证过的结果。

费用采用 Claude Code 报告的官方标价。我们的运行使用 Max 订阅,claude -p 会计入套餐用量上限。两档价格分别怎样消耗订阅额度,这次没有测。API 用户应查看 Console 账单。

相关阅读

来源

  1. Anthropic:Claude Haiku 5.5 发布公告,2026 年 10 月 7 日。公告称,平均运行费用降低约 75%;提示词不超过 100,000 token 时,比 Claude Haiku 4.5 便宜 90%,超过时便宜 50%。原文:“On average, it now costs around 75% less to run.” 以及 “priced 90% lower than Claude Haiku 4.5 for requests up to 100,000 tokens, and 50% lower for requests over 100,000 tokens.”
  2. Anthropic:定价。列出 Haiku 5.5 两档价格,以及 Haiku 4.5、Opus 5.5 和 Sonnet 5.5 的单价;明确说明 Claude Haiku 5.5 按提示词大小计价。
  3. Anthropic:Claude Haiku 5.5 概览。按提示词大小列出的各项价格、1M 上下文、128K 输出,以及默认推理投入档位 medium。
  4. Anthropic:Claude Haiku 5.5 有哪些变化。同样的输入文字,新模型会多产生约 30% 的 token,具体增幅取决于内容。原文:“The same input text produces approximately 30% more tokens on Claude Haiku 5.5 than on Claude Haiku 4.5. The exact increase depends on the content.” 文档还说明,自适应思考默认开启。
  5. Anthropic:Claude Platform 发布说明,2026 年 10 月 7 日。Haiku 5.5 发布;Sonnet 5.5 的缓存读取价格从每百万 token $0.20 降到 $0.10。
  6. Anthropic:Claude Code 模型配置。各平台的别名表、ANTHROPIC_DEFAULT_HAIKU_MODEL、使用 Haiku 5.5 须采用 v2.1.293 或更新版本的要求,以及模型设置为 haiku 时,保存在 Haiku 4.5 上的会话会用 Haiku 5.5 恢复的规则。文档也明确写出:提示词超过 100K token 后,Haiku 5.5 每 token 的费用更高。
  7. Anthropic:Claude Code 更新日志,2.1.293。加入 Claude Haiku 5.5(claude-haiku-5-5),作为 Anthropic API 的默认 Haiku 模型;支持 1M 上下文,每百万 token 输入/输出为 $0.10/$0.50,提示词超过 100K 时为 $0.50/$2.50。
  8. Anthropic:管理费用。Claude Code 在本地按 token 数和官方标价计算费用;合同价可通过 modelPricing 设置。
  9. Anthropic:子代理。子代理元数据中的 model: haiku,以及 CLAUDE_CODE_SUBAGENT_MODEL。
  10. Claude Developers 在 X 上的文章:在 Claude Code 中使用 Haiku 5.5,2026 年 10 月 7 日。推荐把它作为子代理,与 Opus 5.5 或 Sonnet 5.5 配合,原文:“It pairs well with Opus 5.5 or Sonnet 5.5 as a subagent.”
  11. Hacker News:Claude Haiku 5.5,2026 年 10 月 7 日。截至太平洋时间 10 月 7 日晚,帖子有 654 分、328 条评论。
  12. npm:@anthropic-ai/claude-code。2.1.293 于 2026 年 10 月 7 日 17:18 UTC 发布。

我们自己的测量均于 2026 年 10 月 7 日在 macOS 上完成,使用 Claude Code 2.1.293。会话扫描覆盖 7 月 10 日到 10 月 7 日的 208 份会话记录,按 message.id 去重并剔除 32 条合成错误记录后,得到 12,901 条不同的助手消息。

价格和别名通过五次 claude -p 运行核对。分词器样本另用六次 claude -p 运行测量。

审计使用 10 月 4 日的测试样本仓库,按原文的规则评分。claude-haiku-5-5 与 claude-haiku-4-5-20251001 各跑三次,共六次,使用的命令是:claude -p "/doctor prompt-audit ."

所有运行都使用干净环境,启用 --strict-mcp-config,并禁用两个无关插件。

FAQ

Claude Haiku 5.5 真的比 Haiku 4.5 便宜 90% 吗?

按每 token 单价比较,是的,但前提是请求的提示词不超过 100,000 token。超过 100K 后,各项单价都涨到标价的五倍,相当于 Haiku 4.5 的一半。这台机器的 12,901 次真实 Claude Code 调用中,94.8% 的输入侧 token 在门槛之上。把记录中的 token 数套入 Haiku 5.5 两档价目表,费用为 $395.80;按 Haiku 4.5 算则为 $833.14,便宜 52.5%,没有达到 90%。这是费用换算,会话实际跑在 Opus 和 Fable 上。同样的文字,Haiku 5.5 还会产生更多 token:Anthropic 说大约多 30%,我们的样本是 28% 到 40%。若统一按多 30% 折算,这批流量的节省幅度会降到 38.2%。

哪些 token 要计入 Haiku 5.5 的 100,000 token 门槛?

整个提示词都算,包括从缓存读取的 token。Anthropic 的价目表为缓存读取和缓存写入分别列出了 100K 以上那档价。我们的一次审计运行中,第七次调用只有 2 个未缓存输入 token,加上 1,426 个缓存写入和 99,664 个缓存读取 token,总计 101,092。Claude Code 2.1.293 按高价档计算了费用。另一次 220,461 token 的请求也一样:费用为 $0.208,与高价档吻合;按标价算则为 $0.042。最终费用以 Anthropic Console 账单为准。

Claude Code 能算对 Haiku 5.5 的两档费用吗?

能,从 Claude Code 2.1.293 开始就已支持。Haiku 5.5 的更新日志条目列出了两档价格。实测中,claude -p --output-format json 对 220,461 token 的提示词报出的费用,与 100K 以上那档价算出的结果完全一致;对 21,416 token 的提示词,也正确使用了标价。Claude Code 在本地按官方标价计算,如果使用合同价,仍需配置 modelPricing。

Claude Code 的 haiku 别名现在指向 Haiku 5.5 吗?

在 Anthropic API 上,从 2.1.293 开始是这样,除非通过 ANTHROPIC_DEFAULT_HAIKU_MODEL 覆盖。我们执行 claude -p --model haiku 后,用量明细列出的模型是 claude-haiku-5-5。受影响的包括 /model haiku、配置为 model: haiku 的子代理,以及把 CLAUDE_CODE_SUBAGENT_MODEL 设为 haiku 的情况。Anthropic 文档还说明,模型设置为 haiku 时,此前保存在 Haiku 4.5 上的会话会用 Haiku 5.5 恢复。在 Bedrock、Google Cloud 和 Microsoft Foundry 上,别名仍指向 Haiku 4.5。要在 Anthropic API 上继续使用旧模型,固定完整 ID claude-haiku-4-5-20251001 即可。

Haiku 5.5 能做好 Claude Code 的提示词审计吗?

在我们的测试样本仓库上可以。Haiku 5.5 三次都找出了埋入的九个问题,六条对照没有一条被列为问题。找出九个问题这一点,与 Opus 5.5 和 Sonnet 5.5 在 10 月 4 日的结果一致;对照零误报则与 Opus 一致,Sonnet 当时列出过一条。同一天、同一 Claude Code 版本重跑的 Haiku 4.5 分别只找出三个、五个和八个。Haiku 5.5 平均每次 $0.04、96 秒;Haiku 4.5 平均每次 $0.22、69 秒。Haiku 5.5 有一次在第七次调用时超过 100K,那次费用约为另两次的两倍。

Haiku 5.5 的分词器会多产生多少 token?

Anthropic 说,同样的文字,比 Haiku 4.5 大约多 30%,具体取决于内容。我们通过 Claude Code 测了三份样本:三份源代码文件多 28%,一页 16,000 词的文档多 40%,一份重复填充文本多 64%。这些额外的 token 也会让提示词更早碰到 100K 门槛。

这篇对你有帮助吗?

相关阅读


文章独立产出 · 编辑政策

继续阅读 →