如果你的团队每天要跑成千上万次摘要、分类、检索结果整理或 Agent 子任务,Claude Haiku 5.5 的新价格值得认真看。Anthropic 给出的“平均运行成本低约 75%”有旧版请求结构作为背景,不能直接贴到每张账单上:价格按单次提示词长度分档,输出、缓存和人工返工也会改变最终成本。同一轮更新还降低了 Sonnet 5.5 的缓存读取价,并给符合条件的 Max、Team 用户提供按月刷新的 API 额度。本文把这三件事拆开算,最后给出一套小规模迁移试验。
先看清 Haiku 5.5 的两档价格
Anthropic 2026 年 10 月 7 日的公告列出以下每百万 token 美元价格。这里的“≤100K”与“>100K”指单次提示词长度所在档位,不是一个月累计用量。缓存写入价对应 5 分钟缓存;不同缓存策略需按实际账单核对。
| 模型与提示词档位 | 输入 | 输出 | 缓存读取 | 5 分钟缓存写入 |
|---|---|---|---|---|
| Haiku 5.5,≤100K | $0.10 | $0.50 | $0.01 | $0.125 |
| Haiku 5.5,>100K | $0.50 | $2.50 | $0.05 | $0.625 |
| Haiku 4.5 | $1.00 | $5.00 | $0.10 | $1.25 |
| Sonnet 5.5 | $2.00 | $10.00 | $0.10 | $2.50 |
下方的价格表对应这次发布。看图时请盯住 Haiku 5.5 一栏的斜杠:左边是短提示词档,右边是长提示词档。表格是发布时的价格快照,实际采购前仍应再看官方价格页与控制台。

发布时的价格表:Haiku 5.5 的每个价格格子都按提示词长度分成两档。
Anthropic 所说的“平均约省 75%”是总体判断,不是统一折扣。与 Haiku 4.5 相比,≤100K 提示词的输入、输出和缓存读取标价约低 90%,>100K 档约低 50%;官方还指出,旧版 Haiku 4.5 约 90% 的请求落在短提示词档。你的实际节省额仍取决于任务长度、输入输出比例、缓存命中与新 tokenizer 的计数。
举一个可核算的批量任务:100 次调用,每次输入 10,000 token、输出 2,000 token,全部落在短提示词档。总输入 100 万、总输出 20 万 token,按纯输入输出价计算,Haiku 5.5 为 $0.20;Haiku 4.5 为 $2.00;Sonnet 5.5 为 $4.00。这里只是固定计费 token 数量下的单价演算,不包括重试、工具调用、人工检查和其他平台费用。若单次提示词膨胀到 >100K,不能继续套用 $0.10/$0.50 这一档。
同一段文本,token 数也可能变
Haiku 5.5 迁移说明指出,新 tokenizer 对同一输入文本的计数通常比 Haiku 4.5 高约 30%,具体幅度因内容而异。因此上面 $0.20 对 $2.00 的例子是“相同 token 数”的标价比较,不是同一批文本的实测账单。把原有提示词重新用 claude-haiku-5-5 计数,检查是否跨过 100K 分档,再用新 usage 记录重算费用。旧版的 max_tokens 也要复核:相同长度的回答可能更早触及上限。
跑分能说明什么,不能说明什么
官方性能表把 Haiku 5.5、Haiku 4.5、Sonnet 5.5 和其他模型放在同一组测试里,覆盖知识工作、电脑操作、推理和 Agent 编码。它支持“Haiku 5.5 在多项任务上有明显提升”,但不等于“所有生产任务都可替换 Sonnet”。

官方基准表:先核对测试名称与测量条件,再对照你自己的任务样本。
effort 档位要和任务一起评估
Haiku 5.5 是 Haiku 系列中首个支持调节 effort 的模型。下面这张官方 OSWorld 成本曲线显示:提高 effort 可以抬高该项测试的分数,同时单次尝试成本也随之上涨。它适合帮你设计试验档位,不适合直接推断“开到 Max 一定比 Sonnet 更划算”;换成知识工作或编码任务,曲线就会变。

OSWorld 2.1 离线子集:每个点对应特定模型和 effort 档位,横轴为单次尝试成本。
试运行时可先用默认档位作为基线,再只对低通过率但值得挽救的任务提高 effort;同时记录返工率与延迟。这样才能知道增加推理预算是否真的换来更多合格结果。
成本曲线也展示了同一条边界:更便宜的试次可以换来不错的得分,但高难度任务未必达到 Sonnet 的结果。图上的点是特定基准、特定 effort 设置下的观测,不是你公司工单的成功率。

Terminal-Bench 4.0 曲线:横轴是单次尝试成本,纵轴是该基准的 pass@1;不能把它当成通用降本承诺。
更稳妥的路由规则是:固定格式提取、去重、标签分类、长文分段摘要等低风险高频任务先试 Haiku;跨文件改代码、要求严密推理的分析和高错误代价的决策保留 Sonnet 或更强模型。Haiku 5.5 支持 effort 调节,但 effort 越高是否划算,仍要用真实任务的成功率、token 与延迟一起测。
客户实测给了哪些线索?
Anthropic 发布页还附有几组客户报告,比单张综合跑分更接近落地任务,但都带着各自的样本和评测口径:
| 团队 | 官方披露的观察 | 你可以借鉴的试验 |
|---|---|---|
| Asana | 其内部评测中,Agent 单轮推理最快约为原用方案的 2.5 倍,任务延迟降低超过 30%。 | 比较完整任务耗时,而非只盯模型响应速度。 |
| HubSpot | 模拟 CRM 工作流的三次运行,平均得分 92.8%。 | 把字段更新、摘要和后续动作拆成可验收步骤。 |
| AlphaSense | 400 条查询评测中,Haiku 5.5 得分 0.84,Haiku 4.5 为 0.76。 | 对文档问答同时看证据引用和答复准确性。 |
| Box | 在其测试里,得分提高 11 个百分点,延迟约减半。 | 单独测自己的文档类型和权限场景。 |
这些数字是各家公司在特定工作流里的报告,不是跨行业通用承诺。你的任务集如果包含长上下文、工具重试或人工审阅,成本曲线可能完全不同。把客户案例当成设计测试集的线索即可,不要直接写进对客户的 SLA。
安全性也需要按任务验收。官方称 Haiku 5.5 的对齐能力较前代改善,但它不能代替权限限制、敏感信息处理和人工复核;给 Agent 开工具权限前,应先在低风险环境测试拒绝、误调用和数据边界。
Sonnet 5.5 降的是什么价
这次 Sonnet 5.5 变化的重点是缓存读取:每百万 token 从 $0.20 降到 $0.10,并非输入 $2、输出 $10 的统一降价。官方公告表示,这可让许多 Agent 任务的总成本降低约 20%;具体比例取决于缓存命中占比。
例如某工作流一个月读回 500 万缓存 token,其他用量不变:旧缓存价为 $1.00,新价为 $0.50,节省 $0.50。若几乎没有缓存命中,收益就接近零。要判断是否受益,导出计费记录,分别汇总 input_tokens、output_tokens、cache_read_input_tokens 和缓存写入,再按更新前后单价重算,不要只看总请求数。
“每月最高 $500”到底给谁
Anthropic 的月度 API 额度帮助文档把资格写得很具体。Max 5x 每月 $100,Max 20x 每月 $200;Team 标准席位每席 $20,Premium 席位每席 $100。Team 额度合并到组织,组织每月上限 $500。这不是每个人都领 $500,也不是所有 Claude 订阅都适用。Free、Pro、Enterprise 当前不在该活动范围;账户一般需符合至少 7 天的资格条件,额度按官方推出节奏发放。
| 场景 | 可用月度 API 额度 | 容易误解的地方 |
|---|---|---|
| Max 5x | $100 | 不是 Max 订阅自动变成 API 无限额 |
| Max 20x | $200 | 月末未用完不会结转 |
| Team 标准席位 | $20/席 | 额度进入组织池,受组织 $500 上限约束 |
| Team Premium 席位 | $100/席 | 五个 Premium 席位即可触及组织上限 |
领取时,Max 订阅者到 claude.ai 的 Settings > Billing,Team Owner 或 Primary Owner 到 Organization settings > Billing;在 API credits 区域选择 Link organization,选定 Console 组织并确认条款。Console 一侧需要 Owner、Admin 或 Billing 权限;一个计划只可关联一个组织,组织也只能接收一个计划的额度,选错后需要联系支持处理。额度可用于 Anthropic 平台的 Messages API、Batches、Playground、托管 Agent 和 Agent SDK;不抵扣交互式 Claude Code 订阅使用、额外用量或 AWS、Google、Microsoft 的第三方云账单。额度按月刷新、不结转;若组织没有已购额度或自动充值,赠送额度耗尽后 API 请求会停止。建议在 Console 设置 workspace 消费上限,避免试验挤占生产额度。
从 Haiku 4.5 迁移:先排查会报错的请求
官方迁移指南列出了比改模型 ID 更重要的兼容点。Claude API 的新 ID 是 claude-haiku-5-5;Bedrock 等平台的 ID 格式不同,不能直接复制。
- 旧请求若带
thinking: {"type":"enabled","budget_tokens":...},改为自适应思考,并用output_config.effort控制投入。Haiku 5.5 默认会自适应思考;原来只读取content[0]当最终文字的解析器,要改为按内容块type读取。 - 去掉旧代码里的
temperature、top_p、top_k自定义采样参数;按旧值原样发送可能返回 400。不要为了“更稳定”把top_p: 1强塞回去。 - 检查 assistant prefill、工具调用和
stop_reason分支。若回答先输出 thinking 块,过低的max_tokens可能在正文前耗尽;若出现拒绝响应,业务层应按拒绝处理,不能把空文本视为成功。
最小化的请求形态如下,实际接入时还需带上 API Key、版本请求头和适当的 max_tokens:
{
"model": "claude-haiku-5-5",
"max_tokens": 4096,
"thinking": { "type": "adaptive" },
"output_config": { "effort": "medium" },
"messages": [{ "role": "user", "content": "把这条工单归类并给出理由" }]
}
{
"model": "claude-haiku-5-5",
"max_tokens": 4096,
"thinking": { "type": "adaptive" },
"output_config": { "effort": "medium" },
"messages": [{ "role": "user", "content": "把这条工单归类并给出理由" }]
}
Haiku 5.5 有更大的上下文窗口,但“能放进 1M token”不等于“应该把所有资料塞进去”。超过 100K 后进入更高单价档;先裁剪无关上下文、观察缓存命中,再决定是否付长上下文成本。官方模型页还列出 Batch API 的输入输出折扣,适合不要求即时结果的批处理;它与月度额度属于不同的优惠机制,预算表要分项记录。
一周试运行:记录真正的每件任务成本
从最近两周抽 60–100 个已知答案或可人工验收的样本,按摘要/分类、资料问答、代码修改、开放式分析分组。固定提示词、输入、评审规则和超时阈值,让 Haiku 5.5 与当前模型各跑一遍。不要只挑成功案例;失败、重试和人工修正都要计入。
建议至少记录这八列,可直接作为 CSV 表头:
task_id,task_type,model,prompt_tokens,output_tokens,cache_read_tokens,latency_ms,accepted,review_minutes,retry_count
task_id,task_type,model,prompt_tokens,output_tokens,cache_read_tokens,latency_ms,accepted,review_minutes,retry_count
计算时用 每件合格任务成本 = (模型费用 + 重试费用 + 人工复核成本) / 验收通过件数。如果 Haiku 原始 token 账单低 90%,但关键字段漏提取导致 30% 的任务要返工,路由规则就应收窄。建议事先写下通过阈值:例如分类准确率不低于当前模型 2 个百分点、人工复核时间不增加、P95 延迟不超过业务上限;阈值应由你自己的风险要求决定。
试运行结束后,只把验证通过的高频任务切到 Haiku;复杂任务保留 Sonnet;再给模型调用加预算、回退和抽检。新的低价和赠送额度都能降低试错成本,但只有验收后的任务才值得迁移。
资料:Anthropic Haiku 5.5 发布说明;Anthropic 月度 API 额度说明。价格和活动资格以官方最新页面、账户控制台为准。
如果通过 ClaudeAPI 等网关接入模型,还要单独核对网关当前是否提供该模型、实际计费与上游赠送额度是否可用;上游 Console 额度不能默认抵扣第三方平台账单。



