Claude Haiku 5.5 详解:对标 GPT-6 Luna、百万上下文与五倍计费断崖
北京时间 10 月 8 日凌晨,Anthropic 发布 Claude Haiku 5.5。这是继 9 月下旬 Opus 5.5 与 Sonnet 5.5 之后,Claude 5.5 家族的收官之作。
这次发布的焦点集中在两件事上:标价直接对齐 OpenAI GPT-6 Luna(输入 $0.10、输出 $0.50 每百万 token),同时上下文窗口从 200K 跃升至 1M。然而在看似激进的降价背后,隐藏着长上下文单价翻 5 倍的定价分界线、思考档位带来的延迟开销,以及新分词器的实际 token 膨胀。
如果你正在评估轻量模型的 API 选型,或者正在为即将在 2026 年 10 月 20 日退役的 Gemini 2.5 Flash-Lite 寻找替代方案,本文从规格、真实账单算法、基准跑分与延迟表现做完整拆解。
一、规格与发布清单
| 模型 | 上下文 / 输出 | 输入 / 输出($/M) | 缓存读取 | 相比前代变化 |
|---|---|---|---|---|
| Claude Haiku 5.5 | 1M / 128K | $0.10 / $0.50 | $0.01 | 标价降 90%,支持思考档位 |
| GPT-6 Luna | 1.05M / 128K | $0.10 / $0.50 | $0.01 | 价格砍半,272K 后阶梯计费 |
| Gemini 3.5 Flash-Lite | 1M / 64K | $0.30 / $2.50 | $0.03 | 输出单价偏高,延迟极低 |
| Claude Sonnet 5.5 | 1M / 128K | $2.00 / $10.00 | $0.10 | 长任务主力,缓存读降半 |
| Claude Haiku 4.5 | 200K / 64K | $1.00 / $5.00 | $0.10 | 旧款基准,活跃至 10-15 后退役 |
模型 API ID 为 claude-haiku-5-5,AWS Bedrock 端点为 anthropic.claude-haiku-5-5。目前 Claude API、Amazon Bedrock、Google Cloud Vertex AI 以及 OpenRouter 均已完成上线。
需要关注的是分词器(Tokenizer)变化:Haiku 5.5 采用了与 Claude 4.7 相同的新分词器,同一段英文文本相比 Haiku 4.5 增加约 30% 的 token 开销,中文膨胀率可能更高。因此,实际调用账单的降幅约在 75% 左右,略低于名义标价的 90%。
二、定价拆解与五倍计费断崖
虽然 ≤100K tokens 时 Haiku 5.5 的标价与 GPT-6 Luna 完全一致,但 Anthropic 为它引入了一套全产品线独有的双档跳价机制:
| 计费项(每 1M tokens) | 提示词 ≤ 100,000 tokens | 提示词 > 100,000 tokens | 跳价倍率 |
|---|---|---|---|
| 输入单价 | $0.10 | $0.50 | 5x |
| 输出单价 | $0.50 | $2.50 | 5x |
| 缓存读取(Cache Read) | $0.01 | $0.05 | 5x |
| 缓存写入(5 分钟 TTL) | $0.125 | $0.625 | 5x |
| 缓存写入(1 小时 TTL) | $0.20 | $1.00 | 5x |
| Batch 异步批处理(约半价) | $0.05 / $0.25 | $0.25 / $1.25 | 5x |
1. 整单跳价而非超额累进:只要输入提示词超过 100,000 tokens,前面所有的 token 也全部按第二档单价计费。
2. 输出单价按输入长度决定:单次请求的输入只要迈过 100K 门槛,输出单价直接从 $0.50 跃升至 $2.50。
案例:100,000 tokens 输入 + 2,000 tokens 输出 = $0.0110;
100,001 tokens 输入 + 2,000 tokens 输出 = $0.0550(整单飙升整整 5 倍)。
对比之下,GPT-6 Luna 在 272K tokens 之前全程保持 $0.10 / $0.50,超出后也仅小幅调整至 $0.20 / $0.75。在实际任务花费上,Artificial Analysis 实测数据显示,跑完一组标准评测任务,Haiku 5.5 的总消耗约为 Luna 的 3 倍(原因在于分词器开销与输出冗长程度)。Haiku 5.5 的优势主要体现在更强的问题解决率与吞吐速度上。
三、能力变化与思考档位
| 基准测试 | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| OSWorld 2.1(电脑操作) | 72.4% | 15.7% | 48.9% | 83.9% |
| Terminal-Bench 4.0(编程) | 39.2%* | 0.0% | 16.4% | 70.6% |
| GDPval-AA v2.1(知识工作) | 1620 | 735 | 1437 | 1840 |
| FrontierCode 1.1 | 46.4% | — | 42.4% | 52.1% |
| Humanity's Last Exam(无工具/有工具) | 45.9% / 57.4% | 10.2% / 18.7% | — | 56.9% / 64.5% |
*注:Terminal-Bench 的 39.2% 取自 max effort 档位,默认 medium 档位得分约在 20% 左右。
思考档位(Effort Tiers)与成本
Haiku 5.5 是首个支持 Adaptive Thinking 与可调 effort 档位的 Haiku 级模型。在 Artificial Analysis 独立评测中,不同档位的智能指数与开销呈现明显的梯度:
| Effort 档位 | AA 智能指数 | 平均任务成本 | 输出吞吐 | 首字延迟(含思考) |
|---|---|---|---|---|
| low | 29 | $0.02 | 178 tok/s | 9.9s(官方 API 实测 6.28s) |
| medium(默认) | 34 | $0.05 | 137 tok/s | 13.4s |
| high | 38 | $0.08 | 160 tok/s | 28.0s |
| xhigh | 41 | $0.12 | 187 tok/s | 87.0s |
| max | 43 | $0.21 | 242 tok/s | 432.0s |
在默认的 medium 档位下,每任务成本约 $0.05,输出速度 137 tok/s。对于简单的短文本分类、路由和抽取,建议选择 low 档位或直接关闭思考(low 到 high 允许关闭 thinking,xhigh 与 max 强行关闭会返回 400 错误)。
四、首字延迟(TTFT)与工程调优
在流式对话(Streaming)场景中,用户感受到的响应速度往往由首字延迟(Time to First Token, TTFT)决定:
| 模型 | 首字延迟(TTFT) | 吞吐速度 | 测试来源 |
|---|---|---|---|
| Haiku 5.5(low 档) | 6.28s | 181 tok/s | Anthropic 第一方实测 |
| Gemini 3.5 Flash-Lite | ~0.63s | 178 tok/s | OpenRouter p50 |
| Gemini 2.5 Flash-Lite | 0.30s | 253+ tok/s | Google 第一方(即将退役) |
| DeepSeek V4.1 Flash | ~1.10s | 216 tok/s | 第三方测试整理 |
| GLM-5.3-Flash | ~3.00s | 51 tok/s | 第三方公开数据 |
Haiku 5.5 的首字延迟在同级小模型中明显偏慢。原因在于其机制倾向于先做内部思考与预推理,即使在最低档位也有约 6 秒的 TTFT。而在用户实时打字的客服或应用内助手场景中,6 秒的白屏等待往往会让用户误以为请求卡死。
- 交互式 UI 场景:关闭 thinking 或锁定 low 档位;优先使用 OpenRouter 的 Nitro 路由或指定低延迟云端点(如 Vertex AI)。
- 后台子任务与 Subagent:无需考虑 TTFT,137–242 tok/s 的高吞吐和更低的任务解决成本更为关键。
- 提示词缓存利用:长系统提示词打上缓存断点,不仅节省 90% 读取费用,且缓存读取不占用 ITPM 限额。
五、旧模型迁移:应对 Gemini 2.5 退役
一个现实的生产迁移节点是:在 OpenRouter 上广泛部署的 google/gemini-2.5-flash-lite 标注的过期时间为 2026 年 10 月 20 日。开发者必须在 12 天内完成迁移。
| 候选模型 | 输入 / 输出($/M) | AA 智能指数 | 首字延迟 | 选型分析 |
|---|---|---|---|---|
| Claude Haiku 5.5 | $0.10 / $0.50 | 43.4 | 6.28s | 智力跃升 4 倍,输出比 3.5 便宜 5 倍,首字延迟需适配 |
| Gemini 3.5 Flash-Lite | $0.30 / $2.50 | 22.2 | ~0.63s | 延迟最快,但输出 $2.50 太贵,性价比低 |
| DeepSeek V4.1 Flash | $0.30 / $1.20(低谷半价) | 39.0 | ~1.10s | 输入成本极低($0.0392),首字极快,综合性价比强 |
迁移代码细节提醒:
- 移除旧参数
budget_tokens,改用标准effort参数,否则返回 400 错误。 - 移除自定义
temperature、top_p或top_k,非默认值将直接报错。 - 预留充足的
max_tokens,因为思考产生的 token 同样计入该上限。 - 监控
stop_reason: "refusal",Haiku 5.5 新增对竞争性大模型蒸馏与训练相关提示词的拦截。
六、国产同价位与接入合规路径
| 模型 | 输入 / 输出($/M) | AA 智能指数 | 国内直连 | 优势场景 |
|---|---|---|---|---|
| DeepSeek V4.1 Flash | $0.30 / $1.20(低谷半价) | 39.0 | 是 | 输入费用极低、TTFT 仅 1.1s、兼容 Anthropic 接口 |
| GLM-5.3-Flash | $0.15 / $0.50 | 42.0 | 是 | 智能指数高、开源可自托管、人民币结算 |
| MiMo-V2.6-Flash | $0.14 / $0.28 | 38.0 | 是 | 纯输出价格极低,每任务开销 $0.06 |
1. Anthropic IP 封锁与条款限制:Anthropic 官方 API 对中国大陆 IP 强制返回 HTTP 403。其服务条款明文规定,禁止任何中资持股超过 50% 的实体(不论注册地在哪)直接使用。
2. 接入路径推荐:需要使用 Haiku 5.5 的团队,建议通过 OpenRouter(免加价、聚合路由)或海外公有云(AWS Bedrock / Google Cloud Vertex AI)接入;若业务面向国内用户且有数据本地化要求,国产平替模型是更稳妥的方案。
七、场景选型建议
适合已有 Claude 生态、需要为 Opus 5.5 / Sonnet 5.5 配备低成本子 agent 的团队。单次提示词稳定在 100K 以内、涉及复杂提取规则、数据库检索、结构化转换,或者需要使用电脑操作(OSWorld 72.4%)的场景。
如果单次请求经常超过 100K tokens,请避开 Haiku 5.5 的 5 倍跳价,选择 GPT-6 Luna 或 DeepSeek;如果是对秒级首字响应要求极高的实时打字助手,建议选择 DeepSeek V4.1 Flash 或 Gemini 3.5 Flash-Lite;如果是高难度的 Agent 编码任务,依然建议直接调用 Sonnet 5.5。