北京时间 10 月 8 日凌晨,Anthropic 发布 Claude Haiku 5.5。这是 Claude 5.5 家族在 Opus 5.5 和 Sonnet 5.5 之后的收官模型。标价降到和 GPT-6 Luna 完全一致,上下文拉到 1M。大家关心的核心问题通常是两件事:它到底强在哪,手上的小模型要不要换。
笔者维护的浏览器插件 PageGrok,其云端轻量模型之前走 OpenRouter 挂在 Gemini 2.5 Flash-Lite 上。OpenRouter 标注该模型在 2026 年 10 月 20 日退役,刚好需要在这两周内完成迁移选型。借着这次对 Haiku 5.5 的整理,把价格算式、性能实测和替换策略梳理清楚。
下面逐项介绍。依次讨论规格、能力提升、计费断崖、延迟表现以及国产同价位模型的选择。
发布清单
| 模型 | 上下文 | 输入 / 输出单价(≤100K) | 相对上一代变化 |
|---|---|---|---|
| Claude Haiku 5.5 | 1M | $0.10 / $0.50 | 标价降 90%,支持 effort 档位 |
| GPT-6 Luna | 1.05M | $0.10 / $0.50 | 输入降 50%,输出降 58% |
| Gemini 3.5 Flash-Lite | 1M | $0.30 / $2.50 | 现役,输出价格偏高 |
| Claude Sonnet 5.5 | 1M | $2.00 / $10.00 | 复杂任务主力,缓存读降半 |
| Claude Haiku 4.5 | 200K | $1.00 / $5.00 | 旧版基准,不早于 10-15 退役 |
单价均为每百万 token 的美元价格。Haiku 5.5 的最大输出提升至 128K tokens,知识截止到 2026 年 6 月。它支持文本和图像输入,纯文本输出。
访问渠道上,Claude API、AWS Bedrock、Google Cloud Vertex AI 以及 OpenRouter 均已同步上线。
能力变化
| 评测维度 | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| OSWorld 2.1(电脑操作) | 72.4% | 15.7% | 48.9% | 83.9% |
| Terminal-Bench 4.0(编程) | 39.2% | 0.0% | 16.4% | 70.6% |
| GDPval-AA v2.1(知识工作) | 1620 | 735 | 1437 | 1840 |
| AA 智能指数(综合) | 43.4(max) | 17 | 38(max) | 41(medium) |
OSWorld 从 15.7% 跳到 72.4%,是这一代提升最明显的项目。在电脑操作和浏览器自动化任务上,它的表现已经逼近大模型。
编程能力有进步,但有限制条件。Terminal-Bench 4.0 的 39.2% 取自最高思考档位(max effort)。在默认的 medium 档位下,成绩约在 20% 左右。复杂的长链路开发任务,官方依然建议交给 Sonnet 5.5 或 Opus 5.5。
中文表达方面,官方目前没有发布中文专项基准。由于 5.5 家族普遍优化了表达自然度,AI 味相比 4.5 时代有所减轻。不过新分词器让同样一段文本多消耗约 30% 的 token,中文语境下的实际 token 消耗会更高。
定价机制
标价看似与 GPT-6 Luna 相同,但计费规则存在一道明显的门槛。
Haiku 5.5 采用双档定价。当单次请求的提示词长度超过 100,000 tokens 时,整单价格直接上涨 5 倍。输入单价从 $0.10/M 变为 $0.50/M,输出单价也从 $0.50/M 变为 $2.50/M。
| 项目(每 1M tokens) | 提示词 ≤ 100K tokens | 提示词 > 100K tokens |
|---|---|---|
| 输入 | $0.10 | $0.50 |
| 输出 | $0.50 | $2.50 |
| 缓存读取 | $0.01 | $0.05 |
| 缓存写入(5 分钟) | $0.125 | $0.625 |
| Batch 批处理(约半价) | $0.05 / $0.25 | $0.25 / $1.25 |
这意味着 100,000 tokens 输入加上 2,000 tokens 输出,账单约 $0.011。只要输入多出 1 个 token 达到 100,001,账单就会跳到约 $0.055。长上下文任务需要特别注意这道分界线。
GPT-6 Luna 则是在 272K tokens 之后才微调单价,分词器也更紧凑。在 Artificial Analysis 的任务成本测算中,跑完相同评估任务,Haiku 5.5 的总花费约为 Luna 的 3 倍。Haiku 5.5 胜在智能指数更高,速度也更快。
首字延迟
交互体验中,首字延迟往往比吐字吞吐更影响体感。
| 模型 | 首字延迟(TTFT) | 输出吞吐 | 备注 |
|---|---|---|---|
| Haiku 5.5(low 档) | 6.28s | 181 tok/s | 官方 API 实测 |
| Gemini 3.5 Flash-Lite | 0.63s | 178 tok/s | OpenRouter p50 |
| Gemini 2.5 Flash-Lite | 0.30s | 253+ tok/s | 即将退役 |
| DeepSeek V4.1 Flash | 1.10s | 216 tok/s | 第三方整理 |
| GLM-5.3-Flash | 3.00s | 51 tok/s | 公开数据 |
Haiku 5.5 即使在 low effort 档位,首字延迟也在 6 秒左右。随着思考档位拉高,首字等待时间会显著延长。max 档位的首字延迟甚至超过几百秒。
在用户面对面的实时聊天场景中,这个延迟偏高。如果要用在交互场景,建议关闭思考或固定在 low 档位,同时利用 OpenRouter 的 Nitro 路由来压缩网络耗时。在后台子任务、文档抽取和数据清洗这类异步工作流里,这个延迟则没有影响。
思考档位
Haiku 5.5 是首个支持可调思考档位(effort)的 Haiku 模型。档位分为 low、medium、high、xhigh、max 五档,默认是 medium。
| Effort 档位 | AA 智能指数 | 任务单价 | 输出吞吐 | 首字延迟 |
|---|---|---|---|---|
| low | 29 | $0.02 | 178 tok/s | 9.9s |
| medium(默认) | 34 | $0.05 | 137 tok/s | 13.4s |
| high | 38 | $0.08 | 160 tok/s | 28s |
| xhigh | 41 | $0.12 | 187 tok/s | 87s |
| max | 43 | $0.21 | 242 tok/s | 432s |
从 Haiku 4.5 迁移过来的应用,接口参数不能再传 budget_tokens,否则会返回 400 错误。temperature 和 top_p 也只能使用默认值。
对于短文本分类和结构化抽取,建议使用 low 档或关闭思考。需要注意,关闭思考并配合 JSON 工具调用时,模型偶尔会漏调工具,调用时需留意官方给出的 prompt 兼容说明。
旧模型怎么换
针对不同旧模型的替换策略,可以参考以下建议:
Haiku 4.5:建议直接升级到 Haiku 5.5。虽然新分词器多消耗一些 token,但降价幅度足以覆盖膨胀,电脑操作与抽取质量有本质改善。记得清理旧参数。
Gemini 2.5 Flash-Lite:由于模型将在 10 月 20 日退役,迁移不可避免。如果追求高智能和便宜的输出,Haiku 5.5 是合适的主选,智能指数从 10 跃升至 43。如果对秒级首字响应有硬性要求,可以考虑 DeepSeek V4.1 Flash。
Gemini 3.5 Flash-Lite:输出单价高达 $2.50/M,是 Haiku 5.5 的 5 倍。除非输入极长且极度依赖 0.6 秒的首字响应,否则从成本角度建议转用 Haiku 5.5。
GPT-6 Luna:海量简单短文本分类建议留用 Luna,单任务成本更低。涉及复杂业务规则抽取、长文档总结或工具调用时,Haiku 5.5 质量更稳。
国产同价位
在小模型这一档,国产模型同样具备很强的竞争力。
| 模型 | 输入 / 输出单价 | AA 智能指数 | 吞吐与首字延迟 |
|---|---|---|---|
| Claude Haiku 5.5 | $0.10 / $0.50 | 43.4 | 137–242 tok/s,TTFT 6.28s |
| DeepSeek V4.1 Flash | $0.30 / $1.20(低谷半价) | 39.0 | 216 tok/s,TTFT 1.1s |
| GLM-5.3-Flash | $0.15 / $0.50 | 42.0 | 51 tok/s,TTFT 3.0s |
| MiMo-V2.6-Flash | $0.14 / $0.28 | 38.0 | 58 tok/s |
DeepSeek V4.1 Flash 在 OpenRouter 上的输入单价低至 $0.0392/M,且首字延迟只有 1.1 秒。在聊天类输入占比较高的场景里,实际综合开销可能更低。它还支持原生 Anthropic 格式的调用。
GLM-5.3-Flash 和 MiMo-V2.6-Flash 则提供了国内合规直连的路径。对于国内主体而言,Anthropic 官方 API 直接对大陆 IP 返回 403,并且在服务条款中限制中资持股超 50% 的实体。国内团队走 OpenRouter 或海外云端可以解决调用问题,如果业务需要国内数据合规,国产模型是更安全的选择。
怎么选
综合各项测试,选择路径相对明确:
适合接入 Haiku 5.5 的场景:团队已经深耕 Claude 生态,需要更轻便的子 agent 来处理检索、路由、总结或日志清洗;单次提示词稳定在 100K 以内;或者需要高质量的浏览器与电脑操作。
适合选择其他模型的场景:单次提示词经常超过 100K,建议选择没有 5 倍跳价的 Luna 或 DeepSeek;面向用户的实时聊天且对首字延迟敏感,建议选用 DeepSeek 或 Flash-Lite;涉及多步骤复杂编码,依然建议直接调用 Sonnet 5.5。
接下来 PageGrok 准备抽取 30 条生产历史长文本与网页摘要日志,分别接入 Haiku 5.5 和 DeepSeek V4.1 Flash 跑盲测,对比响应速度、首字延迟和页面理解质量,以此敲定最终的切换配置。
参考资料
- Anthropic 官方发布:https://www.anthropic.com/claude-haiku-5-5
- Anthropic 模型概览:https://platform.claude.com/docs/en/models/haiku-5-5/overview
- 官方定价页:https://platform.claude.com/docs/en/about-claude/pricing
- Artificial Analysis 独立评测:https://artificialanalysis.ai/models/claude-haiku-5-5
- OpenRouter 模型目录:https://openrouter.ai/anthropic/claude-haiku-5.5
- Hacker News 社区讨论:https://news.ycombinator.com/item?id=49996437