北京时间 10 月 8 日凌晨,Anthropic 发布 Claude Haiku 5.5。这是 Claude 5.5 家族在 Opus 5.5 和 Sonnet 5.5 之后的收官模型。标价降到和 GPT-6 Luna 完全一致,上下文拉到 1M。大家关心的核心问题通常是两件事:它到底强在哪,手上的小模型要不要换。

笔者维护的浏览器插件 PageGrok,其云端轻量模型之前走 OpenRouter 挂在 Gemini 2.5 Flash-Lite 上。OpenRouter 标注该模型在 2026 年 10 月 20 日退役,刚好需要在这两周内完成迁移选型。借着这次对 Haiku 5.5 的整理,把价格算式、性能实测和替换策略梳理清楚。

下面逐项介绍。依次讨论规格、能力提升、计费断崖、延迟表现以及国产同价位模型的选择。

发布清单

模型 上下文 输入 / 输出单价(≤100K) 相对上一代变化
Claude Haiku 5.5 1M $0.10 / $0.50 标价降 90%,支持 effort 档位
GPT-6 Luna 1.05M $0.10 / $0.50 输入降 50%,输出降 58%
Gemini 3.5 Flash-Lite 1M $0.30 / $2.50 现役,输出价格偏高
Claude Sonnet 5.5 1M $2.00 / $10.00 复杂任务主力,缓存读降半
Claude Haiku 4.5 200K $1.00 / $5.00 旧版基准,不早于 10-15 退役

单价均为每百万 token 的美元价格。Haiku 5.5 的最大输出提升至 128K tokens,知识截止到 2026 年 6 月。它支持文本和图像输入,纯文本输出。

访问渠道上,Claude API、AWS Bedrock、Google Cloud Vertex AI 以及 OpenRouter 均已同步上线。

能力变化

评测维度 Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
OSWorld 2.1(电脑操作) 72.4% 15.7% 48.9% 83.9%
Terminal-Bench 4.0(编程) 39.2% 0.0% 16.4% 70.6%
GDPval-AA v2.1(知识工作) 1620 735 1437 1840
AA 智能指数(综合) 43.4(max) 17 38(max) 41(medium)

OSWorld 从 15.7% 跳到 72.4%,是这一代提升最明显的项目。在电脑操作和浏览器自动化任务上,它的表现已经逼近大模型。

编程能力有进步,但有限制条件。Terminal-Bench 4.0 的 39.2% 取自最高思考档位(max effort)。在默认的 medium 档位下,成绩约在 20% 左右。复杂的长链路开发任务,官方依然建议交给 Sonnet 5.5 或 Opus 5.5。

中文表达方面,官方目前没有发布中文专项基准。由于 5.5 家族普遍优化了表达自然度,AI 味相比 4.5 时代有所减轻。不过新分词器让同样一段文本多消耗约 30% 的 token,中文语境下的实际 token 消耗会更高。

定价机制

标价看似与 GPT-6 Luna 相同,但计费规则存在一道明显的门槛。

Haiku 5.5 采用双档定价。当单次请求的提示词长度超过 100,000 tokens 时,整单价格直接上涨 5 倍。输入单价从 $0.10/M 变为 $0.50/M,输出单价也从 $0.50/M 变为 $2.50/M。

项目(每 1M tokens) 提示词 ≤ 100K tokens 提示词 > 100K tokens
输入 $0.10 $0.50
输出 $0.50 $2.50
缓存读取 $0.01 $0.05
缓存写入(5 分钟) $0.125 $0.625
Batch 批处理(约半价) $0.05 / $0.25 $0.25 / $1.25

这意味着 100,000 tokens 输入加上 2,000 tokens 输出,账单约 $0.011。只要输入多出 1 个 token 达到 100,001,账单就会跳到约 $0.055。长上下文任务需要特别注意这道分界线。

GPT-6 Luna 则是在 272K tokens 之后才微调单价,分词器也更紧凑。在 Artificial Analysis 的任务成本测算中,跑完相同评估任务,Haiku 5.5 的总花费约为 Luna 的 3 倍。Haiku 5.5 胜在智能指数更高,速度也更快。

首字延迟

交互体验中,首字延迟往往比吐字吞吐更影响体感。

模型 首字延迟(TTFT) 输出吞吐 备注
Haiku 5.5(low 档) 6.28s 181 tok/s 官方 API 实测
Gemini 3.5 Flash-Lite 0.63s 178 tok/s OpenRouter p50
Gemini 2.5 Flash-Lite 0.30s 253+ tok/s 即将退役
DeepSeek V4.1 Flash 1.10s 216 tok/s 第三方整理
GLM-5.3-Flash 3.00s 51 tok/s 公开数据

Haiku 5.5 即使在 low effort 档位,首字延迟也在 6 秒左右。随着思考档位拉高,首字等待时间会显著延长。max 档位的首字延迟甚至超过几百秒。

在用户面对面的实时聊天场景中,这个延迟偏高。如果要用在交互场景,建议关闭思考或固定在 low 档位,同时利用 OpenRouter 的 Nitro 路由来压缩网络耗时。在后台子任务、文档抽取和数据清洗这类异步工作流里,这个延迟则没有影响。

思考档位

Haiku 5.5 是首个支持可调思考档位(effort)的 Haiku 模型。档位分为 low、medium、high、xhigh、max 五档,默认是 medium。

Effort 档位 AA 智能指数 任务单价 输出吞吐 首字延迟
low 29 $0.02 178 tok/s 9.9s
medium(默认) 34 $0.05 137 tok/s 13.4s
high 38 $0.08 160 tok/s 28s
xhigh 41 $0.12 187 tok/s 87s
max 43 $0.21 242 tok/s 432s

从 Haiku 4.5 迁移过来的应用,接口参数不能再传 budget_tokens,否则会返回 400 错误。temperature 和 top_p 也只能使用默认值。

对于短文本分类和结构化抽取,建议使用 low 档或关闭思考。需要注意,关闭思考并配合 JSON 工具调用时,模型偶尔会漏调工具,调用时需留意官方给出的 prompt 兼容说明。

旧模型怎么换

针对不同旧模型的替换策略,可以参考以下建议:

Haiku 4.5:建议直接升级到 Haiku 5.5。虽然新分词器多消耗一些 token,但降价幅度足以覆盖膨胀,电脑操作与抽取质量有本质改善。记得清理旧参数。

Gemini 2.5 Flash-Lite:由于模型将在 10 月 20 日退役,迁移不可避免。如果追求高智能和便宜的输出,Haiku 5.5 是合适的主选,智能指数从 10 跃升至 43。如果对秒级首字响应有硬性要求,可以考虑 DeepSeek V4.1 Flash。

Gemini 3.5 Flash-Lite:输出单价高达 $2.50/M,是 Haiku 5.5 的 5 倍。除非输入极长且极度依赖 0.6 秒的首字响应,否则从成本角度建议转用 Haiku 5.5。

GPT-6 Luna:海量简单短文本分类建议留用 Luna,单任务成本更低。涉及复杂业务规则抽取、长文档总结或工具调用时,Haiku 5.5 质量更稳。

国产同价位

在小模型这一档,国产模型同样具备很强的竞争力。

模型 输入 / 输出单价 AA 智能指数 吞吐与首字延迟
Claude Haiku 5.5 $0.10 / $0.50 43.4 137–242 tok/s,TTFT 6.28s
DeepSeek V4.1 Flash $0.30 / $1.20(低谷半价) 39.0 216 tok/s,TTFT 1.1s
GLM-5.3-Flash $0.15 / $0.50 42.0 51 tok/s,TTFT 3.0s
MiMo-V2.6-Flash $0.14 / $0.28 38.0 58 tok/s

DeepSeek V4.1 Flash 在 OpenRouter 上的输入单价低至 $0.0392/M,且首字延迟只有 1.1 秒。在聊天类输入占比较高的场景里,实际综合开销可能更低。它还支持原生 Anthropic 格式的调用。

GLM-5.3-Flash 和 MiMo-V2.6-Flash 则提供了国内合规直连的路径。对于国内主体而言,Anthropic 官方 API 直接对大陆 IP 返回 403,并且在服务条款中限制中资持股超 50% 的实体。国内团队走 OpenRouter 或海外云端可以解决调用问题,如果业务需要国内数据合规,国产模型是更安全的选择。

怎么选

综合各项测试,选择路径相对明确:

适合接入 Haiku 5.5 的场景:团队已经深耕 Claude 生态,需要更轻便的子 agent 来处理检索、路由、总结或日志清洗;单次提示词稳定在 100K 以内;或者需要高质量的浏览器与电脑操作。

适合选择其他模型的场景:单次提示词经常超过 100K,建议选择没有 5 倍跳价的 Luna 或 DeepSeek;面向用户的实时聊天且对首字延迟敏感,建议选用 DeepSeek 或 Flash-Lite;涉及多步骤复杂编码,依然建议直接调用 Sonnet 5.5。

接下来 PageGrok 准备抽取 30 条生产历史长文本与网页摘要日志,分别接入 Haiku 5.5 和 DeepSeek V4.1 Flash 跑盲测,对比响应速度、首字延迟和页面理解质量,以此敲定最终的切换配置。

参考资料

  • Anthropic 官方发布:https://www.anthropic.com/claude-haiku-5-5
  • Anthropic 模型概览:https://platform.claude.com/docs/en/models/haiku-5-5/overview
  • 官方定价页:https://platform.claude.com/docs/en/about-claude/pricing
  • Artificial Analysis 独立评测:https://artificialanalysis.ai/models/claude-haiku-5-5
  • OpenRouter 模型目录:https://openrouter.ai/anthropic/claude-haiku-5.5
  • Hacker News 社区讨论:https://news.ycombinator.com/item?id=49996437