Deepseek ArtifactsDeepseek Artifacts
返回博客

Claude Haiku 5.5 来了:API 定价、跑分,对比 Sonnet 5.5 与 GPT-6 Luna

Claude Haiku 5.5 于 10 月 7 日发布:$0.10/$0.50 每百万 token、1M 上下文、可调 effort。本文逐项核对官方定价与跑分,横向对比 Sonnet 5.5 和 GPT-6 Luna,说清什么活该路由给它。

2026年10月9日

只要你在跑任何形式的 agentic 负载——编码 agent、子 agent、分类流水线、抽取任务——你都该关心这条消息:2026 年 10 月 7 日,Anthropic 发布了 Claude Haiku 5.5,而且这次一点不遮掩——直接把价格标到了 OpenAI GPT-6 Luna 同款的 $0.10/$0.50 每百万 token,前面摆着自家的跑分表,背后是 1M token 上下文,外加 Haiku 系第一个可调 effort 旋钮。

这篇写给要做「路由决策」的人:纠结 Claude Code 里 haiku 别名要不要保持默认的开发者、在给高并发流水线算账的平台组、盯着 Copilot 模型选择器里新条目的管理员。下面每个数字都在发稿当天对照 Anthropic 和 OpenAI 官方页面核实过。文末有一段不粉饰的账单话题:如果你的真正瓶颈是钱,路由 + DeepSeek 这条路值不值得走。

先说结论

  • 发布日期:2026 年 10 月 7 日。 官方说法是「our fastest model to date」「our fastest, cheapest, and most capable small model yet」。
  • API 定价(prompt 不超过 100K token):输入 $0.10 / 输出 $0.50 每百万 token,cache 读取 $0.01。超过 100K 直接跳到 $0.50/$2.50——这就是长上下文溢价。
  • 上下文窗口 1M token,最大输出 128K。 1M 是这个模型的标准配置,但 Haiku 5.5 是当前唯一一个长 prompt 要加钱的 Claude——其他 Claude 4.6+ 全系 1M 平价。
  • 模型 ID:claude-haiku-5-5,Anthropic API、Amazon Bedrock、Google Cloud、Microsoft Foundry 四处同名。
  • 对比 Sonnet 5.5:输入输出都是它的 1/20($0.10/$0.50 vs $2/$10)。所有已公布跑分 Sonnet 5.5 都明显更强;Haiku 5.5 赢的是延迟和 20 倍的单价差。
  • 对比 GPT-6 Luna:标价完全打平,连 $0.01 的 cache 读取都一样。但 Luna 的长上下文加价起点更高(272K vs 100K)、幅度温和得多($0.20/$0.75 vs $0.50/$2.50)。
  • Haiku 系第一个可调 effort:Low / Medium / High / Xhigh / Max,默认 medium。
  • 上线即全平台可用:Claude Code 2.1.293 把默认 Haiku 换成了它,GitHub Copilot 发布当天跟进,Cline 的模型目录 10 月 8 日刷新。

Claude Haiku 5.5 是什么,什么时候发布的

Haiku 是 Anthropic 的快速低价档,官方模型文档给 5.5 的定位是「for high-volume, latency-sensitive tasks such as classification, extraction, and routing」(面向高并发、延迟敏感的分类、抽取、路由类任务)。发布文的说法更进一步——「our fastest model to date」——但脚注补了一句:它「runs less quickly than our Opus models in Fast Mode」。这个脚注值得记住:Opus 5.5 的 Fast Mode 是 $8/$40 的产品,两者不是一个东西。

发布日期 2026 年 10 月 7 日,为 9 月开始的这一代收尾:Opus 5.5 是 9 月 22 日,Sonnet 5.5 是 9 月 28 日,Haiku 5.5 九天后跟上。三个模型共享 2026 年 6 月的知识截止时间,规格也是同一个模子——1M 上下文、128K 最大输出、adaptive thinking。

同一条发布文里还夹了两条容易被忽略的消息:Sonnet 5.5 的 cache 读取价格砍半,从 $0.20 降到 $0.10 每百万 token,Anthropic 说缓存密集的 agentic 负载大约能省 20%;以及订阅用户送月度 API 额度——Max 5x 每月 $100,Max 20x 每月 $200,Team 最高 $500 共享。

Haiku 系第一个 effort 设置 比听起来重要。Haiku 4.5 没有这个旋钮;5.5 用上了和大模型同一套 Low/Med/High/Xhigh/Max,默认 medium。同一个部署可以给路由类任务开到最省,给真正费脑的活儿调高 effort,不用换模型 ID。

Claude Haiku 5.5 定价:把价目表贴全

下面是 Anthropic 官方定价页的完整价格卡,发稿当天核实。读表前先理解一个结构性设定:Haiku 5.5 按 prompt 长度分档计价。 prompt 不超过 100,000 token 走标价,超过 100,000 全单大约乘 5。按 Anthropic 自己的说法,约 90% 的请求落在阈值以下。

单价(每 MTok)≤100K prompt>100K prompt
输入$0.10$0.50
输出$0.50$2.50
Cache 写入(5m)$0.125$0.625
Cache 写入(1h)$0.20$1.00
Cache 读取$0.01$0.05

放在同一张价目表里找找位置:

模型输入输出Cache 读取
Haiku 5.5$0.10$0.50$0.01
Haiku 4.5$1.00$5.00$0.10
Sonnet 5.5$2.00$10.00$0.10
Sonnet 5$2.00$10.00$0.20
Opus 5.5$4.00$20.00$0.20

也就是说,Haiku 5.5 比自家上一代便宜一个数量级——Haiku 4.5 的 $1/$5 本来已经是便宜档,5.5 在输入侧直接砍到 1/10,还声称更强。对现役阵容,它比 Sonnet 5.5 便宜 20 倍,比 Opus 5.5 便宜 40 倍(按输入 token 算)。

一个必须说的坑,和我们在 Claude Pro 默认模型那篇里提过的是同一个:标价不等于账单。tokenizer 换了——Anthropic 自己承认新模型「uses slightly more tokens per task」,按 token 天真对比会高估 5.5 的降幅。而且长上下文档位对编码 agent 不是小数:整仓 prompt 很容易越过 100K,越线之后全单按 5 倍算。下结论之前先看自己的 prompt 长度分布。

1M 上下文,和 100K 这个坎

规格表读起来和两个兄弟一样:1M token 上下文,128K 最大输出。 官方模型总览把 1M 列为当前全线的标准窗口,Claude Code 2.1.293 的 changelog 也一句话把上下文和价格都写了:「Added Claude Haiku 5.5 (claude-haiku-5-5) … 1M context, $0.10/$0.50 per Mtok ($0.50/$2.50 for prompts over 100K)」。

但定价页里有一句要紧的话:Claude 4.6 起的模型——Haiku 5.5 除外——「include the full 1M token context window at standard pricing」。意思是 Sonnet 5.5 和 Opus 5.5 不管你 prompt 是 9K 还是 900K,单价一样;Haiku 5.5 的 prompt 一过 100K,整单切换到长上下文价目。

结论一句话:100K 以内,Haiku 5.5 是每块钱能买到的最大窗口——$0.10 这个价位没有第二个带 1M 上下文的选项。100K 到天花板之间,你付的是 $0.50/$2.50——仍比 Sonnet 5.5 全线平价的 $2/$10 便宜,但已经不是 20 倍的悬殊。算笔账:300K token 的 prompt,Haiku 5.5 输入花 $0.15,Sonnet 5.5 花 $0.60,差 4 倍。选谁之前,先统计自己的 prompt 长度分布。

Claude Haiku 5.5 vs Sonnet 5.5

下面所有数据来自两个模型的官方卡片和 Anthropic 发布文自带的跑分表——至少是同一条赛道上跑出来的。

维度Claude Haiku 5.5Claude Sonnet 5.5
输入 / 输出$0.10 / $0.50(≤100K)$2.00 / $10.00,全线平价
Cache 读取$0.01$0.10
长 prompt 价格超 100K 全单 5 倍无——1M 之内平价
上下文 / 输出1M / 128K1M / 128K
默认 effortmediumhigh
Effort 范围Low → MaxLow → Max
官方一句话「For high-volume, latency-sensitive tasks」「The best combination of speed and intelligence」
GDPval-AA v2.116201840
OSWorld 2.172.4%83.9%
Terminal-Bench 4.039.2%70.6%
FrontierCode 1.146.4%52.1%(Xhigh effort 下)

跑分差距是真的,但不均匀——而这个「不均匀」正是整个路由论证。OSWorld 的电脑操作类任务上,Haiku 5.5 距 Sonnet 5.5 只有 11 个百分点左右——点选、抽取这类活,这个差距你未必在乎。Terminal-Bench 上 Sonnet 5.5 接近翻倍(70.6% vs 39.2%),而长程终端任务恰恰是「跑挂一次亏掉省下的 token」的场景。FrontierCode 居中;顺带一提 Sonnet 5.5 那个分数是 Xhigh effort 下测的,既不是 Haiku 的默认档,也不是它的价位。

以下是我们的判断(是我们的,不是厂商的):短小、边界清晰的任务,理性默认已经从 Sonnet 5.5 换成了 Haiku 5.5——分类、抽取、路由、子 agent 摘要、小修小改、一切初稿类工作,20 倍的价差买得起大量重试。凡是「答错很贵」的活仍归 Sonnet 5.5:跨文件改动、终端重度的 agentic 任务、一切需要模型 Hold 住计划并执行的活。GitHub 自己在 Copilot changelog 里的说法是个不错的第三方锚点:早期测试中 Haiku 5.5「matched Claude Sonnet 5 on many coding tasks while using significantly fewer tokens」——注意那是上一代 Sonnet,不是 5.5。

Claude Haiku 5.5 vs GPT-6 Luna

这是这次发布最想挑起的对比,先把命名捋清楚:OpenAI 目录里列的是 GPT-6 Luna(gpt-6-luna)——不存在「6.1」的 Luna。6.1 只轮到了 Sol;Luna 还是 GPT-6 时代的效率档,OpenAI 给它的定位是「our most efficient model for focused, high-volume tasks」。

维度Claude Haiku 5.5GPT-6 Luna
输入 / 输出$0.10 / $0.50(≤100K)$0.10 / $0.50(≤272K)
Cache 读取$0.01$0.01
Cache 写入$0.125$0.125
长上下文价格超 100K:$0.50 / $2.50超 272K:$0.20 / $0.75
上下文窗口1M1.05M
最大输出128K128K
知识截止2026 年 6 月2026 年 5 月 18 日
Batch / Flex—半价(短上下文 $0.05 / $0.25)
GDPval-AA v2.116201437
OSWorld 2.172.4%48.9%
Terminal-Bench 4.039.2%16.4%
FrontierCode 1.146.4%42.4%

标价上这两个模型是按分平的对齐——输入、输出、cache 读取,连 5 分钟 cache 写入都一样。这个平价本身就是新闻:Anthropic 把自家小模型直接标到了 Luna 的数字上,潜台词是「同样的钱,更多模型」。

真正分岔在长上下文的细则,而这一局 Luna 占优。Luna 的加价起点是 272K 输入 token,幅度是 2 倍输入 / 1.5 倍输出——OpenAI 定价页写的 $0.20/$0.75。Haiku 5.5 从 100K 就开始加价,幅度 5 倍。算个 500K token 的 prompt:Luna 输入 500K × $0.20 = $0.10,Haiku 5.5 是 500K × $0.50 = $0.25。巨型上下文的活,Luna 输入侧便宜 2.5 倍。

至于跑分——先说清楚,上表是 Anthropic 自己测的数字,不是 OpenAI 的,当厂商主张看,最终拿自己的任务实测。但若属实,Haiku 5.5 每一行都领先,OSWorld(72.4% vs 48.9%)和 Terminal-Bench(39.2% vs 16.4%)差距最大。Luna 的反驳不在跑分而在结构:Batch/Flex 半价适合吞吐型负载,窗口略大且加价曲线温和得多,以及同样标价下挂着 OpenAI 全套工具面(web search、file search、computer use)。

跑分:Anthropic 官方公布了什么

Anthropic 这次把跑分表直接放进了发布文,全部由 Anthropic 自己跑,对照组是 Haiku 4.5、GPT-6 Luna 和 Sonnet 5.5:

跑分项Haiku 5.5Haiku 4.5GPT-6 LunaSonnet 5.5
GDPval-AA v2.1162073514371840
AA-Briefcase v1.115786141336
OSWorld 2.1(离线)72.4%15.7%48.9%83.9%
Humanity's Last Exam(无工具)45.9%10.2%—56.9%
Humanity's Last Exam(带工具)57.4%18.7%—64.5%
Terminal-Bench 4.039.2%0.0%16.4%70.6%
FrontierCode 1.1(Main)46.4%—42.4%52.1%
Chartography(无工具)46.4%6.4%29.1%61.6%

对 Haiku 4.5 的代际跨越是 Anthropic 最想讲的故事,数字也撑得住:OSWorld 从 15.7% 到 72.4%,Terminal-Bench 从字面意义上的零到 39.2%,GDPval-AA 翻了一倍多。厂商表格你可以打折听,但 Haiku 4.5——还在大量生产代码里当便宜档的那位——确实不在同一个级别。

三点诚实说明。第一,这些是厂商自测;OpenAI 没有公布 Luna 在这套项目上的官方成绩,Luna 那一列只能当作 Anthropic 的主张。第二,发布页上的客户证言——Box 说比 Haiku 4.5 高「11 points」且延迟约为一半,Asana 说「over a 30% reduction in latency」「up to 2.5x faster inference per agent turn」——是方向性参考,不可复现。第三,Anthropic 没有公布任何 tokens/s 数字,所以你在别处看到的「Haiku 5.5 跑 X tok/s」都是第三方实测,不是规格;官方原话只有「our fastest model to date」。

今天起你在哪能用上它

这次首日可用性出奇地好,发布文直接说「available now on all platforms」,工具链目录也都对上了:

  • Claude Code。 2.1.293 加入 claude-haiku-5-5,并把它设为「the default Haiku model on the Anthropic API」。haiku 别名现在指向 5.5——凡是把 "model": "haiku" 写进 settings 的人已经自动升级,我们在 默认模型那篇里讲的别名钉法,在这件事上是双刃剑。
  • GitHub Copilot。 2026 年 10 月 7 日的 changelog 列明覆盖 VS Code、Visual Studio、JetBrains 全家、Xcode、Eclipse、Copilot CLI、云端 agent、Copilot app、github.com 和 GitHub Mobile,面向 Pro、Pro+、Max、Business、Enterprise 套餐——按供应商刊例价走用量计费,管理员可以通过模型策略控门。
  • Cline。 10 月 8 日的 SDK v0.0.92 与配套的桌面版 v0.0.45、CLI v3.0.70 刷新了模型目录加入 Haiku 5.5,还把它设成了包括 Google Vertex AI 在内多家供应商的默认模型——顶掉了 Sonnet 5.5。第三方工具用默认值投了票。

如果你在这些工具里盯着 token 开销,我们写过一篇 Claude Code 用量限制,讲的就是计量那一侧。

Bedrock、Vertex 与 Foundry 接入

平台组的接入故事很干净:模型总览列出的 ID 在 Anthropic API、Amazon Bedrock、Google Cloud、Microsoft Foundry 四处完全一致——claude-haiku-5-5——多云部署不需要按供应商做 ID 映射;发布文点名了 AWS、Google Cloud 和 Microsoft Azure(「available now on all platforms」)。

一条运维提醒:在 Bedrock 这类平台上,跨区域 inference profile 和分区域可用性经常比发布慢几天。某个区域对模型 ID 返回 404 时,先查 inference profile 列表,别急着断定模型没上。

什么时候选 Haiku,什么时候选 Sonnet / Opus

这道题比跑分表看起来简单,因为价差大到一定程度,中等的能力差异改变不了答案:

  • 选 Haiku 5.5:任务短、边界清楚、量大——分类、抽取、路由、摘要、子 agent 的边角活、lint 级别的代码小改,以及一切「错了可以重试」的流水线。Effort 可以压到 Low,它也是把 frontier 系模型摆在琐事面前的最便宜方式。
  • 选 Sonnet 5.5:真正的编码活——跨文件改动、先规划后执行的 agentic 任务、一切 Terminal-Bench 形状的工作;以及 prompt 经常超过 100K 的场景,因为全线平价让它在巨型上下文上悄悄反超 Haiku 的 5 倍加价。
  • 选 Opus 5.5:值得 $4/$20 的长程自主任务;瓶颈是钟表时间而不是预算的话,上 Fast Mode。

账单的另一种解法:路由 + DeepSeek

定价主题的文章绕不开这个选项,我们直说取舍。如果你的真正约束是每月账单而不是模型档位,那么结构性做法是:琐事干脆不为 frontier 价格买单,路由给专门的便宜 API。Claude Code 这层壳留着,指向一个兼容端点——$0.10 的输入价就有对手了。DeepSeek 的 Anthropic 兼容端点按 token 计价、单价公开,deepseek-flash 错峰输入每百万 token $0.15 起;完整定价表和两个环境变量的接法在 Codex 用量面板那篇里,模型本身看 DeepSeek 页面。

代价是真实存在的:那是另一族模型,上面那张跑分表不是它们的跑分表,agentic 编码这件事上 5.5 一代在做的事,便宜端点未必做得到。换来的是自己掌控的按量账单,以及把琐事甩给「水电煤」定价的东西的自由。Haiku 5.5 的出现收窄了这个论证——$0.10 已经是 Claude 史上最接近水电煤的定价——但在「只要吞吐、不要上限」的纯高并发场景,更便宜的 API 路线依然成立。连配置都不想碰的话,DeepSeek App Builder 在浏览器里直接跑这些模型,一句话生成一个能跑的应用。

常见问题

Claude Haiku 5.5 什么时候发布的? 2026 年 10 月 7 日——5.5 一代的第三个模型,前面是 Opus 5.5(9 月 22 日)和 Sonnet 5.5(9 月 28 日)。

Claude Haiku 5.5 多少钱? Prompt 不超过 100K token 时,输入 $0.10、输出 $0.50 每百万 token,cache 读取 $0.01 每 MTok。超过 100K 按 $0.50/$2.50 计费,cache 读取 $0.05。

Haiku 5.5 有 1M 上下文吗? 有——1M 上下文、128K 最大输出,和 Sonnet 5.5、Opus 5.5 相同。差别在计费:其他模型 1M 全程平价,Haiku 5.5 的 prompt 一过 100K 就切长上下文价目。

Claude Haiku 5.5 比 GPT-6 Luna 便宜吗? 标价完全一样——都是 $0.10/$0.50 每百万 token、$0.01 的 cache 读取。超大 prompt 场景 Luna 更便宜:加价起点是 272K 输入 token,幅度只有 2 倍($0.20/$0.75),Haiku 是 100K 以上 5 倍。至于这 5 倍花得值不值,看跑分差——按 Anthropic 自家表格,是 Claude 领先。

Haiku 5.5 上 Amazon Bedrock 了吗? 上了。模型 ID claude-haiku-5-5 在 Anthropic API、Amazon Bedrock、Google Cloud、Microsoft Foundry 完全一致,发布文确认全平台可用。

Claude Code 里的 haiku 别名现在指向谁? Haiku 5.5,从 2.1.293 起。钉了别名的人已经自动在新模型上;钉了带日期 ID claude-haiku-4-5 的,不改就一直在旧模型上。

相关阅读