直连通道
官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入上下文 | 输入 | 输出 | 缓存命中 | 缓存写入 |
|---|---|---|---|---|
| ≤ 100K | 0.10/M | 0.50/M | 0.01/M | 0.13/M |
| > 100K | 0.50/M | 2.50/M | 0.05/M | 0.63/M |
同一模型能力,多条服务通道;按延迟、稳定性与成本灵活选择。
价格单位:$ / 1M tokensprovider 字段,例如 "provider": { "channel": "direct" }。可选 direct / stable / economical;不传则使用默认通道。官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入上下文 | 输入 | 输出 | 缓存命中 | 缓存写入 |
|---|---|---|---|---|
| ≤ 100K | 0.10/M | 0.50/M | 0.01/M | 0.13/M |
| > 100K | 0.50/M | 2.50/M | 0.05/M | 0.63/M |
Claude Haiku 5.5 是 Anthropic 于 2026 年 10 月 7 日发布的 Haiku 系列新一代模型,也是 Claude 5.5 家族中最快、最省的一个,距上一代 Haiku 4.5 发布将近一年。官方定位是高并发、延迟敏感的工作:分类、抽取、路由、摘要、实时客服,以及在大模型规划下跑子任务的子智能体。
这一代的跨度很大。上下文窗口从 20 万 token 扩到 100 万,最大输出从 64K 翻到 128K,首次在 Haiku 档位支持自适应思考和 Effort 控制。评测上,GDPval-AA v2.1 知识工作从 Haiku 4.5 的 735 分提到 1620 分,OSWorld 2.1 计算机操作从 15.7% 提到 72.4%,Terminal-Bench 4.0 从 0.0% 提到 39.2%,三项都高于 GPT-6 Luna。
价格反向大幅下调:10 万 token 以内的请求,单价比 Haiku 4.5 低 90%。考虑到新分词器会多算一些 token,Anthropic 给出的平均运行成本估算是比 Haiku 4.5 低约 75%。
海鲸AI 通过 OpenAI 兼容接口与 Anthropic 原生 Messages API 提供 Claude Haiku 5.5,支持推理 Effort 控制、工具调用、流式输出、图像与 PDF 输入。
获取 API 密钥 · 模型 ID:
claude-haiku-5-5
low 到 max 五档,按任务在成本和智能之间取舍分类、抽取、路由、摘要、上下文压缩是 Haiku 5.5 的主场。AA-Briefcase v1.1 为 1578 分(Haiku 4.5 为 614 分,GPT-6 Luna 为 1336 分),Humanity's Last Exam 带工具 57.4%(Haiku 4.5 为 18.7%)。AlphaSense 在 400 条文档问答上测得 0.84 对 Haiku 4.5 的 0.76,该功能每周约 800 万次调用;HubSpot 的 CRM 评测三次平均 92.8%,是其在小模型上见过的最好成绩。
延迟是这一档的核心卖点。Box 的早期测试中,它比 Haiku 4.5 高 11 分而延迟约为一半;Asana 报告任务完成延迟下降 30% 以上,单个智能体回合推理最高快 2.5 倍。Artificial Analysis 实测 high 档输出速度约 173 token/秒。
low / medium 档high 及以下档位关闭,换取最低首字延迟Anthropic 推荐的用法是让 Opus 5.5 或 Sonnet 5.5 负责规划,Haiku 5.5 负责执行定义清楚的子任务。FrontierCode 1.1 为 46.4%(GPT-6 Luna 为 42.4%),Terminal-Bench 4.0 为 39.2%(GPT-6 Luna 为 16.4%)。Cognition 在 Devin Fusion 中以 Opus 5.5 为主、Haiku 5.5 为副手,FrontierCode 拿到 66.2 分,同时压低了成本和延迟。
OSWorld 2.1(离线子集)72.4%,是 Haiku 4.5 的四倍多,Sonnet 5.5 在同一子集上为 83.9%。表单填写、数据录入、跨应用搬运信息这类重复性操作,用 Haiku 5.5 规模化运行的成本最低。Chartography 无工具图表识别 46.4%(Haiku 4.5 为 6.4%,GPT-6 Luna 为 29.1%)。
| 场景 | 说明 |
|---|---|
| 批量分类与抽取 | 高并发、低单价,10 万 token 以内的请求最划算 |
| 实时客服与语音 | 当前最快的 Claude 模型,低档位延迟可控 |
| 子智能体 | 大模型规划、Haiku 5.5 执行,压低智能体系统总成本 |
| 摘要与上下文压缩 | 100 万 token 窗口,可处理整份长文档 |
| 浏览器与桌面自动化 | OSWorld 2.1 72.4%,适合重复性操作的规模化运行 |
| 从 Haiku 4.5 升级 | 能力、上下文、输出上限全面提升,价格反而更低 |
| 能力 | Claude Haiku 5.5 | Claude Haiku 4.5 | Claude Sonnet 5.5 |
|---|---|---|---|
| 模型 ID | claude-haiku-5-5 |
claude-haiku-4-5 |
claude-sonnet-5-5 |
| 发布日期 | 2026 年 10 月 7 日 | 2025 年 10 月 15 日 | 2026 年 9 月 28 日 |
| GDPval-AA v2.1 | 1620 | 735 | 1840 |
| AA-Briefcase v1.1 | 1578 | 614 | 1824 |
| OSWorld 2.1(离线子集) | 72.4% | 15.7% | 83.9% |
| Terminal-Bench 4.0 | 39.2% | 0.0% | 70.6% |
| Humanity's Last Exam(带工具) | 57.4% | 18.7% | 64.5% |
| Chartography(无工具) | 46.4% | 6.4% | 61.6% |
| 上下文窗口 | 100 万 token | 20 万 token | 100 万 token |
| 最大输出 | 128K token | 64K token | 128K token |
| 思考模式 | 自适应,默认开启,high 及以下可关闭 |
手动扩展思考 | 自适应,默认开启 |
| Effort 控制 | 支持,默认 medium |
不支持 | 支持,默认 high |
| 助手消息预填充 | 不支持,返回 400 | 支持 | — |
| 计费分档 | 按提示长度分两档,以 10 万 token 为界 | 单一价格 | 单一价格 |
| 缓存读取相对单价 | 基础输入价的 0.1 倍 | 基础输入价的 0.1 倍 | 基础输入价的 0.05 倍 |
| 相对延迟 | 最快 | — | 快 |
| 定位 | 高并发、延迟敏感任务 | 上一代 Haiku | 速度与智能的最佳组合 |
评测数据均为 Anthropic 公布值,Sonnet 5.5 一列取自 Haiku 5.5 发布页。具体计费以页面上方的实时价格卡片为准。
Claude Haiku 5.5 什么时候发布的? 2026 年 10 月 7 日。发布当天即在 Claude API、Amazon Bedrock、Google Cloud 和 Microsoft Foundry 上线。上一代 Haiku 4.5 发布于 2025 年 10 月 15 日,中间没有 Haiku 5。
和 Haiku 4.5 比升级了什么? 四块。一是能力:GDPval-AA 从 735 提到 1620,OSWorld 2.1 从 15.7% 提到 72.4%,Terminal-Bench 4.0 从 0.0% 提到 39.2%。二是规格:上下文从 20 万扩到 100 万 token,最大输出从 64K 提到 128K。三是控制方式:新增自适应思考和 Effort 档位,新增浏览器操作工具。四是成本:10 万 token 以内的请求单价低 90%,10 万以上低 50%,平均运行成本低约 75%。
计费为什么分两档? Haiku 5.5 按提示长度分档:提示在 10 万 token 以内按低档计费,超过 10 万 token 的请求输入、输出和缓存单价都是低档的 5 倍。Anthropic 表示约 90% 的 Haiku 4.5 请求落在低档区间。长上下文任务要把这一点算进成本,必要时先压缩或拆分。
从 Haiku 4.5 迁移要改代码吗?
有五处破坏性变更。一,手动扩展思考 budget_tokens 返回 400,改用自适应思考加 Effort。二,非默认的 temperature、top_p、top_k 返回 400,直接删掉。三,助手消息预填充返回 400,messages 要以用户消息结尾,需要固定格式时改用结构化输出。四,计算机操作在 Claude API 和 Google Cloud 上要把 computer_20250124 换成 computer_toolset_20260801。五,回传思考块时会话要保持只追加,修改更早的历史会让思考块失效。另外,思考文本默认不返回,需要摘要时把 thinking.display 设为 summarized;思考 token 计入 max_tokens,上限给得太小可能只输出思考块就停了。
为什么迁移后 token 数变多了?
Haiku 5.5 用的是 Claude 4.7 及之后模型的新分词器,同样的文本比 Haiku 4.5 多出约 30% 的 token,具体比例取决于内容。请求和响应的结构不变,但凡是按 token 估算的东西——提示长度、max_tokens、成本预算——都要重新算一遍。
Effort 档位怎么选?
五档:low、medium、high、xhigh、max,API 默认 medium。分类、抽取、路由这类任务用 low 即可;实时对话用 low 或 medium;子智能体编码和计算机操作可以升到 high 以上。档位对难任务影响很大:据 VentureBeat 报道,Terminal-Bench 4.0 在最高档约 39%,medium 档只有约 20%。思考可以在 high 及以下档位用 thinking: {"type": "disabled"} 关闭,但官方更推荐直接降 Effort。
有落后或要注意的地方吗?
有。在公布的所有评测上它都低于 Sonnet 5.5,Anthropic 明确表示复杂的智能体编码仍应使用 Sonnet 5.5 或 Opus 5.5。超过 10 万 token 的请求单价是低档的 5 倍。Artificial Analysis 测得 high 档首字延迟约 26 秒,远高于同类中位数——要低延迟就得降 Effort 或关闭思考。安全过滤方面,网络安全限制比 Haiku 4.5 更严,渗透测试类请求会被拒;被拒的请求返回 stop_reason: "refusal",且 Haiku 5.5 不支持服务端自动回退,客户端要自己处理。
和 Sonnet 5.5 怎么选? 看任务难度和量。量大、定义清楚、对延迟敏感的任务用 Haiku 5.5;需要长链路自主执行、复杂编码或更高的一次性交付质量时用 Sonnet 5.5。两者搭配最常见:Sonnet 5.5 或 Opus 5.5 做规划和验收,Haiku 5.5 做并行的子任务执行。
claude-haiku-5-5https://api.haijingai.com/v2/"provider": { "channel": "direct" }海鲸AI 兼容 OpenAI 接口协议,可直接使用 OpenAI SDK 或 HTTP 请求接入,默认开启流式输出。
curl https://api.haijingai.com/v2/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer <API_KEY>" \
-d '{
"model": "claude-haiku-5-5",
"messages": [
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"}
],
"provider": { "channel": "direct" },
"stream": true
}'
# provider 为可选字段,删除该行即使用默认通道from openai import OpenAI
client = OpenAI(
base_url="https://api.haijingai.com/v2",
api_key="<API_KEY>",
)
stream = client.chat.completions.create(
model="claude-haiku-5-5",
messages=[
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"},
],
stream=True,
# 可选:指定服务通道,不传则使用默认通道
extra_body={"provider": {"channel": "direct"}},
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)import OpenAI from 'openai'
const client = new OpenAI({
baseURL: 'https://api.haijingai.com/v2',
apiKey: '<API_KEY>',
})
const stream = await client.chat.completions.create({
model: 'claude-haiku-5-5',
messages: [
{ role: 'system', content: '你是一个有帮助的助手。' },
{ role: 'user', content: '你好!' },
],
stream: true,
// 可选:指定服务通道,不传则使用默认通道
// @ts-expect-error provider 为海鲸AI 扩展字段,不在 OpenAI SDK 类型定义内
provider: { channel: 'direct' },
})
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? '')
}