Skip to content
登录/注册

Claude Haiku 5.5

claude-haiku-5-5

Haiku 系列新一代模型,也是 Claude 5.5 家族中最快、最省的一个

上下文窗口1.0M
提供商Claude
创建时间2026/10/08

在线体验

定价

同一模型能力,多条服务通道;按延迟、稳定性与成本灵活选择。

价格单位:$ / 1M tokens
指定服务通道:在请求体加入 provider 字段,例如 "provider": { "channel": "direct" }。可选 direct / stable / economical;不传则使用默认通道。

直连通道

官方直连链路,适合需要原生体验与完整上下文的请求。

输入上下文输入输出缓存命中缓存写入
≤ 100K0.10/M0.50/M0.01/M0.13/M
> 100K0.50/M2.50/M0.05/M0.63/M

介绍

输入
文本 图像
输出
文本

Claude Haiku 5.5 API:面向高并发与低延迟的最快 Claude 模型

Claude Haiku 5.5 是 Anthropic 于 2026 年 10 月 7 日发布的 Haiku 系列新一代模型,也是 Claude 5.5 家族中最快、最省的一个,距上一代 Haiku 4.5 发布将近一年。官方定位是高并发、延迟敏感的工作:分类、抽取、路由、摘要、实时客服,以及在大模型规划下跑子任务的子智能体。

这一代的跨度很大。上下文窗口从 20 万 token 扩到 100 万,最大输出从 64K 翻到 128K,首次在 Haiku 档位支持自适应思考和 Effort 控制。评测上,GDPval-AA v2.1 知识工作从 Haiku 4.5 的 735 分提到 1620 分,OSWorld 2.1 计算机操作从 15.7% 提到 72.4%,Terminal-Bench 4.0 从 0.0% 提到 39.2%,三项都高于 GPT-6 Luna。

价格反向大幅下调:10 万 token 以内的请求,单价比 Haiku 4.5 低 90%。考虑到新分词器会多算一些 token,Anthropic 给出的平均运行成本估算是比 Haiku 4.5 低约 75%。

海鲸AI 通过 OpenAI 兼容接口与 Anthropic 原生 Messages API 提供 Claude Haiku 5.5,支持推理 Effort 控制、工具调用、流式输出、图像与 PDF 输入。

获取 API 密钥 · 模型 ID:claude-haiku-5-5


为什么选择 Claude Haiku 5.5

  • Anthropic 最快的模型 —— 标准速度下是当前 Claude 阵容中延迟最低的一档
  • 成本大幅下降 —— 10 万 token 以内的请求单价比 Haiku 4.5 低 90%,平均运行成本低约 75%
  • 知识工作翻倍 —— GDPval-AA v2.1 拿到 1620 分,Haiku 4.5 为 735 分,GPT-6 Luna 为 1437 分
  • 能用的计算机操作 —— OSWorld 2.1 拿到 72.4%,Haiku 4.5 为 15.7%,GPT-6 Luna 为 48.9%
  • 首个支持 Effort 的 Haiku —— low 到 max 五档,按任务在成本和智能之间取舍
  • 100 万 token 上下文 + 128K 输出 —— 上一代为 20 万和 64K,Batch API 下可扩展到 300K 输出

核心能力

01 高并发文本任务

分类、抽取、路由、摘要、上下文压缩是 Haiku 5.5 的主场。AA-Briefcase v1.1 为 1578 分(Haiku 4.5 为 614 分,GPT-6 Luna 为 1336 分),Humanity's Last Exam 带工具 57.4%(Haiku 4.5 为 18.7%)。AlphaSense 在 400 条文档问答上测得 0.84 对 Haiku 4.5 的 0.76,该功能每周约 800 万次调用;HubSpot 的 CRM 评测三次平均 92.8%,是其在小模型上见过的最好成绩。

  • 大批量分类、打标、信息抽取与结构化输出
  • 长文档摘要与智能体系统内的上下文压缩
  • 数据库查询、工单分流、意图路由

02 实时对话与低延迟响应

延迟是这一档的核心卖点。Box 的早期测试中,它比 Haiku 4.5 高 11 分而延迟约为一半;Asana 报告任务完成延迟下降 30% 以上,单个智能体回合推理最高快 2.5 倍。Artificial Analysis 实测 high 档输出速度约 173 token/秒。

  • 在线客服、语音智能体、应用内助手
  • 延迟敏感场景用 low / medium 档
  • 思考可在 high 及以下档位关闭,换取最低首字延迟

03 子智能体与轻量编码

Anthropic 推荐的用法是让 Opus 5.5 或 Sonnet 5.5 负责规划,Haiku 5.5 负责执行定义清楚的子任务。FrontierCode 1.1 为 46.4%(GPT-6 Luna 为 42.4%),Terminal-Bench 4.0 为 39.2%(GPT-6 Luna 为 16.4%)。Cognition 在 Devin Fusion 中以 Opus 5.5 为主、Haiku 5.5 为副手,FrontierCode 拿到 66.2 分,同时压低了成本和延迟。

  • 聚焦的单点修改与跨多文件的小改动
  • 多步工具调用与并行子任务
  • 复杂的智能体编码仍建议交给 Sonnet 5.5 或 Opus 5.5

04 浏览器与桌面自动化

OSWorld 2.1(离线子集)72.4%,是 Haiku 4.5 的四倍多,Sonnet 5.5 在同一子集上为 83.9%。表单填写、数据录入、跨应用搬运信息这类重复性操作,用 Haiku 5.5 规模化运行的成本最低。Chartography 无工具图表识别 46.4%(Haiku 4.5 为 6.4%,GPT-6 Luna 为 29.1%)。

  • 表单填写、数据录入、跨应用信息迁移
  • 支持浏览器操作工具与新版计算机操作工具集
  • 界面截图与图表的基础理解

最佳使用场景

场景 说明
批量分类与抽取 高并发、低单价,10 万 token 以内的请求最划算
实时客服与语音 当前最快的 Claude 模型,低档位延迟可控
子智能体 大模型规划、Haiku 5.5 执行,压低智能体系统总成本
摘要与上下文压缩 100 万 token 窗口,可处理整份长文档
浏览器与桌面自动化 OSWorld 2.1 72.4%,适合重复性操作的规模化运行
从 Haiku 4.5 升级 能力、上下文、输出上限全面提升,价格反而更低

Claude Haiku 5.5 与 Haiku 4.5、Sonnet 5.5 的差异

能力 Claude Haiku 5.5 Claude Haiku 4.5 Claude Sonnet 5.5
模型 ID claude-haiku-5-5 claude-haiku-4-5 claude-sonnet-5-5
发布日期 2026 年 10 月 7 日 2025 年 10 月 15 日 2026 年 9 月 28 日
GDPval-AA v2.1 1620 735 1840
AA-Briefcase v1.1 1578 614 1824
OSWorld 2.1(离线子集) 72.4% 15.7% 83.9%
Terminal-Bench 4.0 39.2% 0.0% 70.6%
Humanity's Last Exam(带工具) 57.4% 18.7% 64.5%
Chartography(无工具) 46.4% 6.4% 61.6%
上下文窗口 100 万 token 20 万 token 100 万 token
最大输出 128K token 64K token 128K token
思考模式 自适应,默认开启,high 及以下可关闭 手动扩展思考 自适应,默认开启
Effort 控制 支持,默认 medium 不支持 支持,默认 high
助手消息预填充 不支持,返回 400 支持 —
计费分档 按提示长度分两档,以 10 万 token 为界 单一价格 单一价格
缓存读取相对单价 基础输入价的 0.1 倍 基础输入价的 0.1 倍 基础输入价的 0.05 倍
相对延迟 最快 — 快
定位 高并发、延迟敏感任务 上一代 Haiku 速度与智能的最佳组合

评测数据均为 Anthropic 公布值,Sonnet 5.5 一列取自 Haiku 5.5 发布页。具体计费以页面上方的实时价格卡片为准。


常见问题

Claude Haiku 5.5 什么时候发布的? 2026 年 10 月 7 日。发布当天即在 Claude API、Amazon Bedrock、Google Cloud 和 Microsoft Foundry 上线。上一代 Haiku 4.5 发布于 2025 年 10 月 15 日,中间没有 Haiku 5。

和 Haiku 4.5 比升级了什么? 四块。一是能力:GDPval-AA 从 735 提到 1620,OSWorld 2.1 从 15.7% 提到 72.4%,Terminal-Bench 4.0 从 0.0% 提到 39.2%。二是规格:上下文从 20 万扩到 100 万 token,最大输出从 64K 提到 128K。三是控制方式:新增自适应思考和 Effort 档位,新增浏览器操作工具。四是成本:10 万 token 以内的请求单价低 90%,10 万以上低 50%,平均运行成本低约 75%。

计费为什么分两档? Haiku 5.5 按提示长度分档:提示在 10 万 token 以内按低档计费,超过 10 万 token 的请求输入、输出和缓存单价都是低档的 5 倍。Anthropic 表示约 90% 的 Haiku 4.5 请求落在低档区间。长上下文任务要把这一点算进成本,必要时先压缩或拆分。

从 Haiku 4.5 迁移要改代码吗? 有五处破坏性变更。一,手动扩展思考 budget_tokens 返回 400,改用自适应思考加 Effort。二,非默认的 temperature、top_p、top_k 返回 400,直接删掉。三,助手消息预填充返回 400,messages 要以用户消息结尾,需要固定格式时改用结构化输出。四,计算机操作在 Claude API 和 Google Cloud 上要把 computer_20250124 换成 computer_toolset_20260801。五,回传思考块时会话要保持只追加,修改更早的历史会让思考块失效。另外,思考文本默认不返回,需要摘要时把 thinking.display 设为 summarized;思考 token 计入 max_tokens,上限给得太小可能只输出思考块就停了。

为什么迁移后 token 数变多了? Haiku 5.5 用的是 Claude 4.7 及之后模型的新分词器,同样的文本比 Haiku 4.5 多出约 30% 的 token,具体比例取决于内容。请求和响应的结构不变,但凡是按 token 估算的东西——提示长度、max_tokens、成本预算——都要重新算一遍。

Effort 档位怎么选? 五档:low、medium、high、xhigh、max,API 默认 medium。分类、抽取、路由这类任务用 low 即可;实时对话用 low 或 medium;子智能体编码和计算机操作可以升到 high 以上。档位对难任务影响很大:据 VentureBeat 报道,Terminal-Bench 4.0 在最高档约 39%,medium 档只有约 20%。思考可以在 high 及以下档位用 thinking: {"type": "disabled"} 关闭,但官方更推荐直接降 Effort。

有落后或要注意的地方吗? 有。在公布的所有评测上它都低于 Sonnet 5.5,Anthropic 明确表示复杂的智能体编码仍应使用 Sonnet 5.5 或 Opus 5.5。超过 10 万 token 的请求单价是低档的 5 倍。Artificial Analysis 测得 high 档首字延迟约 26 秒,远高于同类中位数——要低延迟就得降 Effort 或关闭思考。安全过滤方面,网络安全限制比 Haiku 4.5 更严,渗透测试类请求会被拒;被拒的请求返回 stop_reason: "refusal",且 Haiku 5.5 不支持服务端自动回退,客户端要自己处理。

和 Sonnet 5.5 怎么选? 看任务难度和量。量大、定义清楚、对延迟敏感的任务用 Haiku 5.5;需要长链路自主执行、复杂编码或更高的一次性交付质量时用 Sonnet 5.5。两者搭配最常见:Sonnet 5.5 或 Opus 5.5 做规划和验收,Haiku 5.5 做并行的子任务执行。


为什么选择海鲸AI 使用 Claude Haiku 5.5 API

  • 原生 Messages API 完整透传 —— Effort 控制、自适应思考、提示缓存与 beta 特性均可直接使用
  • 双接口接入 —— 原生 Messages API 与 OpenAI 兼容接口任选,迁移成本低
  • 国内直连 —— 无需海外账户和自建代理,稳定性与延迟由平台侧保障
  • 一套密钥多模型 —— 大流量用 Haiku 5.5,日常切 Sonnet 5.5,难任务切 Opus 5.5,同一账户统一账单

API

API 接入信息 ​

Model ID在推理接口中指定模型
claude-haiku-5-5
API Key推理接口的 Bearer Token(鉴权令牌)
Base URL兼容 OpenAI 协议 · /chat/completions
OpenAIhttps://api.haijingai.com/v2/
provider 可选指定服务通道,不传则由系统选择默认通道
"provider": { "channel": "direct" }

claude-haiku-5-5 接入示例 ​

海鲸AI 兼容 OpenAI 接口协议,可直接使用 OpenAI SDK 或 HTTP 请求接入,默认开启流式输出。

js
curl https://api.haijingai.com/v2/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer <API_KEY>" \
  -d '{
    "model": "claude-haiku-5-5",
    "messages": [
      {"role": "system", "content": "你是一个有帮助的助手。"},
      {"role": "user", "content": "你好!"}
    ],
    "provider": { "channel": "direct" },
    "stream": true
  }'
# provider 为可选字段,删除该行即使用默认通道
js
from openai import OpenAI

client = OpenAI(
    base_url="https://api.haijingai.com/v2",
    api_key="<API_KEY>",
)

stream = client.chat.completions.create(
    model="claude-haiku-5-5",
    messages=[
        {"role": "system", "content": "你是一个有帮助的助手。"},
        {"role": "user", "content": "你好!"},
    ],
    stream=True,
    # 可选:指定服务通道,不传则使用默认通道
    extra_body={"provider": {"channel": "direct"}},
)

for chunk in stream:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)
js
import OpenAI from 'openai'

const client = new OpenAI({
  baseURL: 'https://api.haijingai.com/v2',
  apiKey: '<API_KEY>',
})

const stream = await client.chat.completions.create({
  model: 'claude-haiku-5-5',
  messages: [
    { role: 'system', content: '你是一个有帮助的助手。' },
    { role: 'user', content: '你好!' },
  ],
  stream: true,
  // 可选:指定服务通道,不传则使用默认通道
  // @ts-expect-error provider 为海鲸AI 扩展字段,不在 OpenAI SDK 类型定义内
  provider: { channel: 'direct' },
})

for await (const chunk of stream) {
  process.stdout.write(chunk.choices[0]?.delta?.content ?? '')
}
联系客服