直连通道
官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入上下文 | 输入 | 输出 | 缓存命中 |
|---|---|---|---|
| ≤ 32K | 0.74/M | 3.24/M | 0.18/M |
| > 32K | 1.03/M | 3.82/M | 0.26/M |
GLM-5 Turbo 是 Z.ai 的新模型,专为在 OpenClaw 场景等代理驱动环境中实现快速推理和强大性能而设计。它针对涉及长执行链的现实世界代理工作流程进行了深度优化,改进了复杂指令分解、工具使用、计划和持久执行以及扩展任务的整体稳定性。
同一模型能力,多条服务通道;按延迟、稳定性与成本灵活选择。
价格单位:$ / 1M tokensprovider 字段,例如 "provider": { "channel": "direct" }。可选 direct / stable / economical;不传则使用默认通道。官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入上下文 | 输入 | 输出 | 缓存命中 |
|---|---|---|---|
| ≤ 32K | 0.74/M | 3.24/M | 0.18/M |
| > 32K | 1.03/M | 3.82/M | 0.26/M |
GLM-5 Turbo 是智谱推出的快速推理型号,专为 OpenClaw 这类智能体驱动环境中的高速响应和稳定表现而设计。它针对涉及长执行链的现实世界智能体工作流做了深度优化,在复杂指令分解、工具使用、计划与持久执行,以及长任务的整体稳定性上都有针对性改进。
如果你的场景是"智能体要跑很多轮工具调用,每一轮都不能太慢",GLM-5 Turbo 通常比更重的推理档位更合适——它把速度放在了首位,同时保留了长链路执行所需的规划能力。
海鲸AI 通过 OpenAI 兼容接口提供 GLM-5 Turbo,支持工具调用与流式输出。
获取 API 密钥 · 模型 ID:
GLM-5-Turbo
GLM-5 Turbo 的设计目标就是在智能体环境中跑得又快又稳。在需要几十上百轮工具调用的工作流里,单轮延迟的累积效应非常明显,Turbo 档位正是针对这一点优化的。
把一个模糊的目标拆解成一串可执行的具体步骤,是智能体能否跑通的关键。GLM-5 Turbo 在这一环节做了专门优化。
在长链路任务中保持对原始目标的记忆,不因为中间的曲折而偏离方向,是"持久执行"能力的核心。
相比通用模型,GLM-5 Turbo 在长时间运行的任务中更少出现格式崩坏、工具参数错误、重复循环这类稳定性问题。
| 场景 | 说明 |
|---|---|
| 智能体框架核心 | OpenClaw 等环境中的高频执行模型 |
| 多工具编排 | 需要几十轮以上工具调用的工作流 |
| 业务流程自动化 | 长链路的企业流程执行 |
| 编码智能体 | 需要快速迭代的代码修改循环 |
| 高并发智能体 | 同时运行大量智能体实例的场景 |
| 成本敏感的自动化 | 速度与成本兼顾的生产部署 |
| 能力 | GLM-5 Turbo | GLM-5 | GLM-5.1 |
|---|---|---|---|
| 模型 ID | GLM-5-Turbo |
GLM-5 |
GLM-5.1 |
| 定位 | 智能体环境快速推理 | 旗舰开源基座 | 长周期工程智能体 |
| 上下文窗口 | 13.1 万 token | 13.1 万 token | 13.1 万 token |
| 最大输出 | 131K token | 131K token | 131K token |
| 侧重 | 速度与执行稳定性 | 系统设计与深度推理 | 8 小时连续执行 |
| 最适合 | 高频工具调用循环 | 复杂架构问题 | 端到端自主开发 |
具体计费以页面上方的实时价格卡片为准。
1. 创建海鲸AI API 密钥 在控制台生成密钥并充值。
2. 用在高频循环上 GLM-5 Turbo 的价值在多轮调用的累积效应上。单次深度推理任务请用 GLM-5 或 GLM-5.2。
3. 调用接口
curl -X POST https://api.haijingai.com/v1/chat/completions \
-H 'Authorization: Bearer YOUR_API_KEY' \
-H 'Content-Type: application/json' \
-d '{
"model": "GLM-5-Turbo",
"messages": [
{"role": "user", "content": "把这个部署流程拆成可执行步骤,逐步调用工具完成。"}
],
"tools": [{"type": "function", "function": {"name": "run_shell", "parameters": {}}}],
"stream": true
}'
Turbo 和标准版差在哪? Turbo 优先速度和长链路执行稳定性,标准版 GLM-5 优先深度推理和系统设计能力。选哪个取决于你的瓶颈是延迟还是推理深度。
"智能体驱动环境"具体指什么? 指 OpenClaw 这类由智能体主导、需要大量工具调用和自主决策的运行环境。GLM-5 Turbo 针对这类场景做了深度优化。
上下文和输出上限? 131,072 token 上下文,输出上限同为 131,072 token。
适合做多智能体架构吗? 适合。速度优势在多个智能体实例并行运行时会被进一步放大。
长任务会跑偏吗? GLM-5 Turbo 专门优化了计划与持久执行能力,在长链路中保持目标一致性方面比通用模型更稳。
能和其他 GLM 模型混用吗? 可以,而且推荐。用 Turbo 跑高频执行循环,遇到需要深度推理的节点再切到 GLM-5 或 GLM-5.2。
GLM-5-Turbohttps://api.haijingai.com/v2/"provider": { "channel": "direct" }海鲸AI 兼容 OpenAI 接口协议,可直接使用 OpenAI SDK 或 HTTP 请求接入,默认开启流式输出。
curl https://api.haijingai.com/v2/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer <API_KEY>" \
-d '{
"model": "GLM-5-Turbo",
"messages": [
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"}
],
"provider": { "channel": "direct" },
"stream": true
}'
# provider 为可选字段,删除该行即使用默认通道from openai import OpenAI
client = OpenAI(
base_url="https://api.haijingai.com/v2",
api_key="<API_KEY>",
)
stream = client.chat.completions.create(
model="GLM-5-Turbo",
messages=[
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"},
],
stream=True,
# 可选:指定服务通道,不传则使用默认通道
extra_body={"provider": {"channel": "direct"}},
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)import OpenAI from 'openai'
const client = new OpenAI({
baseURL: 'https://api.haijingai.com/v2',
apiKey: '<API_KEY>',
})
const stream = await client.chat.completions.create({
model: 'GLM-5-Turbo',
messages: [
{ role: 'system', content: '你是一个有帮助的助手。' },
{ role: 'user', content: '你好!' },
],
stream: true,
// 可选:指定服务通道,不传则使用默认通道
// @ts-expect-error provider 为海鲸AI 扩展字段,不在 OpenAI SDK 类型定义内
provider: { channel: 'direct' },
})
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? '')
}