Skip to content
登录/注册

GLM 5 Turbo

GLM-5-Turbo

GLM-5 Turbo 是 Z.ai 的新模型,专为在 OpenClaw 场景等代理驱动环境中实现快速推理和强大性能而设计。它针对涉及长执行链的现实世界代理工作流程进行了深度优化,改进了复杂指令分解、工具使用、计划和持久执行以及扩展任务的整体稳定性。

上下文窗口131K
提供商智谱AI
创建时间2026/04/14

在线体验

定价

同一模型能力,多条服务通道;按延迟、稳定性与成本灵活选择。

价格单位:$ / 1M tokens
指定服务通道:在请求体加入 provider 字段,例如 "provider": { "channel": "direct" }。可选 direct / stable / economical;不传则使用默认通道。

直连通道

官方直连链路,适合需要原生体验与完整上下文的请求。

输入上下文输入输出缓存命中
≤ 32K0.74/M3.24/M0.18/M
> 32K1.03/M3.82/M0.26/M

介绍

输入
文本
输出
文本

GLM-5 Turbo API:面向智能体环境的快速推理档位

GLM-5 Turbo 是智谱推出的快速推理型号,专为 OpenClaw 这类智能体驱动环境中的高速响应和稳定表现而设计。它针对涉及长执行链的现实世界智能体工作流做了深度优化,在复杂指令分解、工具使用、计划与持久执行,以及长任务的整体稳定性上都有针对性改进。

如果你的场景是"智能体要跑很多轮工具调用,每一轮都不能太慢",GLM-5 Turbo 通常比更重的推理档位更合适——它把速度放在了首位,同时保留了长链路执行所需的规划能力。

海鲸AI 通过 OpenAI 兼容接口提供 GLM-5 Turbo,支持工具调用与流式输出。

获取 API 密钥 · 模型 ID:GLM-5-Turbo


为什么选择 GLM-5 Turbo

  • 为智能体环境优化 —— 面向 OpenClaw 等智能体驱动场景的快速推理
  • 长执行链稳定性 —— 多轮工具调用中不容易跑偏
  • 复杂指令分解 —— 把模糊需求拆成可执行的步骤
  • 131K 上下文与输出 —— 输入输出对等,长任务上下文充裕
  • 速度优先的定价档 —— 高频调用场景下的成本控制

核心能力

01 智能体驱动环境

GLM-5 Turbo 的设计目标就是在智能体环境中跑得又快又稳。在需要几十上百轮工具调用的工作流里,单轮延迟的累积效应非常明显,Turbo 档位正是针对这一点优化的。

  • 高频工具调用循环
  • 单轮低延迟累积成整体提速
  • 智能体框架的执行核心

02 复杂指令分解

把一个模糊的目标拆解成一串可执行的具体步骤,是智能体能否跑通的关键。GLM-5 Turbo 在这一环节做了专门优化。

  • 模糊需求到执行计划的转换
  • 步骤间依赖关系识别
  • 可验证的中间目标设定

03 计划与持久执行

在长链路任务中保持对原始目标的记忆,不因为中间的曲折而偏离方向,是"持久执行"能力的核心。

  • 长任务中的目标一致性
  • 中间失败后的路径重规划
  • 执行状态的持续跟踪

04 长任务整体稳定性

相比通用模型,GLM-5 Turbo 在长时间运行的任务中更少出现格式崩坏、工具参数错误、重复循环这类稳定性问题。

  • 工具参数构造的准确性
  • 输出格式的一致性
  • 避免无效循环

最佳使用场景

场景 说明
智能体框架核心 OpenClaw 等环境中的高频执行模型
多工具编排 需要几十轮以上工具调用的工作流
业务流程自动化 长链路的企业流程执行
编码智能体 需要快速迭代的代码修改循环
高并发智能体 同时运行大量智能体实例的场景
成本敏感的自动化 速度与成本兼顾的生产部署

GLM-5 Turbo 与 GLM-5、GLM-5.1 的差异

能力 GLM-5 Turbo GLM-5 GLM-5.1
模型 ID GLM-5-Turbo GLM-5 GLM-5.1
定位 智能体环境快速推理 旗舰开源基座 长周期工程智能体
上下文窗口 13.1 万 token 13.1 万 token 13.1 万 token
最大输出 131K token 131K token 131K token
侧重 速度与执行稳定性 系统设计与深度推理 8 小时连续执行
最适合 高频工具调用循环 复杂架构问题 端到端自主开发

具体计费以页面上方的实时价格卡片为准。


如何使用 GLM-5 Turbo API

1. 创建海鲸AI API 密钥 在控制台生成密钥并充值。

2. 用在高频循环上 GLM-5 Turbo 的价值在多轮调用的累积效应上。单次深度推理任务请用 GLM-5 或 GLM-5.2。

3. 调用接口

curl -X POST https://api.haijingai.com/v1/chat/completions \
  -H 'Authorization: Bearer YOUR_API_KEY' \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "GLM-5-Turbo",
    "messages": [
      {"role": "user", "content": "把这个部署流程拆成可执行步骤,逐步调用工具完成。"}
    ],
    "tools": [{"type": "function", "function": {"name": "run_shell", "parameters": {}}}],
    "stream": true
  }'

常见问题

Turbo 和标准版差在哪? Turbo 优先速度和长链路执行稳定性,标准版 GLM-5 优先深度推理和系统设计能力。选哪个取决于你的瓶颈是延迟还是推理深度。

"智能体驱动环境"具体指什么? 指 OpenClaw 这类由智能体主导、需要大量工具调用和自主决策的运行环境。GLM-5 Turbo 针对这类场景做了深度优化。

上下文和输出上限? 131,072 token 上下文,输出上限同为 131,072 token。

适合做多智能体架构吗? 适合。速度优势在多个智能体实例并行运行时会被进一步放大。

长任务会跑偏吗? GLM-5 Turbo 专门优化了计划与持久执行能力,在长链路中保持目标一致性方面比通用模型更稳。

能和其他 GLM 模型混用吗? 可以,而且推荐。用 Turbo 跑高频执行循环,遇到需要深度推理的节点再切到 GLM-5 或 GLM-5.2。


为什么选择海鲸AI 使用 GLM-5 Turbo API

  • 免部署直接调用 —— 无需自建推理集群
  • OpenAI 兼容接口 —— 现有智能体框架直接接入
  • 全系列切换 —— GLM-5 / 5.1 / 5.2 / Turbo / 5V-Turbo 同账户按需路由
  • 人民币结算 —— 国产模型按人民币计价

API

API 接入信息

Model ID在推理接口中指定模型
GLM-5-Turbo
API Key推理接口的 Bearer Token(鉴权令牌)
Base URL兼容 OpenAI 协议 · /chat/completions
OpenAIhttps://api.haijingai.com/v2/
provider 可选指定服务通道,不传则由系统选择默认通道
"provider": { "channel": "direct" }

GLM-5-Turbo 接入示例

海鲸AI 兼容 OpenAI 接口协议,可直接使用 OpenAI SDK 或 HTTP 请求接入,默认开启流式输出。

js
curl https://api.haijingai.com/v2/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer <API_KEY>" \
  -d '{
    "model": "GLM-5-Turbo",
    "messages": [
      {"role": "system", "content": "你是一个有帮助的助手。"},
      {"role": "user", "content": "你好!"}
    ],
    "provider": { "channel": "direct" },
    "stream": true
  }'
# provider 为可选字段,删除该行即使用默认通
js
from openai import OpenAI

client = OpenAI(
    base_url="https://api.haijingai.com/v2",
    api_key="<API_KEY>",
)

stream = client.chat.completions.create(
    model="GLM-5-Turbo",
    messages=[
        {"role": "system", "content": "你是一个有帮助的助手。"},
        {"role": "user", "content": "你好!"},
    ],
    stream=True,
    # 可选:指定服务通道,不传则使用默认通道
    extra_body={"provider": {"channel": "direct"}},
)

for chunk in stream:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)
js
import OpenAI from 'openai'

const client = new OpenAI({
  baseURL: 'https://api.haijingai.com/v2',
  apiKey: '<API_KEY>',
})

const stream = await client.chat.completions.create({
  model: 'GLM-5-Turbo',
  messages: [
    { role: 'system', content: '你是一个有帮助的助手。' },
    { role: 'user', content: '你好!' },
  ],
  stream: true,
  // 可选:指定服务通道,不传则使用默认通道
  // @ts-expect-error provider 为海鲸AI 扩展字段,不在 OpenAI SDK 类型定义内
  provider: { channel: 'direct' },
})

for await (const chunk of stream) {
  process.stdout.write(chunk.choices[0]?.delta?.content ?? '')
}