直连通道
官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入上下文 | 输入 | 输出 | 缓存命中 |
|---|---|---|---|
| ≤ 32K | 0.59/M | 2.65/M | 0.15/M |
| > 32K | 0.88/M | 2.65/M | 0.15/M |
GLM-5 是 Z.ai 的旗舰开源基础模型,专为复杂系统设计和长期代理工作流程而设计。它专为专家开发人员打造,可在大规模编程任务中提供生产级性能,可与领先的闭源模型相媲美。凭借先进的代理规划、深度后端推理和迭代自我修正,GLM-5 超越了代码生成,进入了全系统构建和自主执行。
同一模型能力,多条服务通道;按延迟、稳定性与成本灵活选择。
价格单位:$ / 1M tokensprovider 字段,例如 "provider": { "channel": "direct" }。可选 direct / stable / economical;不传则使用默认通道。官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入上下文 | 输入 | 输出 | 缓存命中 |
|---|---|---|---|
| ≤ 32K | 0.59/M | 2.65/M | 0.15/M |
| > 32K | 0.88/M | 2.65/M | 0.15/M |
GLM-5 是智谱(Z.ai)的旗舰开源基座模型,专为复杂系统设计和长周期智能体工作流打造。它面向的是专家级开发者:在大规模编程任务中提供生产级性能,可与领先的闭源模型相媲美。
GLM-5 的定位不只是"能写代码"。凭借先进的智能体规划、深度后端推理和迭代式自我修正能力,它超越了代码生成的范畴,进入全系统构建和自主执行的领域。
海鲸AI 通过 OpenAI 兼容接口提供 GLM-5,支持工具调用、流式输出与长周期智能体工作流。
获取 API 密钥 · 模型 ID:
GLM-5
GLM-5 最擅长的是系统级的工作:架构设计、模块拆分、接口定义、依赖治理。它面向的是需要通盘考虑的工程问题,而不是单个函数的实现。
在后端工程场景中,GLM-5 能够处理数据模型设计、并发与一致性问题、性能瓶颈定位这类需要深度推理的任务。
内置的智能体架构支持自主规划、工具调用、网页浏览和多步骤工作流管理,可以直接作为工程智能体的基座。
GLM-5 会在执行过程中主动检查中间结果并改进自己的产出,这在长周期任务中显著降低了最终交付的返工率。
| 场景 | 说明 |
|---|---|
| 系统架构设计 | 复杂系统的通盘设计与评估 |
| 后端工程 | 数据模型、并发、性能优化 |
| 工程智能体基座 | 需要自主规划与执行的开发智能体 |
| 大规模编程任务 | 专家级开发者的生产级需求 |
| 私有化部署 | 开源许可下的本地化方案 |
| 国产化替代 | 自主可控的企业级基座模型 |
| 能力 | GLM-5 | GLM-5 Turbo | GLM-5.1 |
|---|---|---|---|
| 模型 ID | GLM-5 |
GLM-5-Turbo |
GLM-5.1 |
| 定位 | 旗舰开源基座 | 快速推理档 | 长周期工程智能体 |
| 上下文窗口 | 13.1 万 token | 13.1 万 token | 13.1 万 token |
| 最大输出 | 131K token | 131K token | 131K token |
| 侧重 | 系统设计与深度推理 | 速度与响应 | 8 小时连续执行 |
| 开源许可 | MIT | — | MIT |
具体计费以页面上方的实时价格卡片为准。
1. 创建海鲸AI API 密钥 在控制台生成密钥并充值。
2. 用它做系统级的事 GLM-5 的优势在通盘设计和深度推理上。简单的代码补全用 GLM-5 Turbo 更划算,复杂架构问题才值得上 GLM-5。
3. 调用接口
curl -X POST https://api.haijingai.com/v1/chat/completions \
-H 'Authorization: Bearer YOUR_API_KEY' \
-H 'Content-Type: application/json' \
-d '{
"model": "GLM-5",
"messages": [
{"role": "user", "content": "设计一套支持水平扩展的订单系统:数据分片、幂等保证、最终一致性方案,逐项论证。"}
],
"stream": true
}'
GLM-5 和 GLM-5.1 什么关系? GLM-5 是旗舰开源基座,GLM-5.1 在其基础上大幅强化了长周期任务能力(可连续工作 8 小时以上)并在 SWE-Bench Pro 上取得开源第一。
GLM-5 适合什么样的开发者? 面向专家级开发者和需要通盘系统设计的场景。日常代码补全用更轻的档位性价比更高。
上下文和输出上限? 131,072 token 上下文,输出上限同为 131,072 token。
内置智能体架构是什么意思? 模型本身针对自主规划、工具调用、网页浏览和多步骤工作流管理做了训练,不需要额外的框架就能承担智能体角色。
可以私有化部署吗? 可以。GLM-5 系列采用 MIT 开源许可,模型权重公开,允许商用和私有化部署。
和闭源旗舰比如何? 在大规模编程任务上达到可与领先闭源模型相媲美的水平,同时具备开源可控和成本优势。
GLM-5https://api.haijingai.com/v2/"provider": { "channel": "direct" }海鲸AI 兼容 OpenAI 接口协议,可直接使用 OpenAI SDK 或 HTTP 请求接入,默认开启流式输出。
curl https://api.haijingai.com/v2/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer <API_KEY>" \
-d '{
"model": "GLM-5",
"messages": [
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"}
],
"provider": { "channel": "direct" },
"stream": true
}'
# provider 为可选字段,删除该行即使用默认通道from openai import OpenAI
client = OpenAI(
base_url="https://api.haijingai.com/v2",
api_key="<API_KEY>",
)
stream = client.chat.completions.create(
model="GLM-5",
messages=[
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"},
],
stream=True,
# 可选:指定服务通道,不传则使用默认通道
extra_body={"provider": {"channel": "direct"}},
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)import OpenAI from 'openai'
const client = new OpenAI({
baseURL: 'https://api.haijingai.com/v2',
apiKey: '<API_KEY>',
})
const stream = await client.chat.completions.create({
model: 'GLM-5',
messages: [
{ role: 'system', content: '你是一个有帮助的助手。' },
{ role: 'user', content: '你好!' },
],
stream: true,
// 可选:指定服务通道,不传则使用默认通道
// @ts-expect-error provider 为海鲸AI 扩展字段,不在 OpenAI SDK 类型定义内
provider: { channel: 'direct' },
})
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? '')
}