直连通道
官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入 | 输出 | 缓存命中 |
|---|---|---|
| 0.15/M | 0.50/M | 0.03/M |
GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,以极致低成本架构实现超越 GLM-5.2 的更强智能
同一模型能力,多条服务通道;按延迟、稳定性与成本灵活选择。
价格单位:$ / 1M tokensprovider 字段,例如 "provider": { "channel": "direct" }。可选 direct / stable / economical;不传则使用默认通道。官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入 | 输出 | 缓存命中 |
|---|---|---|
| 0.15/M | 0.50/M | 0.03/M |
GLM-5.3-Flash 是智谱(Z.ai)于 2026 年 8 月 26 日发布并以 MIT 许可证开源的模型,是 GLM-5 系列第一个原生多模态成员。3200 亿总参数、每 token 激活 180 亿,支持图像输入和 100 万 token 上下文。
它最值得注意的不是参数规模,而是架构:线性注意力与稀疏注意力的混合设计,层数从 GLM-4.5 的 92 层压到 45 层,并引入 mHC(流形约束超连接)。相比旗舰 GLM-5.3,注意力计算量降低约 3.01 倍、KV 缓存降低约 4.44 倍——这直接换成了 GLM-5.3 约十分之一的价格档位。
在 Artificial Analysis 综合智能指数上,GLM-5.3-Flash 拿到 57 分,进入全球前沿模型区间;Toolathlon Verified 78.4、AutomationBench 48.8 两项智能体基准都是同组第一。
海鲸AI 通过 OpenAI 兼容接口提供 GLM-5.3-Flash,支持图像输入、工具调用、reasoning_effort 推理强度控制与流式输出。
获取 API 密钥 · 模型 ID:
GLM-5.3-Flash
原生多模态让模型可以直接读设计稿、截图和报错界面,再写代码——不需要先让另一个模型把图转成文字描述。做前端还原、UI 调试和自动化流程时,模型能看到自己产出的界面长什么样,再决定下一步怎么改。
Toolathlon Verified 78.4(同组第一)、AutomationBench 48.8(同组第一),在多工具编排与自动化流程上是这个参数档位里的第一梯队。GDPval-AA v2 拿到 1773 分,真实职业任务上排在第 2。
线性注意力 + 稀疏注意力的混合架构,配合 45 层的浅层设计和 mHC,把长上下文场景下最贵的两块开销压了下来:注意力计算约 1/3,KV 缓存约 1/4.4。这是它能把价格做到旗舰十分之一的直接原因,也让长上下文推理的延迟明显更低。
100 万 token 上下文同时接纳文本和图像,最大输出 128K token。整份带插图的技术文档、一整套设计稿加上对应代码仓库,都可以一次装下。
| 场景 | 说明 |
|---|---|
| 视觉编程 | 设计稿、截图直接转前端代码与界面调试 |
| 高并发智能体 | Toolathlon、AutomationBench 同组第一,成本可控 |
| 图文文档处理 | 带插图的技术文档、报告的长上下文理解 |
| 成本敏感的生产部署 | 约 GLM-5.3 十分之一的价格档位 |
| 私有化部署 | MIT 许可 + 180 亿激活参数,显存需求友好 |
| 大批量处理 | 低延迟长上下文,适合流水线任务 |
| 能力 | GLM-5.3-Flash | GLM-5.3 | GLM-5.2 |
|---|---|---|---|
| 模型 ID | GLM-5.3-Flash |
GLM-5.3 |
GLM-5.2 |
| 总参数 / 激活 | 3200 亿 / 180 亿 | 7530 亿 / 约 400 亿 | 同 GLM-5.3 基座 |
| 模型层数 | 45 层 | — | — |
| 输入模态 | 文本 + 图像 | 文本 | 文本 |
| 上下文窗口 | 100 万 token | 100 万 token | 100 万 token |
| 最大输出 | 128K token | 128K token | 128K token |
| AA 智能指数 | 57 | 更高 | 低于 GLM-5.3 |
| Terminal-Bench 2.1 | 84.3 | 88.2 | 略低 |
| 权重许可 | MIT | GLM-5.3 License | MIT |
| 推理强度 | low / high / max | low / high / max | high / xhigh |
| 定位 | 轻量多模态,约 1/10 价格 | 旗舰:最强编程与安全 | 上一代旗舰 |
具体计费以页面上方的实时价格卡片为准。
GLM-5.3-Flash 什么时候发布的? 2026 年 8 月 26 日正式上线并同步开源权重,采用 MIT 许可证。
它和 GLM-5.3 是什么关系? 不是同一个基座的裁剪版,而是一条独立的轻量多模态路线:3200 亿总参数、180 亿激活,用线性 + 稀疏的混合注意力架构做效率优化,价格约为 GLM-5.3 的十分之一。GLM-5.3 是纯文本旗舰,编程和安全能力更强;Flash 多了图像输入,并在成本和延迟上占优。
"原生多模态"和外挂视觉模型有什么区别? 原生多模态是在预训练阶段就用图文混合数据训练(约 30 万亿多模态 token),模型直接理解图像,而不是先由另一个模型把图转成文字再喂进来。中间那层信息损失没有了,视觉编程和界面调试这类任务受益最明显。
混合注意力具体省了多少? 相比 GLM-5.3,注意力计算量降低约 3.01 倍,KV 缓存降低约 4.44 倍。长上下文场景下这两项是主要开销,所以延迟和成本的下降在长输入时最明显。
智能水平够用吗? AA 综合智能指数 57 分,已进入全球前沿模型区间。Toolathlon Verified 78.4 和 AutomationBench 48.8 都是同组第一,GDPval-AA v2 1773 分排第 2。纯编程强度上不如 GLM-5.3(Terminal-Bench 2.1 为 84.3 对 88.2)。
思考模式可以关掉吗?
不能。思考模式常驻开启,通过 reasoning_effort 在 low/high/max 三档之间调节,官方推荐 max。
能私有化部署吗? 可以。MIT 许可证,权重约 328GB(FP8),支持 vLLM、SGLang、Transformers、KTransformers 等主流推理框架。
glm-5.3-flashhttps://api.haijingai.com/v2/"provider": { "channel": "direct" }海鲸AI 兼容 OpenAI 接口协议,可直接使用 OpenAI SDK 或 HTTP 请求接入,默认开启流式输出。
curl https://api.haijingai.com/v2/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer <API_KEY>" \
-d '{
"model": "glm-5.3-flash",
"messages": [
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"}
],
"provider": { "channel": "direct" },
"stream": true
}'
# provider 为可选字段,删除该行即使用默认通道from openai import OpenAI
client = OpenAI(
base_url="https://api.haijingai.com/v2",
api_key="<API_KEY>",
)
stream = client.chat.completions.create(
model="glm-5.3-flash",
messages=[
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"},
],
stream=True,
# 可选:指定服务通道,不传则使用默认通道
extra_body={"provider": {"channel": "direct"}},
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)import OpenAI from 'openai'
const client = new OpenAI({
baseURL: 'https://api.haijingai.com/v2',
apiKey: '<API_KEY>',
})
const stream = await client.chat.completions.create({
model: 'glm-5.3-flash',
messages: [
{ role: 'system', content: '你是一个有帮助的助手。' },
{ role: 'user', content: '你好!' },
],
stream: true,
// 可选:指定服务通道,不传则使用默认通道
// @ts-expect-error provider 为海鲸AI 扩展字段,不在 OpenAI SDK 类型定义内
provider: { channel: 'direct' },
})
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? '')
}