Skip to content
登录/注册

GLM-5.3-Flash

glm-5.3-flash

GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,以极致低成本架构实现超越 GLM-5.2 的更强智能

上下文窗口1.0M
提供商智谱AI
创建时间2026/09/01

在线体验

定价

同一模型能力,多条服务通道;按延迟、稳定性与成本灵活选择。

价格单位:$ / 1M tokens
指定服务通道:在请求体加入 provider 字段,例如 "provider": { "channel": "direct" }。可选 direct / stable / economical;不传则使用默认通道。

直连通道

官方直连链路,适合需要原生体验与完整上下文的请求。

输入输出缓存命中
0.15/M0.50/M0.03/M

介绍

输入
文本 图像
输出
文本

GLM-5.3-Flash API:能看图干活的混合注意力多模态模型

GLM-5.3-Flash 是智谱(Z.ai)于 2026 年 8 月 26 日发布并以 MIT 许可证开源的模型,是 GLM-5 系列第一个原生多模态成员。3200 亿总参数、每 token 激活 180 亿,支持图像输入和 100 万 token 上下文。

它最值得注意的不是参数规模,而是架构:线性注意力与稀疏注意力的混合设计,层数从 GLM-4.5 的 92 层压到 45 层,并引入 mHC(流形约束超连接)。相比旗舰 GLM-5.3,注意力计算量降低约 3.01 倍、KV 缓存降低约 4.44 倍——这直接换成了 GLM-5.3 约十分之一的价格档位。

在 Artificial Analysis 综合智能指数上,GLM-5.3-Flash 拿到 57 分,进入全球前沿模型区间;Toolathlon Verified 78.4、AutomationBench 48.8 两项智能体基准都是同组第一。

海鲸AI 通过 OpenAI 兼容接口提供 GLM-5.3-Flash,支持图像输入、工具调用、reasoning_effort 推理强度控制与流式输出。

获取 API 密钥 · 模型 ID:GLM-5.3-Flash


为什么选择 GLM-5.3-Flash

  • 原生多模态 —— GLM-5 系列首个支持图像输入的模型,可一次传多张图
  • AA 智能指数 57 分 —— 以 180 亿激活参数进入前沿模型区间
  • 混合注意力架构 —— 注意力计算量降低约 3.01 倍,KV 缓存降低约 4.44 倍
  • 价格约为 GLM-5.3 的 1/10 —— 前沿能力配轻量级成本
  • MIT 开源许可 —— 权重完全开放,可自由商用与私有化部署
  • 100 万 token 上下文 —— 最大输出 128K token

核心能力

01 视觉编程与"看着自己干活"

原生多模态让模型可以直接读设计稿、截图和报错界面,再写代码——不需要先让另一个模型把图转成文字描述。做前端还原、UI 调试和自动化流程时,模型能看到自己产出的界面长什么样,再决定下一步怎么改。

  • 设计稿 / 截图直出前端代码
  • 界面缺陷的视觉定位与修复
  • 图文混合的多轮迭代开发

02 智能体与工具调用

Toolathlon Verified 78.4(同组第一)、AutomationBench 48.8(同组第一),在多工具编排与自动化流程上是这个参数档位里的第一梯队。GDPval-AA v2 拿到 1773 分,真实职业任务上排在第 2。

  • 多工具编排与长链路自动化
  • 真实职业任务的知识工作
  • 图文混合的智能体流程

03 混合注意力带来的效率优势

线性注意力 + 稀疏注意力的混合架构,配合 45 层的浅层设计和 mHC,把长上下文场景下最贵的两块开销压了下来:注意力计算约 1/3,KV 缓存约 1/4.4。这是它能把价格做到旗舰十分之一的直接原因,也让长上下文推理的延迟明显更低。

  • 长上下文下的低延迟响应
  • 高并发场景的成本可控
  • 私有化部署的显存友好

04 100 万 token 多模态上下文

100 万 token 上下文同时接纳文本和图像,最大输出 128K token。整份带插图的技术文档、一整套设计稿加上对应代码仓库,都可以一次装下。

  • 图文混排的长文档理解
  • 完整仓库 + 界面截图联合分析
  • 长会话历史全量保留

最佳使用场景

场景 说明
视觉编程 设计稿、截图直接转前端代码与界面调试
高并发智能体 Toolathlon、AutomationBench 同组第一,成本可控
图文文档处理 带插图的技术文档、报告的长上下文理解
成本敏感的生产部署 约 GLM-5.3 十分之一的价格档位
私有化部署 MIT 许可 + 180 亿激活参数,显存需求友好
大批量处理 低延迟长上下文,适合流水线任务

GLM-5.3-Flash 与 GLM-5.3、GLM-5.2 的差异

能力 GLM-5.3-Flash GLM-5.3 GLM-5.2
模型 ID GLM-5.3-Flash GLM-5.3 GLM-5.2
总参数 / 激活 3200 亿 / 180 亿 7530 亿 / 约 400 亿 同 GLM-5.3 基座
模型层数 45 层
输入模态 文本 + 图像 文本 文本
上下文窗口 100 万 token 100 万 token 100 万 token
最大输出 128K token 128K token 128K token
AA 智能指数 57 更高 低于 GLM-5.3
Terminal-Bench 2.1 84.3 88.2 略低
权重许可 MIT GLM-5.3 License MIT
推理强度 low / high / max low / high / max high / xhigh
定位 轻量多模态,约 1/10 价格 旗舰:最强编程与安全 上一代旗舰

具体计费以页面上方的实时价格卡片为准。

常见问题

GLM-5.3-Flash 什么时候发布的? 2026 年 8 月 26 日正式上线并同步开源权重,采用 MIT 许可证。

它和 GLM-5.3 是什么关系? 不是同一个基座的裁剪版,而是一条独立的轻量多模态路线:3200 亿总参数、180 亿激活,用线性 + 稀疏的混合注意力架构做效率优化,价格约为 GLM-5.3 的十分之一。GLM-5.3 是纯文本旗舰,编程和安全能力更强;Flash 多了图像输入,并在成本和延迟上占优。

"原生多模态"和外挂视觉模型有什么区别? 原生多模态是在预训练阶段就用图文混合数据训练(约 30 万亿多模态 token),模型直接理解图像,而不是先由另一个模型把图转成文字再喂进来。中间那层信息损失没有了,视觉编程和界面调试这类任务受益最明显。

混合注意力具体省了多少? 相比 GLM-5.3,注意力计算量降低约 3.01 倍,KV 缓存降低约 4.44 倍。长上下文场景下这两项是主要开销,所以延迟和成本的下降在长输入时最明显。

智能水平够用吗? AA 综合智能指数 57 分,已进入全球前沿模型区间。Toolathlon Verified 78.4 和 AutomationBench 48.8 都是同组第一,GDPval-AA v2 1773 分排第 2。纯编程强度上不如 GLM-5.3(Terminal-Bench 2.1 为 84.3 对 88.2)。

思考模式可以关掉吗? 不能。思考模式常驻开启,通过 reasoning_effortlow/high/max 三档之间调节,官方推荐 max

能私有化部署吗? 可以。MIT 许可证,权重约 328GB(FP8),支持 vLLM、SGLang、Transformers、KTransformers 等主流推理框架。


为什么选择海鲸AI 使用 GLM-5.3-Flash API

  • 免部署直接调用 —— 不用准备 328GB 权重和 GPU 集群
  • OpenAI 兼容接口 —— 图像输入沿用标准多模态格式,现有代码改两行接入
  • 与闭源模型同台对比 —— 同一账户下直接和 Claude、GPT、Gemini 比效果比成本
  • 人民币结算 —— 国产模型按人民币计价,账目清晰

API

API 接入信息

Model ID在推理接口中指定模型
glm-5.3-flash
API Key推理接口的 Bearer Token(鉴权令牌)
Base URL兼容 OpenAI 协议 · /chat/completions
OpenAIhttps://api.haijingai.com/v2/
provider 可选指定服务通道,不传则由系统选择默认通道
"provider": { "channel": "direct" }

glm-5.3-flash 接入示例

海鲸AI 兼容 OpenAI 接口协议,可直接使用 OpenAI SDK 或 HTTP 请求接入,默认开启流式输出。

js
curl https://api.haijingai.com/v2/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer <API_KEY>" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [
      {"role": "system", "content": "你是一个有帮助的助手。"},
      {"role": "user", "content": "你好!"}
    ],
    "provider": { "channel": "direct" },
    "stream": true
  }'
# provider 为可选字段,删除该行即使用默认通
js
from openai import OpenAI

client = OpenAI(
    base_url="https://api.haijingai.com/v2",
    api_key="<API_KEY>",
)

stream = client.chat.completions.create(
    model="glm-5.3-flash",
    messages=[
        {"role": "system", "content": "你是一个有帮助的助手。"},
        {"role": "user", "content": "你好!"},
    ],
    stream=True,
    # 可选:指定服务通道,不传则使用默认通道
    extra_body={"provider": {"channel": "direct"}},
)

for chunk in stream:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)
js
import OpenAI from 'openai'

const client = new OpenAI({
  baseURL: 'https://api.haijingai.com/v2',
  apiKey: '<API_KEY>',
})

const stream = await client.chat.completions.create({
  model: 'glm-5.3-flash',
  messages: [
    { role: 'system', content: '你是一个有帮助的助手。' },
    { role: 'user', content: '你好!' },
  ],
  stream: true,
  // 可选:指定服务通道,不传则使用默认通道
  // @ts-expect-error provider 为海鲸AI 扩展字段,不在 OpenAI SDK 类型定义内
  provider: { channel: 'direct' },
})

for await (const chunk of stream) {
  process.stdout.write(chunk.choices[0]?.delta?.content ?? '')
}