Skip to content
登录/注册

GLM 5V Turbo

GLM-5V-Turbo

GLM-5V-Turbo 是智谱首个多模态 Agent 基座模型,面向视觉编程与复杂任务场景深度优化,支持图像、视频、文本与文件等多模态输入,强化视觉理解、长程规划与动作执行能力。相比通用多模态模型,它更适合融入 Agent 工作流,完成「环境感知 → 任务规划 → 执行落地」的完整闭环,让多模态能力从“能看懂”走向“能行动”。

上下文窗口131K
提供商智谱AI
创建时间2026/05/25

在线体验

定价

同一模型能力,多条服务通道;按延迟、稳定性与成本灵活选择。

价格单位:$ / 1M tokens
指定服务通道:在请求体加入 provider 字段,例如 "provider": { "channel": "direct" }。可选 direct / stable / economical;不传则使用默认通道。

直连通道

官方直连链路,适合需要原生体验与完整上下文的请求。

输入上下文输入输出缓存命中
≤ 32K0.74/M3.24/M0.18/M
> 32K1.03/M3.82/M0.26/M

介绍

输入
文本 图像
输出
文本

GLM-5V-Turbo API:智谱首个多模态 Agent 基座模型

GLM-5V-Turbo 是智谱首个多模态 Agent 基座模型,面向视觉编程与复杂任务场景做了深度优化。它支持图像、视频、文本与文件等多模态输入,强化了视觉理解、长程规划与动作执行能力。

相比通用多模态模型,GLM-5V-Turbo 更适合融入 Agent 工作流,完成「环境感知 → 任务规划 → 执行落地」的完整闭环——让多模态能力从"能看懂"走向"能干活"。

海鲸AI 通过 OpenAI 兼容接口提供 GLM-5V-Turbo,支持多模态输入、工具调用与流式输出。

获取 API 密钥 · 模型 ID:GLM-5V-Turbo


为什么选择 GLM-5V-Turbo

  • 智谱首个多模态 Agent 基座 —— 不只是看懂图,而是基于视觉做决策和执行
  • 完整的感知—规划—执行闭环 —— 从环境理解到动作落地一体化
  • 面向视觉编程优化 —— 看着界面写代码、看着设计稿实现前端
  • 多模态输入 —— 图像、视频、文本、文件统一处理
  • 13.1 万 token 上下文 —— 多模态上下文空间充裕

核心能力

01 视觉编程

GLM-5V-Turbo 针对视觉编程场景做了深度优化:看设计稿写前端、看截图定位 UI 问题、看图表生成数据处理代码。这是多模态能力最直接的工程价值。

  • 设计稿到前端代码
  • 界面截图的问题定位
  • 图表与数据的代码化处理

02 环境感知与动作执行

作为 Agent 基座模型,它的强项在于把视觉理解转化为具体动作:识别界面元素、判断当前状态、决定下一步操作。

  • 界面元素识别与定位
  • 当前状态判断
  • 下一步动作决策

03 长程规划

在需要多步骤完成的视觉任务中,GLM-5V-Turbo 能维持对整体目标的规划,而不是每一步都重新开始判断。

  • 多步骤视觉任务规划
  • 中间状态跟踪
  • 目标一致性维持

04 多模态统一理解

图像、视频、文本、文件在同一上下文中统一处理,适合需要跨模态关联推理的场景。

  • 视频内容理解与时序推理
  • 文档中的图文混合理解
  • 跨模态信息关联

最佳使用场景

场景 说明
视觉编程 设计稿转前端代码、截图问题定位
界面自动化 基于视觉的 UI 操作与测试
多模态 Agent 需要看懂环境再决策执行的智能体
视频内容分析 时序理解与内容提取
文档理解 图文混排文档的完整解析
质检与巡检 基于图像的判断与后续动作触发

GLM-5V-Turbo 与其他多模态模型的差异

能力 GLM-5V-Turbo GLM-5 Turbo Gemini 3.5 Flash
模型 ID GLM-5V-Turbo GLM-5-Turbo gemini-3.5-flash
定位 多模态 Agent 基座 纯文本智能体快速档 高效多模态主力
输入模态 图像、视频、文本、文件 文本 文本、图像、视频、音频、PDF
上下文窗口 13.1 万 token 13.1 万 token 10.5 万 token
最大输出 32K token 131K token 64K token
侧重 视觉编程与动作执行 长执行链稳定性 编码与并行智能体

具体计费以页面上方的实时价格卡片为准。


如何使用 GLM-5V-Turbo API

1. 创建海鲸AI API 密钥 在控制台生成密钥并充值。

2. 把视觉当成上下文的一部分 GLM-5V-Turbo 的优势不在单纯的图像描述,而在"看了之后要做什么"。提示词里把目标动作说清楚,效果最好。

3. 调用接口

curl -X POST https://api.haijingai.com/v1/chat/completions \
  -H 'Authorization: Bearer YOUR_API_KEY' \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "GLM-5V-Turbo",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "image_url", "image_url": {"url": "https://example.com/design.png"}},
        {"type": "text", "text": "按这张设计稿实现对应的 Vue 组件,注意间距和字号。"}
      ]
    }],
    "stream": true
  }'

常见问题

它和普通多模态模型有什么不同? 普通多模态模型的目标是"看懂",GLM-5V-Turbo 的目标是"看懂之后能干活"——它把视觉理解、长程规划和动作执行整合成一条闭环,更适合融入 Agent 工作流。

支持哪些输入模态? 图像、视频、文本和文件。输出为文本。

视觉编程能力具体指什么? 包括设计稿转代码、界面截图的问题定位、图表数据的代码化处理等——把视觉信息直接转化为可执行的工程产出。

上下文和输出上限? 131,000 token 上下文,最大输出 32,000 token。

适合做界面自动化吗? 适合。它针对「环境感知 → 任务规划 → 执行落地」的闭环做了优化,是基于视觉的自动化场景的合适选择。

能处理视频吗? 可以。支持视频输入和时序理解,适合内容分析类场景。


为什么选择海鲸AI 使用 GLM-5V-Turbo API

  • 多模态统一入口 —— 图像、视频、文档与文本共用一套接口
  • OpenAI 兼容 —— 现有代码改两行即可接入
  • 与纯文本模型互补 —— 视觉任务走 5V-Turbo,文本任务走 GLM-5 系列
  • 人民币结算 —— 国产模型按人民币计价

API

API 接入信息

Model ID在推理接口中指定模型
GLM-5V-Turbo
API Key推理接口的 Bearer Token(鉴权令牌)
Base URL兼容 OpenAI 协议 · /chat/completions
OpenAIhttps://api.haijingai.com/v2/
provider 可选指定服务通道,不传则由系统选择默认通道
"provider": { "channel": "direct" }

GLM-5V-Turbo 接入示例

海鲸AI 兼容 OpenAI 接口协议,可直接使用 OpenAI SDK 或 HTTP 请求接入,默认开启流式输出。

js
curl https://api.haijingai.com/v2/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer <API_KEY>" \
  -d '{
    "model": "GLM-5V-Turbo",
    "messages": [
      {"role": "system", "content": "你是一个有帮助的助手。"},
      {"role": "user", "content": "你好!"}
    ],
    "provider": { "channel": "direct" },
    "stream": true
  }'
# provider 为可选字段,删除该行即使用默认通
js
from openai import OpenAI

client = OpenAI(
    base_url="https://api.haijingai.com/v2",
    api_key="<API_KEY>",
)

stream = client.chat.completions.create(
    model="GLM-5V-Turbo",
    messages=[
        {"role": "system", "content": "你是一个有帮助的助手。"},
        {"role": "user", "content": "你好!"},
    ],
    stream=True,
    # 可选:指定服务通道,不传则使用默认通道
    extra_body={"provider": {"channel": "direct"}},
)

for chunk in stream:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)
js
import OpenAI from 'openai'

const client = new OpenAI({
  baseURL: 'https://api.haijingai.com/v2',
  apiKey: '<API_KEY>',
})

const stream = await client.chat.completions.create({
  model: 'GLM-5V-Turbo',
  messages: [
    { role: 'system', content: '你是一个有帮助的助手。' },
    { role: 'user', content: '你好!' },
  ],
  stream: true,
  // 可选:指定服务通道,不传则使用默认通道
  // @ts-expect-error provider 为海鲸AI 扩展字段,不在 OpenAI SDK 类型定义内
  provider: { channel: 'direct' },
})

for await (const chunk of stream) {
  process.stdout.write(chunk.choices[0]?.delta?.content ?? '')
}