直连通道
官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入上下文 | 输入 | 输出 | 缓存命中 |
|---|---|---|---|
| ≤ 32K | 0.74/M | 3.24/M | 0.18/M |
| > 32K | 1.03/M | 3.82/M | 0.26/M |
GLM-5V-Turbo 是智谱首个多模态 Agent 基座模型,面向视觉编程与复杂任务场景深度优化,支持图像、视频、文本与文件等多模态输入,强化视觉理解、长程规划与动作执行能力。相比通用多模态模型,它更适合融入 Agent 工作流,完成「环境感知 → 任务规划 → 执行落地」的完整闭环,让多模态能力从“能看懂”走向“能行动”。
同一模型能力,多条服务通道;按延迟、稳定性与成本灵活选择。
价格单位:$ / 1M tokensprovider 字段,例如 "provider": { "channel": "direct" }。可选 direct / stable / economical;不传则使用默认通道。官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入上下文 | 输入 | 输出 | 缓存命中 |
|---|---|---|---|
| ≤ 32K | 0.74/M | 3.24/M | 0.18/M |
| > 32K | 1.03/M | 3.82/M | 0.26/M |
GLM-5V-Turbo 是智谱首个多模态 Agent 基座模型,面向视觉编程与复杂任务场景做了深度优化。它支持图像、视频、文本与文件等多模态输入,强化了视觉理解、长程规划与动作执行能力。
相比通用多模态模型,GLM-5V-Turbo 更适合融入 Agent 工作流,完成「环境感知 → 任务规划 → 执行落地」的完整闭环——让多模态能力从"能看懂"走向"能干活"。
海鲸AI 通过 OpenAI 兼容接口提供 GLM-5V-Turbo,支持多模态输入、工具调用与流式输出。
获取 API 密钥 · 模型 ID:
GLM-5V-Turbo
GLM-5V-Turbo 针对视觉编程场景做了深度优化:看设计稿写前端、看截图定位 UI 问题、看图表生成数据处理代码。这是多模态能力最直接的工程价值。
作为 Agent 基座模型,它的强项在于把视觉理解转化为具体动作:识别界面元素、判断当前状态、决定下一步操作。
在需要多步骤完成的视觉任务中,GLM-5V-Turbo 能维持对整体目标的规划,而不是每一步都重新开始判断。
图像、视频、文本、文件在同一上下文中统一处理,适合需要跨模态关联推理的场景。
| 场景 | 说明 |
|---|---|
| 视觉编程 | 设计稿转前端代码、截图问题定位 |
| 界面自动化 | 基于视觉的 UI 操作与测试 |
| 多模态 Agent | 需要看懂环境再决策执行的智能体 |
| 视频内容分析 | 时序理解与内容提取 |
| 文档理解 | 图文混排文档的完整解析 |
| 质检与巡检 | 基于图像的判断与后续动作触发 |
| 能力 | GLM-5V-Turbo | GLM-5 Turbo | Gemini 3.5 Flash |
|---|---|---|---|
| 模型 ID | GLM-5V-Turbo |
GLM-5-Turbo |
gemini-3.5-flash |
| 定位 | 多模态 Agent 基座 | 纯文本智能体快速档 | 高效多模态主力 |
| 输入模态 | 图像、视频、文本、文件 | 文本 | 文本、图像、视频、音频、PDF |
| 上下文窗口 | 13.1 万 token | 13.1 万 token | 10.5 万 token |
| 最大输出 | 32K token | 131K token | 64K token |
| 侧重 | 视觉编程与动作执行 | 长执行链稳定性 | 编码与并行智能体 |
具体计费以页面上方的实时价格卡片为准。
1. 创建海鲸AI API 密钥 在控制台生成密钥并充值。
2. 把视觉当成上下文的一部分 GLM-5V-Turbo 的优势不在单纯的图像描述,而在"看了之后要做什么"。提示词里把目标动作说清楚,效果最好。
3. 调用接口
curl -X POST https://api.haijingai.com/v1/chat/completions \
-H 'Authorization: Bearer YOUR_API_KEY' \
-H 'Content-Type: application/json' \
-d '{
"model": "GLM-5V-Turbo",
"messages": [{
"role": "user",
"content": [
{"type": "image_url", "image_url": {"url": "https://example.com/design.png"}},
{"type": "text", "text": "按这张设计稿实现对应的 Vue 组件,注意间距和字号。"}
]
}],
"stream": true
}'
它和普通多模态模型有什么不同? 普通多模态模型的目标是"看懂",GLM-5V-Turbo 的目标是"看懂之后能干活"——它把视觉理解、长程规划和动作执行整合成一条闭环,更适合融入 Agent 工作流。
支持哪些输入模态? 图像、视频、文本和文件。输出为文本。
视觉编程能力具体指什么? 包括设计稿转代码、界面截图的问题定位、图表数据的代码化处理等——把视觉信息直接转化为可执行的工程产出。
上下文和输出上限? 131,000 token 上下文,最大输出 32,000 token。
适合做界面自动化吗? 适合。它针对「环境感知 → 任务规划 → 执行落地」的闭环做了优化,是基于视觉的自动化场景的合适选择。
能处理视频吗? 可以。支持视频输入和时序理解,适合内容分析类场景。
GLM-5V-Turbohttps://api.haijingai.com/v2/"provider": { "channel": "direct" }海鲸AI 兼容 OpenAI 接口协议,可直接使用 OpenAI SDK 或 HTTP 请求接入,默认开启流式输出。
curl https://api.haijingai.com/v2/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer <API_KEY>" \
-d '{
"model": "GLM-5V-Turbo",
"messages": [
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"}
],
"provider": { "channel": "direct" },
"stream": true
}'
# provider 为可选字段,删除该行即使用默认通道from openai import OpenAI
client = OpenAI(
base_url="https://api.haijingai.com/v2",
api_key="<API_KEY>",
)
stream = client.chat.completions.create(
model="GLM-5V-Turbo",
messages=[
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"},
],
stream=True,
# 可选:指定服务通道,不传则使用默认通道
extra_body={"provider": {"channel": "direct"}},
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)import OpenAI from 'openai'
const client = new OpenAI({
baseURL: 'https://api.haijingai.com/v2',
apiKey: '<API_KEY>',
})
const stream = await client.chat.completions.create({
model: 'GLM-5V-Turbo',
messages: [
{ role: 'system', content: '你是一个有帮助的助手。' },
{ role: 'user', content: '你好!' },
],
stream: true,
// 可选:指定服务通道,不传则使用默认通道
// @ts-expect-error provider 为海鲸AI 扩展字段,不在 OpenAI SDK 类型定义内
provider: { channel: 'direct' },
})
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? '')
}