直连通道
官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入上下文 | 输入 | 输出 |
|---|---|---|
| ≤ 256K | 0.29/M | 1.18/M |
| > 256K | 0.88/M | 3.53/M |
Qwen3.7-Plus是阿里巴巴Qwen3.7系列中的一款高性价比机型。它支持文本和图像输入以及文本输出,以该系列的文本功能为基础,对其视觉语言能力进行了全面升级,同时保留了编码、工具使用和生产力工作流程的全栈、代理级智能。其显着特征是多模式交互式混合代理功能:它可以感知现实世界场景、读取屏幕并与 GUI 交互、从视觉参考生成代码以及在移动应用程序中执行端到端导航。
同一模型能力,多条服务通道;按延迟、稳定性与成本灵活选择。
价格单位:$ / 1M tokensprovider 字段,例如 "provider": { "channel": "direct" }。可选 direct / stable / economical;不传则使用默认通道。官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入上下文 | 输入 | 输出 |
|---|---|---|
| ≤ 256K | 0.29/M | 1.18/M |
| > 256K | 0.88/M | 3.53/M |
Qwen3.7-Plus 是阿里 Qwen3.7 系列中的高性价比机型,采用稠密架构。它支持文本和图像输入以及文本输出,在该系列文本能力的基础上对视觉语言能力做了全面升级,同时保留了编码、工具使用和生产力工作流的全栈智能体级智能。
它最显著的特征是多模态交互式混合智能体能力:可以感知现实世界场景、读取屏幕并与 GUI 交互、从视觉信息中提取任务要素并驱动后续执行。在 Arena AI 综合评测中,Qwen3.7-Plus-Preview 取得 1156 分,接近 Claude Opus 4.7 的 1189 分。
海鲸AI 通过 OpenAI 兼容接口提供 Qwen3.7-Plus,支持多模态输入、工具调用与流式输出。
获取 API 密钥 · 模型 ID:
qwen3.7-plus
这是 Qwen3.7-Plus 最有辨识度的能力:它可以读取屏幕内容、理解界面结构、判断可操作元素,并驱动后续的点击、输入等动作。这让基于视觉的自动化不再依赖脆弱的选择器。
除了屏幕,它也能理解现实世界的图像场景——设备状态、环境布局、图表数据——并把视觉信息转化为可执行的任务要素。
在多模态能力升级的同时,Qwen3.7-Plus 保留了完整的编码、工具使用和生产力工作流能力,是一个能力均衡的通用智能体基座。
Qwen3.7 系列首次实现文本、图像、代码的统一推理链,突破了以往模型只支持文本思考链的限制。
| 场景 | 说明 |
|---|---|
| GUI 自动化 | 读屏幕、判断状态、驱动操作 |
| 视觉测试 | 基于界面理解的自动化测试 |
| 多模态客服 | 用户发来截图后的问题诊断 |
| 现场质检 | 图像判断与后续动作触发 |
| 图文文档处理 | 图表、表格、混排文档解析 |
| 高性价比智能体 | 需要多模态但预算有限的场景 |
| 能力 | Qwen3.7-Plus | Qwen3.7-Max | Qwen3.6-Plus |
|---|---|---|---|
| 模型 ID | qwen3.7-plus |
qwen3.7-max |
qwen3.6-plus |
| 架构 | 稠密 | 万亿参数 MoE | 混合架构 |
| 输入模态 | 文本、图像 | 文本 | 文本、图像 |
| 上下文窗口 | 100 万 token | 100 万 token | 100 万 token |
| 最大输出 | 128K token | 128K token | 65.5K token |
| Arena AI | 1156 | 1284 | — |
| 侧重 | 屏幕理解与 GUI 交互 | 智能体编码与自主执行 | 智能体编码与前端 |
具体计费以页面上方的实时价格卡片为准。
1. 创建海鲸AI API 密钥 在控制台生成密钥并充值。
2. 把视觉当成决策输入 Qwen3.7-Plus 的价值在于"看完之后做什么"。提示词里说清楚目标动作,而不只是要求描述图像。
3. 调用接口
curl -X POST https://api.haijingai.com/v1/chat/completions \
-H 'Authorization: Bearer YOUR_API_KEY' \
-H 'Content-Type: application/json' \
-d '{
"model": "qwen3.7-plus",
"messages": [{
"role": "user",
"content": [
{"type": "image_url", "image_url": {"url": "https://example.com/screen.png"}},
{"type": "text", "text": "当前页面处于什么状态?要完成下单还需要点哪些元素?"}
]
}],
"stream": true
}'
Plus 和 Max 怎么选? 需要图像输入、屏幕理解或 GUI 交互选 Plus;纯文本的智能体编码和长期自主执行选 Max。Plus 的性价比也更高。
"混合智能体"是什么意思? 指模型能同时处理视觉感知和动作执行两端——不只是理解图像,还能基于理解驱动后续操作,形成完整闭环。
Arena AI 1156 分是什么水平? 接近 Claude Opus 4.7 的 1189 分,在多模态模型中处于第一梯队。
上下文和输出上限? 100 万 token 上下文,最大输出 128K token。
全领域思考模式有什么用? 它让图像信息可以直接参与推理过程,而不是先转成文字描述再推理,在图文混合问题上准确率更高。
适合做 GUI 自动化吗? 适合。基于视觉理解的自动化比依赖 DOM 选择器的方案更鲁棒,界面改版后不容易失效。
qwen3.7-plushttps://api.haijingai.com/v2/"provider": { "channel": "direct" }海鲸AI 兼容 OpenAI 接口协议,可直接使用 OpenAI SDK 或 HTTP 请求接入,默认开启流式输出。
curl https://api.haijingai.com/v2/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer <API_KEY>" \
-d '{
"model": "qwen3.7-plus",
"messages": [
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"}
],
"provider": { "channel": "direct" },
"stream": true
}'
# provider 为可选字段,删除该行即使用默认通道from openai import OpenAI
client = OpenAI(
base_url="https://api.haijingai.com/v2",
api_key="<API_KEY>",
)
stream = client.chat.completions.create(
model="qwen3.7-plus",
messages=[
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"},
],
stream=True,
# 可选:指定服务通道,不传则使用默认通道
extra_body={"provider": {"channel": "direct"}},
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)import OpenAI from 'openai'
const client = new OpenAI({
baseURL: 'https://api.haijingai.com/v2',
apiKey: '<API_KEY>',
})
const stream = await client.chat.completions.create({
model: 'qwen3.7-plus',
messages: [
{ role: 'system', content: '你是一个有帮助的助手。' },
{ role: 'user', content: '你好!' },
],
stream: true,
// 可选:指定服务通道,不传则使用默认通道
// @ts-expect-error provider 为海鲸AI 扩展字段,不在 OpenAI SDK 类型定义内
provider: { channel: 'direct' },
})
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? '')
}