直连通道
官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入 | 输出 | 缓存命中 |
|---|---|---|
| 1.50/M | 9.00/M | 0.15/M |
Gemini 3.5 Flash 是 Google 的高效多模态模型,以 Flash 级别的成本和速度带来接近 Pro 级别的编码和推理。它针对编码能力和并行代理执行循环进行了高度优化,支持文本、图像、视频、音频和 PDF 输入。 默认为中等思维努力,以获得更快、更具成本效益的响应,并完全支持思维级别(最小、低、中、高)以实现细粒度的成本/性能权衡。
同一模型能力,多条服务通道;按延迟、稳定性与成本灵活选择。
价格单位:$ / 1M tokensprovider 字段,例如 "provider": { "channel": "direct" }。可选 direct / stable / economical;不传则使用默认通道。官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入 | 输出 | 缓存命中 |
|---|---|---|
| 1.50/M | 9.00/M | 0.15/M |
Gemini 3.5 Flash 是 Google 在 2026 年 5 月 I/O 大会上发布的高效多模态模型,也是 Gemini 3.5 系列的首个成员。它的核心卖点很直接:以 Flash 级的成本和速度,交付接近 Pro 级的编码与推理能力。
Google 公布的数据显示,Gemini 3.5 Flash 在编码和智能体基准上超过 Gemini 3.1 Pro,同时输出速度快 4 倍,任务完成成本往往不到一半。它针对编码能力和并行智能体执行循环做了专门优化,支持文本、图像、视频、音频和 PDF 输入。
海鲸AI 通过 OpenAI 兼容接口提供 Gemini 3.5 Flash,支持工具调用、流式输出与多模态输入。
获取 API 密钥 · 模型 ID:
gemini-3.5-flash
Gemini 3.5 Flash 专门针对编码能力和并行智能体执行循环做了优化。在需要同时跑多个子任务的智能体架构里,它的速度优势会被进一步放大。
MCP Atlas 83.6% 衡量的是工具调用在规模化场景下的可靠性——参数构造正确、调用时机恰当、结果处理稳定。这对生产级智能体是关键指标。
支持文本、图像、视频、音频和 PDF 输入,CharXiv Reasoning 84.2% 反映了它在图表这类复杂视觉推理上的表现。
默认使用中等思考强度以获得更快、更具成本效益的响应,同时完整支持从最小到最高的思考档位,可以按任务难度精确分配算力。
| 场景 | 说明 |
|---|---|
| 高吞吐编码助手 | 需要快速响应的代码补全与修改 |
| 并行智能体架构 | 同时跑多个子任务的执行循环 |
| 大规模工具调用 | MCP 等工具协议下的生产级智能体 |
| 图表与科学分析 | CharXiv 类的复杂视觉推理 |
| 多模态处理 | 视频、音频、PDF 的统一理解 |
| 成本敏感的生产部署 | 用 Flash 价格拿到接近 Pro 的能力 |
| 能力 | Gemini 3.5 Flash | Gemini 3.1 Pro Preview | Gemini 3.1 Flash Lite |
|---|---|---|---|
| 模型 ID | gemini-3.5-flash |
gemini-3.1-pro-preview |
gemini-3.1-flash-lite-preview |
| 定位 | 高效多模态主力 | 上一代旗舰 | 大容量经济档 |
| 编码能力 | 超过 3.1 Pro | 前沿 | 基础 |
| 输出速度 | 4× 于 3.1 Pro | 标准 | 快 |
| Terminal-Bench 2.1 | 76.2% | — | — |
| 输入模态 | 文本、图像、视频、音频、PDF | 文本、图像 | 文本、图像 |
具体计费以页面上方的实时价格卡片为准。
1. 创建海鲸AI API 密钥 在控制台生成密钥并充值。
2. 从默认思考档位开始 Gemini 3.5 Flash 默认使用中等思考强度,这对大多数任务是合适的起点。只在质量不达标时上调。
3. 调用接口
curl -X POST https://api.haijingai.com/v1/chat/completions \
-H 'Authorization: Bearer YOUR_API_KEY' \
-H 'Content-Type: application/json' \
-d '{
"model": "gemini-3.5-flash",
"messages": [
{"role": "user", "content": "读取这份 CSV 的结构,写一个数据清洗脚本并说明每步的作用。"}
],
"stream": true
}'
Gemini 3.5 Flash 什么时候发布的? 2026 年 5 月的 Google I/O 大会,是 Gemini 3.5 系列的首个模型。
它真的比 3.1 Pro 强吗? 在编码和智能体基准上是的,同时输出速度快 4 倍、成本往往不到一半。在某些需要极深推理的场景下 Pro 档位仍有优势,建议按自己的工作负载实测。
关键基准表现如何? Terminal-Bench 2.1 76.2%,GDPval-AA 1656 Elo,MCP Atlas 83.6%,CharXiv Reasoning 84.2%。
支持哪些输入模态? 文本、图像、视频、音频和 PDF——是本页所列模型中模态覆盖最全的之一。
思考档位怎么调? 默认中等。高难度推理任务可以上调,延迟敏感的高频任务可以降到最低档。
适合做并行智能体吗? 非常适合。它针对并行智能体执行循环做过专门优化,速度优势在扇出场景下被放大。
gemini-3.5-flashhttps://api.haijingai.com/v2/"provider": { "channel": "direct" }海鲸AI 兼容 OpenAI 接口协议,可直接使用 OpenAI SDK 或 HTTP 请求接入,默认开启流式输出。
curl https://api.haijingai.com/v2/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer <API_KEY>" \
-d '{
"model": "gemini-3.5-flash",
"messages": [
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"}
],
"provider": { "channel": "direct" },
"stream": true
}'
# provider 为可选字段,删除该行即使用默认通道from openai import OpenAI
client = OpenAI(
base_url="https://api.haijingai.com/v2",
api_key="<API_KEY>",
)
stream = client.chat.completions.create(
model="gemini-3.5-flash",
messages=[
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"},
],
stream=True,
# 可选:指定服务通道,不传则使用默认通道
extra_body={"provider": {"channel": "direct"}},
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)import OpenAI from 'openai'
const client = new OpenAI({
baseURL: 'https://api.haijingai.com/v2',
apiKey: '<API_KEY>',
})
const stream = await client.chat.completions.create({
model: 'gemini-3.5-flash',
messages: [
{ role: 'system', content: '你是一个有帮助的助手。' },
{ role: 'user', content: '你好!' },
],
stream: true,
// 可选:指定服务通道,不传则使用默认通道
// @ts-expect-error provider 为海鲸AI 扩展字段,不在 OpenAI SDK 类型定义内
provider: { channel: 'direct' },
})
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? '')
}