Skip to content
登录/注册

Gemini 3.5 Flash

gemini-3.5-flash

Gemini 3.5 Flash 是 Google 的高效多模态模型,以 Flash 级别的成本和速度带来接近 Pro 级别的编码和推理。它针对编码能力和并行代理执行循环进行了高度优化,支持文本、图像、视频、音频和 PDF 输入。 默认为中等思维努力,以获得更快、更具成本效益的响应,并完全支持思维级别(最小、低、中、高)以实现细粒度的成本/性能权衡。

上下文窗口105K
提供商Gemini
创建时间2026/05/20

在线体验

定价

同一模型能力,多条服务通道;按延迟、稳定性与成本灵活选择。

价格单位:$ / 1M tokens
指定服务通道:在请求体加入 provider 字段,例如 "provider": { "channel": "direct" }。可选 direct / stable / economical;不传则使用默认通道。

直连通道

官方直连链路,适合需要原生体验与完整上下文的请求。

输入输出缓存命中
1.50/M9.00/M0.15/M

介绍

输入
文本 图像
输出
文本

Gemini 3.5 Flash API:Flash 成本跑出 Pro 级编码能力

Gemini 3.5 Flash 是 Google 在 2026 年 5 月 I/O 大会上发布的高效多模态模型,也是 Gemini 3.5 系列的首个成员。它的核心卖点很直接:以 Flash 级的成本和速度,交付接近 Pro 级的编码与推理能力

Google 公布的数据显示,Gemini 3.5 Flash 在编码和智能体基准上超过 Gemini 3.1 Pro,同时输出速度快 4 倍,任务完成成本往往不到一半。它针对编码能力和并行智能体执行循环做了专门优化,支持文本、图像、视频、音频和 PDF 输入。

海鲸AI 通过 OpenAI 兼容接口提供 Gemini 3.5 Flash,支持工具调用、流式输出与多模态输入。

获取 API 密钥 · 模型 ID:gemini-3.5-flash


为什么选择 Gemini 3.5 Flash

  • 超过上一代 Pro 的编码表现 —— 在编码与智能体基准上优于 Gemini 3.1 Pro
  • 输出速度快 4 倍 —— 同样的任务往往在一半以下的成本内完成
  • Terminal-Bench 2.1 76.2% —— 真实终端环境中的执行力
  • GDPval-AA 1656 Elo —— 真实职业任务上的综合表现
  • MCP Atlas 83.6% —— 大规模工具调用场景下的可靠性
  • 全模态输入 —— 文本、图像、视频、音频、PDF 统一处理

核心能力

01 编码与并行智能体执行

Gemini 3.5 Flash 专门针对编码能力和并行智能体执行循环做了优化。在需要同时跑多个子任务的智能体架构里,它的速度优势会被进一步放大。

  • 多文件代码生成与修改
  • 并行子智能体执行循环
  • 终端环境中的命令执行与验证

02 大规模工具调用可靠性

MCP Atlas 83.6% 衡量的是工具调用在规模化场景下的可靠性——参数构造正确、调用时机恰当、结果处理稳定。这对生产级智能体是关键指标。

  • 多工具编排与并行调用
  • 参数构造的准确性
  • 长链路调用中的稳定性

03 全模态理解

支持文本、图像、视频、音频和 PDF 输入,CharXiv Reasoning 84.2% 反映了它在图表这类复杂视觉推理上的表现。

  • 图表与科学图像推理
  • 视频内容理解
  • 音频转写与理解
  • PDF 文档解析

04 可调思维档位

默认使用中等思考强度以获得更快、更具成本效益的响应,同时完整支持从最小到最高的思考档位,可以按任务难度精确分配算力。

  • 默认中等思考,兼顾速度与质量
  • 高难度任务可上调思考深度
  • 简单任务可降到最低档

最佳使用场景

场景 说明
高吞吐编码助手 需要快速响应的代码补全与修改
并行智能体架构 同时跑多个子任务的执行循环
大规模工具调用 MCP 等工具协议下的生产级智能体
图表与科学分析 CharXiv 类的复杂视觉推理
多模态处理 视频、音频、PDF 的统一理解
成本敏感的生产部署 用 Flash 价格拿到接近 Pro 的能力

Gemini 3.5 Flash 与 Gemini 3.1 Pro、3.1 Flash Lite 的差异

能力 Gemini 3.5 Flash Gemini 3.1 Pro Preview Gemini 3.1 Flash Lite
模型 ID gemini-3.5-flash gemini-3.1-pro-preview gemini-3.1-flash-lite-preview
定位 高效多模态主力 上一代旗舰 大容量经济档
编码能力 超过 3.1 Pro 前沿 基础
输出速度 4× 于 3.1 Pro 标准
Terminal-Bench 2.1 76.2%
输入模态 文本、图像、视频、音频、PDF 文本、图像 文本、图像

具体计费以页面上方的实时价格卡片为准。


如何使用 Gemini 3.5 Flash API

1. 创建海鲸AI API 密钥 在控制台生成密钥并充值。

2. 从默认思考档位开始 Gemini 3.5 Flash 默认使用中等思考强度,这对大多数任务是合适的起点。只在质量不达标时上调。

3. 调用接口

curl -X POST https://api.haijingai.com/v1/chat/completions \
  -H 'Authorization: Bearer YOUR_API_KEY' \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "gemini-3.5-flash",
    "messages": [
      {"role": "user", "content": "读取这份 CSV 的结构,写一个数据清洗脚本并说明每步的作用。"}
    ],
    "stream": true
  }'

常见问题

Gemini 3.5 Flash 什么时候发布的? 2026 年 5 月的 Google I/O 大会,是 Gemini 3.5 系列的首个模型。

它真的比 3.1 Pro 强吗? 在编码和智能体基准上是的,同时输出速度快 4 倍、成本往往不到一半。在某些需要极深推理的场景下 Pro 档位仍有优势,建议按自己的工作负载实测。

关键基准表现如何? Terminal-Bench 2.1 76.2%,GDPval-AA 1656 Elo,MCP Atlas 83.6%,CharXiv Reasoning 84.2%。

支持哪些输入模态? 文本、图像、视频、音频和 PDF——是本页所列模型中模态覆盖最全的之一。

思考档位怎么调? 默认中等。高难度推理任务可以上调,延迟敏感的高频任务可以降到最低档。

适合做并行智能体吗? 非常适合。它针对并行智能体执行循环做过专门优化,速度优势在扇出场景下被放大。


为什么选择海鲸AI 使用 Gemini 3.5 Flash API

  • 国内直连 —— 无需 Google Cloud 账户和海外网络
  • OpenAI 兼容接口 —— 现有代码改两行即可接入
  • 全模态统一入口 —— 视频、音频、PDF 与文本共用一套接口
  • 跨厂商对比 —— 与 GPT、Claude 系列在同一账户下横向比价比效果

API

API 接入信息

Model ID在推理接口中指定模型
gemini-3.5-flash
API Key推理接口的 Bearer Token(鉴权令牌)
Base URL兼容 OpenAI 协议 · /chat/completions
OpenAIhttps://api.haijingai.com/v2/
provider 可选指定服务通道,不传则由系统选择默认通道
"provider": { "channel": "direct" }

gemini-3.5-flash 接入示例

海鲸AI 兼容 OpenAI 接口协议,可直接使用 OpenAI SDK 或 HTTP 请求接入,默认开启流式输出。

js
curl https://api.haijingai.com/v2/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer <API_KEY>" \
  -d '{
    "model": "gemini-3.5-flash",
    "messages": [
      {"role": "system", "content": "你是一个有帮助的助手。"},
      {"role": "user", "content": "你好!"}
    ],
    "provider": { "channel": "direct" },
    "stream": true
  }'
# provider 为可选字段,删除该行即使用默认通
js
from openai import OpenAI

client = OpenAI(
    base_url="https://api.haijingai.com/v2",
    api_key="<API_KEY>",
)

stream = client.chat.completions.create(
    model="gemini-3.5-flash",
    messages=[
        {"role": "system", "content": "你是一个有帮助的助手。"},
        {"role": "user", "content": "你好!"},
    ],
    stream=True,
    # 可选:指定服务通道,不传则使用默认通道
    extra_body={"provider": {"channel": "direct"}},
)

for chunk in stream:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)
js
import OpenAI from 'openai'

const client = new OpenAI({
  baseURL: 'https://api.haijingai.com/v2',
  apiKey: '<API_KEY>',
})

const stream = await client.chat.completions.create({
  model: 'gemini-3.5-flash',
  messages: [
    { role: 'system', content: '你是一个有帮助的助手。' },
    { role: 'user', content: '你好!' },
  ],
  stream: true,
  // 可选:指定服务通道,不传则使用默认通道
  // @ts-expect-error provider 为海鲸AI 扩展字段,不在 OpenAI SDK 类型定义内
  provider: { channel: 'direct' },
})

for await (const chunk of stream) {
  process.stdout.write(chunk.choices[0]?.delta?.content ?? '')
}