Skip to content
登录/注册

Gemini 3.8 Flash

gemini-3.8-flash

Google 最新推出的 Flash 级工具,适用于编码、智能体工作流程、知识工作和多模态推理,据报道其准确率高于 Gemini 3.7 Flash,并拥有 100 万个标记的上下文窗口。

上下文窗口1.0M
提供商Gemini
创建时间2026/09/04

在线体验

定价

同一模型能力,多条服务通道;按延迟、稳定性与成本灵活选择。

价格单位:$ / 1M tokens
指定服务通道:在请求体加入 provider 字段,例如 "provider": { "channel": "direct" }。可选 direct / stable / economical;不传则使用默认通道。

直连通道

官方直连链路,适合需要原生体验与完整上下文的请求。

输入输出缓存命中
0.75/M3.75/M0.07/M

介绍

输入
文本 图像
输出
文本

Gemini 3.8 Flash API:把专业智能体任务做到旗舰之上的 Flash 档

Gemini 3.8 Flash 是 Google 于 2026 年 9 月 2 日发布的多模态模型,距离 3.7 Flash 只隔三周——这是六周内的第三个 Flash 模型。它延续 Flash 档的成本定位,但在编码和智能体方向的涨幅是这一系列少见的:DeepSWE v1.1 从 65.3% 提到 73.7%,OSWorld 2.0 从 50.6% 提到 59.0%,两项都是 8.4 个百分点。

它的设计取向是"愿意多花力气":面对复杂任务会执行额外的推理步骤、反复调用工具,然后才给答案。代价是高档位下 token 用量上升,收益是在金融、法律这类垂直智能体评测上直接压过体量大得多的旗舰——Vals Finance Agent v2 拿到 61.4%(Claude Opus 5 58.6%、GPT-5.6 Sol 53.8%),Harvey 法律智能体 10.0%(Opus 5 6.7%、Sol 2.5%)。

需要注意的是 3.8 Flash 引入了不向后兼容的 API 变更temperaturetop_ptop_kcandidate_count 被移除,thinking_budget 换成了字符串枚举 thinking_level。从旧版迁移的代码需要改。

海鲸AI 通过 OpenAI 兼容接口提供 Gemini 3.8 Flash,支持工具调用、思考档位控制、流式输出与多模态输入。

获取 API 密钥 · 模型 ID:gemini-3.8-flash


为什么选择 Gemini 3.8 Flash

  • 垂直智能体压过旗舰 —— Vals Finance Agent v2 61.4%、Harvey 法律 10.0%,两项都高于 Opus 5 与 GPT-5.6 Sol
  • 编码大幅跃升 —— DeepSWE v1.1 从 3.7 Flash 的 65.3% 提到 73.7%
  • 电脑操作提升 8.4 分 —— OSWorld 2.0 从 50.6% 到 59.0%
  • Terminal-Bench 2.1 89.4% —— 略高于 Opus 5 的 89.1% 与 Sol 的 88.8%
  • 长视频理解领先 —— LVBench 87.8%,比 Opus 5 的 75.4% 高出 12 个百分点
  • 100 万 token 上下文 + 全模态输入 —— 文本、图像、音频、视频、PDF,最大输出 6.4 万 token

核心能力

01 长周期编码

DeepSWE v1.1 73.7%,比 3.7 Flash 高 8.4 个百分点,与 Claude Opus 5 的 74.0% 只差 0.3 分——这是 Flash 档位第一次在长周期软件工程上贴住旗舰。Terminal-Bench 2.1 89.4%,同样小幅领先 Opus 5 和 GPT-5.6 Sol。

  • 端到端的复杂工程问题求解
  • 真实终端环境中的多步执行
  • 代码库级的重构与缺陷修复

02 垂直领域智能体

这是 3.8 Flash 最反直觉的一块:在金融和法律的专业智能体评测上,它直接超过了价格档位高得多的旗舰模型。Vals Finance Agent v2 61.4%(Opus 5 58.6%、Sol 53.8%),Harvey 法律智能体 10.0%(Opus 5 6.7%、Sol 2.5%)。GDPval-AA v2 也从 1482 Elo 涨到 1545。

  • 金融数据分析与报告类智能体
  • 法律文档处理与合规流程
  • 真实职业任务的多步编排

03 全模态理解

支持文本、图像、音频、视频与 PDF 输入,输出为文本。LVBench 87.8%(3.7 Flash 85.4%,Opus 5 仅 75.4%),长视频理解是它拉开差距最明显的多模态方向。CharXiv 图表推理 86.2%。

  • 长视频内容理解与检索
  • 科研图表与数据可视化解读
  • PDF、音频等混合资料的统一处理

04 思考档位与工具编排

thinking_level 支持 lowmediumhigh 三档,默认 medium(该模型不支持 minimal)。高档位下模型会主动增加推理步数并反复调用工具。内置工具覆盖 Google 搜索、Google 地图、代码执行、URL 上下文、文件检索与 computer use。

  • 按任务难度切换思考深度
  • 迭代式工具调用与结果校验
  • 结构化输出与函数调用

最佳使用场景

场景 说明
金融分析智能体 Vals Finance Agent v2 61.4%,高于 Opus 5 与 GPT-5.6 Sol
法律文档智能体 Harvey 法律评测 10.0%,为对比模型中最高
长周期编码 DeepSWE v1.1 73.7%,与 Opus 5 仅差 0.3 分
长视频理解 LVBench 87.8%,比 Opus 5 高 12 个百分点
生物医学研究 LABBench2 86.2%,BioMysteryBench 难题档 43.5%→56.5%
高并发生产流量 Flash 档成本跑专业级智能体任务

Gemini 3.8 Flash 与 Gemini 3.7 Flash、Claude Opus 5 的差异

能力 Gemini 3.8 Flash Gemini 3.7 Flash Claude Opus 5
模型 ID gemini-3.8-flash gemini-3.7-flash claude-opus-5
厂商 Google Google Anthropic
发布日期 2026-09-02 2026-08-13
DeepSWE v1.1 73.7% 65.3% 74.0%
Terminal-Bench 2.1 89.4% 85.8% 89.1%
Terminal-Bench 4.0 19.1% 11.2% 51.8%
OSWorld 2.0 59.0% 50.6% 75.4%
Vals Finance Agent v2 61.4% 59.0% 58.6%
Harvey 法律智能体 10.0% 8.8% 6.7%
HLE-Verified 54.9% 53.6%
LVBench 87.8% 85.4% 75.4%
上下文窗口 100 万 token 100 万 token
最大输出 6.4 万 token
输入模态 文本/图像/音频/视频/PDF 同左 文本/图像
思考档位 low/medium/high thinking_budget 数值 可调
定位 专业智能体的 Flash 档主力 上一代 Flash 主力 通用旗舰

具体计费以页面上方的实时价格卡片为准。


常见问题

Gemini 3.8 Flash 什么时候发布的? 2026 年 9 月 2 日发布,距 3.7 Flash(8 月 13 日)只有三周,是六周内的第三个 Flash 模型。同期还发布了受限访问的 Gemini 3.8 Flash Cyber。

和 Gemini 3.7 Flash 比升级了什么? Google 报告的基准全部上涨,涨幅最大的是编码和电脑操作:DeepSWE v1.1 +8.4 分(65.3%→73.7%)、OSWorld 2.0 +8.4 分(50.6%→59.0%)、Terminal-Bench 4.0 +7.9 分。生物医学难题档提升也很大,BioMysteryBench 人类难解组从 43.5% 到 56.5%。知识类涨幅小得多,HLE-Verified 只 +1.3 分。

有落后的地方吗? 有,而且是结构性的。它在最难的通用智能体测试上明显落后:Terminal-Bench 4.0 只有 19.1%,Opus 5 是 51.8%、GPT-5.6 Sol 是 37.3%;OSWorld 2.0 的 59.0% 也低于 Opus 5 的 75.4%。规律很清楚——它赢的是更便宜、更垂直的智能体任务,输的是开放式的高难度长链路任务。此外知识类提升有限,GDP.PDF 35.0% 低于 Sol 的 40.0%。

上下文和输出上限是多少? 上下文窗口 100 万 token,最大输出 6.4 万 token。输入支持文本、图像、音频、视频与 PDF,输出为纯文本。

思考档位怎么设? thinking_level 三档:lowmediumhigh,默认 mediumminimal 档这个模型不支持。转写检索、基础元数据抽取这类任务用 low;密集推理用 high。注意 high 档模型会主动增加推理步数和工具调用,token 用量会明显上升。

从旧版本迁移要改代码吗? 要。3.8 Flash 移除了 temperaturetop_ptop_kcandidate_count 四个参数,thinking_budget 被字符串枚举 thinking_level 取代。函数调用侧 FunctionResponse 需要带 call_idname 字段,多模态资源必须放在响应负载中。多轮会话依赖服务端的 previous_interaction_id,不再支持预填模型回合。

Gemini 3.8 Flash Cyber 是什么?能直接用吗? 不能。它是同期发布的安全专用变体,通过 Fairwind 计划只向经审核的政府机构、关键基础设施运营方和软件维护者开放,安全护栏更宽松。Google 称它生成的正确 Chrome 漏洞补丁数是最强商用模型的 2.6 倍,真实漏洞发现成功率超过 70%(覆盖 20 种编程语言);CWE-Bench 补丁 pass@1 为 47.2%,与领先旗舰的 47.8% 基本持平。标准版 gemini-3.8-flash 不含这些放宽的能力。


为什么选择海鲸AI 使用 Gemini 3.8 Flash API

  • 无需海外账户 —— 国内直连,不用自建代理
  • OpenAI 兼容接口 —— 现有代码改两行即可接入
  • 跨厂商横向对比 —— 与 Claude、GPT、Grok 在同一账户下直接比价比效果
  • 统一账单 —— 多模型用量与花费集中管理

API

API 接入信息

Model ID在推理接口中指定模型
gemini-3.8-flash
API Key推理接口的 Bearer Token(鉴权令牌)
Base URL兼容 OpenAI 协议 · /chat/completions
OpenAIhttps://api.haijingai.com/v2/
provider 可选指定服务通道,不传则由系统选择默认通道
"provider": { "channel": "direct" }

gemini-3.8-flash 接入示例

海鲸AI 兼容 OpenAI 接口协议,可直接使用 OpenAI SDK 或 HTTP 请求接入,默认开启流式输出。

js
curl https://api.haijingai.com/v2/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer <API_KEY>" \
  -d '{
    "model": "gemini-3.8-flash",
    "messages": [
      {"role": "system", "content": "你是一个有帮助的助手。"},
      {"role": "user", "content": "你好!"}
    ],
    "provider": { "channel": "direct" },
    "stream": true
  }'
# provider 为可选字段,删除该行即使用默认通
js
from openai import OpenAI

client = OpenAI(
    base_url="https://api.haijingai.com/v2",
    api_key="<API_KEY>",
)

stream = client.chat.completions.create(
    model="gemini-3.8-flash",
    messages=[
        {"role": "system", "content": "你是一个有帮助的助手。"},
        {"role": "user", "content": "你好!"},
    ],
    stream=True,
    # 可选:指定服务通道,不传则使用默认通道
    extra_body={"provider": {"channel": "direct"}},
)

for chunk in stream:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)
js
import OpenAI from 'openai'

const client = new OpenAI({
  baseURL: 'https://api.haijingai.com/v2',
  apiKey: '<API_KEY>',
})

const stream = await client.chat.completions.create({
  model: 'gemini-3.8-flash',
  messages: [
    { role: 'system', content: '你是一个有帮助的助手。' },
    { role: 'user', content: '你好!' },
  ],
  stream: true,
  // 可选:指定服务通道,不传则使用默认通道
  // @ts-expect-error provider 为海鲸AI 扩展字段,不在 OpenAI SDK 类型定义内
  provider: { channel: 'direct' },
})

for await (const chunk of stream) {
  process.stdout.write(chunk.choices[0]?.delta?.content ?? '')
}