直连通道
官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入 | 输出 | 缓存命中 |
|---|---|---|
| 0.75/M | 3.75/M | 0.07/M |
Google 最新推出的 Flash 级工具,适用于编码、智能体工作流程、知识工作和多模态推理,据报道其准确率高于 Gemini 3.7 Flash,并拥有 100 万个标记的上下文窗口。
同一模型能力,多条服务通道;按延迟、稳定性与成本灵活选择。
价格单位:$ / 1M tokensprovider 字段,例如 "provider": { "channel": "direct" }。可选 direct / stable / economical;不传则使用默认通道。官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入 | 输出 | 缓存命中 |
|---|---|---|
| 0.75/M | 3.75/M | 0.07/M |
Gemini 3.8 Flash 是 Google 于 2026 年 9 月 2 日发布的多模态模型,距离 3.7 Flash 只隔三周——这是六周内的第三个 Flash 模型。它延续 Flash 档的成本定位,但在编码和智能体方向的涨幅是这一系列少见的:DeepSWE v1.1 从 65.3% 提到 73.7%,OSWorld 2.0 从 50.6% 提到 59.0%,两项都是 8.4 个百分点。
它的设计取向是"愿意多花力气":面对复杂任务会执行额外的推理步骤、反复调用工具,然后才给答案。代价是高档位下 token 用量上升,收益是在金融、法律这类垂直智能体评测上直接压过体量大得多的旗舰——Vals Finance Agent v2 拿到 61.4%(Claude Opus 5 58.6%、GPT-5.6 Sol 53.8%),Harvey 法律智能体 10.0%(Opus 5 6.7%、Sol 2.5%)。
需要注意的是 3.8 Flash 引入了不向后兼容的 API 变更:temperature、top_p、top_k、candidate_count 被移除,thinking_budget 换成了字符串枚举 thinking_level。从旧版迁移的代码需要改。
海鲸AI 通过 OpenAI 兼容接口提供 Gemini 3.8 Flash,支持工具调用、思考档位控制、流式输出与多模态输入。
获取 API 密钥 · 模型 ID:
gemini-3.8-flash
DeepSWE v1.1 73.7%,比 3.7 Flash 高 8.4 个百分点,与 Claude Opus 5 的 74.0% 只差 0.3 分——这是 Flash 档位第一次在长周期软件工程上贴住旗舰。Terminal-Bench 2.1 89.4%,同样小幅领先 Opus 5 和 GPT-5.6 Sol。
这是 3.8 Flash 最反直觉的一块:在金融和法律的专业智能体评测上,它直接超过了价格档位高得多的旗舰模型。Vals Finance Agent v2 61.4%(Opus 5 58.6%、Sol 53.8%),Harvey 法律智能体 10.0%(Opus 5 6.7%、Sol 2.5%)。GDPval-AA v2 也从 1482 Elo 涨到 1545。
支持文本、图像、音频、视频与 PDF 输入,输出为文本。LVBench 87.8%(3.7 Flash 85.4%,Opus 5 仅 75.4%),长视频理解是它拉开差距最明显的多模态方向。CharXiv 图表推理 86.2%。
thinking_level 支持 low、medium、high 三档,默认 medium(该模型不支持 minimal)。高档位下模型会主动增加推理步数并反复调用工具。内置工具覆盖 Google 搜索、Google 地图、代码执行、URL 上下文、文件检索与 computer use。
| 场景 | 说明 |
|---|---|
| 金融分析智能体 | Vals Finance Agent v2 61.4%,高于 Opus 5 与 GPT-5.6 Sol |
| 法律文档智能体 | Harvey 法律评测 10.0%,为对比模型中最高 |
| 长周期编码 | DeepSWE v1.1 73.7%,与 Opus 5 仅差 0.3 分 |
| 长视频理解 | LVBench 87.8%,比 Opus 5 高 12 个百分点 |
| 生物医学研究 | LABBench2 86.2%,BioMysteryBench 难题档 43.5%→56.5% |
| 高并发生产流量 | Flash 档成本跑专业级智能体任务 |
| 能力 | Gemini 3.8 Flash | Gemini 3.7 Flash | Claude Opus 5 |
|---|---|---|---|
| 模型 ID | gemini-3.8-flash |
gemini-3.7-flash |
claude-opus-5 |
| 厂商 | Anthropic | ||
| 发布日期 | 2026-09-02 | 2026-08-13 | — |
| DeepSWE v1.1 | 73.7% | 65.3% | 74.0% |
| Terminal-Bench 2.1 | 89.4% | 85.8% | 89.1% |
| Terminal-Bench 4.0 | 19.1% | 11.2% | 51.8% |
| OSWorld 2.0 | 59.0% | 50.6% | 75.4% |
| Vals Finance Agent v2 | 61.4% | 59.0% | 58.6% |
| Harvey 法律智能体 | 10.0% | 8.8% | 6.7% |
| HLE-Verified | 54.9% | 53.6% | — |
| LVBench | 87.8% | 85.4% | 75.4% |
| 上下文窗口 | 100 万 token | 100 万 token | — |
| 最大输出 | 6.4 万 token | — | — |
| 输入模态 | 文本/图像/音频/视频/PDF | 同左 | 文本/图像 |
| 思考档位 | low/medium/high |
thinking_budget 数值 |
可调 |
| 定位 | 专业智能体的 Flash 档主力 | 上一代 Flash 主力 | 通用旗舰 |
具体计费以页面上方的实时价格卡片为准。
Gemini 3.8 Flash 什么时候发布的? 2026 年 9 月 2 日发布,距 3.7 Flash(8 月 13 日)只有三周,是六周内的第三个 Flash 模型。同期还发布了受限访问的 Gemini 3.8 Flash Cyber。
和 Gemini 3.7 Flash 比升级了什么? Google 报告的基准全部上涨,涨幅最大的是编码和电脑操作:DeepSWE v1.1 +8.4 分(65.3%→73.7%)、OSWorld 2.0 +8.4 分(50.6%→59.0%)、Terminal-Bench 4.0 +7.9 分。生物医学难题档提升也很大,BioMysteryBench 人类难解组从 43.5% 到 56.5%。知识类涨幅小得多,HLE-Verified 只 +1.3 分。
有落后的地方吗? 有,而且是结构性的。它在最难的通用智能体测试上明显落后:Terminal-Bench 4.0 只有 19.1%,Opus 5 是 51.8%、GPT-5.6 Sol 是 37.3%;OSWorld 2.0 的 59.0% 也低于 Opus 5 的 75.4%。规律很清楚——它赢的是更便宜、更垂直的智能体任务,输的是开放式的高难度长链路任务。此外知识类提升有限,GDP.PDF 35.0% 低于 Sol 的 40.0%。
上下文和输出上限是多少? 上下文窗口 100 万 token,最大输出 6.4 万 token。输入支持文本、图像、音频、视频与 PDF,输出为纯文本。
思考档位怎么设?
thinking_level 三档:low、medium、high,默认 medium。minimal 档这个模型不支持。转写检索、基础元数据抽取这类任务用 low;密集推理用 high。注意 high 档模型会主动增加推理步数和工具调用,token 用量会明显上升。
从旧版本迁移要改代码吗?
要。3.8 Flash 移除了 temperature、top_p、top_k、candidate_count 四个参数,thinking_budget 被字符串枚举 thinking_level 取代。函数调用侧 FunctionResponse 需要带 call_id 和 name 字段,多模态资源必须放在响应负载中。多轮会话依赖服务端的 previous_interaction_id,不再支持预填模型回合。
Gemini 3.8 Flash Cyber 是什么?能直接用吗?
不能。它是同期发布的安全专用变体,通过 Fairwind 计划只向经审核的政府机构、关键基础设施运营方和软件维护者开放,安全护栏更宽松。Google 称它生成的正确 Chrome 漏洞补丁数是最强商用模型的 2.6 倍,真实漏洞发现成功率超过 70%(覆盖 20 种编程语言);CWE-Bench 补丁 pass@1 为 47.2%,与领先旗舰的 47.8% 基本持平。标准版 gemini-3.8-flash 不含这些放宽的能力。
gemini-3.8-flashhttps://api.haijingai.com/v2/"provider": { "channel": "direct" }海鲸AI 兼容 OpenAI 接口协议,可直接使用 OpenAI SDK 或 HTTP 请求接入,默认开启流式输出。
curl https://api.haijingai.com/v2/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer <API_KEY>" \
-d '{
"model": "gemini-3.8-flash",
"messages": [
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"}
],
"provider": { "channel": "direct" },
"stream": true
}'
# provider 为可选字段,删除该行即使用默认通道from openai import OpenAI
client = OpenAI(
base_url="https://api.haijingai.com/v2",
api_key="<API_KEY>",
)
stream = client.chat.completions.create(
model="gemini-3.8-flash",
messages=[
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"},
],
stream=True,
# 可选:指定服务通道,不传则使用默认通道
extra_body={"provider": {"channel": "direct"}},
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)import OpenAI from 'openai'
const client = new OpenAI({
baseURL: 'https://api.haijingai.com/v2',
apiKey: '<API_KEY>',
})
const stream = await client.chat.completions.create({
model: 'gemini-3.8-flash',
messages: [
{ role: 'system', content: '你是一个有帮助的助手。' },
{ role: 'user', content: '你好!' },
],
stream: true,
// 可选:指定服务通道,不传则使用默认通道
// @ts-expect-error provider 为海鲸AI 扩展字段,不在 OpenAI SDK 类型定义内
provider: { channel: 'direct' },
})
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? '')
}