Skip to content
登录/注册

Gemini 3.1 Flash Lite Preview

gemini-3.1-flash-lite-preview

Gemini 3.1 Flash Lite Preview 是 Google 针对大容量用例进行优化的高效模型。它在整体质量上优于 Gemini 2.5 Flash Lite,并在关键功能方面接近 Gemini 2.5 Flash 性能。改进涵盖音频输入/ASR、RAG 片段排名、翻译、数据提取和代码完成。支持完整的思维级别(最低、低、中、高)以实现细粒度的成本/性能权衡。价格仅为 Gemini 3 Flash 成本的一半。

上下文窗口1.0M
提供商Gemini
创建时间2026/04/30

在线体验

定价

同一模型能力,多条服务通道;按延迟、稳定性与成本灵活选择。

价格单位:$ / 1M tokens
指定服务通道:在请求体加入 provider 字段,例如 "provider": { "channel": "direct" }。可选 direct / stable / economical;不传则使用默认通道。

直连通道

官方直连链路,适合需要原生体验与完整上下文的请求。

输入输出缓存命中缓存写入
0.25/M1.50/M0.03/M0.08/M

介绍

输入
文本 图像
输出
文本

Gemini 3.1 Flash Lite Preview API:面向大容量场景的高效模型

Gemini 3.1 Flash Lite Preview 是 Google 针对大容量用例优化的高效模型。它在整体质量上优于 Gemini 2.5 Flash Lite,并在关键能力上接近 Gemini 2.5 Flash 的水平——改进覆盖音频输入与 ASR、RAG 片段排序、翻译、数据提取和代码补全。

它的定位很清楚:当你的调用量大到让旗舰模型在经济上不可行时,Flash Lite 是那个"依然能用、而且用得起"的选择。配合 100 万 token 上下文窗口,它在长文档预处理这类场景上性价比尤其突出。

海鲸AI 通过 OpenAI 兼容接口提供 Gemini 3.1 Flash Lite Preview,支持工具调用、流式输出与多模态输入。

获取 API 密钥 · 模型 ID:gemini-3.1-flash-lite-preview


为什么选择 Gemini 3.1 Flash Lite Preview

  • 大容量场景的经济选择 —— 高频调用下的成本控制核心
  • 整体质量优于 2.5 Flash Lite —— 关键能力接近 2.5 Flash
  • 100 万 token 上下文 —— 轻量档位同样支持超长输入
  • 支持完整思维档位 —— 需要时可上调思考深度
  • 多模态输入 —— 文本与图像统一处理

核心能力

01 音频输入与语音识别

Flash Lite 在音频输入和 ASR(自动语音识别)上相比上一代有明显改进,适合大规模的语音转写和音频内容处理管线。

  • 语音转文字与转写
  • 音频内容理解
  • 会议、客服录音批量处理

02 RAG 片段排序

在检索增强生成管线中,Flash Lite 适合承担召回结果的重排序工作——把最相关的片段挑出来交给更强的模型,显著降低整体成本。

  • 检索结果相关性排序
  • 片段筛选与裁剪
  • RAG 管线的成本优化层

03 翻译与数据提取

翻译质量和结构化数据提取是这一代改进的重点,适合大批量的多语言内容处理和非结构化数据转换。

  • 多语言翻译
  • 表单与文档字段提取
  • 结构化 JSON 输出

04 代码补全

代码补全能力的改进让它可以承担 IDE 内联补全这类高频、低延迟要求的场景。

  • IDE 内联代码补全
  • 代码片段生成
  • 语法与格式修正

最佳使用场景

场景 说明
大批量转写 音频/语音的规模化转文字
RAG 重排序 检索结果的相关性打分与筛选
多语言翻译 大规模内容本地化
数据提取 非结构化文本转结构化字段
代码补全 IDE 内联补全等低延迟场景
长文档预处理 100 万 token 窗口内的低成本摘要

Gemini 3.1 Flash Lite 与 Gemini 3.5 Flash、3 Flash 的差异

能力 Gemini 3.1 Flash Lite Gemini 3 Flash Preview Gemini 3.5 Flash
模型 ID gemini-3.1-flash-lite-preview gemini-3-flash-preview gemini-3.5-flash
定位 大容量经济档 快速通用档 高效多模态主力
上下文窗口 约 105 万 token 约 105 万 token 10.5 万 token
最大输出 65.5K token 65.5K token 64K token
侧重 ASR、排序、翻译、抽取 通用快速响应 编码与并行智能体
相对成本 最低

具体计费以页面上方的实时价格卡片为准。


如何使用 Gemini 3.1 Flash Lite Preview API

1. 创建海鲸AI API 密钥 在控制台生成密钥并充值。

2. 用它做管线的第一层 典型做法是让 Flash Lite 承担筛选、排序、抽取这类前置工作,把精炼后的内容交给更强的模型做最终推理。

3. 调用接口

curl -X POST https://api.haijingai.com/v1/chat/completions \
  -H 'Authorization: Bearer YOUR_API_KEY' \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "gemini-3.1-flash-lite-preview",
    "messages": [
      {"role": "user", "content": "从下面 20 段检索结果中挑出与问题最相关的 3 段,只输出编号。"}
    ]
  }'

常见问题

它比 2.5 Flash Lite 强多少? 整体质量优于 2.5 Flash Lite,在关键能力上接近 2.5 Flash 的水平。改进集中在音频输入/ASR、RAG 片段排序、翻译、数据提取和代码补全上。

上下文窗口多大? 约 105 万 token,是轻量档位中上下文最充裕的选择之一,长文档预处理场景很划算。

支持思考吗? 支持完整的思维档位设置,可以按任务难度上调或下调思考深度。

适合做 RAG 管线的哪一层? 最适合做重排序和筛选层。用它把召回结果精炼后交给更强的模型,能显著降低整体成本。

支持音频输入吗? 上游模型支持音频输入与 ASR,具体可用性以平台接口说明为准。

Preview 意味着什么? 表示这是预览版本,能力和接口可能随上游更新调整。生产使用前建议做好版本变更的应对预案。


为什么选择海鲸AI 使用 Gemini 3.1 Flash Lite API

  • 国内直连 —— 无需 Google Cloud 账户和海外网络
  • OpenAI 兼容接口 —— 现有代码改两行接入
  • 分层管线友好 —— 与 Gemini 3.5 Flash、Pro 档位共用密钥,按环节路由
  • 统一用量看板 —— 大批量调用的花费集中查看

API

API 接入信息

Model ID在推理接口中指定模型
gemini-3.1-flash-lite-preview
API Key推理接口的 Bearer Token(鉴权令牌)
Base URL兼容 OpenAI 协议 · /chat/completions
OpenAIhttps://api.haijingai.com/v2/
provider 可选指定服务通道,不传则由系统选择默认通道
"provider": { "channel": "direct" }

gemini-3.1-flash-lite-preview 接入示例

海鲸AI 兼容 OpenAI 接口协议,可直接使用 OpenAI SDK 或 HTTP 请求接入,默认开启流式输出。

js
curl https://api.haijingai.com/v2/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer <API_KEY>" \
  -d '{
    "model": "gemini-3.1-flash-lite-preview",
    "messages": [
      {"role": "system", "content": "你是一个有帮助的助手。"},
      {"role": "user", "content": "你好!"}
    ],
    "provider": { "channel": "direct" },
    "stream": true
  }'
# provider 为可选字段,删除该行即使用默认通
js
from openai import OpenAI

client = OpenAI(
    base_url="https://api.haijingai.com/v2",
    api_key="<API_KEY>",
)

stream = client.chat.completions.create(
    model="gemini-3.1-flash-lite-preview",
    messages=[
        {"role": "system", "content": "你是一个有帮助的助手。"},
        {"role": "user", "content": "你好!"},
    ],
    stream=True,
    # 可选:指定服务通道,不传则使用默认通道
    extra_body={"provider": {"channel": "direct"}},
)

for chunk in stream:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)
js
import OpenAI from 'openai'

const client = new OpenAI({
  baseURL: 'https://api.haijingai.com/v2',
  apiKey: '<API_KEY>',
})

const stream = await client.chat.completions.create({
  model: 'gemini-3.1-flash-lite-preview',
  messages: [
    { role: 'system', content: '你是一个有帮助的助手。' },
    { role: 'user', content: '你好!' },
  ],
  stream: true,
  // 可选:指定服务通道,不传则使用默认通道
  // @ts-expect-error provider 为海鲸AI 扩展字段,不在 OpenAI SDK 类型定义内
  provider: { channel: 'direct' },
})

for await (const chunk of stream) {
  process.stdout.write(chunk.choices[0]?.delta?.content ?? '')
}