直连通道
官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入 | 输出 | 缓存命中 | 缓存写入 |
|---|---|---|---|
| 0.25/M | 1.50/M | 0.03/M | 0.08/M |
Gemini 3.1 Flash Lite Preview 是 Google 针对大容量用例进行优化的高效模型。它在整体质量上优于 Gemini 2.5 Flash Lite,并在关键功能方面接近 Gemini 2.5 Flash 性能。改进涵盖音频输入/ASR、RAG 片段排名、翻译、数据提取和代码完成。支持完整的思维级别(最低、低、中、高)以实现细粒度的成本/性能权衡。价格仅为 Gemini 3 Flash 成本的一半。
同一模型能力,多条服务通道;按延迟、稳定性与成本灵活选择。
价格单位:$ / 1M tokensprovider 字段,例如 "provider": { "channel": "direct" }。可选 direct / stable / economical;不传则使用默认通道。官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入 | 输出 | 缓存命中 | 缓存写入 |
|---|---|---|---|
| 0.25/M | 1.50/M | 0.03/M | 0.08/M |
Gemini 3.1 Flash Lite Preview 是 Google 针对大容量用例优化的高效模型。它在整体质量上优于 Gemini 2.5 Flash Lite,并在关键能力上接近 Gemini 2.5 Flash 的水平——改进覆盖音频输入与 ASR、RAG 片段排序、翻译、数据提取和代码补全。
它的定位很清楚:当你的调用量大到让旗舰模型在经济上不可行时,Flash Lite 是那个"依然能用、而且用得起"的选择。配合 100 万 token 上下文窗口,它在长文档预处理这类场景上性价比尤其突出。
海鲸AI 通过 OpenAI 兼容接口提供 Gemini 3.1 Flash Lite Preview,支持工具调用、流式输出与多模态输入。
获取 API 密钥 · 模型 ID:
gemini-3.1-flash-lite-preview
Flash Lite 在音频输入和 ASR(自动语音识别)上相比上一代有明显改进,适合大规模的语音转写和音频内容处理管线。
在检索增强生成管线中,Flash Lite 适合承担召回结果的重排序工作——把最相关的片段挑出来交给更强的模型,显著降低整体成本。
翻译质量和结构化数据提取是这一代改进的重点,适合大批量的多语言内容处理和非结构化数据转换。
代码补全能力的改进让它可以承担 IDE 内联补全这类高频、低延迟要求的场景。
| 场景 | 说明 |
|---|---|
| 大批量转写 | 音频/语音的规模化转文字 |
| RAG 重排序 | 检索结果的相关性打分与筛选 |
| 多语言翻译 | 大规模内容本地化 |
| 数据提取 | 非结构化文本转结构化字段 |
| 代码补全 | IDE 内联补全等低延迟场景 |
| 长文档预处理 | 100 万 token 窗口内的低成本摘要 |
| 能力 | Gemini 3.1 Flash Lite | Gemini 3 Flash Preview | Gemini 3.5 Flash |
|---|---|---|---|
| 模型 ID | gemini-3.1-flash-lite-preview |
gemini-3-flash-preview |
gemini-3.5-flash |
| 定位 | 大容量经济档 | 快速通用档 | 高效多模态主力 |
| 上下文窗口 | 约 105 万 token | 约 105 万 token | 10.5 万 token |
| 最大输出 | 65.5K token | 65.5K token | 64K token |
| 侧重 | ASR、排序、翻译、抽取 | 通用快速响应 | 编码与并行智能体 |
| 相对成本 | 最低 | 低 | 中 |
具体计费以页面上方的实时价格卡片为准。
1. 创建海鲸AI API 密钥 在控制台生成密钥并充值。
2. 用它做管线的第一层 典型做法是让 Flash Lite 承担筛选、排序、抽取这类前置工作,把精炼后的内容交给更强的模型做最终推理。
3. 调用接口
curl -X POST https://api.haijingai.com/v1/chat/completions \
-H 'Authorization: Bearer YOUR_API_KEY' \
-H 'Content-Type: application/json' \
-d '{
"model": "gemini-3.1-flash-lite-preview",
"messages": [
{"role": "user", "content": "从下面 20 段检索结果中挑出与问题最相关的 3 段,只输出编号。"}
]
}'
它比 2.5 Flash Lite 强多少? 整体质量优于 2.5 Flash Lite,在关键能力上接近 2.5 Flash 的水平。改进集中在音频输入/ASR、RAG 片段排序、翻译、数据提取和代码补全上。
上下文窗口多大? 约 105 万 token,是轻量档位中上下文最充裕的选择之一,长文档预处理场景很划算。
支持思考吗? 支持完整的思维档位设置,可以按任务难度上调或下调思考深度。
适合做 RAG 管线的哪一层? 最适合做重排序和筛选层。用它把召回结果精炼后交给更强的模型,能显著降低整体成本。
支持音频输入吗? 上游模型支持音频输入与 ASR,具体可用性以平台接口说明为准。
Preview 意味着什么? 表示这是预览版本,能力和接口可能随上游更新调整。生产使用前建议做好版本变更的应对预案。
gemini-3.1-flash-lite-previewhttps://api.haijingai.com/v2/"provider": { "channel": "direct" }海鲸AI 兼容 OpenAI 接口协议,可直接使用 OpenAI SDK 或 HTTP 请求接入,默认开启流式输出。
curl https://api.haijingai.com/v2/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer <API_KEY>" \
-d '{
"model": "gemini-3.1-flash-lite-preview",
"messages": [
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"}
],
"provider": { "channel": "direct" },
"stream": true
}'
# provider 为可选字段,删除该行即使用默认通道from openai import OpenAI
client = OpenAI(
base_url="https://api.haijingai.com/v2",
api_key="<API_KEY>",
)
stream = client.chat.completions.create(
model="gemini-3.1-flash-lite-preview",
messages=[
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"},
],
stream=True,
# 可选:指定服务通道,不传则使用默认通道
extra_body={"provider": {"channel": "direct"}},
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)import OpenAI from 'openai'
const client = new OpenAI({
baseURL: 'https://api.haijingai.com/v2',
apiKey: '<API_KEY>',
})
const stream = await client.chat.completions.create({
model: 'gemini-3.1-flash-lite-preview',
messages: [
{ role: 'system', content: '你是一个有帮助的助手。' },
{ role: 'user', content: '你好!' },
],
stream: true,
// 可选:指定服务通道,不传则使用默认通道
// @ts-expect-error provider 为海鲸AI 扩展字段,不在 OpenAI SDK 类型定义内
provider: { channel: 'direct' },
})
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? '')
}