直连通道
官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入 | 输出 | 缓存命中 |
|---|---|---|
| 0.20/M | 1.25/M | 0.02/M |
GPT-5.4 nano 是 GPT-5.4 系列中最轻量且最具成本效益的变体,针对速度关键和大批量任务进行了优化。它支持文本和图像输入,专为低延迟用例而设计,例如分类、数据提取、排名和子代理执行。 该模型优先考虑响应能力和效率而不是深度推理,使其成为需要大规模快速、可靠输出的管道的理想选择。 GPT-5.4 nano 非常适合后台任务、实时系统和分布式代理架构,在这些架构中,最大限度地降低成本和延迟至关重要。
同一模型能力,多条服务通道;按延迟、稳定性与成本灵活选择。
价格单位:$ / 1M tokensprovider 字段,例如 "provider": { "channel": "direct" }。可选 direct / stable / economical;不传则使用默认通道。官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入 | 输出 | 缓存命中 |
|---|---|---|
| 0.20/M | 1.25/M | 0.02/M |
GPT-5.4 Nano 是 GPT-5.4 系列中最轻量、最具成本效益的变体,针对速度关键和大批量任务做了优化。它支持文本和图像输入,专为低延迟用例设计——分类、数据提取、排序、子智能体执行。
Nano 的设计取舍是明确的:优先考虑响应速度和效率而不是深度推理。这让它成为需要大规模快速可靠输出的管线的理想选择,也让它在多智能体架构中特别适合承担并行子任务。
海鲸AI 通过 OpenAI 兼容接口提供 GPT-5.4 Nano,支持工具调用、流式输出与图像输入。
获取 API 密钥 · 模型 ID:
gpt-5.4-nano
Nano 最典型的用途是高频的判别类任务:把输入归到有限的类别里。这类任务不需要深度推理,需要的是稳定、快速、便宜。
从非结构化文本中抽取字段并输出结构化结果,配合工具调用可以直接对接下游系统。
在检索增强(RAG)管线里,Nano 适合做召回结果的重排序和相关性筛选,把最相关的少量内容交给更强的模型。
在多智能体架构中,Nano 可以并行执行大量读取、搜索、检查类子任务,把结果汇总给主智能体,显著降低整体成本。
| 场景 | 说明 |
|---|---|
| 高频分类 | 工单路由、内容审核、意图识别 |
| 信息抽取 | 非结构化文本转结构化数据 |
| RAG 重排序 | 检索结果的相关性打分与筛选 |
| 子智能体 | 多智能体架构中的并行执行单元 |
| 批处理管线 | 大规模语料清洗、标注与转换 |
| 实时响应 | 对延迟极度敏感的交互场景 |
| 能力 | GPT-5.4 Nano | GPT-5.6 Luna | GPT-5.4 Mini |
|---|---|---|---|
| 模型 ID | gpt-5.4-nano |
gpt-5.6-luna |
gpt-5.4-mini |
| 定位 | 极轻量、速度优先 | 新一代经济档 | 轻量均衡档 |
| 上下文窗口 | 40 万 token | 100 万 token | 较小 |
| 最大输出 | 128K token | 256K token | 较小 |
| 推理深度 | 浅(速度优先) | 中等 | 中等 |
| 最适合 | 分类、抽取、排序 | 抽取、批处理、轻量智能体 | 通用轻量任务 |
具体计费以页面上方的实时价格卡片为准。
1. 创建海鲸AI API 密钥 在控制台生成密钥并充值。
2. 把提示词写得尽量确定 Nano 优先速度,提示词越具体、输出格式约束越明确,效果越稳定。避免让它做开放式推理。
3. 调用接口
curl -X POST https://api.haijingai.com/v1/chat/completions \
-H 'Authorization: Bearer YOUR_API_KEY' \
-H 'Content-Type: application/json' \
-d '{
"model": "gpt-5.4-nano",
"messages": [
{"role": "system", "content": "只输出一个类别,不要解释。可选类别:咨询、投诉、退款、其他。"},
{"role": "user", "content": "我上周买的东西到现在还没发货,能不能退了"}
]
}'
Nano 能做推理任务吗? 不建议。Nano 的设计目标是速度和成本,深度推理请用 GPT-5.5、GPT-5.6 Terra 或更高档位。
和 GPT-5.6 Luna 怎么选? Luna 是新一代经济档,上下文和输出上限都更大,综合能力更强;Nano 更极端地偏向速度和成本。延迟极度敏感或调用量极大时选 Nano。
上下文窗口多大? 40 万 token,对轻量档位来说相当充裕,长文档摘要也能胜任。
支持图像输入吗? 支持。可以做基础的图像分类和信息提取,复杂视觉推理请用更强档位。
适合做子智能体吗? 非常适合。在多智能体架构中用 Nano 承担并行子任务,是压低整体成本的常见做法。
输出稳定性怎么保证? 用系统提示明确约束输出格式,或者配合工具调用的严格 schema,能显著提升结构化输出的稳定性。
gpt-5.4-nanohttps://api.haijingai.com/v2/"provider": { "channel": "direct" }海鲸AI 兼容 OpenAI 接口协议,可直接使用 OpenAI SDK 或 HTTP 请求接入,默认开启流式输出。
curl https://api.haijingai.com/v2/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer <API_KEY>" \
-d '{
"model": "gpt-5.4-nano",
"messages": [
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"}
],
"provider": { "channel": "direct" },
"stream": true
}'
# provider 为可选字段,删除该行即使用默认通道from openai import OpenAI
client = OpenAI(
base_url="https://api.haijingai.com/v2",
api_key="<API_KEY>",
)
stream = client.chat.completions.create(
model="gpt-5.4-nano",
messages=[
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"},
],
stream=True,
# 可选:指定服务通道,不传则使用默认通道
extra_body={"provider": {"channel": "direct"}},
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)import OpenAI from 'openai'
const client = new OpenAI({
baseURL: 'https://api.haijingai.com/v2',
apiKey: '<API_KEY>',
})
const stream = await client.chat.completions.create({
model: 'gpt-5.4-nano',
messages: [
{ role: 'system', content: '你是一个有帮助的助手。' },
{ role: 'user', content: '你好!' },
],
stream: true,
// 可选:指定服务通道,不传则使用默认通道
// @ts-expect-error provider 为海鲸AI 扩展字段,不在 OpenAI SDK 类型定义内
provider: { channel: 'direct' },
})
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? '')
}