直连通道
官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入 | 输出 | 缓存命中 |
|---|---|---|
| 0.20/M | 0.50/M | 0.05/M |
Grok 4.1 Fast 是 xAI 最好的代理工具调用模型,在客户支持和深入研究等实际用例中表现出色。 2M上下文窗口。
同一模型能力,多条服务通道;按延迟、稳定性与成本灵活选择。
价格单位:$ / 1M tokensprovider 字段,例如 "provider": { "channel": "direct" }。可选 direct / stable / economical;不传则使用默认通道。官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入 | 输出 | 缓存命中 |
|---|---|---|
| 0.20/M | 0.50/M | 0.05/M |
Grok 4.1 Fast 是 xAI 面向智能体工具调用优化的模型,在客户支持、深度研究这类真实业务场景中表现突出。它最大的特点是 200 万 token 的超长上下文窗口——在同价位区间里几乎没有对手。
这个组合很实用:超长上下文意味着整个知识库、完整工单历史或大批检索结果都可以直接塞进去,不需要复杂的分块和向量检索;而"Fast"的定位意味着这样做的成本和延迟都在可接受范围内。
海鲸AI 通过 OpenAI 兼容接口提供 Grok 4.1 Fast,支持工具调用、流式输出与多模态输入。
获取 API 密钥 · 模型 ID:
grok-4-1-fast
200 万 token 让很多原本需要 RAG 管线的场景可以直接简化:把整个产品文档、完整对话历史、全部检索结果一次性放进上下文,让模型自己找相关内容。
Grok 4.1 Fast 是 xAI 面向工具调用优化的型号,在多工具编排、参数构造和结果处理上表现稳定,适合作为智能体框架的执行核心。
在客服场景中,超长上下文加上稳定的工具调用是一个很强的组合:完整的用户历史 + 知识库 + 订单查询工具,可以直接支撑高质量的自动应答。
在需要跨越大量资料的研究任务中,200 万 token 上下文让模型可以同时"看到"全部材料,减少信息在分块检索中丢失的风险。
| 场景 | 说明 |
|---|---|
| 智能客服 | 全量用户历史 + 知识库 + 工具调用 |
| 深度研究 | 跨越大量资料的综合分析与报告撰写 |
| 知识库问答 | 直接注入完整文档,免去 RAG 管线 |
| 智能体执行层 | 多工具编排与参数构造 |
| 长会话产品 | 完整对话历史不需要压缩 |
| 大规模日志分析 | 一次性处理超长日志与追踪数据 |
| 能力 | Grok 4.1 Fast | Grok 4.5 | Grok 4.20 |
|---|---|---|---|
| 模型 ID | grok-4-1-fast |
grok-4.5 |
grok-4.20 |
| 定位 | 智能体工具调用 + 超长上下文 | 前沿编码与知识工作 | 上一代旗舰 |
| 上下文窗口 | 200 万 token | 50 万 token | 200 万 token |
| 最大输出 | 200 万 token | 128K token | 200 万 token |
| 推理深度 | 中(速度优先) | 高 | 高 |
| 最适合 | 客服、研究、工具编排 | 长会话编码、STEM | 通用前沿任务 |
具体计费以页面上方的实时价格卡片为准。
1. 创建海鲸AI API 密钥 在控制台生成密钥并充值。
2. 善用超长上下文 如果你现在的架构里有一层为了绕开上下文限制而搭的 RAG 管线,先试试直接把全部内容塞进 Grok 4.1 Fast——很多时候效果更好且工程更简单。
3. 调用接口
curl -X POST https://api.haijingai.com/v1/chat/completions \
-H 'Authorization: Bearer YOUR_API_KEY' \
-H 'Content-Type: application/json' \
-d '{
"model": "grok-4-1-fast",
"messages": [
{"role": "system", "content": "以下是完整的产品知识库……"},
{"role": "user", "content": "用户反馈订单一直显示待发货,应该怎么处理?"}
],
"tools": [{"type": "function", "function": {"name": "query_order", "parameters": {}}}],
"stream": true
}'
200 万 token 上下文真的能用满吗? 可以,但要注意成本随输入长度线性增长。实际做法通常是把最相关的大块内容全量注入,而不是把所有历史无差别塞进去。
和 Grok 4.5 怎么选? 需要最强编码和推理能力选 Grok 4.5;需要超长上下文和高频工具调用、且对成本敏感选 Grok 4.1 Fast。
能替代 RAG 吗? 在知识库规模适中(能装进 200 万 token)的场景下可以显著简化架构。知识库超大时仍然需要检索层,但可以把召回数量放宽很多。
支持哪些输入模态? 文本和图像。工具调用、流式输出均可使用。
适合做智能体框架的核心吗? 适合。它本身就是面向智能体工具调用优化的型号,多工具编排场景是它的主场。
延迟表现如何? "Fast"定位意味着在同等上下文长度下延迟优于深度推理档位,但输入越长首 token 延迟越高,请合理控制注入量。
grok-4-1-fasthttps://api.haijingai.com/v2/"provider": { "channel": "direct" }海鲸AI 兼容 OpenAI 接口协议,可直接使用 OpenAI SDK 或 HTTP 请求接入,默认开启流式输出。
curl https://api.haijingai.com/v2/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer <API_KEY>" \
-d '{
"model": "grok-4-1-fast",
"messages": [
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"}
],
"provider": { "channel": "direct" },
"stream": true
}'
# provider 为可选字段,删除该行即使用默认通道from openai import OpenAI
client = OpenAI(
base_url="https://api.haijingai.com/v2",
api_key="<API_KEY>",
)
stream = client.chat.completions.create(
model="grok-4-1-fast",
messages=[
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"},
],
stream=True,
# 可选:指定服务通道,不传则使用默认通道
extra_body={"provider": {"channel": "direct"}},
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)import OpenAI from 'openai'
const client = new OpenAI({
baseURL: 'https://api.haijingai.com/v2',
apiKey: '<API_KEY>',
})
const stream = await client.chat.completions.create({
model: 'grok-4-1-fast',
messages: [
{ role: 'system', content: '你是一个有帮助的助手。' },
{ role: 'user', content: '你好!' },
],
stream: true,
// 可选:指定服务通道,不传则使用默认通道
// @ts-expect-error provider 为海鲸AI 扩展字段,不在 OpenAI SDK 类型定义内
provider: { channel: 'direct' },
})
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? '')
}