直连通道
官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入 | 输出 | 缓存命中 |
|---|---|---|
| 0.44/M | 1.32/M | 0.01/M |
DeepSeek V4 Flash 是 DeepSeek 的效率优化混合专家模型,总参数为 284B,激活参数为 13B,支持 1M 代币上下文窗口。它专为快速推理和高吞吐量工作负载而设计,同时保持强大的推理和编码性能。 该模型包括用于高效长上下文处理的混合注意力,并支持可配置的推理模式。它非常适合编码助理、聊天系统和代理工作流程等应用程序,这些应用程序的响应能力和成本效率非常重要。
同一模型能力,多条服务通道;按延迟、稳定性与成本灵活选择。
价格单位:$ / 1M tokensprovider 字段,例如 "provider": { "channel": "direct" }。可选 direct / stable / economical;不传则使用默认通道。官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入 | 输出 | 缓存命中 |
|---|---|---|
| 0.44/M | 1.32/M | 0.01/M |
DeepSeek V4 Flash 是 DeepSeek 的效率优化混合专家模型,总参数 2840 亿、激活参数 13B,支持 100 万 token 上下文窗口。它专为快速推理和高吞吐量工作负载设计,同时保持了强劲的推理和编码性能。
Flash 版与 Pro 版共享同一套架构创新——混合注意力用于高效长上下文处理,并支持可配置的推理模式。实测显示,在简单任务上 Flash 与 Pro 旗鼓相当,只有在高难度任务上才会出现差距。对绝大多数生产场景来说,这意味着可以用 Flash 的价格拿到接近旗舰的效果。
海鲸AI 通过 OpenAI 兼容接口提供 DeepSeek V4 Flash,支持工具调用、流式输出与长上下文处理。
获取 API 密钥 · 模型 ID:
deepseek-v4-flash
Flash 版的设计目标就是快速推理和高吞吐量。13B 激活参数意味着单次推理的计算量远低于 Pro 版,可以在同样的资源下承载数倍的并发。
官方明确将 Flash 定位为编码助手、聊天系统这类场景的理想选择——这些场景需要的是稳定的中等难度输出加上快速响应。
Flash 与 Pro 共享同样的 100 万 token 上下文能力和混合注意力架构,长文档和大仓库场景不需要为此升级档位。
支持可配置的推理模式,可以按任务难度调整推理深度,在质量和速度之间找到合适的平衡点。
| 场景 | 说明 |
|---|---|
| 编码助手 | 代码补全、重构、解释、测试生成 |
| 聊天系统 | 高并发的对话产品 |
| 长文档处理 | 100 万 token 窗口内的分析与摘要 |
| 批处理管线 | 大规模语料的清洗与转换 |
| 成本敏感的智能体 | 需要大量调用的自动化流程 |
| 私有化部署 | 参数量适中,本地部署门槛更低 |
| 能力 | DeepSeek V4 Flash | DeepSeek V4 Pro |
|---|---|---|
| 模型 ID | deepseek-v4-flash |
deepseek-v4-pro |
| 总参数 | 2840 亿 | 1.6 万亿 |
| 激活参数 | 13B | 49B |
| 上下文窗口 | 100 万 token | 100 万 token |
| 最大输出 | 384K token | 384K token |
| 世界知识 | 稍弱 | 更强 |
| 推理能力 | 接近 Pro | 前沿 |
| 简单任务 | 与 Pro 旗鼓相当 | 优秀 |
| 高难度任务 | 存在差距 | 明显更强 |
具体计费以页面上方的实时价格卡片为准。
1. 创建海鲸AI API 密钥 在控制台生成密钥并充值。
2. 默认从 Flash 起步 既然简单任务上 Flash 与 Pro 表现相当,合理的做法是默认用 Flash,只在实测发现质量不够时才升级到 Pro。
3. 调用接口
curl -X POST https://api.haijingai.com/v1/chat/completions \
-H 'Authorization: Bearer YOUR_API_KEY' \
-H 'Content-Type: application/json' \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{"role": "user", "content": "给这个 Python 模块补齐类型注解和 docstring。"}
],
"stream": true
}'
Flash 和 Pro 差多少? Flash 在世界知识储备上稍逊,但推理能力与 Pro 接近。在智能体评测中,简单任务上两者旗鼓相当,只有高难度任务才有明显差距。
什么时候需要升级到 Pro? 需要广泛世界知识、高难度数学推理,或者最复杂的仓库级智能体任务时。日常编码和对话场景 Flash 完全够用。
上下文和输出上限? 100 万 token 上下文,最大输出 384,000 token——与 Pro 版完全相同。
284B 参数会不会推理很慢? 不会。它是稀疏 MoE,实际激活参数只有 13B,推理速度和成本都接近中等规模的稠密模型。
可以私有化部署吗? 可以。DeepSeek V4 系列权重公开,Flash 版参数量适中,本地部署门槛低于 Pro 版。
混合注意力是什么? V4 系列引入的架构升级,用于高效处理长上下文,是 100 万 token 窗口在经济上可用的关键。
deepseek-v4-flashhttps://api.haijingai.com/v2/"provider": { "channel": "direct" }海鲸AI 兼容 OpenAI 接口协议,可直接使用 OpenAI SDK 或 HTTP 请求接入,默认开启流式输出。
curl https://api.haijingai.com/v2/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer <API_KEY>" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"}
],
"provider": { "channel": "direct" },
"stream": true
}'
# provider 为可选字段,删除该行即使用默认通道from openai import OpenAI
client = OpenAI(
base_url="https://api.haijingai.com/v2",
api_key="<API_KEY>",
)
stream = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"},
],
stream=True,
# 可选:指定服务通道,不传则使用默认通道
extra_body={"provider": {"channel": "direct"}},
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)import OpenAI from 'openai'
const client = new OpenAI({
baseURL: 'https://api.haijingai.com/v2',
apiKey: '<API_KEY>',
})
const stream = await client.chat.completions.create({
model: 'deepseek-v4-flash',
messages: [
{ role: 'system', content: '你是一个有帮助的助手。' },
{ role: 'user', content: '你好!' },
],
stream: true,
// 可选:指定服务通道,不传则使用默认通道
// @ts-expect-error provider 为海鲸AI 扩展字段,不在 OpenAI SDK 类型定义内
provider: { channel: 'direct' },
})
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? '')
}