发布时间
2026/4/24模型系列
DeepSeek输入模态
输出模态
输入价格
¥3 / 1M tokens输出价格
¥9 / 1M tokens缓存写入价格
¥3.75 / 1M tokens缓存读取价格
¥0.3 / 1M tokens上下文窗口
1,000,000最大输出长度
384,000DeepSeek-V4 拥有百万字超长上下文,在 Agent 能力、世界知识和推理性能上均实现国内与开源领域的领先。 相比 DeepSeek-V4-Pro,DeepSeek-V4-Flash 在世界知识储备方面稍逊一筹,但展现出了接近的推理能力。而由于模型参数和激活更小,相较之下 V4-Flash 能够提供更加快捷、经济的 API 服务。
智脑 API 根据调度策略向最合适的供应商发起请求,并自动回退至可用性最高的供应商。
首字延迟
3.10s
吞吐量
69.65tps
可用性
100.00%
供应商模型名
deepseek/deepseek/deepseek-v4-flash
支持的参数
近期可用性
推理
可切换推理
支持的响应格式
上下文长度
1,000,000
最大输出
384,000
输入价格
¥3 / 1M tokens
输出价格
¥9 / 1M tokens
缓存写入
¥3.75 / 1M tokens
缓存读取
¥0.3 / 1M tokens
首字延迟
1.29s
吞吐量
44.63tps
可用性
100.00%
供应商模型名
huaweicloud/deepseek/deepseek-v4-flash
支持的参数
近期可用性
推理
可切换推理
支持的响应格式
上下文长度
1,000,000
最大输出
384,000
输入价格
¥1 / 1M tokens
输出价格
¥2 / 1M tokens
缓存写入
¥1.25 / 1M tokens
缓存读取
¥0.02 / 1M tokens
首字延迟
0.81s
吞吐量
56.59tps
可用性
100.00%
供应商模型名
st/deepseek/deepseek-v4-flash
支持的参数
近期可用性
推理
可切换推理
支持的响应格式
上下文长度
1,000,000
最大输出
384,000
输入价格
¥0.8 / 1M tokens
输出价格
¥1.6 / 1M tokens
缓存写入
¥1 / 1M tokens
缓存读取
¥0.016 / 1M tokens
首字延迟
56.07s
吞吐量
21.52tps
可用性
67.00%
供应商模型名
tokenmall-cdtx/deepseek/deepseek-v4-flash
支持的参数
近期可用性
推理
可切换推理
支持的响应格式
上下文长度
1,000,000
最大输出
384,000
输入价格
¥1.8 / 1M tokens
输出价格
¥5.4 / 1M tokens
缓存写入
¥2.25 / 1M tokens
缓存读取
¥0.06 / 1M tokens
首字延迟
153.79s
吞吐量
23.94tps
可用性
50.00%
供应商模型名
aiping/deepseek/deepseek-v4-flash
支持的参数
近期可用性
推理
可切换推理
支持的响应格式
上下文长度
1,000,000
最大输出
384,000
输入价格
¥0.6 / 1M tokens
输出价格
¥1.2 / 1M tokens
缓存写入
¥0.75 / 1M tokens
缓存读取
¥0.012 / 1M tokens
首字延迟
0.99s
吞吐量
63.14tps
可用性
100.00%
供应商模型名
volcengine/deepseek/deepseek-v4-flash
支持的参数
近期可用性
推理
可切换推理
支持的响应格式
上下文长度
1,000,000
最大输出
384,000
输入价格
¥1.5 / 1M tokens
输出价格
¥4.5 / 1M tokens
缓存写入
¥1.875 / 1M tokens
缓存读取
¥0.05 / 1M tokens
首字延迟
0.45s
吞吐量
77.90tps
可用性
98.00%
供应商模型名
tencent/deepseek/deepseek-v4-flash
支持的参数
近期可用性
推理
可切换推理
支持的响应格式
上下文长度
1,000,000
最大输出
384,000
输入价格
¥3 / 1M tokens
输出价格
¥9 / 1M tokens
缓存写入
¥3.75 / 1M tokens
缓存读取
¥0.3 / 1M tokens
首字延迟
1.28s
吞吐量
53.26tps
可用性
100.00%
供应商模型名
alibaba/deepseek/deepseek-v4-flash
支持的参数
近期可用性
推理
可切换推理
支持的响应格式
上下文长度
1,000,000
最大输出
384,000
输入价格
¥3 / 1M tokens
输出价格
¥9 / 1M tokens
缓存写入
¥3.75 / 1M tokens
缓存读取
¥0.3 / 1M tokens
在智脑 API 上对比不同供应商的表现
52.44 tok/s
1.18 s
deepseek/deepseek-v4-flash的各供应商可用性
智脑 API 为您统一各供应商的请求与响应格式
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.360.cn/v1",
apiKey: process.env.ZHINAO_API_KEY,
});
const response = await client.chat.completions.create({
model: "deepseek/deepseek-v4-flash",
messages: [
{ role: "user", content: "Hello, how are you?" }
],
temperature: 0.7,
max_tokens: 1000,
});
console.log(response.choices[0].message.content);