发布时间
2026/9/10模型系列
DeepSeek输入模态
输出模态
输入价格
¥2 / 1M tokens输出价格
¥8 / 1M tokens缓存写入价格
¥2.5 / 1M tokens缓存读取价格
¥0.04 / 1M tokens上下文窗口
1,000,000最大输出长度
384,000DeepSeek V4.1 Flash 为 552B 参数的 MoE 模型,采用了全新的 Causal-Encoder-Decoder 结构,输入和输出不对称,输入激活只有 8B,输出激活 16B,成本显著低于已知的同尺寸模型。同时,V4.1 Flash 还采用了新的预训练方式、经过了更大规模的强化学习后训练,在基准测试中,成功超越了包括 DeepSeek V4 Pro 在内的一众旗舰模型的智能水平。
智脑 API 根据调度策略向最合适的供应商发起请求,并自动回退至可用性最高的供应商。
首字延迟
0.54s
吞吐量
157.35tps
可用性
100.00%
供应商模型名
deepseek/deepseek/deepseek-v4.1-flash
支持的参数
近期可用性
推理
可切换推理
支持的响应格式
上下文长度
1,000,000
最大输出
384,000
输入价格
¥2 / 1M tokens
输出价格
¥8 / 1M tokens
缓存写入
¥2.5 / 1M tokens
缓存读取
¥0.04 / 1M tokens
首字延迟
2.49s
吞吐量
81.59tps
可用性
100.00%
供应商模型名
tokenmall-zqf/deepseek/deepseek-v4.1-flash
支持的参数
近期可用性
推理
可切换推理
支持的响应格式
上下文长度
1,000,000
最大输出
384,000
输入价格
¥1 / 1M tokens
输出价格
¥4 / 1M tokens
缓存写入
¥1.25 / 1M tokens
缓存读取
¥0.02 / 1M tokens
首字延迟
3.25s
吞吐量
66.92tps
可用性
100.00%
供应商模型名
volcengine/deepseek/deepseek-v4.1-flash
支持的参数
近期可用性
推理
可切换推理
支持的响应格式
上下文长度
1,000,000
最大输出
384,000
输入价格
¥2 / 1M tokens
输出价格
¥8 / 1M tokens
缓存写入
¥2.5 / 1M tokens
缓存读取
¥0.04 / 1M tokens
首字延迟
1.35s
吞吐量
104.50tps
可用性
100.00%
供应商模型名
tencent/deepseek/deepseek-v4.1-flash
支持的参数
近期可用性
推理
可切换推理
支持的响应格式
上下文长度
1,000,000
最大输出
384,000
输入价格
¥2 / 1M tokens
输出价格
¥8 / 1M tokens
缓存写入
¥2.5 / 1M tokens
缓存读取
¥0.04 / 1M tokens
首字延迟
0.97s
吞吐量
39.71tps
可用性
100.00%
供应商模型名
alibaba/deepseek/deepseek-v4.1-flash
支持的参数
近期可用性
推理
可切换推理
支持的响应格式
上下文长度
1,000,000
最大输出
384,000
输入价格
¥2 / 1M tokens
输出价格
¥8 / 1M tokens
缓存写入
¥2.5 / 1M tokens
缓存读取
¥0.2 / 1M tokens
在智脑 API 上对比不同供应商的表现
124.24 tok/s
1.84 s
deepseek/deepseek-v4.1-flash的各供应商可用性
智脑 API 为您统一各供应商的请求与响应格式
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.360.cn/v1",
apiKey: process.env.ZHINAO_API_KEY,
});
const response = await client.chat.completions.create({
model: "deepseek/deepseek-v4.1-flash",
messages: [
{ role: "user", content: "Hello, how are you?" }
],
temperature: 0.7,
max_tokens: 1000,
});
console.log(response.choices[0].message.content);