DeepSeek V4.1 Flash API 完整指南:552B MoE 架构、原生视觉与低成本路由
上手 DeepSeek V4.1 Flash 所需的一切。这款 552B MoE 模型在输入阶段仅激活 8B 参数。本文覆盖 Causal Encoder-Decoder 架构、原生视觉、定价(非高峰 $0.15/M 输入 token 起步)、思考模式、工具调用,以及如何把 V4.1 Flash 接入多供应商路由。
DeepSeek V4.1 Flash 是一款 552B 参数的 Mixture-of-Experts 模型,输入阶段每个 token 仅激活 8B 参数,输出阶段激活 16B。它于 2026 年 9 月 10 日上线,同时替代了 V4 Flash 和 V4-Flash-Vision-Exp,合并为一个多模态接口。调用方式是把 model 设为 "deepseek-flash",指向同样的 https://api.deepseek.com,已有的 OpenAI SDK 代码不用改动就能跑通。
我们写这篇指南,是因为 V4.1 Flash 把 DeepSeek 的模型线做了一次大幅重排。V4 Flash 和 V4-Flash-Vision-Exp 即刻退役;9 月 14 日起 V4 Pro 的请求也将转由 V4.1 Flash 服务。如果你在生产环境跑着 DeepSeek,有必要搞清楚变了什么、新定价长什么样、V4.1 Flash 在多供应商路由里放在哪个位置。
三分钟上手
第一步,注册账号。 打开 platform.deepseek.com,用邮箱或 Google OAuth 注册。
第二步,拿到 API key。 进入 API Keys 页面,点击「Create API Key」并复制。密钥只展示一次。
第三步,发起第一次调用。
pip install --upgrade openai
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_KEY",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-flash",
messages=[{"role": "user", "content": "DeepSeek V4.1 Flash 是什么?"}],
)
print(response.choices[0].message.content)
整个接入流程到这里就结束了。DeepSeek 的 API 遵循 OpenAI chat completions 格式,任何支持 OpenAI 兼容端点的库和框架都能直接用。
OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。
架构概览:Causal Encoder-Decoder 与非对称激活
V4.1 Flash 引入了一种新的 Causal Encoder-Decoder(CED)架构。模型共 40 层 Transformer,前 20 层是因果编码器,后 20 层是解码器。解码器的全局 KV cache 从编码器最终隐藏状态投影而来,而不是每层独立计算。
这个设计带来一个直接的结果。模型在预填充阶段(处理输入)每个 token 只激活 8B 参数,在解码阶段(生成输出)激活 16B 参数。对于输入量大的场景,比如长文档分析、RAG、Agent 工具调用循环,你在输入端消耗的算力远低于 552B 总参数的直觉预期。
MoE 层包含 1 个共享专家和 384 个路由专家,每个 token 激活其中 6 个路由专家。模型还包含一个 196B 参数的 Engram 条件记忆,通过基于 token 的查找稀疏访问。
KV cache 压缩。 V4.1 Flash 使用 Compressed Sparse Attention 2(CSA2),给每个注意力层分配 Full、Reindex 或 Reuse 三种静态模式之一,在层之间共享 KV 状态。配合 FP4 主 KV 缓存(E2M1 格式),全局 KV cache 占用降到每 token 约 890 字节。和 V4 Flash 相比,HBM 占用降到约 1/4,SSD 持久化存储降到约 1/8。
对 API 用户来说,KV cache 的改进直接反映在更低的缓存命中价格和长上下文场景下更快的首 token 延迟。
原生多模态:视觉输入
V4.1 Flash 原生处理图片。不同于之前的 V4-Flash-Vision-Exp(把视觉编码器加装到 V4 Flash 上),V4.1 Flash 从头开始就以多模态方式训练。视觉编码器(DeepSeek-ViT,带 2D-RoPE 和 3x3 像素解混洗下采样)和两层 MLP 投影器在 45T token 的预训练中和文本一起参与训练。
发送图片的方式如下。
response = client.chat.completions.create(
model="deepseek-flash",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "描述这张架构图。"},
{
"type": "image_url",
"image_url": {"url": "https://example.com/diagram.png"},
},
],
}
],
)
也支持 base64 编码的图片。视觉能力在同一个 deepseek-flash 模型 slug 上提供,不需要单独的模型名。
在 DeepSeek 内部测评中,V4.1 Flash 在 MMMU-Pro 上得分 56.5,CVBench 上 77.9,DocVQA(LLM-Judge)上 95.6。V4 Pro 完全不支持视觉输入。
定价:高峰、非高峰与缓存经济学
V4.1 Flash 采用分时段定价。非高峰价格是高峰价格的 50%。高峰时段为工作日 UTC 01:00-04:00 和 06:00-10:00,其余时间均为非高峰。
| 非高峰 | 高峰 | |
|---|---|---|
| 输入(缓存未命中) | $0.15 / 1M tokens | $0.30 / 1M tokens |
| 输入(缓存命中) | $0.003 / 1M tokens | $0.006 / 1M tokens |
| 输出 | $0.60 / 1M tokens | $1.20 / 1M tokens |
缓存命中的输入价格比缓存未命中低 98%。对于 Agent 类工作负载,每一轮都重新发送长 system prompt 或工具定义,缓存命中率直接决定了实际成本。V4.1 Flash 的 KV cache 压缩让 DeepSeek 能在保持低缓存命中价格的同时,在每块 GPU 上塞下更多并发上下文。
和 V4 Pro 的对比
| V4.1 Flash(非高峰) | V4 Pro(非高峰) | |
|---|---|---|
| 输入(缓存未命中) | $0.15 | $0.66 |
| 输入(缓存命中) | $0.003 | $0.022 |
| 输出 | $0.60 | $1.98 |
V4.1 Flash 在非高峰时段的输入价格约为 V4 Pro 的 1/4,输出价格约为 1/3,而在多数测评上反而表现更好。
来源 DeepSeek Models & Pricing,检索于 2026 年 9 月 11 日。
思考模式与推理能力
V4.1 Flash 同时支持思考模式和非思考模式。思考模式默认开启,模型会在最终答案之前先在 reasoning_content 字段输出思维链推理过程。
关闭思考模式的写法如下。
response = client.chat.completions.create(
model="deepseek-flash",
messages=[{"role": "user", "content": "总结这段文字。"}],
extra_body={"thinking": {"type": "disabled"}},
)
V4.1 Flash 还支持 1 到 100 的连续可控推理力度。在最大力度(100)下,它在 Codeforces 上的 rating 达到 3471(V4 Pro 为 3348),GPQA Diamond 90.9,MathArena Apex 65.6。
Agent 类测评中 V4.1 Flash 的表现尤其突出。
- Terminal-Bench 2.1 90.6(超过 Opus 5.0 的 89.1 和 GPT-5.6 Sol 的 88.8)
- DeepSWE v1.1 74.2(超过 GPT-5.6 Sol 的 73.0)
- AutomationBench 54.8(超过 Opus 5.0 的 50.3)
- Agent's Last Exam 31.8(在所有列出的竞品中最高)
以上为供应商公布的测评数据。模型刚发布,独立评测还在陆续出来。
来源 DeepSeek V4.1 Flash 技术报告,检索于 2026 年 9 月 11 日。
支持的功能
| 功能 | 是否支持 |
|---|---|
| JSON Output | 是 |
| Tool Calls / Function Calling | 是 |
| Responses API | 是 |
| Anthropic API 格式 | 是 |
| Chat Prefix Completion(Beta) | 是 |
| FIM Completion(Beta) | 仅非思考模式 |
| 视觉输入 | 是 |
| 上下文长度 | 1M tokens |
| 最大输出 | 384K tokens |
| 并发限制 | 2,500 |
DeepSeek 还在 https://api.deepseek.com/anthropic 上支持 Anthropic messages API 格式。如果你的技术栈用 Anthropic SDK,也可以指向 DeepSeek,不需要切换到 OpenAI 格式。
来源 DeepSeek API Docs,检索于 2026 年 9 月 11 日。
模型名称迁移:哪些模型退役了
V4.1 Flash 立即替代了两个模型。
| 退役模型 | 遗留 slug | 路由行为 |
|---|---|---|
| V4 Flash | deepseek-v4-flash | 现在路由到 V4.1 Flash,按 V4.1 Flash 定价计费 |
| V4-Flash-Vision-Exp | deepseek-v4-flash-vision-exp | 现在路由到 V4.1 Flash,按 V4.1 Flash 定价计费 |
2026 年 9 月 14 日 UTC 04:00 起,deepseek-v4-pro 的请求也将路由到 V4.1 Flash 并按 V4.1 Flash 费率计费。DeepSeek 随后澄清,V4 Pro 的 API 服务将在 9 月 14 日之后继续提供,计费方式不变,后续如有调整会另行通知。
如果你的代码在用 deepseek-v4-flash 或 deepseek-v4-flash-vision-exp,它们会继续工作,背后静默解析到 V4.1 Flash。但我们建议更新到 deepseek-flash,避免 V4.1 Pro 上线后产生混淆。
来源 DeepSeek V4.1 Flash 公告,检索于 2026 年 9 月 11 日。
常见错误和注意事项
429 Too Many Requests。 V4.1 Flash 每个账号有 2,500 的并发请求上限。如果遇到 429 错误,可以提交扩容申请,不收额外费用。请求从发出到模型响应完成的整个过程算一个并发连接。
思考模式默认开启。 从 V4 Flash 迁移过来时,如果你期望的是非思考行为,需要在每次请求中显式关闭思考模式。这个默认值变了。
遗留模型名仍可用但计费发生了变化。 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 现在按 V4.1 Flash 费率计费,而 V4.1 Flash 的价格低于 V4 Flash 原来的定价。即使不改代码,你的成本也可能下降。
FIM Completion 需要关闭思考模式。 Fill-in-the-Middle 补全仅在思考模式关闭时可用。开着思考模式发 FIM 请求会报错。
视觉输入的 token 消耗。 图片在下采样后按分辨率消耗 token。一张高分辨率的架构图可能消耗的输入 token 远超预期。首次使用视觉功能时,留意 token 用量。
速率限制与并发
| 模型 | 并发上限 |
|---|---|
deepseek-flash(V4.1 Flash) | 2,500 |
deepseek-v4-pro | 500 |
并发限制按账号维度计算,与使用哪个 API key 无关。如果需要按用户隔离,传 user_id 参数。DeepSeek 用它做内容安全隔离、KV cache 隔离和调度隔离。
来源 DeepSeek Rate Limit & Isolation,检索于 2026 年 9 月 11 日。
TheRouter 集成:把 V4.1 Flash 放进 Fallback 链
TheRouter 能路由 OpenAI 兼容的请求到已配置的供应商,把 V4.1 Flash 加入路由配置和其他模型并列即可。
一个实用的模式是把 V4.1 Flash 作为通用任务的默认模型,当 DeepSeek 返回 5xx 或超时时回退到其他供应商。
# 示例:V4.1 Flash 主力,Qwen3.7-Max 备用
models:
- provider: deepseek
model: deepseek-flash
priority: 1
- provider: dashscope
model: qwen3.7-max
priority: 2
V4.1 Flash 2,500 的并发上限和低定价让它非常适合放在高吞吐路由配置的首选位置。对于需要视觉输入的任务,V4.1 Flash 目前是通过 OpenAI 兼容 API 能用到的最便宜的多模态选项之一。
更多关于 fallback 路由的细节,见我们的模型回退指南。
上线检查清单
在生产环境部署 V4.1 Flash 之前,确认以下几项。
- 更新模型 slug。 从
deepseek-v4-flash/deepseek-v4-flash-vision-exp切换到deepseek-flash。 - 显式设置思考模式。 不要依赖默认值。如果需要非思考行为,在每次请求中关闭它。
- 如果从 Vision-Exp 迁移,测试视觉输入。 V4.1 Flash 的视觉编码器和实验版本不同。对你的图片处理测试用例跑一遍新模型。
- 监控缓存命中率。 V4.1 Flash 的压缩 KV cache 改变了缓存行为。跟踪响应中的
prompt_tokens_details.cached_tokens来了解实际输入成本。 - 检查并发余量。 默认限制从之前的 V4 Flash 跳到了 2,500。如果之前经常打限制,现在可能有空间提高吞吐。
- 把弹性工作负载安排在非高峰时段。 非高峰价格是高峰的一半。批量任务、评测和非延迟敏感的作业应该瞄准非高峰时段(工作日 UTC 01:00-04:00 和 06:00-10:00 以外的所有时间)。
小结
DeepSeek V4.1 Flash 在一个模型里装进了很多东西。552B MoE 参数配合 8B/16B 非对称激活,原生视觉,1M 上下文,带可控力度的思考模式,非高峰输入起步价 $0.15/M token。它一次性替代了 V4 Flash、V4-Flash-Vision-Exp,也部分替代 V4 Pro。
对路由运维者来说,关键事实就几条。它是 OpenAI 兼容的,base URL https://api.deepseek.com,模型 slug 是 deepseek-flash,并发上限 2,500,Agent 类测评表现比肩顶级模型但成本只有零头。