DeepSeek V4-Pro vs V4-Flash(2026 年 8 月):API 定价、基准测试与路由策略
DeepSeek V4-Pro-0813 与 V4-Flash-0731 的全面对比,涵盖峰谷定价、独立基准测试、推理力度控制,以及面向 OpenAI 兼容 API 运营方的路由决策框架。
DeepSeek 现在在其 OpenAI 兼容端点上提供两个生产模型,分别是 V4-Pro(0813 版,8 月 13 日正式 GA)和 V4-Flash(0731 版,7 月 31 日正式 GA)。两者共享 1M token 上下文窗口、384K 最大输出、混合思维模式、tool calling、JSON 输出、Responses API,以及 Anthropic 格式端点。账面参数几乎完全一致,看上去像同一个模型的两个价格档位。实测下来,两者之间的差距比名字暗示的要小得多。路由决策取决于你的任务对错误的容忍度,不取决于哪个名字听起来更"高端"。
这篇对比整理了当前定价(包括 8 月 16 日生效的峰谷费率)、独立基准测试数据,以及一套面向单一 base_url 运行两个模型的运营方的路由框架。
OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。
定价对比:峰时、谷时,以及那个 3 倍系数
DeepSeek 在 2026 年 8 月 16 日引入了分时段定价。峰时为 UTC 01:00–04:00 和 UTC 06:00–10:00(大致对应北京时间 09:00–12:00 和 14:00–18:00)。谷时费率恰好是峰时的一半。
所有价格以美元计,单位为每 1M token。
| 价格项 | V4-Flash(谷时) | V4-Flash(峰时) | V4-Pro(谷时) | V4-Pro(峰时) | Pro/Flash 倍率 |
|---|---|---|---|---|---|
| 缓存命中输入 | $0.007 | $0.014 | $0.022 | $0.044 | ~3.1× |
| 缓存未命中输入 | $0.22 | $0.44 | $0.66 | $1.32 | 3× |
| 输出 | $0.66 | $1.32 | $1.98 | $3.96 | 3× |
| 并发上限 | 2,500 | 2,500 | 500 | 500 | 0.2× |
三个要点值得留意。
第一,Pro 在缓存未命中输入和输出上的价格恰好是 Flash 的 3 倍,峰谷比率都一样。没有隐藏的乘数。
第二,两个模型的谷时价格都是峰时的一半。如果你能把批处理任务挪到谷时窗口(UTC 10:00–01:00、UTC 04:00–06:00),相当于回到了 8 月 16 日涨价前的 Flash 费率水平。
第三,Flash 的并发上限是 Pro 的 5 倍。在 2,500 对 500 的数字面前,高吞吐场景如批量分类和并行 sub-agent 调度只能选 Flash。
跨供应商比较 API 价格时,统一到美元每百万 token口径,并区分输入与输出。多数供应商的输出 token 价是输入的 2–5 倍,所以"补全长度大" 的负载与"检索为主"的负载在同样的标称单价下成本会差很多。
- 统一货币(USD)——发表日按汇率折算并标注。
- 区分输入/输出——永远不要给单一"混合价"。
- 每行引到供应商自己的价格页 + 抓取日期。
- 注明长上下文阶梯价——长上下文常常单独跳一档。
实际工作负载下的费用
以一个典型的对话回合(1K 新输入 + 500 输出 token)为例,谷时费率下的开销如下。
- V4-Flash 约 $0.00055
- V4-Pro 约 $0.00165
再看一个重缓存 agent 循环(200K 缓存 + 20K 新输入 + 10K 输出),同样是谷时费率。
- V4-Flash 约 $0.011
- V4-Pro 约 $0.033
3 倍的价差在各种工作负载形态下都保持稳定。Pro 不会因为上下文更长或输出更多而变得格外昂贵,它是一个固定溢价。
独立基准测试
"Pro" 和 "Flash" 这两个标签暗示了巨大的能力差距。独立测试讲述了不同的故事。
以下是 Artificial Analysis 的数据(2026 年 8 月 13 日核查)。
| 基准测试 | V4-Pro 0813 | V4-Flash 0731 | 差距 |
|---|---|---|---|
| Intelligence Index | 53 | 52 | Pro +1 |
| Agentic Index | 49.6 | 48.4 | Pro +1.2 |
| Terminal-Bench v2.1 | 78.65% | 78.65% | 持平 |
| 长上下文推理 | 75.33% | 74.33% | Pro +1 |
| GPQA Diamond | 92.83% | 90.81% | Pro +2 |
| SciCode | 49.19% | 49.88% | Flash +0.7 |
| 输出速度 | 83.2 tok/s | 122.2 tok/s | Flash 快 47% |
DeepSeek 自己的基准测试数据(来自 Hugging Face 上的 V4 技术报告)在知识密集型和 agentic 任务上展示了更大的差距。
| 基准测试 | V4-Pro 0813 | V4-Flash 0731 | 差距 |
|---|---|---|---|
| SimpleQA | 57.9% | 34.1% | Pro +23.8 |
| BrowseComp | 83.4% | 73.2% | Pro +10.2 |
| Terminal-Bench 2.0 | 67.9% | 56.9% | Pro +11 |
| SWE-bench Pro | 55.4% | 52.6% | Pro +2.8 |
| HLE | 42.7% | 34.8% | Pro +7.9 |
独立测试和厂商数据描绘了不同的画面。在独立评估中,Pro 和 Flash 落在同一个大的能力层级,大多数指标差距只有个位数。在 DeepSeek 自己的基准测试(Terminal-Bench 2.0、SimpleQA、BrowseComp)上,Pro 拉开了更明显的距离。
三个经得起两组数据检验的结论。
第一,V4-Pro 0813 相比早期预览版有了实质性提升。Artificial Analysis 记录到 Intelligence Index 从 ~45.3 跳到 53,Agentic Index 从 ~37.8 跳到 49.6。
第二,在常规编码和 agent 任务上,Flash 在独立评估中与 Pro 匹配或接近匹配。Terminal-Bench v2.1 持平,SWE-bench Pro 差距只有 2.8 个百分点。
第三,Pro 的优势集中在知识密集型和多步 agentic 任务上,SimpleQA、BrowseComp、HLE 这几项都指向同一个方向。在这些场景里,第一次答错的代价很高。
功能对等
两个模型共享完全相同的 API 接口。
| 功能 | V4-Pro | V4-Flash |
|---|---|---|
| 上下文窗口 | 1M | 1M |
| 最大输出 | 384K | 384K |
| 思维模式 | 默认开启,支持力度控制 | 默认开启,支持力度控制 |
| 推理力度级别 | low / high / max | low / high / max |
| Tool calling | 支持 | 支持 |
| JSON 输出 | 支持 | 支持 |
| Responses API | 支持 | 支持 |
| Anthropic API 格式 | 支持 | 支持 |
| FIM completion(beta) | 仅非思维模式 | 仅非思维模式 |
| Chat prefix completion(beta) | 支持 | 支持 |
推理力度控制在两个模型上的行为完全一致。设置 reasoning_effort: "low" 映射到低力度,"high" 映射到高力度,"max" 映射到最大力度。中间值 "medium" 和 "xhigh" 都映射到高力度。这意味着你可以把力度控制当作逐请求的成本杠杆来用,不需要切换模型就能在简单分类和复杂推理之间调节。
路由策略
V4-Pro 和 V4-Flash 之间的路由决策并非"难题用 Pro、简单题用 Flash"。正确的思路是"用 Flash 作为默认路由,当答错一次的代价超过 3 倍 token 溢价时才升级到 Pro"。
从 Flash 开始
Flash 应该是你的默认路由,适用于以下场景。
- 大批量代码生成 可以重试,可以衡量,而且 Flash 快 47%
- 分类、提取和摘要 质量差异小,吞吐量才是关键
- Sub-agent worker 2,500 的并发上限足以支撑并行扇出
- 探索性原型开发 先用低成本建立基线,再考虑是否值得为 Pro 买单
升级到 Pro 的场景
Pro 值得 3 倍溢价的场景如下。
- 架构设计和跨系统调试 错误会传播并导致昂贵的返工
- 知识密集型查询 Pro 在 SimpleQA 上拿到 57.9%(Flash 是 34.1%),事实性更强
- 高风险分析 人工复审一个错误答案的成本如果超过 API 价差,Pro 更划算
- 带分支的多步 agentic 任务 BrowseComp 和 Terminal-Bench 2.0 的差距显示 Pro 在复杂 agent 循环中表现更好
Planner-Worker 模式
一个常见的生产模式是让 Pro 承担 planner 角色(架构决策、任务分解),Flash 承担 worker 角色(代码生成、测试执行、文件操作)。高价模型集中在需要判断力的环节,批量工作交给 Flash。
# 示例:通过 TheRouter 按任务类型路由
from openai import OpenAI
client = OpenAI(
base_url="https://therouter.ai/v1",
api_key="your-therouter-key"
)
# 规划任务 → V4-Pro
plan = client.chat.completions.create(
model="deepseek/deepseek-v4-pro",
messages=[{"role": "user", "content": "设计迁移方案..."}],
reasoning_effort="high"
)
# 执行任务 → V4-Flash
for task in plan_tasks:
result = client.chat.completions.create(
model="deepseek/deepseek-v4-flash",
messages=[{"role": "user", "content": task}],
reasoning_effort="low"
)
利用峰谷定价优化成本
谷时费率是峰时的 50%,运营方可以把批处理和非延迟敏感的工作负载安排在谷时窗口(UTC 10:00–01:00,UTC 04:00–06:00)。Flash + 谷时的组合相比 Pro + 峰时最多可以节省 6 倍成本。
对延迟敏感的生产流量来说,峰谷差价帮助有限,请求来了就得服务。但批量评估、回归测试和数据管线任务完全可以挪到谷时运行。
通过 TheRouter 路由
两个模型都在 TheRouter 的模型目录中,分别是 deepseek/deepseek-v4-pro 和 deepseek/deepseek-v4-flash。你可以设置 model fallbacks 来在两者之间自动路由。
常见配置方式如下。
- 主路由用
deepseek/deepseek-v4-flash,追求性价比 - 当 Flash 返回错误或达到并发上限时,自动回退到
deepseek/deepseek-v4-pro - 或者按任务元数据路由,规划类 prompt 发给 Pro,执行类 prompt 发给 Flash
OpenAI 兼容的 base_url 意味着切换模型只需要改 model 参数。不需要换 SDK,也不需要改端点或重新认证。
Pro 不值得的场景
以下情况 Pro 的溢价没有意义。
- 你还没有任务级别的评估数据。先用 Flash 建立基线。
- 任务可以用低成本手段重试和验证(单元测试、格式校验)。
- 吞吐量比单次请求质量更重要。Flash 的 5 倍并发和 47% 速度优势占主导。
- 你在峰时运行,而成本是约束条件。Flash 峰时($1.32/1M 输出)比 Pro 谷时($1.98/1M 输出)还便宜。
总结
V4-Pro 0813 相比早期预览版有了实质性升级,在知识密集型和复杂 agentic 基准测试上拉开了差距。V4-Flash 0731 在独立编码和推理评估中与 Pro 匹配或接近匹配,同时快 47%,并发上限高 5 倍,价格恰好是 Pro 的三分之一。
对大多数生产工作负载来说,Flash 是正确的默认选择。Pro 在特定高风险场景中赢得自己的位置,前提是答错一次的代价要超过 3 倍 token 溢价。Planner-Worker 模式让 Pro 负责规划、Flash 负责执行,既能获得两者的优势又不会过度消费。
峰谷定价已经生效,能把批处理挪到谷时的运营方还能进一步叠加节省。通过单一 OpenAI 兼容网关 路由两个模型,让你的工作负载数据而非模型名称来驱动路由决策。
来源
- DeepSeek Models & Pricing — 2026-08-18 获取
- DeepSeek V4-Pro GA 发布公告 — 2026-08-18 获取
- DeepSeek 思维模式文档 — 2026-08-18 获取
- Artificial Analysis: DeepSeek V4 Pro 0813 — 2026-08-13 核查
- Artificial Analysis: DeepSeek V4 Flash 0731 — 2026-08-13 核查
- BenchLM: V4-Flash-0731 vs V4-Pro-0813 对比 — 2026-08-18 获取
- DeepSeek V4 技术报告 (PDF) — 基准测试数据来源