← 全部文章

DeepSeek V4-Pro vs V4-Flash(2026 年 8 月):API 定价、基准测试与路由策略

DeepSeek V4-Pro-0813 与 V4-Flash-0731 的全面对比,涵盖峰谷定价、独立基准测试、推理力度控制,以及面向 OpenAI 兼容 API 运营方的路由决策框架。

· updated 2026-08-18· TheRouter

DeepSeek 现在在其 OpenAI 兼容端点上提供两个生产模型,分别是 V4-Pro(0813 版,8 月 13 日正式 GA)和 V4-Flash(0731 版,7 月 31 日正式 GA)。两者共享 1M token 上下文窗口、384K 最大输出、混合思维模式、tool calling、JSON 输出、Responses API,以及 Anthropic 格式端点。账面参数几乎完全一致,看上去像同一个模型的两个价格档位。实测下来,两者之间的差距比名字暗示的要小得多。路由决策取决于你的任务对错误的容忍度,不取决于哪个名字听起来更"高端"。

这篇对比整理了当前定价(包括 8 月 16 日生效的峰谷费率)、独立基准测试数据,以及一套面向单一 base_url 运行两个模型的运营方的路由框架。

OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。

定价对比:峰时、谷时,以及那个 3 倍系数

DeepSeek 在 2026 年 8 月 16 日引入了分时段定价。峰时为 UTC 01:00–04:00 和 UTC 06:00–10:00(大致对应北京时间 09:00–12:00 和 14:00–18:00)。谷时费率恰好是峰时的一半。

所有价格以美元计,单位为每 1M token。

价格项V4-Flash(谷时)V4-Flash(峰时)V4-Pro(谷时)V4-Pro(峰时)Pro/Flash 倍率
缓存命中输入$0.007$0.014$0.022$0.044~3.1×
缓存未命中输入$0.22$0.44$0.66$1.323×
输出$0.66$1.32$1.98$3.963×
并发上限2,5002,5005005000.2×

三个要点值得留意。

第一,Pro 在缓存未命中输入和输出上的价格恰好是 Flash 的 3 倍,峰谷比率都一样。没有隐藏的乘数。

第二,两个模型的谷时价格都是峰时的一半。如果你能把批处理任务挪到谷时窗口(UTC 10:00–01:00、UTC 04:00–06:00),相当于回到了 8 月 16 日涨价前的 Flash 费率水平。

第三,Flash 的并发上限是 Pro 的 5 倍。在 2,500 对 500 的数字面前,高吞吐场景如批量分类和并行 sub-agent 调度只能选 Flash。

跨供应商比较 API 价格时,统一到美元每百万 token口径,并区分输入与输出。多数供应商的输出 token 价是输入的 2–5 倍,所以"补全长度大" 的负载与"检索为主"的负载在同样的标称单价下成本会差很多。

  • 统一货币(USD)——发表日按汇率折算并标注。
  • 区分输入/输出——永远不要给单一"混合价"。
  • 每行引到供应商自己的价格页 + 抓取日期。
  • 注明长上下文阶梯价——长上下文常常单独跳一档。

实际工作负载下的费用

以一个典型的对话回合(1K 新输入 + 500 输出 token)为例,谷时费率下的开销如下。

  • V4-Flash 约 $0.00055
  • V4-Pro 约 $0.00165

再看一个重缓存 agent 循环(200K 缓存 + 20K 新输入 + 10K 输出),同样是谷时费率。

  • V4-Flash 约 $0.011
  • V4-Pro 约 $0.033

3 倍的价差在各种工作负载形态下都保持稳定。Pro 不会因为上下文更长或输出更多而变得格外昂贵,它是一个固定溢价。

独立基准测试

"Pro" 和 "Flash" 这两个标签暗示了巨大的能力差距。独立测试讲述了不同的故事。

以下是 Artificial Analysis 的数据(2026 年 8 月 13 日核查)。

基准测试V4-Pro 0813V4-Flash 0731差距
Intelligence Index5352Pro +1
Agentic Index49.648.4Pro +1.2
Terminal-Bench v2.178.65%78.65%持平
长上下文推理75.33%74.33%Pro +1
GPQA Diamond92.83%90.81%Pro +2
SciCode49.19%49.88%Flash +0.7
输出速度83.2 tok/s122.2 tok/sFlash 快 47%

DeepSeek 自己的基准测试数据(来自 Hugging Face 上的 V4 技术报告)在知识密集型和 agentic 任务上展示了更大的差距。

基准测试V4-Pro 0813V4-Flash 0731差距
SimpleQA57.9%34.1%Pro +23.8
BrowseComp83.4%73.2%Pro +10.2
Terminal-Bench 2.067.9%56.9%Pro +11
SWE-bench Pro55.4%52.6%Pro +2.8
HLE42.7%34.8%Pro +7.9

独立测试和厂商数据描绘了不同的画面。在独立评估中,Pro 和 Flash 落在同一个大的能力层级,大多数指标差距只有个位数。在 DeepSeek 自己的基准测试(Terminal-Bench 2.0、SimpleQA、BrowseComp)上,Pro 拉开了更明显的距离。

三个经得起两组数据检验的结论。

第一,V4-Pro 0813 相比早期预览版有了实质性提升。Artificial Analysis 记录到 Intelligence Index 从 ~45.3 跳到 53,Agentic Index 从 ~37.8 跳到 49.6。

第二,在常规编码和 agent 任务上,Flash 在独立评估中与 Pro 匹配或接近匹配。Terminal-Bench v2.1 持平,SWE-bench Pro 差距只有 2.8 个百分点。

第三,Pro 的优势集中在知识密集型和多步 agentic 任务上,SimpleQA、BrowseComp、HLE 这几项都指向同一个方向。在这些场景里,第一次答错的代价很高。

功能对等

两个模型共享完全相同的 API 接口。

功能V4-ProV4-Flash
上下文窗口1M1M
最大输出384K384K
思维模式默认开启,支持力度控制默认开启,支持力度控制
推理力度级别low / high / maxlow / high / max
Tool calling支持支持
JSON 输出支持支持
Responses API支持支持
Anthropic API 格式支持支持
FIM completion(beta)仅非思维模式仅非思维模式
Chat prefix completion(beta)支持支持

推理力度控制在两个模型上的行为完全一致。设置 reasoning_effort: "low" 映射到低力度,"high" 映射到高力度,"max" 映射到最大力度。中间值 "medium" 和 "xhigh" 都映射到高力度。这意味着你可以把力度控制当作逐请求的成本杠杆来用,不需要切换模型就能在简单分类和复杂推理之间调节。

路由策略

V4-Pro 和 V4-Flash 之间的路由决策并非"难题用 Pro、简单题用 Flash"。正确的思路是"用 Flash 作为默认路由,当答错一次的代价超过 3 倍 token 溢价时才升级到 Pro"。

从 Flash 开始

Flash 应该是你的默认路由,适用于以下场景。

  • 大批量代码生成 可以重试,可以衡量,而且 Flash 快 47%
  • 分类、提取和摘要 质量差异小,吞吐量才是关键
  • Sub-agent worker 2,500 的并发上限足以支撑并行扇出
  • 探索性原型开发 先用低成本建立基线,再考虑是否值得为 Pro 买单

升级到 Pro 的场景

Pro 值得 3 倍溢价的场景如下。

  • 架构设计和跨系统调试 错误会传播并导致昂贵的返工
  • 知识密集型查询 Pro 在 SimpleQA 上拿到 57.9%(Flash 是 34.1%),事实性更强
  • 高风险分析 人工复审一个错误答案的成本如果超过 API 价差,Pro 更划算
  • 带分支的多步 agentic 任务 BrowseComp 和 Terminal-Bench 2.0 的差距显示 Pro 在复杂 agent 循环中表现更好

Planner-Worker 模式

一个常见的生产模式是让 Pro 承担 planner 角色(架构决策、任务分解),Flash 承担 worker 角色(代码生成、测试执行、文件操作)。高价模型集中在需要判断力的环节,批量工作交给 Flash。

# 示例:通过 TheRouter 按任务类型路由
from openai import OpenAI

client = OpenAI(
    base_url="https://therouter.ai/v1",
    api_key="your-therouter-key"
)

# 规划任务 → V4-Pro
plan = client.chat.completions.create(
    model="deepseek/deepseek-v4-pro",
    messages=[{"role": "user", "content": "设计迁移方案..."}],
    reasoning_effort="high"
)

# 执行任务 → V4-Flash
for task in plan_tasks:
    result = client.chat.completions.create(
        model="deepseek/deepseek-v4-flash",
        messages=[{"role": "user", "content": task}],
        reasoning_effort="low"
    )

利用峰谷定价优化成本

谷时费率是峰时的 50%,运营方可以把批处理和非延迟敏感的工作负载安排在谷时窗口(UTC 10:00–01:00,UTC 04:00–06:00)。Flash + 谷时的组合相比 Pro + 峰时最多可以节省 6 倍成本。

对延迟敏感的生产流量来说,峰谷差价帮助有限,请求来了就得服务。但批量评估、回归测试和数据管线任务完全可以挪到谷时运行。

通过 TheRouter 路由

两个模型都在 TheRouter 的模型目录中,分别是 deepseek/deepseek-v4-pro 和 deepseek/deepseek-v4-flash。你可以设置 model fallbacks 来在两者之间自动路由。

常见配置方式如下。

  • 主路由用 deepseek/deepseek-v4-flash,追求性价比
  • 当 Flash 返回错误或达到并发上限时,自动回退到 deepseek/deepseek-v4-pro
  • 或者按任务元数据路由,规划类 prompt 发给 Pro,执行类 prompt 发给 Flash

OpenAI 兼容的 base_url 意味着切换模型只需要改 model 参数。不需要换 SDK,也不需要改端点或重新认证。

Pro 不值得的场景

以下情况 Pro 的溢价没有意义。

  • 你还没有任务级别的评估数据。先用 Flash 建立基线。
  • 任务可以用低成本手段重试和验证(单元测试、格式校验)。
  • 吞吐量比单次请求质量更重要。Flash 的 5 倍并发和 47% 速度优势占主导。
  • 你在峰时运行,而成本是约束条件。Flash 峰时($1.32/1M 输出)比 Pro 谷时($1.98/1M 输出)还便宜。

总结

V4-Pro 0813 相比早期预览版有了实质性升级,在知识密集型和复杂 agentic 基准测试上拉开了差距。V4-Flash 0731 在独立编码和推理评估中与 Pro 匹配或接近匹配,同时快 47%,并发上限高 5 倍,价格恰好是 Pro 的三分之一。

对大多数生产工作负载来说,Flash 是正确的默认选择。Pro 在特定高风险场景中赢得自己的位置,前提是答错一次的代价要超过 3 倍 token 溢价。Planner-Worker 模式让 Pro 负责规划、Flash 负责执行,既能获得两者的优势又不会过度消费。

峰谷定价已经生效,能把批处理挪到谷时的运营方还能进一步叠加节省。通过单一 OpenAI 兼容网关 路由两个模型,让你的工作负载数据而非模型名称来驱动路由决策。


来源

本文涉及的模型

帮助与联系