DeepSeek V4-Pro-0813 与 8 月 16 日价格断崖,网关运营团队接下来 48 小时必须检查什么

DeepSeek 的 V4-Pro 别名刚刚升级到新的 GA 模型,agent 基准显著提高,峰谷定价将在 8 月 16 日生效。生产 routing 团队的成本计算方式已经变了。

TheRouter Newsroom来源 DeepSeek
抽象图示展示 AI API routing 的分时价格层级,画面分成日间和夜间区域

DeepSeek 这周同时确认了两件事。第一,V4-Pro-0813 已经进入 GA,deepseek-v4-pro 这个别名现在指向新模型。第二,7 月初还停留在传闻阶段的峰谷定价,已经有了官方价格和明确时间。它会在 2026 年 8 月 16 日 16 点 00 UTC 生效,离现在不到 48 小时。

如果你的 routing 策略、cron 任务或批处理流水线仍然按 DeepSeek 的固定单价配置,今天就该改。

V4-Pro-0813 带来的模型变化

这次 GA 把预览阶段的 agent 能力提升正式落到 deepseek-v4-pro 别名上。DeepSeek 更新日志给出的基准包括 HLE 无工具和有工具分别为 42.7 和 60.0,TerminalBench 2.1 为 87.9,NL2Repo 为 61.5,Cybergym 为 83.3,DeepSWE 为 62.7,Toolathlon-Verified 为 74.1,DSBench-FullStack 为 71.1,DSBench-Hard 为 67.2。

对运营团队更重要的是思考强度控制方式。新模型支持通过 reasoning_effort 设置三个层级,分别是 "low"、"high" 和 "max"。过去那种二元开关写法 thinking 二元开关 仍然可用,但官方现在推荐把 reasoning_effort 作为主要控制项。实际迁移可以这样做。

  • reasoning_effort 取 "low" 时,用在成本敏感、步骤简单的任务上
  • reasoning_effort 取 "high" 时,适合作为日常 agent 任务的默认值
  • reasoning_effort 取 "max" 时,留给复杂规划、困难编码和多步推理任务

DeepSeek 还为模型加入了原生 Responses API 支持,并特别适配 Codex 工作流。如果你已经把 Codex 接到 deepseek-v4-pro,这次不是换模型名那么简单,配置也应该同步更新。

8 月 16 日的价格断崖

7 月时,我们曾基于 TechNode 的二手消息发布过一篇 DeepSeek V4 峰时定价分析。当时的信息只有大致方向和模糊数字。现在 DeepSeek 官方价格页已经确认了精确价格,数字也和传闻不完全一致。

8 月 16 日 16 点 00 UTC 前的当前价格

模型非缓存输入输出
deepseek-v4-flash$0.14/M$0.28/M
deepseek-v4-pro$0.435/M$0.87/M

8 月 16 日 16 点 00 UTC 后的新价格

模型时段缓存命中非缓存输入输出
deepseek-v4-flash谷时$0.007/M$0.22/M$0.66/M
deepseek-v4-flash峰时$0.014/M$0.44/M$1.32/M
deepseek-v4-pro谷时$0.022/M$0.66/M$1.98/M
deepseek-v4-pro峰时$0.044/M$1.32/M$3.96/M

峰时时段是 01 点 00 到 04 点 00 UTC,以及 06 点 00 到 10 点 00 UTC。除此之外都是谷时。

峰时价格正好是谷时的 2 倍。更关键的是,deepseek-v4-pro 的输出价格会从今天的 $0.87/M 变成峰时 $3.96/M,涨幅约为 4.55 倍。

网关运营团队现在要改什么

这两个峰时窗口覆盖了美国西海岸深夜、欧洲工作时间、美国东海岸清晨,也和中国工作时间有重叠。对很多生产团队来说,这不是边缘时段。

如果一个团队每天把 1000 万输出 token 路由到 deepseek-v4-pro,并且全部落在峰时,8 月 16 日之后每天输出成本会是 39.60 美元。同样的任务如果全部移到谷时,成本是 19.80 美元。模型没变,token 数没变,只是时间不同,账单就差一倍。

这意味着 DeepSeek 流量必须把时间纳入 routing 决策。06 点 00 到 10 点 00 UTC 期间,deepseek-v4-pro 的输出价格是 $3.96/M。对价格敏感的请求,策略层应该先判断时段,再决定是否继续走 DeepSeek,还是切到固定价格的替代模型。

这和 OpenAI Fast Mode 的 service_tier 逻辑不一样。Fast Mode 可以改变吞吐、延迟或服务层级,但不会因为 UTC 时间不同而改变单价。对多 provider 团队来说,一个合理做法是在高峰业务时段保留价格可预测的路径,把大批量异步任务移到 DeepSeek 的谷时窗口。

8 月 16 日前的检查清单

先查定时任务。任何落在 01 点 00 到 04 点 00 UTC 或 06 点 00 到 10 点 00 UTC 的 cron、CI、评测和数据处理任务,都会按峰时价格调用 DeepSeek。重任务尽量移到 10 点 00 到 23 点 59 UTC,或者 04 点 00 到 06 点 00 UTC 这段空窗。

再查思考强度设置。如果你仍然只写 thinking 二元开关,现在应该改成显式的 reasoning_effort。多数 agent 任务从 "high" 开始,简单任务用 "low",只有确实需要质量上限时再用 "max"。

最后查 Codex 配置。DeepSeek 已经说明 V4-Pro-0813 支持原生 Responses API,并针对 Codex 做了适配。把模型别名、Responses API 配置和 reasoning effort 一起检查,避免模型升级之后成本和行为都失去控制。

这不是单独的一次模型更新,也不是普通涨价。它把模型能力、思考强度和时间价格绑在了一起。对于 gateway 和 router 来说,8 月 16 日之后,时钟本身就是 routing 策略的一部分。

帮助与联系