DeepSeek V4 Pro 永久降价:$0.87/M 输出价格,80%+ SWE-bench 重新定义推理模型路由层级

DeepSeek V4 Pro 的 75% 降价已确认永久生效,输出价格锁定 $0.87/M tokens。SWE-bench 80.6% 的成绩让 V4 Pro 成为主力推理模型而非备用选项——这意味着你的路由策略需要重新定价。

发布于 来源 DeepSeek

归档条目:由 AI 根据所引信源辅助生成,发布时未经逐篇审阅。责任编辑:Joe Werner。

DeepSeek V4 Pro 永久降价:AI 工程团队路由策略决策框架

AI 价格战已经从促销手段演变为永久性定价策略。DeepSeek 于 2026 年 5 月 23 日确认,原本计划在 5 月 31 日到期的 V4 Pro 75% 折扣将永久生效。这意味着 4 月上线时标价 $1.74/M 输入、$3.48/M 输出的 V4 Pro,正式将价格锁定在 $0.435/M 输入、$0.87/M 输出。

这不只是一条"降价新闻"——它是一个路由策略触发器:所有将 V4 Pro 配置为"高端备用模型"的团队,都需要重新评估它是否应该成为主力推理层。

发生了什么

DeepSeek 于 2026 年 4 月 24 日发布 V4 Pro 和 V4 Flash,构成分层定价体系:

模型输入(缓存未命中)输出上下文思考模式
deepseek-v4-flash$0.14/M$0.28/M1M支持
deepseek-v4-pro$0.435/M$0.87/M1M支持

V4 Pro 发布时原价为 $1.74/M 输入、$3.48/M 输出,75% 促销折扣原定 5 月 31 日截止。但公司在 5 月 23 日发表声明,确认这一折扣价格将成为永久正式定价。此外,从 4 月 26 日起,两款模型的缓存命中价格均已降低至发布价格的 1/10。

并发限制维持原有分层:V4 Flash 支持 2,500 个并发请求,V4 Pro 为 500 个。

对 AI 工程团队的影响

与同级别前沿模型的成本对比已发生根本性改变。 V4 Pro 以 $0.87/M 输出,在主流模型中的价格位置如下:

  • OpenAI o4-mini:$4.40/M 输出(贵 5 倍)
  • Claude Sonnet 4:$15/M 输出(贵 17 倍)
  • GPT-4.1:$8/M 输出(贵 9 倍)

DeepSeek V4 Pro 在 SWE-bench Verified 上得分 80.6%,与多个价格高出一个数量级的模型持平或超越。它同时提供 1M token 上下文、函数调用、JSON 输出、思考/非思考双模式,以及 OpenAI/Anthropic 双格式 API 兼容。

原有逻辑是:只有 V4 Flash 无法处理时,才升级调用 V4 Pro。永久定价改变了这个逻辑:V4 Pro 现在的价格已经适合作为默认推理模型,而不只是高端例外情形。

备用链成本计算逻辑需要反转。 部分团队构建路由策略时遵循"优先调用便宜的国内模型,失败时回落到 V4 Pro"的模式。按新的定价,V4 Pro 作为主力推理层——V4 Flash 作为快速、低成本的执行层——可能比将 V4 Pro 配置为备用选项更具成本效益。

国内与全球路由的权衡更加清晰。 对于跨地域使用多个模型提供商的团队,V4 Pro 永久定价使其在推理密集型工作负载上具有更强的竞争力。DeepSeek API 同时支持 OpenAI 格式和 Anthropic 格式,进一步降低了多供应商路由的协议复杂度。

路由运营视角

永久降价在路由策略上触发三个即时决策点:

1. 重新评估模型分层。 如果 V4 Pro 被配置为"第 2 层备用",考虑是否应改为"第 1 层主力推理",同时将 V4 Flash 调整为"第 0 层快速/低成本"执行模型。$0.87/M 输出的价格,使 V4 Pro 在许多提供商的 Flash 类模型中也具有竞争力。

2. 重新评估思考模式的成本预算。 V4 Pro 和 V4 Flash 默认均开启思考模式,思考模式会增加输出 token 数量,直接放大每次查询的成本。旧价格($3.48/M)下,4,000 token 的思考链成本为 $0.014;新价格($0.87/M)下仅需 $0.0035,成本缩减 4 倍。思考模式的启用门槛变得更宽松,但仍需注意对长上下文任务的 token 控制。

3. 检查备用链中的"反向路由"风险。 一个常见模式:先调用低价国内模型,失败时回落到贵的全球模型。如果你的主力是 V4 Pro($0.87/M),备用是 Claude Sonnet($15/M)或 GPT-4.1($8/M),失败路径的 token 成本是主链的 10-17 倍。请确认你的备用链设计与当前价格对应,而不是写配置时的历史价格。

2026 年 5 月定价格局下的分层参考框架:

分层模型输出 $/M适用场景
快速/低成本deepseek-v4-flash$0.28自动补全、快速评估、重试
主力推理deepseek-v4-pro$0.87代码、长上下文、Agent 任务
前沿推理o4-mini$4.40需要最强模型能力的任务
前沿完成Claude Sonnet 4$15需要特定 Anthropic 能力的任务

并发上限风险。 V4 Pro 最多支持 500 个并发请求。峰值流量下,应为 V4 Pro 设计基于并发量的溢出路由:当 V4 Pro 达到并发上限时,自动溢出至 V4 Flash 或其他提供商,而不是无限排队或失败。这与任何有并发限制的提供商的容量感知路由是同一模式。

TheRouter 用户的行动建议

如果你已通过 TheRouter 路由 DeepSeek 请求,并且已从 deepseek-chat 迁移到 deepseek-v4-pro,价格变化是透明的——账单中的 token 成本会自动降低,无需更改配置。

需要主动操作的是逻辑层面的路由策略调整:

  • 检查你的供应商排序是否仍然反映"最低成本优先"或"质量优先"的设计意图。V4 Pro 的成本位置已移动,排序可能需要更新。
  • 如果你为 V4 Pro 配置了基于成本的路由门控(例如"仅对超过 N token 的提示使用 Pro"),在 $0.87/M 输出的新定价下,这个阈值是否仍然合理?
  • 对于使用 Claude Code 或 OpenCode 的团队:V4 Pro 通过 deepseek.com/anthropic 端点以 Anthropic 格式访问,在长时间 Agent 任务上的价格性能比得到进一步提升。已经按 V4 迁移指南配置了直连 Anthropic 格式路由的团队,无需任何配置变更就能获得永久的定价优势。

关于通过路由网关接入中国 AI 供应商的配置模式,可参考 SiliconFlow 提供商指南——其中的成本控制原则同样适用于今天的 DeepSeek V4 Pro。

更宏观的趋势是:前沿级中国模型的永久价格压缩,已经成为 AI 提供商格局的结构性特征,而非临时套利窗口。路由策略需要以此为基础设计,而不是每次降价时被动调整。

本文涉及的模型

帮助与联系