DeepSeek V4 Pro 永久降价:$0.87/M 输出价格,80%+ SWE-bench 重新定义推理模型路由层级
DeepSeek V4 Pro 的 75% 降价已确认永久生效,输出价格锁定 $0.87/M tokens。SWE-bench 80.6% 的成绩让 V4 Pro 成为主力推理模型而非备用选项——这意味着你的路由策略需要重新定价。
归档条目:由 AI 根据所引信源辅助生成,发布时未经逐篇审阅。责任编辑:Joe Werner。

AI 价格战已经从促销手段演变为永久性定价策略。DeepSeek 于 2026 年 5 月 23 日确认,原本计划在 5 月 31 日到期的 V4 Pro 75% 折扣将永久生效。这意味着 4 月上线时标价 $1.74/M 输入、$3.48/M 输出的 V4 Pro,正式将价格锁定在 $0.435/M 输入、$0.87/M 输出。
这不只是一条"降价新闻"——它是一个路由策略触发器:所有将 V4 Pro 配置为"高端备用模型"的团队,都需要重新评估它是否应该成为主力推理层。
发生了什么
DeepSeek 于 2026 年 4 月 24 日发布 V4 Pro 和 V4 Flash,构成分层定价体系:
| 模型 | 输入(缓存未命中) | 输出 | 上下文 | 思考模式 |
|---|---|---|---|---|
| deepseek-v4-flash | $0.14/M | $0.28/M | 1M | 支持 |
| deepseek-v4-pro | $0.435/M | $0.87/M | 1M | 支持 |
V4 Pro 发布时原价为 $1.74/M 输入、$3.48/M 输出,75% 促销折扣原定 5 月 31 日截止。但公司在 5 月 23 日发表声明,确认这一折扣价格将成为永久正式定价。此外,从 4 月 26 日起,两款模型的缓存命中价格均已降低至发布价格的 1/10。
并发限制维持原有分层:V4 Flash 支持 2,500 个并发请求,V4 Pro 为 500 个。
对 AI 工程团队的影响
与同级别前沿模型的成本对比已发生根本性改变。 V4 Pro 以 $0.87/M 输出,在主流模型中的价格位置如下:
- OpenAI o4-mini:$4.40/M 输出(贵 5 倍)
- Claude Sonnet 4:$15/M 输出(贵 17 倍)
- GPT-4.1:$8/M 输出(贵 9 倍)
DeepSeek V4 Pro 在 SWE-bench Verified 上得分 80.6%,与多个价格高出一个数量级的模型持平或超越。它同时提供 1M token 上下文、函数调用、JSON 输出、思考/非思考双模式,以及 OpenAI/Anthropic 双格式 API 兼容。
原有逻辑是:只有 V4 Flash 无法处理时,才升级调用 V4 Pro。永久定价改变了这个逻辑:V4 Pro 现在的价格已经适合作为默认推理模型,而不只是高端例外情形。
备用链成本计算逻辑需要反转。 部分团队构建路由策略时遵循"优先调用便宜的国内模型,失败时回落到 V4 Pro"的模式。按新的定价,V4 Pro 作为主力推理层——V4 Flash 作为快速、低成本的执行层——可能比将 V4 Pro 配置为备用选项更具成本效益。
国内与全球路由的权衡更加清晰。 对于跨地域使用多个模型提供商的团队,V4 Pro 永久定价使其在推理密集型工作负载上具有更强的竞争力。DeepSeek API 同时支持 OpenAI 格式和 Anthropic 格式,进一步降低了多供应商路由的协议复杂度。
路由运营视角
永久降价在路由策略上触发三个即时决策点:
1. 重新评估模型分层。 如果 V4 Pro 被配置为"第 2 层备用",考虑是否应改为"第 1 层主力推理",同时将 V4 Flash 调整为"第 0 层快速/低成本"执行模型。$0.87/M 输出的价格,使 V4 Pro 在许多提供商的 Flash 类模型中也具有竞争力。
2. 重新评估思考模式的成本预算。 V4 Pro 和 V4 Flash 默认均开启思考模式,思考模式会增加输出 token 数量,直接放大每次查询的成本。旧价格($3.48/M)下,4,000 token 的思考链成本为 $0.014;新价格($0.87/M)下仅需 $0.0035,成本缩减 4 倍。思考模式的启用门槛变得更宽松,但仍需注意对长上下文任务的 token 控制。
3. 检查备用链中的"反向路由"风险。 一个常见模式:先调用低价国内模型,失败时回落到贵的全球模型。如果你的主力是 V4 Pro($0.87/M),备用是 Claude Sonnet($15/M)或 GPT-4.1($8/M),失败路径的 token 成本是主链的 10-17 倍。请确认你的备用链设计与当前价格对应,而不是写配置时的历史价格。
2026 年 5 月定价格局下的分层参考框架:
| 分层 | 模型 | 输出 $/M | 适用场景 |
|---|---|---|---|
| 快速/低成本 | deepseek-v4-flash | $0.28 | 自动补全、快速评估、重试 |
| 主力推理 | deepseek-v4-pro | $0.87 | 代码、长上下文、Agent 任务 |
| 前沿推理 | o4-mini | $4.40 | 需要最强模型能力的任务 |
| 前沿完成 | Claude Sonnet 4 | $15 | 需要特定 Anthropic 能力的任务 |
并发上限风险。 V4 Pro 最多支持 500 个并发请求。峰值流量下,应为 V4 Pro 设计基于并发量的溢出路由:当 V4 Pro 达到并发上限时,自动溢出至 V4 Flash 或其他提供商,而不是无限排队或失败。这与任何有并发限制的提供商的容量感知路由是同一模式。
TheRouter 用户的行动建议
如果你已通过 TheRouter 路由 DeepSeek 请求,并且已从 deepseek-chat 迁移到 deepseek-v4-pro,价格变化是透明的——账单中的 token 成本会自动降低,无需更改配置。
需要主动操作的是逻辑层面的路由策略调整:
- 检查你的供应商排序是否仍然反映"最低成本优先"或"质量优先"的设计意图。V4 Pro 的成本位置已移动,排序可能需要更新。
- 如果你为 V4 Pro 配置了基于成本的路由门控(例如"仅对超过 N token 的提示使用 Pro"),在 $0.87/M 输出的新定价下,这个阈值是否仍然合理?
- 对于使用 Claude Code 或 OpenCode 的团队:V4 Pro 通过
deepseek.com/anthropic端点以 Anthropic 格式访问,在长时间 Agent 任务上的价格性能比得到进一步提升。已经按 V4 迁移指南配置了直连 Anthropic 格式路由的团队,无需任何配置变更就能获得永久的定价优势。
关于通过路由网关接入中国 AI 供应商的配置模式,可参考 SiliconFlow 提供商指南——其中的成本控制原则同样适用于今天的 DeepSeek V4 Pro。
更宏观的趋势是:前沿级中国模型的永久价格压缩,已经成为 AI 提供商格局的结构性特征,而非临时套利窗口。路由策略需要以此为基础设计,而不是每次降价时被动调整。
本文涉及的模型
相关阅读
AI 路由新闻与供应商动态 →
GLM-5.2 Fast 模式在百炼降价 20%:阿里的这步棋如何改变你的路由成本模型
阿里云百炼于 7 月 15 日下调了 GLM-5.2 Fast 模式的 token 单价,降幅 20%。对于通过 DashScope OpenAI 兼容端点路由成本敏感型工作负载的 operator,定价模型已经改变。

DeepSeek V4 Pro 熬过了自己的死亡日期,这次反转对路由策略意味着什么
DeepSeek 在9月10日宣布 V4 Pro 将于今天 04:00 UTC 停服,结果食言了。他们以「用户需求」为由保留了 V4 Pro,价格不变。本文梳理两个模型当前的实际参数差异,以及路由团队现在需要做的决策。

DeepSeek V4.1-Flash 上线带原生视觉——四天后 deepseek-v4-pro 静默切换
DeepSeek V4.1-Flash 今日上线,新 API 名 `deepseek-flash`,原生支持图像输入。9 月 14 日 12:00 起,所有 deepseek-v4-pro 请求静默切换至 V4.1-Flash 并按 Flash 定价计费。本文拆解能力差异、定价变化与截止日期前需要确认的配置。