DeepSeek API 涨价预告:路由运维需要知道的一切和应对方案
DeepSeek 在官方定价页面确认即将'大幅'上调 API 价格。本文梳理已知事实,帮你审计 DeepSeek API 支出、比对 DashScope、SiliconFlow 和 Kimi 的等价替代方案,并配置基于成本的路由回退,让涨价不击穿预算。
DeepSeek API 涨价预告:路由运维需要知道的一切
DeepSeek 确认了涨价计划。消息藏在官方定价页面的脚注 (2) 里。
"We plan to raise the overall pricing for DeepSeek API services in the near future, with a significant increase expected. Please plan your usage accordingly."
翻译过来就是"我们打算在近期内全面上调 API 价格,涨幅可能很大,请提前做好规划"。
没有给出具体数字,也没有给出生效日期。但"significant"这个词挂在目前市面上最便宜的大模型 API 旁边,所有正在通过 DeepSeek 走流量的运维都需要重新算账。
这篇文章是一份给路由运维的应对清单,重点在应对而非转述新闻。
信息来源 DeepSeek Models & Pricing(2026-08-08 获取),Bloomberg/Yahoo Finance 报道(2026-08-06),TechNode 报道(2026-08-06)。
- 替换三个值,不是三个 SDK。在现有 OpenAI 客户端里改
api_key、base_url、model。请求与响应代码保持不变。 - 显式映射 model ID。目标供应商的 model id 几乎不会和 OpenAI 完全一致。 在业务代码之外维护一份
{ openai_id: target_id }映射。 - 验证流式格式。SSE 分片必须遵循 OpenAI 的
data: {...}+data: [DONE]契约。切生产前先跑一次流式调用。 - 检查限流响应头。部分供应商不返回
x-ratelimit-*。 在包装层 做缺省兜底,缺头不要崩。 - 留回滚路径。用 feature flag 切流;新旧 endpoint 影子并行 24 小时,再正式切换。
已确认的信息和尚未公开的部分
已确认
- 2026 年 8 月 8 日在 DeepSeek 官方定价页面可见该脚注,来源是官方文档而非媒体转述。
- 涨价范围覆盖"overall pricing for DeepSeek API services",V4-Flash 和 V4-Pro 都在其中。
- 原文措辞是"significant increase"和"near future"。
尚未公开
- 新的每 token 单价。
- 具体生效日期。
- 缓存命中价格是否按同比例上调。
- Anthropic 格式端点是否同步调整。
我们会在 DeepSeek 公布具体方案后更新这篇文章。下面所有内容围绕准备工作展开,不做具体价格预测。
当前 DeepSeek 定价基线
先弄清楚现在付的是多少。
| 模型 | 输入(缓存未命中) | 输入(缓存命中) | 输出 | 上下文 | 并发上限 |
|---|---|---|---|---|---|
| V4-Flash | $0.14/M | $0.0028/M | $0.28/M | 1M | 2,500 |
| V4-Pro | $0.435/M | $0.003625/M | $0.87/M | 1M | 500 |
这是主流大模型 API 里最低的价格。作为参考,Anthropic Claude Sonnet 4 输入/输出为 $3/$15,OpenAI GPT-4o 为 $2.50/$10。V4-Flash 的输入价格大约是 Claude Sonnet 4 的 1/18,输出是 1/36。
"大幅上涨"从这个基线出发,区间非常宽。涨 3 倍,V4-Flash 变成 $0.42/$0.84,仍然比所有西方前沿模型便宜。涨 10 倍到 $1.40/$2.80,跟 GPT-4o mini 差不多,不再是理所当然的预算首选。
审计你的 DeepSeek API 支出
如果你的流量经过 DeepSeek,在做任何决定之前需要三个数。
1. 月度 token 消耗量。 从 DeepSeek 平台控制台 或路由层的计费日志里导出,按模型拆分(V4-Flash 和 V4-Pro)。
2. 输入/输出比例。 大多数工作负载偏重输入(长 system prompt、上下文、few-shot 示例)。输入输出比达到 5 比 1 以上时输入价格变化对总成本影响更大;跑聊天或代码生成、输出较多的场景,输出价格才是关键。
3. 缓存命中率。 V4-Flash 的缓存命中价仅为未命中价的 1/50。命中率超过 60%,缓存价格按比例涨的影响较小;命中率低意味着每次调用都在付全额输入价。
一个快速成本估算模型放在下面。
# 当前月度成本估算
monthly_input_tokens_m = 500 # 百万输入 token
monthly_output_tokens_m = 100 # 百万输出 token
cache_hit_rate = 0.4 # 40% 输入 token 命中缓存
# 当前 V4-Flash 费率
input_miss = 0.14 # $/M tokens
input_hit = 0.0028 # $/M tokens
output = 0.28 # $/M tokens
input_cost = (monthly_input_tokens_m * (1 - cache_hit_rate) * input_miss +
monthly_input_tokens_m * cache_hit_rate * input_hit)
output_cost = monthly_output_tokens_m * output
current_monthly = input_cost + output_cost
print(f"当前月支出: ${current_monthly:.2f}")
# 情景:全面 3 倍
multiplier = 3
projected = current_monthly * multiplier
print(f"涨 {multiplier} 倍后: ${projected:.2f}")
print(f"月增: +${projected - current_monthly:.2f}")
填入你的实际数字。结果会告诉你是需要立即行动还是可以等正式方案出来。
按使用场景对比替代方案
如果涨价把 DeepSeek 推出你的预算线,以下是我们评估过的可以近乎直接替换的提供商和模型,全部支持 OpenAI 兼容 API。
高吞吐聊天和代码(替代 V4-Flash)
| 提供商 | 模型 | 输入/M | 输出/M | 上下文 | 备注 |
|---|---|---|---|---|---|
| DashScope | qwen3.7-max | ¥6(约 $0.83) | ¥18(约 $2.49) | 1M | 限时五折进行中,原价 ¥12/¥36 |
| DashScope | qwen3-max | ¥2.50(约 $0.35) | ¥10(约 $1.38) | 256K | 阶梯计费,最低档 |
| SiliconFlow | deepseek-v4-flash | $0.13 | $0.28 | 1M | 同模型,不同运营商 |
| SiliconFlow | Qwen3.5-122B-A10B | $0.26 | $2.08 | 262K | 开源权重 Qwen,SiliconFlow 部署 |
SiliconFlow 托管的 DeepSeek V4-Flash 报价 $0.13/$0.28,比 DeepSeek 直连还便宜一点。如果 DeepSeek 涨价但 SiliconFlow 没有立刻跟进,把流量切到 SiliconFlow 可以争取一段缓冲期。不过 SiliconFlow 也有可能随后调整自己的价格。
复杂推理(替代 V4-Pro)
| 提供商 | 模型 | 输入/M | 输出/M | 上下文 | 备注 |
|---|---|---|---|---|---|
| DashScope | qwen3.7-max | ¥6(约 $0.83) | ¥18(约 $2.49) | 1M | 支持 thinking mode |
| DashScope | qwen3.8-max | ¥12(约 $1.66) | ¥36(约 $4.98) | 1M | 最新旗舰 |
| Kimi | kimi-k3 | $3.00 | $15.00 | 1M | 前沿推理,价格更高 |
| SiliconFlow | deepseek-v4-pro | $1.50 | $3.14 | 1M | 同模型,SiliconFlow 部署 |
V4-Pro 的工作负载,DashScope 上的 Qwen3.7-Max 是最接近的性价比竞争者,推理能力相当。Kimi K3 价格更高但在长周期编码任务上基准测试结果有竞争力。配置细节见 Kimi K3 API 集成指南。
SiliconFlow 的对冲策略
SiliconFlow 值得单独说,因为它用自己的基础设施托管了跟 DeepSeek 完全一样的模型。如果 DeepSeek 在 api.deepseek.com 涨价但 SiliconFlow 维持现价,你只需要换 base_url 和 api_key,model 字段都不用改。配置方法见 SiliconFlow 免费模型路由指南。
代价在于 SiliconFlow 的并发上限可能低于 DeepSeek 直连,而且 SiliconFlow 也可能跟着涨。这是对冲手段,不是长期保证。
配置基于成本的路由回退
比选定一家替代方案更重要的是把路由层的自动切换规则配好,一旦成本超标流量就自动转移。
调整前:单一提供商 DeepSeek 配置
from openai import OpenAI
# 所有流量走 DeepSeek,没有回退
client = OpenAI(
api_key="sk-deepseek-xxx",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "总结这份文档。"}],
)
调整后:多提供商回退 + 成本感知
from openai import OpenAI
# 主:DeepSeek 直连
# 回退 1:SiliconFlow(同模型,不同运营商)
# 回退 2:DashScope Qwen(不同模型,能力相当)
providers = [
{
"name": "deepseek",
"base_url": "https://api.deepseek.com",
"api_key": "sk-deepseek-xxx",
"model": "deepseek-v4-flash",
},
{
"name": "siliconflow",
"base_url": "https://api.siliconflow.cn/v1",
"api_key": "sk-siliconflow-xxx",
"model": "deepseek-v4-flash",
},
{
"name": "dashscope",
"base_url": "https://dashscope.aliyuncs.com/compatible-mode/v1",
"api_key": "sk-dashscope-xxx",
"model": "qwen3.7-max",
},
]
def call_with_fallback(messages, providers):
for provider in providers:
try:
client = OpenAI(
api_key=provider["api_key"],
base_url=provider["base_url"],
)
return client.chat.completions.create(
model=provider["model"],
messages=messages,
)
except Exception as e:
print(f"{provider['name']} 失败: {e}")
continue
raise RuntimeError("所有提供商均失败")
response = call_with_fallback(
[{"role": "user", "content": "总结这份文档。"}],
providers,
)
使用 TheRouter 的话,可以配置 provider fallback 链实现自动处理,包括基于单 token 成本的阈值路由规则。
涨价前的五件事
-
导出当前使用数据。 从 DeepSeek 平台下载至少 30 天的 token 级别账单。这是评估涨价影响的基线。
-
注册 SiliconFlow 账号。 即使现在不往那边走流量,提前把账号、API key 和连通性测好,涨价时几分钟就能切。SiliconFlow 注册免费,附赠 $1 体验额度。
-
测试替代方案。 拿你的评测集跑一下 DashScope 上的
qwen3.7-max和 SiliconFlow 上的deepseek-v4-flash。看响应质量、延迟、边缘情况(tool calling 格式差异、thinking mode 输出结构等)。 -
配好回退路由。 即使主力仍然是 DeepSeek,至少加一个回退提供商。涨价落地后你要的是"立即切"的能力,而不是花一个周末做集成。
-
设置成本告警。 如果你的计费系统支持,配一个告警,单 token 有效费率变动超过 20% 时触发。这样即使你没注意到公告,涨价一生效就能感知到。
对路由运维意味着什么
DeepSeek 的超低价一直是把流量引向它的最大理由。很多运维用 V4-Flash 做高吞吐工作负载的默认选项,只在复杂任务上才用更贵的模型。一次"大幅"涨价会打破这个分配逻辑。
好消息是 OpenAI 兼容 API 生态意味着切换提供商只是换 base_url,不用重写代码。你可能回退到的模型,Qwen3.7-Max、SiliconFlow 托管的 DeepSeek、Kimi K3,都讲同一套协议。代码不变,prompt 不变,变的只有端点和 API key。
风险藏在细节里。不同提供商的 rate limit 不一样,tool calling 格式有边缘差异,thinking mode 的输出结构也有细微区别。在生产环境需要切换之前把测试做完。
DeepSeek 公布具体价格后我们会更新这篇指南。在那之前,把回退路由配好,把账算清。
相关阅读
- DeepSeek API 完整指南 V4-Flash 和 V4-Pro 完整 API 参考
- DeepSeek Chat/Reasoner 7 月 24 日停用迁移 旧模型名迁移
- DashScope Qwen3.7 系列指南 Qwen3.7-Max 配置和定价
- SiliconFlow 免费模型路由指南 SiliconFlow 配置
- Kimi K3 API 集成指南 K3 配置和定价
- LLM API 成本优化策略 通用成本路由模式