Повышение цен на DeepSeek API: что нужно знать операторам маршрутизации и как подготовиться
DeepSeek официально подтвердил предстоящее 'значительное' повышение цен на API. В этом руководстве разбираем известные факты, аудит расходов на DeepSeek API, сопоставимые альтернативы от DashScope, SiliconFlow и Kimi, а также настройку fallback-маршрутизации на основе стоимости.
Повышение цен на DeepSeek API: что нужно знать операторам маршрутизации
DeepSeek подтвердил планы повысить цены на API. Объявление размещено в сноске (2) на официальной странице цен:
"We plan to raise the overall pricing for DeepSeek API services in the near future, with a significant increase expected. Please plan your usage accordingly."
Конкретных ставок нет. Даты нет. Но слово «significant» рядом с самым дешёвым API крупного LLM-провайдера на рынке меняет расклад для каждого оператора, который сейчас гонит трафик через DeepSeek. Это не новостная заметка — это чек-лист подготовки для операторов маршрутизации.
Источники: DeepSeek Models & Pricing (получено 2026-08-08), Bloomberg/Yahoo Finance (2026-08-06), TechNode (2026-08-06).
- Меняйте три значения, а не три SDK. Замените
api_key,base_urlиmodelв существующем клиенте OpenAI. Код запроса и ответа оставьте неизменным. - Сопоставьте model ID явно. ID модели у целевого провайдера почти никогда не совпадает с OpenAI ID. Держите словарь
{ openai_id: target_id }вне бизнес-логики. - Проверьте формат streaming. SSE-чанки должны соответствовать контракту OpenAI:
data: {...}+data: [DONE]. Прогоните один streaming вызов до продакшена. - Проверьте rate-limit заголовки. Некоторые провайдеры не возвращают
x-ratelimit-*. Добавьте обёртку с безопасным дефолтом. - Оставьте путь отката. Раскатайте замену под feature flag, гоняйте оба endpoint в shadow-режиме 24 часа, затем переключайтесь.
Что подтверждено и что пока неизвестно
Подтверждённые факты:
- По состоянию на 8 августа 2026 года сноска присутствует на официальной странице цен DeepSeek. Это не слух — это документация провайдера.
- Повышение охватывает «overall pricing for DeepSeek API services», то есть и V4-Flash, и V4-Pro.
- Формулировка: «significant increase» и «near future».
Неизвестно:
- Новые ставки за токен.
- Точная дата вступления в силу.
- Будет ли цена кэш-попадания меняться пропорционально.
- Распространяется ли повышение на Anthropic-format endpoint.
Мы обновим эту статью, когда DeepSeek опубликует конкретные цены. Всё, что ниже, — подготовка к сценариям, а не прогноз конкретных цифр.
Текущая ценовая база DeepSeek
Прежде чем планировать, нужно точно знать, сколько вы платите сейчас:
| Модель | Вход (кэш-промах) | Вход (кэш-попадание) | Выход | Контекст | Конкурентность |
|---|---|---|---|---|---|
| V4-Flash | $0.14/M | $0.0028/M | $0.28/M | 1M | 2 500 |
| V4-Pro | $0.435/M | $0.003625/M | $0.87/M | 1M | 500 |
Это самые низкие ставки среди крупных LLM API-провайдеров. Для сравнения: Anthropic Claude Sonnet 4 стоит $3/$15 за вход/выход, OpenAI GPT-4o — $2.50/$10. V4-Flash примерно в 18 раз дешевле по входу и в 36 раз дешевле по выходу, чем Claude Sonnet 4.
«Значительное» повышение от этой базы допускает широкий диапазон. При 3-кратном росте V4-Flash станет $0.42/$0.84 — по-прежнему дешевле любой западной frontier-модели. При 10-кратном — $1.40/$2.80, на уровне GPT-4o mini, и статус «бюджетного варианта по умолчанию» теряется.
Как провести аудит расходов на DeepSeek API
Если ваш трафик идёт через DeepSeek, перед планированием нужны три числа:
1. Месячный объём токенов. Выгрузите данные из панели DeepSeek или из логов биллинга вашего routing layer. Разбейте по модели (V4-Flash и V4-Pro).
2. Соотношение входа и выхода. Большинство нагрузок перекошены в сторону входа (длинные system prompt, контекст, few-shot примеры). Если соотношение 5:1 и выше, изменение входной цены доминирует. Если генерация с длинными ответами — выходная цена важнее.
3. Доля кэш-попаданий. Цена кэш-попадания у V4-Flash в 50 раз ниже полной входной. При высокой доле кэш-попаданий (>60%) пропорциональный рост кэш-цены бьёт меньше. При низкой — вы платите полную ставку за каждый вызов.
Быстрая модель расчёта:
# Текущая оценка месячных расходов
monthly_input_tokens_m = 500 # миллионов входных токенов
monthly_output_tokens_m = 100 # миллионов выходных токенов
cache_hit_rate = 0.4 # 40% входных токенов из кэша
# Текущие ставки V4-Flash
input_miss = 0.14 # $/M tokens
input_hit = 0.0028 # $/M tokens
output = 0.28 # $/M tokens
input_cost = (monthly_input_tokens_m * (1 - cache_hit_rate) * input_miss +
monthly_input_tokens_m * cache_hit_rate * input_hit)
output_cost = monthly_output_tokens_m * output
current_monthly = input_cost + output_cost
print(f"Текущие расходы: ${current_monthly:.2f}")
# Сценарий: 3x по всем позициям
multiplier = 3
projected = current_monthly * multiplier
print(f"При {multiplier}x: ${projected:.2f}")
print(f"Разница: +${projected - current_monthly:.2f}/мес")
Подставьте ваши реальные цифры. Результат покажет, нужно ли действовать немедленно или можно дождаться официальных ставок.
Альтернативы по стоимости для разных сценариев
Если повышение цен выводит DeepSeek за рамки вашего бюджета, вот провайдеры и модели, которые мы оценили как drop-in или почти drop-in замену. Все поддерживают OpenAI-совместимые API.
Для высоконагруженного чата и кода (замена V4-Flash)
| Провайдер | Модель | Вход/M | Выход/M | Контекст | Примечания |
|---|---|---|---|---|---|
| DashScope | qwen3.7-max | ¥6 (~$0.83) | ¥18 (~$2.49) | 1M | Акция 50%; полная цена ¥12/¥36 |
| DashScope | qwen3-max | ¥2.50 (~$0.35) | ¥10 (~$1.38) | 256K | Ступенчатая цена, минимальный порог |
| SiliconFlow | deepseek-v4-flash | $0.13 | $0.28 | 1M | Та же модель, другой хостер |
| SiliconFlow | Qwen3.5-122B-A10B | $0.26 | $2.08 | 262K | Open-weight Qwen на инфраструктуре SiliconFlow |
SiliconFlow размещает DeepSeek V4-Flash за $0.13/$0.28 — чуть ниже, чем напрямую через DeepSeek. Если DeepSeek поднимет цены на api.deepseek.com, а SiliconFlow не последует сразу, переключение трафика на SiliconFlow даёт временной буфер. Но SiliconFlow тоже может скорректировать свои ставки.
Для сложных рассуждений (замена V4-Pro)
| Провайдер | Модель | Вход/M | Выход/M | Контекст | Примечания |
|---|---|---|---|---|---|
| DashScope | qwen3.7-max | ¥6 (~$0.83) | ¥18 (~$2.49) | 1M | Thinking mode поддерживается |
| DashScope | qwen3.8-max | ¥12 (~$1.66) | ¥36 (~$4.98) | 1M | Новейший flagship |
| Kimi | kimi-k3 | $3.00 | $15.00 | 1M | Frontier-рассуждение, более высокий ценовой сегмент |
| SiliconFlow | deepseek-v4-pro | $1.50 | $3.14 | 1M | Та же модель, SiliconFlow |
Для нагрузок V4-Pro Qwen3.7-Max на DashScope — ближайший конкурент по соотношению цена/качество с сопоставимыми возможностями рассуждения. Kimi K3 стоит дороже, но показывает конкурентные результаты бенчмарков для долгосрочных задач кодинга. Настройка описана в руководстве по Kimi K3 API.
SiliconFlow как хедж
SiliconFlow заслуживает отдельного упоминания, потому что размещает те же модели DeepSeek на собственной инфраструктуре. Если DeepSeek поднимает цены, а SiliconFlow сохраняет свои, достаточно поменять base_url и api_key — model менять не нужно. Настройка описана в руководстве по маршрутизации бесплатных моделей SiliconFlow.
Компромисс: лимиты конкурентности у SiliconFlow могут быть ниже, и SiliconFlow тоже может поднять ставки в ответ. Это хедж, не гарантия.
Настройка fallback-маршрутизации по стоимости
Важнее выбора конкретной альтернативы — настройка routing layer на автоматическое переключение трафика при превышении порога стоимости.
До: конфигурация с одним провайдером
from openai import OpenAI
# Весь трафик на DeepSeek — нет fallback
client = OpenAI(
api_key="sk-deepseek-xxx",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Обобщи этот документ."}],
)
После: multi-provider fallback с учётом стоимости
from openai import OpenAI
# Основной: DeepSeek напрямую
# Fallback 1: SiliconFlow (та же модель, другой хостер)
# Fallback 2: DashScope Qwen (другая модель, сопоставимые возможности)
providers = [
{
"name": "deepseek",
"base_url": "https://api.deepseek.com",
"api_key": "sk-deepseek-xxx",
"model": "deepseek-v4-flash",
},
{
"name": "siliconflow",
"base_url": "https://api.siliconflow.cn/v1",
"api_key": "sk-siliconflow-xxx",
"model": "deepseek-v4-flash",
},
{
"name": "dashscope",
"base_url": "https://dashscope.aliyuncs.com/compatible-mode/v1",
"api_key": "sk-dashscope-xxx",
"model": "qwen3.7-max",
},
]
def call_with_fallback(messages, providers):
for provider in providers:
try:
client = OpenAI(
api_key=provider["api_key"],
base_url=provider["base_url"],
)
return client.chat.completions.create(
model=provider["model"],
messages=messages,
)
except Exception as e:
print(f"{provider['name']} ошибка: {e}")
continue
raise RuntimeError("Все провайдеры недоступны")
response = call_with_fallback(
[{"role": "user", "content": "Обобщи этот документ."}],
providers,
)
С TheRouter можно настроить цепочки fallback между провайдерами, включая правила маршрутизации по стоимости с автоматическим переключением трафика при превышении порога.
Пять шагов до повышения цен
-
Выгрузите текущие данные потребления. Скачайте минимум 30 дней биллинга на уровне токенов с платформы DeepSeek. Это базовая линия для оценки влияния.
-
Зарегистрируйтесь на SiliconFlow. Даже если вы пока не направляете туда трафик, подготовленный аккаунт, API key и протестированное соединение позволят переключиться за минуты. Регистрация на SiliconFlow бесплатна и включает стартовый кредит $1.
-
Протестируйте альтернативы. Прогоните вашу eval-suite через
qwen3.7-maxна DashScope иdeepseek-v4-flashна SiliconFlow. Оцените качество ответов, задержки и граничные случаи (формат tool calling, структура вывода thinking mode). -
Настройте fallback-маршрутизацию. Даже если DeepSeek остаётся основным, добавьте хотя бы один резервный провайдер. Когда цены изменятся, вам нужна возможность переключиться сразу, а не тратить выходные на интеграцию.
-
Настройте алерты по стоимости. Если ваша биллинг-система поддерживает, создайте алерт на изменение эффективной ставки за токен более чем на 20%. Так вы узнаете о повышении в момент его вступления в силу, даже если пропустите анонс.
Что это значит для операторов маршрутизации
Сверхнизкие цены DeepSeek были главной причиной направлять туда трафик. Многие операторы используют V4-Flash как бюджетный вариант по умолчанию для высоконагруженных задач, а более дорогие модели оставляют для сложных запросов. «Значительное» повышение ломает эту модель распределения.
Хорошая новость: экосистема OpenAI-совместимых API означает, что смена провайдера — это замена base_url, а не переписывание кода. Модели, на которые можно переключиться — Qwen3.7-Max, DeepSeek через SiliconFlow, Kimi K3 — говорят на одном протоколе. Код не меняется. Промпты не меняются. Меняются только endpoint и API key.
Риск в деталях: rate limits различаются, формат tool calling имеет граничные расхождения, структура вывода thinking mode немного отличается между провайдерами. Тестируйте до того, как понадобится переключение в production.
Мы обновим это руководство, когда DeepSeek опубликует конкретные цены. До тех пор — настройте fallback и подсчитайте свои цифры.
Дополнительное чтение
- DeepSeek API: полное руководство — полный справочник API для V4-Flash и V4-Pro
- Миграция с DeepSeek Chat/Reasoner до 24 июля — миграция устаревших имён моделей
- Руководство по серии DashScope Qwen3.7 — настройка и цены Qwen3.7-Max
- Маршрутизация бесплатных моделей SiliconFlow — конфигурация SiliconFlow
- Руководство по Kimi K3 API — настройка и цены K3
- Стратегии оптимизации стоимости LLM API — общие паттерны маршрутизации по стоимости