← Все статьи

Повышение цен на DeepSeek API: что нужно знать операторам маршрутизации и как подготовиться

DeepSeek официально подтвердил предстоящее 'значительное' повышение цен на API. В этом руководстве разбираем известные факты, аудит расходов на DeepSeek API, сопоставимые альтернативы от DashScope, SiliconFlow и Kimi, а также настройку fallback-маршрутизации на основе стоимости.

· TheRouter

Повышение цен на DeepSeek API: что нужно знать операторам маршрутизации

DeepSeek подтвердил планы повысить цены на API. Объявление размещено в сноске (2) на официальной странице цен:

"We plan to raise the overall pricing for DeepSeek API services in the near future, with a significant increase expected. Please plan your usage accordingly."

Конкретных ставок нет. Даты нет. Но слово «significant» рядом с самым дешёвым API крупного LLM-провайдера на рынке меняет расклад для каждого оператора, который сейчас гонит трафик через DeepSeek. Это не новостная заметка — это чек-лист подготовки для операторов маршрутизации.

Источники: DeepSeek Models & Pricing (получено 2026-08-08), Bloomberg/Yahoo Finance (2026-08-06), TechNode (2026-08-06).

  1. Меняйте три значения, а не три SDK. Замените api_key, base_url и model в существующем клиенте OpenAI. Код запроса и ответа оставьте неизменным.
  2. Сопоставьте model ID явно. ID модели у целевого провайдера почти никогда не совпадает с OpenAI ID. Держите словарь { openai_id: target_id } вне бизнес-логики.
  3. Проверьте формат streaming. SSE-чанки должны соответствовать контракту OpenAI: data: {...} + data: [DONE]. Прогоните один streaming вызов до продакшена.
  4. Проверьте rate-limit заголовки. Некоторые провайдеры не возвращают x-ratelimit-*. Добавьте обёртку с безопасным дефолтом.
  5. Оставьте путь отката. Раскатайте замену под feature flag, гоняйте оба endpoint в shadow-режиме 24 часа, затем переключайтесь.

Что подтверждено и что пока неизвестно

Подтверждённые факты:

  • По состоянию на 8 августа 2026 года сноска присутствует на официальной странице цен DeepSeek. Это не слух — это документация провайдера.
  • Повышение охватывает «overall pricing for DeepSeek API services», то есть и V4-Flash, и V4-Pro.
  • Формулировка: «significant increase» и «near future».

Неизвестно:

  • Новые ставки за токен.
  • Точная дата вступления в силу.
  • Будет ли цена кэш-попадания меняться пропорционально.
  • Распространяется ли повышение на Anthropic-format endpoint.

Мы обновим эту статью, когда DeepSeek опубликует конкретные цены. Всё, что ниже, — подготовка к сценариям, а не прогноз конкретных цифр.

Текущая ценовая база DeepSeek

Прежде чем планировать, нужно точно знать, сколько вы платите сейчас:

МодельВход (кэш-промах)Вход (кэш-попадание)ВыходКонтекстКонкурентность
V4-Flash$0.14/M$0.0028/M$0.28/M1M2 500
V4-Pro$0.435/M$0.003625/M$0.87/M1M500

Это самые низкие ставки среди крупных LLM API-провайдеров. Для сравнения: Anthropic Claude Sonnet 4 стоит $3/$15 за вход/выход, OpenAI GPT-4o — $2.50/$10. V4-Flash примерно в 18 раз дешевле по входу и в 36 раз дешевле по выходу, чем Claude Sonnet 4.

«Значительное» повышение от этой базы допускает широкий диапазон. При 3-кратном росте V4-Flash станет $0.42/$0.84 — по-прежнему дешевле любой западной frontier-модели. При 10-кратном — $1.40/$2.80, на уровне GPT-4o mini, и статус «бюджетного варианта по умолчанию» теряется.

Как провести аудит расходов на DeepSeek API

Если ваш трафик идёт через DeepSeek, перед планированием нужны три числа:

1. Месячный объём токенов. Выгрузите данные из панели DeepSeek или из логов биллинга вашего routing layer. Разбейте по модели (V4-Flash и V4-Pro).

2. Соотношение входа и выхода. Большинство нагрузок перекошены в сторону входа (длинные system prompt, контекст, few-shot примеры). Если соотношение 5:1 и выше, изменение входной цены доминирует. Если генерация с длинными ответами — выходная цена важнее.

3. Доля кэш-попаданий. Цена кэш-попадания у V4-Flash в 50 раз ниже полной входной. При высокой доле кэш-попаданий (>60%) пропорциональный рост кэш-цены бьёт меньше. При низкой — вы платите полную ставку за каждый вызов.

Быстрая модель расчёта:

# Текущая оценка месячных расходов
monthly_input_tokens_m = 500   # миллионов входных токенов
monthly_output_tokens_m = 100  # миллионов выходных токенов
cache_hit_rate = 0.4           # 40% входных токенов из кэша

# Текущие ставки V4-Flash
input_miss = 0.14   # $/M tokens
input_hit = 0.0028  # $/M tokens
output = 0.28       # $/M tokens

input_cost = (monthly_input_tokens_m * (1 - cache_hit_rate) * input_miss +
              monthly_input_tokens_m * cache_hit_rate * input_hit)
output_cost = monthly_output_tokens_m * output

current_monthly = input_cost + output_cost
print(f"Текущие расходы: ${current_monthly:.2f}")

# Сценарий: 3x по всем позициям
multiplier = 3
projected = current_monthly * multiplier
print(f"При {multiplier}x: ${projected:.2f}")
print(f"Разница: +${projected - current_monthly:.2f}/мес")

Подставьте ваши реальные цифры. Результат покажет, нужно ли действовать немедленно или можно дождаться официальных ставок.

Альтернативы по стоимости для разных сценариев

Если повышение цен выводит DeepSeek за рамки вашего бюджета, вот провайдеры и модели, которые мы оценили как drop-in или почти drop-in замену. Все поддерживают OpenAI-совместимые API.

Для высоконагруженного чата и кода (замена V4-Flash)

ПровайдерМодельВход/MВыход/MКонтекстПримечания
DashScopeqwen3.7-max¥6 (~$0.83)¥18 (~$2.49)1MАкция 50%; полная цена ¥12/¥36
DashScopeqwen3-max¥2.50 (~$0.35)¥10 (~$1.38)256KСтупенчатая цена, минимальный порог
SiliconFlowdeepseek-v4-flash$0.13$0.281MТа же модель, другой хостер
SiliconFlowQwen3.5-122B-A10B$0.26$2.08262KOpen-weight Qwen на инфраструктуре SiliconFlow

SiliconFlow размещает DeepSeek V4-Flash за $0.13/$0.28 — чуть ниже, чем напрямую через DeepSeek. Если DeepSeek поднимет цены на api.deepseek.com, а SiliconFlow не последует сразу, переключение трафика на SiliconFlow даёт временной буфер. Но SiliconFlow тоже может скорректировать свои ставки.

Для сложных рассуждений (замена V4-Pro)

ПровайдерМодельВход/MВыход/MКонтекстПримечания
DashScopeqwen3.7-max¥6 (~$0.83)¥18 (~$2.49)1MThinking mode поддерживается
DashScopeqwen3.8-max¥12 (~$1.66)¥36 (~$4.98)1MНовейший flagship
Kimikimi-k3$3.00$15.001MFrontier-рассуждение, более высокий ценовой сегмент
SiliconFlowdeepseek-v4-pro$1.50$3.141MТа же модель, SiliconFlow

Для нагрузок V4-Pro Qwen3.7-Max на DashScope — ближайший конкурент по соотношению цена/качество с сопоставимыми возможностями рассуждения. Kimi K3 стоит дороже, но показывает конкурентные результаты бенчмарков для долгосрочных задач кодинга. Настройка описана в руководстве по Kimi K3 API.

SiliconFlow как хедж

SiliconFlow заслуживает отдельного упоминания, потому что размещает те же модели DeepSeek на собственной инфраструктуре. Если DeepSeek поднимает цены, а SiliconFlow сохраняет свои, достаточно поменять base_url и api_key — model менять не нужно. Настройка описана в руководстве по маршрутизации бесплатных моделей SiliconFlow.

Компромисс: лимиты конкурентности у SiliconFlow могут быть ниже, и SiliconFlow тоже может поднять ставки в ответ. Это хедж, не гарантия.

Настройка fallback-маршрутизации по стоимости

Важнее выбора конкретной альтернативы — настройка routing layer на автоматическое переключение трафика при превышении порога стоимости.

До: конфигурация с одним провайдером

from openai import OpenAI

# Весь трафик на DeepSeek — нет fallback
client = OpenAI(
    api_key="sk-deepseek-xxx",
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Обобщи этот документ."}],
)

После: multi-provider fallback с учётом стоимости

from openai import OpenAI

# Основной: DeepSeek напрямую
# Fallback 1: SiliconFlow (та же модель, другой хостер)
# Fallback 2: DashScope Qwen (другая модель, сопоставимые возможности)

providers = [
    {
        "name": "deepseek",
        "base_url": "https://api.deepseek.com",
        "api_key": "sk-deepseek-xxx",
        "model": "deepseek-v4-flash",
    },
    {
        "name": "siliconflow",
        "base_url": "https://api.siliconflow.cn/v1",
        "api_key": "sk-siliconflow-xxx",
        "model": "deepseek-v4-flash",
    },
    {
        "name": "dashscope",
        "base_url": "https://dashscope.aliyuncs.com/compatible-mode/v1",
        "api_key": "sk-dashscope-xxx",
        "model": "qwen3.7-max",
    },
]

def call_with_fallback(messages, providers):
    for provider in providers:
        try:
            client = OpenAI(
                api_key=provider["api_key"],
                base_url=provider["base_url"],
            )
            return client.chat.completions.create(
                model=provider["model"],
                messages=messages,
            )
        except Exception as e:
            print(f"{provider['name']} ошибка: {e}")
            continue
    raise RuntimeError("Все провайдеры недоступны")

response = call_with_fallback(
    [{"role": "user", "content": "Обобщи этот документ."}],
    providers,
)

С TheRouter можно настроить цепочки fallback между провайдерами, включая правила маршрутизации по стоимости с автоматическим переключением трафика при превышении порога.

Пять шагов до повышения цен

  1. Выгрузите текущие данные потребления. Скачайте минимум 30 дней биллинга на уровне токенов с платформы DeepSeek. Это базовая линия для оценки влияния.

  2. Зарегистрируйтесь на SiliconFlow. Даже если вы пока не направляете туда трафик, подготовленный аккаунт, API key и протестированное соединение позволят переключиться за минуты. Регистрация на SiliconFlow бесплатна и включает стартовый кредит $1.

  3. Протестируйте альтернативы. Прогоните вашу eval-suite через qwen3.7-max на DashScope и deepseek-v4-flash на SiliconFlow. Оцените качество ответов, задержки и граничные случаи (формат tool calling, структура вывода thinking mode).

  4. Настройте fallback-маршрутизацию. Даже если DeepSeek остаётся основным, добавьте хотя бы один резервный провайдер. Когда цены изменятся, вам нужна возможность переключиться сразу, а не тратить выходные на интеграцию.

  5. Настройте алерты по стоимости. Если ваша биллинг-система поддерживает, создайте алерт на изменение эффективной ставки за токен более чем на 20%. Так вы узнаете о повышении в момент его вступления в силу, даже если пропустите анонс.

Что это значит для операторов маршрутизации

Сверхнизкие цены DeepSeek были главной причиной направлять туда трафик. Многие операторы используют V4-Flash как бюджетный вариант по умолчанию для высоконагруженных задач, а более дорогие модели оставляют для сложных запросов. «Значительное» повышение ломает эту модель распределения.

Хорошая новость: экосистема OpenAI-совместимых API означает, что смена провайдера — это замена base_url, а не переписывание кода. Модели, на которые можно переключиться — Qwen3.7-Max, DeepSeek через SiliconFlow, Kimi K3 — говорят на одном протоколе. Код не меняется. Промпты не меняются. Меняются только endpoint и API key.

Риск в деталях: rate limits различаются, формат tool calling имеет граничные расхождения, структура вывода thinking mode немного отличается между провайдерами. Тестируйте до того, как понадобится переключение в production.

Мы обновим это руководство, когда DeepSeek опубликует конкретные цены. До тех пор — настройте fallback и подсчитайте свои цифры.

Дополнительное чтение

Модели, упомянутые в статье

Помощь и контакты