← Все статьи

DeepSeek V4-Pro GA: пиковые/внепиковые тарифы, Responses API и оптимизация стоимости маршрутизации

DeepSeek V4-Pro вышел в GA-релиз 13 августа с гибким уровнем reasoning, нативной поддержкой Responses API и новой моделью пикового/внепикового ценообразования, вступившей в силу 16 августа. Разбираем изменения, полную таблицу цен и способы планирования нагрузки через routing для экономии.

· TheRouter

DeepSeek V4-Pro вышел в общий доступ. GA-релиз (версия модели DeepSeek-V4-Pro-0813) появился 13 августа 2026 года с тремя изменениями, важными для тех, кто маршрутизирует API-трафик через DeepSeek: гибкий уровень reasoning (low/high/max), нативная поддержка OpenAI Responses API с оптимизацией под Codex, и новая схема пикового/внепикового ценообразования, вступившая в силу 16 августа 2026 года в 16:00 UTC. Внепиковые тарифы ровно вдвое ниже пиковых — ночные batch-задачи стали на 50% дешевле, если правильно запланировать их.

В этом руководстве — подтверждённые цены на V4-Pro и V4-Flash, окна пиковых/внепиковых часов по часовым поясам, влияние reasoning effort на стоимость и способы использования routing для оптимизации.

Что изменилось 13 августа

Анонс GA-релиза V4-Pro от DeepSeek содержит несколько обновлений:

  1. V4-Pro стал GA. Версия модели — DeepSeek-V4-Pro-0813. Имя модели в API осталось deepseek-v4-pro, менять код не нужно.

  2. Гибкий reasoning effort. И V4-Pro, и V4-Flash теперь поддерживают уровни low, high и max. По умолчанию — high. Для задач классификации и извлечения данных low убирает лишние thinking-токены.

  3. Нативный Responses API. DeepSeek стал первым провайдером за пределами OpenAI, реализовавшим поддержку Responses API на том же base URL https://api.deepseek.com. Codex и другие потребители Responses API могут подключаться напрямую.

  4. Пиковое/внепиковое ценообразование. С 16 августа 2026 года, 16:00 UTC, все вызовы DeepSeek API тарифицируются по пиковым или внепиковым ставкам. Внепиковая ставка — 50% от пиковой.

Полная таблица цен

Все цены за 1 миллион токенов. Данные получены с официальной страницы цен DeepSeek 17 августа 2026 года.

V4-Flash (deepseek-v4-flash)

МетрикаВнепикПик
Вход (cache hit)$0.007$0.014
Вход (cache miss)$0.22$0.44
Выход$0.66$1.32
Лимит конкурентности2 5002 500

V4-Pro (deepseek-v4-pro)

МетрикаВнепикПик
Вход (cache hit)$0.022$0.044
Вход (cache miss)$0.66$1.32
Выход$1.98$3.96
Лимит конкурентности500500

Пиковые и внепиковые окна

Пиковые часы — 01:00–04:00 UTC и 06:00–10:00 UTC. Все остальные часы — внепиковые.

Пересчёт в основные часовые пояса:

Часовой поясПиковые окнаВнепиковое время
UTC01:00–04:00, 06:00–10:00Всё остальное
Пекин (CST, UTC+8)09:00–12:00, 14:00–18:00Всё остальное
US Pacific (PDT, UTC-7)18:00–21:00, 23:00–03:00Всё остальное
US Eastern (EDT, UTC-4)21:00–00:00, 02:00–06:00Всё остальное
Центральная Европа (CEST, UTC+2)03:00–06:00, 08:00–12:00Всё остальное
Москва (MSK, UTC+3)04:00–07:00, 09:00–13:00Всё остальное

Пиковые окна совпадают с рабочим днём в Китае и утренними часами Европы. Если ваши пользователи в основном в Америке, большая часть трафика попадает на внепик автоматически.

Сравнение до и после

До 16 августа DeepSeek использовал единый тариф. Для V4-Pro изменения такие:

Сценарий (V4-Pro, 1M токенов)Старый единый тарифНовый внепикНовый пик
Вход (cache miss)$0.44$0.66$1.32
Выход$1.32$1.98$3.96

Внепиковый тариф примерно на 50% выше старого, пиковый — втрое выше. Для нагрузок без оптимизации это чистое повышение цен. Но при переносе batch-задач на внепик общие расходы могут остаться на уровне прежнего единого тарифа.

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Reasoning effort: как выбрать подходящий уровень

V4-Pro и V4-Flash по умолчанию работают в thinking mode с уровнем high. Маппинг уровней:

Запрошенный уровеньФактический
lowLow (минимальная цепочка рассуждений)
mediumHigh (маппится на high)
highHigh (по умолчанию)
maxMax (максимальная глубина рассуждений)

Пример установки reasoning_effort через OpenAI SDK:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_KEY",
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{"role": "user", "content": "Проанализируй этот пункт договора..."}],
    reasoning_effort="low",
    extra_body={"thinking": {"type": "enabled"}},
)

Для полного отключения thinking установите thinking.type в "disabled". Модель пропустит цепочку рассуждений и вернёт только финальный ответ.

Влияние на стоимость. Thinking-токены тарифицируются по цене выходных токенов. Уровень low сокращает количество reasoning-токенов, и для задач классификации/извлечения low обычно экономит 60–80% thinking-токенов по сравнению с max.

Responses API: Codex и агентные рабочие процессы

Responses API от DeepSeek — drop-in реализация формата OpenAI Responses API. Поддерживаемые возможности:

  • Семантические SSE-события в потоке — response.output_text.delta, response.reasoning_text.delta и типизированные события tool call
  • Вызов функций и web search через параметр tools
  • Управление reasoning effort через поле reasoning.effort
  • Параметр instructions — вставляется как первое system-сообщение
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_KEY",
    base_url="https://api.deepseek.com",
)

response = client.responses.create(
    model="deepseek-v4-pro",
    instructions="Ты — помощник по программированию.",
    input="Перепиши эту функцию на async/await.",
)

print(response.output_text)

Ограничения по сравнению с OpenAI Responses API: не поддерживаются previous_response_id, conversation, store, background, metadata. Реализация полностью stateless — каждый запрос независим. Неподдерживаемые параметры молча игнорируются.

Интеграция с Codex

DeepSeek предоставляет конфигурацию для Codex в один клик с поддержкой multi-agent v2, инструментом apply_patch типа freeform и контекстным окном 1M токенов. Доступны оба модели — V4-Flash и V4-Pro.

Маршрутизация DeepSeek V4-Pro через TheRouter

TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров. Вы можете использовать DeepSeek V4-Pro как основную модель и настроить fallback routing для автоматического переключения при недоступности DeepSeek.

Базовый вызов:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_THEROUTER_KEY",
    base_url="https://therouter.ai/api/v1",
)

response = client.chat.completions.create(
    model="deepseek/deepseek-v4-pro",
    messages=[{"role": "user", "content": "Объясни пиковое ценообразование"}],
)

DashScope как запасной путь

V4-Pro также доступен в DashScope (Alibaba Cloud Bailian) с model ID deepseek-v4-pro-0813. DashScope использует другую структуру тарификации (в юанях, без пикового/внепикового деления на момент написания), что может стабилизировать расходы как fallback во время пиковых часов DeepSeek.

Планирование нагрузки для внепиковой экономии

Пиковая/внепиковая модель открывает прямой способ оптимизации: задачи, которые можно отложить, запускать во внепиковые часы.

Можно отложить:

  • Batch-оценки и бенчмарки
  • Разметка и аннотация датасетов
  • Pipeline суммаризации документов
  • Code review несрочных PR
  • Генерация embedding для RAG-индексов

Нельзя откладывать:

  • Интерактивные чат-сессии
  • Ответы в реальном времени от coding assistant
  • Latency-чувствительные API-эндпоинты

Варианты реализации

1. Cron-задачи. Запускайте batch-обработку во внепиковые часы. Для команды в Пекине это означает планирование вне 09:00–12:00 и 14:00–18:00 CST.

2. Отложенная обработка через очереди. Несрочные запросы отправляются в очередь (SQS, RabbitMQ, Redis) и потребляются во внепик. Хорошо подходит для pipeline обработки документов.

3. Сравнение с OpenAI Batch API. У DeepSeek нет отдельного Batch API, но внепиковая скидка 50% по сути даёт тот же эффект — разница лишь в том, что переключение идёт по времени суток, а не по формату запроса.

Частые ошибки и их решения

ОшибкаПричинаРешение
400: reasoning_content must participate in contextВ thinking mode был tool call, но reasoning_content не передан обратноПри наличии tool call обязательно передавайте reasoning_content из assistant-сообщения в последующие запросы
400: request exceeds context windowВход превышает лимит 1M токеновОбрежьте вход или разбейте на несколько запросов
Rate limit exceededПревышен лимит конкурентности (500 для V4-Pro, 2 500 для V4-Flash)Добавьте backoff-логику или маршрутизируйте overflow к другому провайдеру

Чек-лист перед продакшеном

Перед запуском V4-Pro в production-окружении:

  • Убедитесь, что используете deepseek-v4-pro, а не устаревшие deepseek-chat или deepseek-reasoner
  • Устанавливайте reasoning_effort явно для каждого use case, не оставляйте дефолтный high для простых задач
  • Отслеживайте распределение токенов по пиковым/внепиковым часам. Если более 60% объёма приходится на пик — оцените возможность переноса batch-задач
  • Настройте хотя бы один fallback (V4-Flash, V4-Pro на DashScope или модель другого семейства)
  • Протестируйте совместимость с Responses API, если планируете использовать Codex
  • Настройте алерты на лимит конкурентности 500 для V4-Pro

Дополнительные материалы

Модели, упомянутые в статье

Помощь и контакты