DeepSeek V4-Pro GA: пиковые/внепиковые тарифы, Responses API и оптимизация стоимости маршрутизации
DeepSeek V4-Pro вышел в GA-релиз 13 августа с гибким уровнем reasoning, нативной поддержкой Responses API и новой моделью пикового/внепикового ценообразования, вступившей в силу 16 августа. Разбираем изменения, полную таблицу цен и способы планирования нагрузки через routing для экономии.
DeepSeek V4-Pro вышел в общий доступ. GA-релиз (версия модели DeepSeek-V4-Pro-0813) появился 13 августа 2026 года с тремя изменениями, важными для тех, кто маршрутизирует API-трафик через DeepSeek: гибкий уровень reasoning (low/high/max), нативная поддержка OpenAI Responses API с оптимизацией под Codex, и новая схема пикового/внепикового ценообразования, вступившая в силу 16 августа 2026 года в 16:00 UTC. Внепиковые тарифы ровно вдвое ниже пиковых — ночные batch-задачи стали на 50% дешевле, если правильно запланировать их.
В этом руководстве — подтверждённые цены на V4-Pro и V4-Flash, окна пиковых/внепиковых часов по часовым поясам, влияние reasoning effort на стоимость и способы использования routing для оптимизации.
Что изменилось 13 августа
Анонс GA-релиза V4-Pro от DeepSeek содержит несколько обновлений:
-
V4-Pro стал GA. Версия модели —
DeepSeek-V4-Pro-0813. Имя модели в API осталосьdeepseek-v4-pro, менять код не нужно. -
Гибкий reasoning effort. И V4-Pro, и V4-Flash теперь поддерживают уровни
low,highиmax. По умолчанию —high. Для задач классификации и извлечения данныхlowубирает лишние thinking-токены. -
Нативный Responses API. DeepSeek стал первым провайдером за пределами OpenAI, реализовавшим поддержку Responses API на том же base URL
https://api.deepseek.com. Codex и другие потребители Responses API могут подключаться напрямую. -
Пиковое/внепиковое ценообразование. С 16 августа 2026 года, 16:00 UTC, все вызовы DeepSeek API тарифицируются по пиковым или внепиковым ставкам. Внепиковая ставка — 50% от пиковой.
Полная таблица цен
Все цены за 1 миллион токенов. Данные получены с официальной страницы цен DeepSeek 17 августа 2026 года.
V4-Flash (deepseek-v4-flash)
| Метрика | Внепик | Пик |
|---|---|---|
| Вход (cache hit) | $0.007 | $0.014 |
| Вход (cache miss) | $0.22 | $0.44 |
| Выход | $0.66 | $1.32 |
| Лимит конкурентности | 2 500 | 2 500 |
V4-Pro (deepseek-v4-pro)
| Метрика | Внепик | Пик |
|---|---|---|
| Вход (cache hit) | $0.022 | $0.044 |
| Вход (cache miss) | $0.66 | $1.32 |
| Выход | $1.98 | $3.96 |
| Лимит конкурентности | 500 | 500 |
Пиковые и внепиковые окна
Пиковые часы — 01:00–04:00 UTC и 06:00–10:00 UTC. Все остальные часы — внепиковые.
Пересчёт в основные часовые пояса:
| Часовой пояс | Пиковые окна | Внепиковое время |
|---|---|---|
| UTC | 01:00–04:00, 06:00–10:00 | Всё остальное |
| Пекин (CST, UTC+8) | 09:00–12:00, 14:00–18:00 | Всё остальное |
| US Pacific (PDT, UTC-7) | 18:00–21:00, 23:00–03:00 | Всё остальное |
| US Eastern (EDT, UTC-4) | 21:00–00:00, 02:00–06:00 | Всё остальное |
| Центральная Европа (CEST, UTC+2) | 03:00–06:00, 08:00–12:00 | Всё остальное |
| Москва (MSK, UTC+3) | 04:00–07:00, 09:00–13:00 | Всё остальное |
Пиковые окна совпадают с рабочим днём в Китае и утренними часами Европы. Если ваши пользователи в основном в Америке, большая часть трафика попадает на внепик автоматически.
Сравнение до и после
До 16 августа DeepSeek использовал единый тариф. Для V4-Pro изменения такие:
| Сценарий (V4-Pro, 1M токенов) | Старый единый тариф | Новый внепик | Новый пик |
|---|---|---|---|
| Вход (cache miss) | $0.44 | $0.66 | $1.32 |
| Выход | $1.32 | $1.98 | $3.96 |
Внепиковый тариф примерно на 50% выше старого, пиковый — втрое выше. Для нагрузок без оптимизации это чистое повышение цен. Но при переносе batch-задач на внепик общие расходы могут остаться на уровне прежнего единого тарифа.
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
Reasoning effort: как выбрать подходящий уровень
V4-Pro и V4-Flash по умолчанию работают в thinking mode с уровнем high. Маппинг уровней:
| Запрошенный уровень | Фактический |
|---|---|
low | Low (минимальная цепочка рассуждений) |
medium | High (маппится на high) |
high | High (по умолчанию) |
max | Max (максимальная глубина рассуждений) |
Пример установки reasoning_effort через OpenAI SDK:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_KEY",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Проанализируй этот пункт договора..."}],
reasoning_effort="low",
extra_body={"thinking": {"type": "enabled"}},
)
Для полного отключения thinking установите thinking.type в "disabled". Модель пропустит цепочку рассуждений и вернёт только финальный ответ.
Влияние на стоимость. Thinking-токены тарифицируются по цене выходных токенов. Уровень low сокращает количество reasoning-токенов, и для задач классификации/извлечения low обычно экономит 60–80% thinking-токенов по сравнению с max.
Responses API: Codex и агентные рабочие процессы
Responses API от DeepSeek — drop-in реализация формата OpenAI Responses API. Поддерживаемые возможности:
- Семантические SSE-события в потоке —
response.output_text.delta,response.reasoning_text.deltaи типизированные события tool call - Вызов функций и web search через параметр
tools - Управление reasoning effort через поле
reasoning.effort - Параметр
instructions— вставляется как первое system-сообщение
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_KEY",
base_url="https://api.deepseek.com",
)
response = client.responses.create(
model="deepseek-v4-pro",
instructions="Ты — помощник по программированию.",
input="Перепиши эту функцию на async/await.",
)
print(response.output_text)
Ограничения по сравнению с OpenAI Responses API: не поддерживаются previous_response_id, conversation, store, background, metadata. Реализация полностью stateless — каждый запрос независим. Неподдерживаемые параметры молча игнорируются.
Интеграция с Codex
DeepSeek предоставляет конфигурацию для Codex в один клик с поддержкой multi-agent v2, инструментом apply_patch типа freeform и контекстным окном 1M токенов. Доступны оба модели — V4-Flash и V4-Pro.
Маршрутизация DeepSeek V4-Pro через TheRouter
TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров. Вы можете использовать DeepSeek V4-Pro как основную модель и настроить fallback routing для автоматического переключения при недоступности DeepSeek.
Базовый вызов:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_THEROUTER_KEY",
base_url="https://therouter.ai/api/v1",
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4-pro",
messages=[{"role": "user", "content": "Объясни пиковое ценообразование"}],
)
DashScope как запасной путь
V4-Pro также доступен в DashScope (Alibaba Cloud Bailian) с model ID deepseek-v4-pro-0813. DashScope использует другую структуру тарификации (в юанях, без пикового/внепикового деления на момент написания), что может стабилизировать расходы как fallback во время пиковых часов DeepSeek.
Планирование нагрузки для внепиковой экономии
Пиковая/внепиковая модель открывает прямой способ оптимизации: задачи, которые можно отложить, запускать во внепиковые часы.
Можно отложить:
- Batch-оценки и бенчмарки
- Разметка и аннотация датасетов
- Pipeline суммаризации документов
- Code review несрочных PR
- Генерация embedding для RAG-индексов
Нельзя откладывать:
- Интерактивные чат-сессии
- Ответы в реальном времени от coding assistant
- Latency-чувствительные API-эндпоинты
Варианты реализации
1. Cron-задачи. Запускайте batch-обработку во внепиковые часы. Для команды в Пекине это означает планирование вне 09:00–12:00 и 14:00–18:00 CST.
2. Отложенная обработка через очереди. Несрочные запросы отправляются в очередь (SQS, RabbitMQ, Redis) и потребляются во внепик. Хорошо подходит для pipeline обработки документов.
3. Сравнение с OpenAI Batch API. У DeepSeek нет отдельного Batch API, но внепиковая скидка 50% по сути даёт тот же эффект — разница лишь в том, что переключение идёт по времени суток, а не по формату запроса.
Частые ошибки и их решения
| Ошибка | Причина | Решение |
|---|---|---|
| 400: reasoning_content must participate in context | В thinking mode был tool call, но reasoning_content не передан обратно | При наличии tool call обязательно передавайте reasoning_content из assistant-сообщения в последующие запросы |
| 400: request exceeds context window | Вход превышает лимит 1M токенов | Обрежьте вход или разбейте на несколько запросов |
| Rate limit exceeded | Превышен лимит конкурентности (500 для V4-Pro, 2 500 для V4-Flash) | Добавьте backoff-логику или маршрутизируйте overflow к другому провайдеру |
Чек-лист перед продакшеном
Перед запуском V4-Pro в production-окружении:
- Убедитесь, что используете
deepseek-v4-pro, а не устаревшиеdeepseek-chatилиdeepseek-reasoner - Устанавливайте
reasoning_effortявно для каждого use case, не оставляйте дефолтныйhighдля простых задач - Отслеживайте распределение токенов по пиковым/внепиковым часам. Если более 60% объёма приходится на пик — оцените возможность переноса batch-задач
- Настройте хотя бы один fallback (V4-Flash, V4-Pro на DashScope или модель другого семейства)
- Протестируйте совместимость с Responses API, если планируете использовать Codex
- Настройте алерты на лимит конкурентности 500 для V4-Pro
Дополнительные материалы
- Анонс GA-релиза DeepSeek V4-Pro
- Модели и цены DeepSeek
- DeepSeek Thinking Mode
- DeepSeek Responses API
- Интеграция с Codex
- DeepSeek API: полное руководство — подробный гайд по всей линейке V4 API
- Страница провайдера DeepSeek — доступность моделей и настройка маршрутизации
- Fallback-маршрутизация TheRouter — настройка multi-provider fallback