DeepSeek V4-Pro-0813 и ценовой обрыв 16 августа: что операторам gateway нужно проверить за ближайшие 48 часов

Алиас DeepSeek V4-Pro перешел на новую GA-модель с сильными agent-бенчмарками, а peak/off-peak pricing вступает в силу 16 августа. Экономика production routing изменилась.

TheRouter Newsroomисточник DeepSeek
Абстрактная схема с временными тарифными зонами для AI API routing, разделенная на дневные и ночные периоды

На этой неделе DeepSeek подтвердил два изменения, которые вместе меняют расчет для команд, пропускающих production-трафик через API провайдера. Во-первых, V4-Pro-0813 стала GA-моделью, и алиас deepseek-v4-pro теперь указывает на нее. Во-вторых, схема peak/off-peak pricing, о которой в начале июля говорили на уровне слухов, получила официальные цены и жесткий срок запуска: 16:00 UTC 16 августа 2026 года — меньше чем через 48 часов.

Если routing policy, cron-задачи или batch-пайплайны у вас настроены под плоскую цену DeepSeek, их нужно пересмотреть уже сейчас.

Что изменилось в V4-Pro-0813

GA-релиз переносит улучшения agent-сценариев из preview в основной алиас deepseek-v4-pro. В changelog DeepSeek указаны такие показатели: HLE без инструментов и с инструментами 42.7/60.0, TerminalBench 2.1 — 87.9, NL2Repo — 61.5, Cybergym — 83.3, DeepSWE — 62.7, Toolathlon-Verified — 74.1, DSBench-FullStack — 71.1, DSBench-Hard — 67.2.

Более важное операционное изменение — управление уровнем reasoning. Модель теперь поддерживает три явных уровня через параметр reasoning_effort: "low", "high" и "max". Старый бинарный подход через thinking: {type: "enabled"} остается совместимым, но рекомендуемым контролем становится reasoning_effort. Практическая миграция выглядит так:

  • reasoning_effort: "low" — простые и чувствительные к стоимости задачи
  • reasoning_effort: "high" — базовый уровень по умолчанию для повседневных agent-задач
  • reasoning_effort: "max" — сложное планирование, трудные coding-задачи и многошаговый reasoning

Модель также получила нативную поддержку Responses API, отдельно адаптированную под Codex. Если Codex-интеграция уже ходит в deepseek-v4-pro, стоит обновить не только алиас модели, но и конфигурацию Responses API.

Цены после 16 августа уже не слух

В июле мы публиковали материал о peak-hour pricing для DeepSeek V4 на основе сообщения TechNode. Тогда были понятны направление и примерная логика, но цифры оставались расплывчатыми. Теперь официальная pricing-страница DeepSeek подтвердила точные значения, и они отличаются от ранних предположений.

Текущие цены до 16:00 UTC 16 августа:

ModelCache miss inputOutput
deepseek-v4-flash$0.14/M$0.28/M
deepseek-v4-pro$0.435/M$0.87/M

Новые цены после 16:00 UTC 16 августа:

ModelWindowCache hitCache miss inputOutput
deepseek-v4-flashOff-peak$0.007/M$0.22/M$0.66/M
deepseek-v4-flashPeak$0.014/M$0.44/M$1.32/M
deepseek-v4-proOff-peak$0.022/M$0.66/M$1.98/M
deepseek-v4-proPeak$0.044/M$1.32/M$3.96/M

Peak windows: 01:00–04:00 UTC и 06:00–10:00 UTC. Все остальные часы считаются off-peak.

Разница между peak и off-peak ровно 2×. Но относительно текущей плоской цены скачок заметнее: output у deepseek-v4-pro вырастает с $0.87/M до $3.96/M в peak, то есть примерно в 4.55 раза.

Почему routing теперь должен смотреть на часы

Окна 01:00–04:00 UTC и 06:00–10:00 UTC попадают в реальные рабочие периоды: поздний вечер на западном побережье США, рабочее утро в Европе, раннее утро на восточном побережье США и пересечение с рабочими часами Китая. Для production-команд это не экзотическое ночное время.

Если оператор отправляет 10M output tokens в день в deepseek-v4-pro и весь этот объем попадает в peak, после 16 августа output будет стоить $39.60 в день. Тот же объем в off-peak стоит $19.80. Модель та же, задача та же, число token то же, но расписание дает двукратную разницу.

Значит, time-of-day становится самостоятельной переменной routing. В окне 06:00–10:00 UTC output у deepseek-v4-pro стоит $3.96/M. Для cost-sensitive запросов policy должна сначала проверить временное окно, а затем решить, оставлять DeepSeek или переключаться на альтернативного провайдера с плоской ценой.

Это отличается от OpenAI Fast Mode на базе service_tier. Там можно управлять уровнем сервиса, throughput или latency, но цена не меняется только из-за часа UTC. Для multi-provider архитектуры это открывает простую тактику: держать предсказуемый маршрут для peak business traffic, а большие async и batch-нагрузки переносить в off-peak окна DeepSeek.

Что проверить до дедлайна

Начните с расписаний. Любые cron, CI, benchmark или data-processing jobs, которые запускаются в 01:00–04:00 UTC или 06:00–10:00 UTC, будут платить peak-цену за вызовы DeepSeek. Тяжелые batch-задачи лучше перенести в 10:00–23:59 UTC или в короткое окно 04:00–06:00 UTC.

Затем проверьте настройки reasoning. Если конфигурация все еще использует только thinking: {type: "enabled"}, задайте reasoning_effort явно. Для большинства agent-задач начните с "high"; для простых задач используйте "low"; "max" оставьте для случаев, где качество важнее стоимости.

Отдельно проверьте Codex. DeepSeek указывает, что V4-Pro-0813 поддерживает нативный Responses API и адаптирован под Codex workflows. Проверьте алиас модели, Responses API configuration и reasoning effort вместе, иначе обновление модели может незаметно изменить и поведение, и счет.

Это не просто новый model release и не обычное повышение цены. DeepSeek одновременно меняет качество модели, управление reasoning и экономику по времени суток. После 16 августа часы становятся частью routing policy.

Диаграмма маршрутизации с двумя активными API-эндпоинтами deepseek-v4-pro и deepseek-flash с разными лимитами конкурентности и ценовыми уровнями

DeepSeek V4 Pro пережил собственный дедлайн: что разворот означает для вашей политики маршрутизации

DeepSeek объявил 10 сентября, что V4 Pro будет отключён сегодня в 04:00 UTC. Вместо этого они отыграли назад под давлением пользователей, сохранив V4 Pro на прежних ценах. Разбираем актуальные параметры двух моделей и решения для routing-операторов.

источник DeepSeek
Abstract API routing diagram showing deepseek-v4-pro requests being silently redirected to V4.1-Flash with a September 14 deadline

DeepSeek V4.1-Flash выходит с нативным зрением — и через четыре дня убивает deepseek-v4-pro

DeepSeek запустил V4.1-Flash с новым именем deepseek-flash и нативным зрением. 14 сентября в 12:00 по Пекину все запросы к deepseek-v4-pro уйдут на V4.1-Flash по ценам Flash. Имя и URL не меняются, код 200 — но модель другая. Дельта возможностей и что изменить до дедлайна.

источник DeepSeek
Циферблат часов поверх схемы сетевой маршрутизации, с выделенными зонами пиковых часов, сигнализирующими о 2× ценообразовании на трафик DeepSeek API

DeepSeek V4 вводит пиковое ценообразование: время суток становится параметром маршрутизации для каждого AI-шлюза

DeepSeek V4 выходит в середине июля с двукратным повышением цен на API в пиковые часы — первое пиковое ценообразование в AI API. Каждому слою маршрутизации теперь нужен учёт часовых поясов в расчёте затрат и fallback-логике.

источник DeepSeek / TechNode
Помощь и контакты