DeepSeek V4-Pro-0813 и ценовой обрыв 16 августа: что операторам gateway нужно проверить за ближайшие 48 часов
Алиас DeepSeek V4-Pro перешел на новую GA-модель с сильными agent-бенчмарками, а peak/off-peak pricing вступает в силу 16 августа. Экономика production routing изменилась.

На этой неделе DeepSeek подтвердил два изменения, которые вместе меняют расчет для команд, пропускающих production-трафик через API провайдера. Во-первых, V4-Pro-0813 стала GA-моделью, и алиас deepseek-v4-pro теперь указывает на нее. Во-вторых, схема peak/off-peak pricing, о которой в начале июля говорили на уровне слухов, получила официальные цены и жесткий срок запуска: 16:00 UTC 16 августа 2026 года — меньше чем через 48 часов.
Если routing policy, cron-задачи или batch-пайплайны у вас настроены под плоскую цену DeepSeek, их нужно пересмотреть уже сейчас.
Что изменилось в V4-Pro-0813
GA-релиз переносит улучшения agent-сценариев из preview в основной алиас deepseek-v4-pro. В changelog DeepSeek указаны такие показатели: HLE без инструментов и с инструментами 42.7/60.0, TerminalBench 2.1 — 87.9, NL2Repo — 61.5, Cybergym — 83.3, DeepSWE — 62.7, Toolathlon-Verified — 74.1, DSBench-FullStack — 71.1, DSBench-Hard — 67.2.
Более важное операционное изменение — управление уровнем reasoning. Модель теперь поддерживает три явных уровня через параметр reasoning_effort: "low", "high" и "max". Старый бинарный подход через thinking: {type: "enabled"} остается совместимым, но рекомендуемым контролем становится reasoning_effort. Практическая миграция выглядит так:
reasoning_effort: "low"— простые и чувствительные к стоимости задачиreasoning_effort: "high"— базовый уровень по умолчанию для повседневных agent-задачreasoning_effort: "max"— сложное планирование, трудные coding-задачи и многошаговый reasoning
Модель также получила нативную поддержку Responses API, отдельно адаптированную под Codex. Если Codex-интеграция уже ходит в deepseek-v4-pro, стоит обновить не только алиас модели, но и конфигурацию Responses API.
Цены после 16 августа уже не слух
В июле мы публиковали материал о peak-hour pricing для DeepSeek V4 на основе сообщения TechNode. Тогда были понятны направление и примерная логика, но цифры оставались расплывчатыми. Теперь официальная pricing-страница DeepSeek подтвердила точные значения, и они отличаются от ранних предположений.
Текущие цены до 16:00 UTC 16 августа:
| Model | Cache miss input | Output |
|---|---|---|
| deepseek-v4-flash | $0.14/M | $0.28/M |
| deepseek-v4-pro | $0.435/M | $0.87/M |
Новые цены после 16:00 UTC 16 августа:
| Model | Window | Cache hit | Cache miss input | Output |
|---|---|---|---|---|
| deepseek-v4-flash | Off-peak | $0.007/M | $0.22/M | $0.66/M |
| deepseek-v4-flash | Peak | $0.014/M | $0.44/M | $1.32/M |
| deepseek-v4-pro | Off-peak | $0.022/M | $0.66/M | $1.98/M |
| deepseek-v4-pro | Peak | $0.044/M | $1.32/M | $3.96/M |
Peak windows: 01:00–04:00 UTC и 06:00–10:00 UTC. Все остальные часы считаются off-peak.
Разница между peak и off-peak ровно 2×. Но относительно текущей плоской цены скачок заметнее: output у deepseek-v4-pro вырастает с $0.87/M до $3.96/M в peak, то есть примерно в 4.55 раза.
Почему routing теперь должен смотреть на часы
Окна 01:00–04:00 UTC и 06:00–10:00 UTC попадают в реальные рабочие периоды: поздний вечер на западном побережье США, рабочее утро в Европе, раннее утро на восточном побережье США и пересечение с рабочими часами Китая. Для production-команд это не экзотическое ночное время.
Если оператор отправляет 10M output tokens в день в deepseek-v4-pro и весь этот объем попадает в peak, после 16 августа output будет стоить $39.60 в день. Тот же объем в off-peak стоит $19.80. Модель та же, задача та же, число token то же, но расписание дает двукратную разницу.
Значит, time-of-day становится самостоятельной переменной routing. В окне 06:00–10:00 UTC output у deepseek-v4-pro стоит $3.96/M. Для cost-sensitive запросов policy должна сначала проверить временное окно, а затем решить, оставлять DeepSeek или переключаться на альтернативного провайдера с плоской ценой.
Это отличается от OpenAI Fast Mode на базе service_tier. Там можно управлять уровнем сервиса, throughput или latency, но цена не меняется только из-за часа UTC. Для multi-provider архитектуры это открывает простую тактику: держать предсказуемый маршрут для peak business traffic, а большие async и batch-нагрузки переносить в off-peak окна DeepSeek.
Что проверить до дедлайна
Начните с расписаний. Любые cron, CI, benchmark или data-processing jobs, которые запускаются в 01:00–04:00 UTC или 06:00–10:00 UTC, будут платить peak-цену за вызовы DeepSeek. Тяжелые batch-задачи лучше перенести в 10:00–23:59 UTC или в короткое окно 04:00–06:00 UTC.
Затем проверьте настройки reasoning. Если конфигурация все еще использует только thinking: {type: "enabled"}, задайте reasoning_effort явно. Для большинства agent-задач начните с "high"; для простых задач используйте "low"; "max" оставьте для случаев, где качество важнее стоимости.
Отдельно проверьте Codex. DeepSeek указывает, что V4-Pro-0813 поддерживает нативный Responses API и адаптирован под Codex workflows. Проверьте алиас модели, Responses API configuration и reasoning effort вместе, иначе обновление модели может незаметно изменить и поведение, и счет.
Это не просто новый model release и не обычное повышение цены. DeepSeek одновременно меняет качество модели, управление reasoning и экономику по времени суток. После 16 августа часы становятся частью routing policy.
Похожие материалы
Новости AI-роутинга и провайдеров →
DeepSeek V4 Pro пережил собственный дедлайн: что разворот означает для вашей политики маршрутизации
DeepSeek объявил 10 сентября, что V4 Pro будет отключён сегодня в 04:00 UTC. Вместо этого они отыграли назад под давлением пользователей, сохранив V4 Pro на прежних ценах. Разбираем актуальные параметры двух моделей и решения для routing-операторов.

DeepSeek V4.1-Flash выходит с нативным зрением — и через четыре дня убивает deepseek-v4-pro
DeepSeek запустил V4.1-Flash с новым именем deepseek-flash и нативным зрением. 14 сентября в 12:00 по Пекину все запросы к deepseek-v4-pro уйдут на V4.1-Flash по ценам Flash. Имя и URL не меняются, код 200 — но модель другая. Дельта возможностей и что изменить до дедлайна.

DeepSeek V4 вводит пиковое ценообразование: время суток становится параметром маршрутизации для каждого AI-шлюза
DeepSeek V4 выходит в середине июля с двукратным повышением цен на API в пиковые часы — первое пиковое ценообразование в AI API. Каждому слою маршрутизации теперь нужен учёт часовых поясов в расчёте затрат и fallback-логике.