DeepSeek закрепляет снижение цены на V4 Pro: что ценовая война в AI значит для вашей routing-политики

DeepSeek подтвердила, что 75% скидка на V4 Pro теперь постоянная. При цене «$0,87/M» за output-токены и результатах SWE-bench выше 80% модель переписывает карту routing-уровней — V4 Pro больше не премиальный fallback, а основная reasoning-модель.

Опубликовано источник DeepSeek

Архивный материал, подготовленный с помощью ИИ по указанному источнику и опубликованный без индивидуальной проверки. Ответственный редактор: Joe Werner.

Постоянное снижение цены DeepSeek V4 Pro: схема выбора routing-уровней для AI-инженерных команд
Машинный перевод с английского оригинала — читать оригинал

Ценовая война в AI только что перешла из плоскости промо-акций в плоскость постоянной стратегии. 23 мая 2026 года DeepSeek подтвердила: 75% скидка на V4 Pro, изначально действовавшая до 31 мая, не будет отменена. То, что в апреле запускалось по цене «$1,74/M» input и «$3,48/M» output, теперь постоянно стоит «$0,435/M» input и «$0,87/M» output. Это не округление, а смена категории.

Эта новость важна не сама по себе, а как триггер для пересмотра routing-политики: каждой команде, которая настраивала V4 Pro как «премиальный fallback для сложных задач», стоит заново оценить, не пора ли сделать его основным уровнем.

Что изменилось

DeepSeek запустила V4 Pro 24 апреля 2026 года вместе с V4 Flash, позиционировав их как разделённую двухуровневую линейку:

МодельInput (cache miss)OutputКонтекстThinking
deepseek-v4-flash«$0,14/M»«$0,28/M»1MОба режима
deepseek-v4-pro«$0,435/M»«$0,87/M»1MОба режима

Стартовая цена V4 Pro была «$1,74/M» input и «$3,48/M» output. Промо-скидка в 75% действовала с момента запуска и должна была закончиться 31 мая, но 23 мая компания подтвердила, что эти сниженные тарифы становятся постоянной прайс-листовой ценой. Также с 26 апреля цены на cache hit по обеим моделям были снижены до 1/10 от стартовых.

Лимиты по concurrency остаются разделёнными: V4 Flash поддерживает 2 500 параллельных запросов, V4 Pro — 500.

Почему это важно для AI-инженерных команд

Сравнение по стоимости с сопоставимыми frontier-моделями изменилось окончательно. При «$0,87/M» output V4 Pro теперь ощутимо дешевле, чем:

  • OpenAI o4-mini: «$4,40/M» output (в 5 раз дороже)
  • Claude Sonnet 4: «$15/M» output (в 17 раз дороже)
  • GPT-4.1: «$8/M» output (в 9 раз дороже)

DeepSeek V4 Pro показывает 80,6% на SWE-bench Verified — на уровне или выше нескольких моделей, стоящих на порядок дороже. Она поставляется с контекстом в 1M токенов, tool calling, JSON-выводом, режимами thinking и без него, а также совместимостью одновременно с OpenAI- и Anthropic-форматом API.

Изначальная логика звучала так: использовать V4 Pro, только если V4 Flash не справляется. Постоянное снижение цены меняет эту логику: V4 Pro теперь по цене позиционируется как reasoning-модель по умолчанию, а не как премиальное исключение.

Экономика «fallback» переворачивается. Команды, которые строили routing-политики вокруг «откатываемся на дешёвую внутреннюю модель при сбое V4 Pro», теперь могут считать математику задом наперёд. При таких ценах хвостовая стоимость fallback настолько мала, что V4 Pro как основной tier — с V4 Flash в качестве быстрого и дешёвого исполнительного уровня — может оказаться выгоднее, чем держать V4 Pro в роли резерва.

Натяжение между Китаем и глобальным routing усиливается. Для команд, использующих несколько provider-ов в разных регионах, постоянная цена V4 Pro делает её более сильным якорем для reasoning-нагрузок даже против новых глобальных моделей. К тому же DeepSeek API теперь предоставляет base URL как в OpenAI-формате, так и в Anthropic-формате, что упрощает мульти-provider routing на уровне протокола.

Взгляд router/operator

Постоянное изменение цены порождает три немедленных решения по routing-политике:

1. Пересмотрите распределение моделей по уровням. Если V4 Pro был настроен как «tier 2 fallback», подумайте, не должен ли он стать «tier 1 primary для reasoning», а V4 Flash — «tier 0 fast/cheap» исполнительной моделью. Цена «$0,87/M» output делает V4 Pro конкурентной flash-моделям многих других provider-ов.

2. Переоцените экономику thinking-режима. И V4 Pro, и V4 Flash по умолчанию идут с включённым thinking. Этот режим увеличивает число output-токенов, что напрямую умножает стоимость каждого запроса. При «$0,87/M» output цепочка thinking на 4 000 токенов стоит «$0,0035». При старой цене в «$3,48» та же цепочка стоила «$0,014». Математика на запрос стала лучше в 4 раза — порог включения thinking теперь куда мягче.

3. Проверьте свою fallback-цепочку на риск reverse-routing. Распространённый паттерн: основной маршрут — дешёвая внутренняя модель, fallback — дорогая глобальная. Если этот fallback у вас Claude Sonnet или GPT-4.1, а в роли primary теперь V4 Pro по «$0,87/M» output, то fallback при сбое внезапно дороже на токен в 10–17 раз. Убедитесь, что ваши fallback-цепочки отражают текущие цены, а не те, что были на момент написания конфигурации.

Схема routing-уровней для прайс-картины на май 2026:

TierМодельOutput «$/M»Сценарий
Fast/economydeepseek-v4-flash«$0,28»Автодополнение, быстрые eval-ы, retries
Primary reasoningdeepseek-v4-pro«$0,87»Код, длинный контекст, агентные задачи
Frontier reasoningo4-mini«$4,40»Задачи, требующие сильнейшей доступной модели
Frontier completionClaude Sonnet 4«$15»Задачи, требующие специфических возможностей Anthropic

Риск потолка по concurrency. V4 Pro ограничена 500 параллельными запросами. Командам с пиковыми нагрузками стоит выстроить overflow routing по concurrency: когда V4 Pro насыщена, направлять избыток на V4 Flash или вторичного provider-а, а не падать или бесконечно копить очередь. Тот же паттерн, что и capacity-aware routing для любого provider-а с лимитами concurrency.

На что обратить внимание пользователям TheRouter

Если вы маршрутизируете запросы к DeepSeek через TheRouter, изменение цены прозрачно — конфиг provider-а обновлять не нужно, если вы уже мигрировали с deepseek-chat на deepseek-v4-pro. Цена в billing просто станет ниже.

Обновления routing-политики, которые всё-таки требуют действий, — логические, а не механические:

  • Проверьте, по-прежнему ли порядок provider-ов отражает изначальный замысел «cheapest-first» или «quality-first». Положение V4 Pro по стоимости сдвинулось, и порядок может уже быть неверным.
  • Если V4 Pro был настроен с cost-based guard-ом (например, «использовать Pro только для промптов длиннее N токенов»), пересмотрите, имеет ли смысл этот порог при «$0,87/M» output.
  • Для пользователей Claude Code или OpenCode: V4 Pro через эндпоинт deepseek.com/anthropic теперь даёт более выгодное соотношение цена/качество для долгих агентных задач. Команды, настроившие прямой Anthropic-формат routing к DeepSeek по миграционному гайду V4, получают постоянную выгоду по цене без изменений в конфиге.

См. гайд по provider-у SiliconFlow как пример настройки китайского AI-provider-а через routing-слой TheRouter — те же принципы cost-control применимы и к DeepSeek V4 Pro сегодня.

Более широкий тренд: постоянное сжатие цен на модели frontier-класса от китайских вендоров теперь структурная черта AI-рынка, а не временное промо-окно. Routing-политики стоит проектировать так, чтобы извлекать из этого пользу, а не воспринимать как краткосрочный арбитраж.

Модели, упомянутые в статье

Чёткая схема routing с уровнями стоимости и выбором между GLM-5.2 Fast и Full на DashScope

GLM-5.2 Fast Mode на DashScope подешевел на 20%: что изменилось в вашей модели routing-затрат

Alibaba Cloud Bailian снизила цену токенов для GLM-5.2 Fast mode на 20% с 15 июля. Для операторов, маршрутизирующих нагрузки через OpenAI-совместимый endpoint DashScope, формула стоимости изменилась.

источник Alibaba Cloud Model Studio
Диаграмма маршрутизации с двумя активными API-эндпоинтами deepseek-v4-pro и deepseek-flash с разными лимитами конкурентности и ценовыми уровнями

DeepSeek V4 Pro пережил собственный дедлайн: что разворот означает для вашей политики маршрутизации

DeepSeek объявил 10 сентября, что V4 Pro будет отключён сегодня в 04:00 UTC. Вместо этого они отыграли назад под давлением пользователей, сохранив V4 Pro на прежних ценах. Разбираем актуальные параметры двух моделей и решения для routing-операторов.

источник DeepSeek
Abstract API routing diagram showing deepseek-v4-pro requests being silently redirected to V4.1-Flash with a September 14 deadline

DeepSeek V4.1-Flash выходит с нативным зрением — и через четыре дня убивает deepseek-v4-pro

DeepSeek запустил V4.1-Flash с новым именем deepseek-flash и нативным зрением. 14 сентября в 12:00 по Пекину все запросы к deepseek-v4-pro уйдут на V4.1-Flash по ценам Flash. Имя и URL не меняются, код 200 — но модель другая. Дельта возможностей и что изменить до дедлайна.

источник DeepSeek
Помощь и контакты