← Все статьи

DeepSeek V4-Pro vs V4-Flash (август 2026): цены API, бенчмарки и стратегии маршрутизации

Прямое сравнение DeepSeek V4-Pro-0813 и V4-Flash-0731 — пиковые/внепиковые цены, независимые бенчмарки, управление reasoning effort и конкретные стратегии маршрутизации для операторов OpenAI-совместимых API.

· updated 2026-08-18· TheRouter

DeepSeek теперь предлагает два production-модели через свой OpenAI-совместимый endpoint: V4-Pro (версия 0813, GA с 13 августа) и V4-Flash (версия 0731, GA с 31 июля). Оба делят контекстное окно в 1M токенов, максимальный output 384K, гибридный режим reasoning, tool calling, JSON output, Responses API и endpoint в формате Anthropic. На бумаге они выглядят как одна модель с двумя ценниками. На практике разрыв между ними меньше, чем подсказывают названия, и решение о маршрутизации зависит от чувствительности задачи к ошибкам, а не от абстрактного «уровня качества».

Это сравнение охватывает текущие цены (включая пиковые/внепиковые тарифы, действующие с 16 августа), независимые бенчмарки и конкретный routing-фреймворк для операторов, запускающих обе модели за одним base_url.

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Цены: пиковые, внепиковые и множитель 3×

DeepSeek ввёл посуточное ценообразование 16 августа 2026 года. Пиковые часы — 01:00–04:00 UTC и 06:00–10:00 UTC (примерно 09:00–12:00 и 14:00–18:00 по пекинскому времени). Внепиковые тарифы — ровно половина пиковых.

Все цены в USD за 1M токенов:

Компонент ценыV4-Flash (внепик.)V4-Flash (пик.)V4-Pro (внепик.)V4-Pro (пик.)Pro/Flash
Cache-hit input$0.007$0.014$0.022$0.044~3.1×
Cache-miss input$0.22$0.44$0.66$1.323×
Output$0.66$1.32$1.98$3.963×
Concurrency limit2,5002,5005005000.2×

Три ключевых момента.

Первый: Pro стоит ровно в 3 раза дороже Flash по cache-miss input и output, и в пиковые, и во внепиковые часы. Скрытых множителей нет.

Второй: внепиковые тарифы составляют 50% от пиковых для обеих моделей. Если пакетные задачи можно перенести во внепиковое окно (10:00–01:00 UTC, 04:00–06:00 UTC), вы платите примерно столько же, сколько Flash стоил до повышения 16 августа.

Третий: Flash поддерживает в 5 раз больше параллельных запросов. При 2,500 vs 500 concurrent requests задачи с высоким throughput — массовая классификация, параллельные sub-agents — работают только на Flash.

Сравнивая цены API между провайдерами, всегда нормализуйте кUSD за миллион токенов и разделяйте input и output. Большинство провайдеров берёт за output токены в 2–5 раз дороже, чем за input, поэтому нагрузка с длинными completion'ами при одной и той же номинальной цене обходится дороже.

  • Одна валюта (USD) — конвертация на дату публикации с указанием курса.
  • Разделяйте input/output — никогда не публикуйте смешанную цифру.
  • Цитируйте каждую строку со страницы цен провайдера + дата извлечения.
  • Указывайте тарифы длинного контекста — они часто скачут вверх.

Стоимость реальных рабочих нагрузок

Типичный чат-запрос (1K свежих input + 500 output токенов) по внепиковым тарифам:

  • V4-Flash: ~$0.00055
  • V4-Pro: ~$0.00165

Cache-heavy agent-цикл (200K cached + 20K свежих input + 10K output) по внепиковым тарифам:

  • V4-Flash: ~$0.011
  • V4-Pro: ~$0.033

Множитель 3× стабилен при любой форме нагрузки. Pro не становится непропорционально дорогим при длинных контекстах или большом output — это фиксированная наценка.

Независимые бенчмарки: разрыв меньше, чем кажется

Названия «Pro» и «Flash» предполагают большой разрыв в возможностях. Независимое тестирование рисует другую картину.

Данные Artificial Analysis (проверены 13 августа 2026):

БенчмаркV4-Pro 0813V4-Flash 0731Разрыв
Intelligence Index5352Pro +1
Agentic Index49.648.4Pro +1.2
Terminal-Bench v2.178.65%78.65%Ничья
Long-context reasoning75.33%74.33%Pro +1
GPQA Diamond92.83%90.81%Pro +2
SciCode49.19%49.88%Flash +0.7
Скорость output83.2 tok/s122.2 tok/sFlash быстрее на 47%

Собственные бенчмарки DeepSeek (из технического отчёта V4 на Hugging Face) показывают более значительный разрыв на knowledge-intensive и agentic задачах:

БенчмаркV4-Pro 0813V4-Flash 0731Разрыв
SimpleQA57.9%34.1%Pro +23.8
BrowseComp83.4%73.2%Pro +10.2
Terminal-Bench 2.067.9%56.9%Pro +11
SWE-bench Pro55.4%52.6%Pro +2.8
HLE42.7%34.8%Pro +7.9

Независимые и вендорские данные рисуют разные картины. По независимым оценкам Pro и Flash находятся в одном широком capability-тире — большинство метрик расходятся на единицы. По собственным бенчмаркам DeepSeek (Terminal-Bench 2.0, SimpleQA, BrowseComp) Pro отрывается заметнее.

Три вывода, которые выдерживают проверку обоими датасетами.

Первый: V4-Pro 0813 — существенное обновление по сравнению с ранним preview. Artificial Analysis зафиксировал скачок Intelligence Index с ~45.3 до 53 и Agentic Index с ~37.8 до 49.6.

Второй: на рутинных задачах кодирования и agent-работы Flash на независимых оценках соответствует или почти соответствует Pro. Terminal-Bench v2.1 — ничья. SWE-bench Pro — разрыв 2.8 пункта.

Третий: преимущество Pro концентрируется на knowledge-intensive и многошаговых agentic задачах — SimpleQA, BrowseComp, HLE — где цена ошибки на первом шаге высока.

Паритет функций

Обе модели разделяют одинаковый API-интерфейс:

ФункцияV4-ProV4-Flash
Контекстное окно1M1M
Максимальный output384K384K
Режим reasoningПо умолчанию вкл., effort controlПо умолчанию вкл., effort control
Уровни reasoning effortlow / high / maxlow / high / max
Tool callingДаДа
JSON outputДаДа
Responses APIДаДа
Anthropic API форматДаДа
FIM completion (beta)Только non-thinkingТолько non-thinking
Chat prefix completion (beta)ДаДа

Управление reasoning effort идентично на обеих моделях. reasoning_effort: "low" → низкий effort; "high" → высокий; "max" → максимальный. Промежуточные значения ("medium", "xhigh") оба маппятся на высокий. Это позволяет использовать effort control как рычаг стоимости на уровне отдельного запроса, без переключения моделей.

Стратегия маршрутизации: когда какую использовать

Решение о routing между V4-Pro и V4-Flash — это не «Pro для сложного, Flash для простого». Правильный подход: Flash по умолчанию, переход на Pro, когда стоимость ошибки в первом ответе превышает 3× наценку за токены.

Начинайте с Flash

Flash — ваш маршрут по умолчанию для:

  • Массовая генерация кода — задачи можно перезапустить, результат измерить, а Flash на 47% быстрее
  • Классификация, извлечение, суммаризация — разница в качестве мала, throughput важнее
  • Sub-agent workers — concurrency 2,500 поддерживает параллельный fan-out
  • Прототипирование — постройте baseline на дешёвой модели перед тем, как платить за Pro

Когда переходить на Pro

Pro оправдывает 3× наценку, когда:

  • Архитектурное планирование и кроссистемный debugging — ошибки каскадируют и создают дорогую переработку
  • Knowledge-intensive запросы — разрыв Pro на SimpleQA (57.9% vs 34.1%) указывает на более сильную фактологическую основу
  • Высокорисковая аналитика — когда стоимость human review ошибочного ответа превышает разницу в API-цене
  • Многошаговые agentic задачи с ветвлением — разрыв на BrowseComp и Terminal-Bench 2.0 указывает на лучшую работу Pro в сложных agent-циклах

Паттерн Planner-Worker

Распространённый production-паттерн: Pro как planner (архитектурные решения, декомпозиция задач), Flash как worker (генерация кода, выполнение тестов, операции с файлами). Это концентрирует premium-модель там, где нужно качество суждений, а объёмную работу отдаёт Flash.

# Пример: маршрутизация по типу задачи через TheRouter
from openai import OpenAI

client = OpenAI(
    base_url="https://therouter.ai/v1",
    api_key="your-therouter-key"
)

# Планирование → V4-Pro
plan = client.chat.completions.create(
    model="deepseek/deepseek-v4-pro",
    messages=[{"role": "user", "content": "Спроектируй план миграции..."}],
    reasoning_effort="high"
)

# Исполнение → V4-Flash
for task in plan_tasks:
    result = client.chat.completions.create(
        model="deepseek/deepseek-v4-flash",
        messages=[{"role": "user", "content": task}],
        reasoning_effort="low"
    )

Оптимизация через пиковое/внепиковое расписание

Внепиковые тарифы — 50% от пиковых. Операторы, запускающие batch-задачи и нечувствительные к latency нагрузки, могут планировать их во внепиковые окна (10:00–01:00 UTC, 04:00–06:00 UTC). Комбинация Flash + внепиковое время даёт до 6× экономии по сравнению с Pro в пиковые часы.

Для latency-sensitive production-трафика пиковая/внепиковая разница менее значима — запросы обслуживаются по мере поступления. Но batch-оценка, регрессионное тестирование и data-pipeline задачи переносятся во внепиковое окно без проблем.

Routing через TheRouter

Обе модели доступны в каталоге TheRouter как deepseek/deepseek-v4-pro и deepseek/deepseek-v4-flash. Можно настроить model fallbacks для автоматической маршрутизации между ними.

Типичные конфигурации:

  • Основной маршрут — deepseek/deepseek-v4-flash для cost-efficient routing
  • Fallback на deepseek/deepseek-v4-pro при ошибках Flash или достижении concurrency-лимита
  • Или routing по метаданным задач — planning-промпты на Pro, execution-промпты на Flash

OpenAI-совместимый base_url означает, что переключение моделей — это изменение одного параметра model. Никаких изменений SDK, endpoint или аутентификации.

Когда Pro не оправдан

Pro не стоит наценки, когда:

  • У вас нет task-level evaluation данных. Постройте baseline на Flash.
  • Задача retriable с дешёвой проверкой (unit-тесты, format-чеки).
  • Throughput важнее качества отдельного запроса. Flash с 5× concurrency и 47% скоростью доминирует.
  • Вы работаете в пиковые часы, и стоимость — ограничение. Flash в пик ($1.32/1M output) дешевле Pro во внепик ($1.98/1M output).

Итог

V4-Pro 0813 — существенное обновление по сравнению с ранним preview, с заметным отрывом на knowledge-intensive и сложных agentic бенчмарках. V4-Flash 0731 на независимых оценках кодирования и reasoning соответствует или почти соответствует Pro, при этом работает на 47% быстрее, поддерживает в 5 раз больше concurrent requests и стоит ровно треть.

Для большинства production-нагрузок Flash — правильный выбор по умолчанию. Pro зарабатывает своё место в конкретных высокорисковых сценариях, где цена ошибки в первом ответе превышает 3× наценку за токены. Паттерн Planner-Worker — Pro для планирования, Flash для исполнения — позволяет получить лучшее от обеих моделей без перерасхода.

С введением пикового/внепикового ценообразования операторы, способные сдвинуть batch-нагрузки во внепиковые часы, получают дополнительную экономию. Маршрутизируйте обе модели через единый OpenAI-совместимый gateway и позвольте данным о ваших нагрузках, а не названиям моделей, управлять routing.


Источники:

Модели, упомянутые в статье

Помощь и контакты