DeepSeek V4-Pro vs V4-Flash (август 2026): цены API, бенчмарки и стратегии маршрутизации
Прямое сравнение DeepSeek V4-Pro-0813 и V4-Flash-0731 — пиковые/внепиковые цены, независимые бенчмарки, управление reasoning effort и конкретные стратегии маршрутизации для операторов OpenAI-совместимых API.
DeepSeek теперь предлагает два production-модели через свой OpenAI-совместимый endpoint: V4-Pro (версия 0813, GA с 13 августа) и V4-Flash (версия 0731, GA с 31 июля). Оба делят контекстное окно в 1M токенов, максимальный output 384K, гибридный режим reasoning, tool calling, JSON output, Responses API и endpoint в формате Anthropic. На бумаге они выглядят как одна модель с двумя ценниками. На практике разрыв между ними меньше, чем подсказывают названия, и решение о маршрутизации зависит от чувствительности задачи к ошибкам, а не от абстрактного «уровня качества».
Это сравнение охватывает текущие цены (включая пиковые/внепиковые тарифы, действующие с 16 августа), независимые бенчмарки и конкретный routing-фреймворк для операторов, запускающих обе модели за одним base_url.
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
Цены: пиковые, внепиковые и множитель 3×
DeepSeek ввёл посуточное ценообразование 16 августа 2026 года. Пиковые часы — 01:00–04:00 UTC и 06:00–10:00 UTC (примерно 09:00–12:00 и 14:00–18:00 по пекинскому времени). Внепиковые тарифы — ровно половина пиковых.
Все цены в USD за 1M токенов:
| Компонент цены | V4-Flash (внепик.) | V4-Flash (пик.) | V4-Pro (внепик.) | V4-Pro (пик.) | Pro/Flash |
|---|---|---|---|---|---|
| Cache-hit input | $0.007 | $0.014 | $0.022 | $0.044 | ~3.1× |
| Cache-miss input | $0.22 | $0.44 | $0.66 | $1.32 | 3× |
| Output | $0.66 | $1.32 | $1.98 | $3.96 | 3× |
| Concurrency limit | 2,500 | 2,500 | 500 | 500 | 0.2× |
Три ключевых момента.
Первый: Pro стоит ровно в 3 раза дороже Flash по cache-miss input и output, и в пиковые, и во внепиковые часы. Скрытых множителей нет.
Второй: внепиковые тарифы составляют 50% от пиковых для обеих моделей. Если пакетные задачи можно перенести во внепиковое окно (10:00–01:00 UTC, 04:00–06:00 UTC), вы платите примерно столько же, сколько Flash стоил до повышения 16 августа.
Третий: Flash поддерживает в 5 раз больше параллельных запросов. При 2,500 vs 500 concurrent requests задачи с высоким throughput — массовая классификация, параллельные sub-agents — работают только на Flash.
Сравнивая цены API между провайдерами, всегда нормализуйте кUSD за миллион токенов и разделяйте input и output. Большинство провайдеров берёт за output токены в 2–5 раз дороже, чем за input, поэтому нагрузка с длинными completion'ами при одной и той же номинальной цене обходится дороже.
- Одна валюта (USD) — конвертация на дату публикации с указанием курса.
- Разделяйте input/output — никогда не публикуйте смешанную цифру.
- Цитируйте каждую строку со страницы цен провайдера + дата извлечения.
- Указывайте тарифы длинного контекста — они часто скачут вверх.
Стоимость реальных рабочих нагрузок
Типичный чат-запрос (1K свежих input + 500 output токенов) по внепиковым тарифам:
- V4-Flash: ~$0.00055
- V4-Pro: ~$0.00165
Cache-heavy agent-цикл (200K cached + 20K свежих input + 10K output) по внепиковым тарифам:
- V4-Flash: ~$0.011
- V4-Pro: ~$0.033
Множитель 3× стабилен при любой форме нагрузки. Pro не становится непропорционально дорогим при длинных контекстах или большом output — это фиксированная наценка.
Независимые бенчмарки: разрыв меньше, чем кажется
Названия «Pro» и «Flash» предполагают большой разрыв в возможностях. Независимое тестирование рисует другую картину.
Данные Artificial Analysis (проверены 13 августа 2026):
| Бенчмарк | V4-Pro 0813 | V4-Flash 0731 | Разрыв |
|---|---|---|---|
| Intelligence Index | 53 | 52 | Pro +1 |
| Agentic Index | 49.6 | 48.4 | Pro +1.2 |
| Terminal-Bench v2.1 | 78.65% | 78.65% | Ничья |
| Long-context reasoning | 75.33% | 74.33% | Pro +1 |
| GPQA Diamond | 92.83% | 90.81% | Pro +2 |
| SciCode | 49.19% | 49.88% | Flash +0.7 |
| Скорость output | 83.2 tok/s | 122.2 tok/s | Flash быстрее на 47% |
Собственные бенчмарки DeepSeek (из технического отчёта V4 на Hugging Face) показывают более значительный разрыв на knowledge-intensive и agentic задачах:
| Бенчмарк | V4-Pro 0813 | V4-Flash 0731 | Разрыв |
|---|---|---|---|
| SimpleQA | 57.9% | 34.1% | Pro +23.8 |
| BrowseComp | 83.4% | 73.2% | Pro +10.2 |
| Terminal-Bench 2.0 | 67.9% | 56.9% | Pro +11 |
| SWE-bench Pro | 55.4% | 52.6% | Pro +2.8 |
| HLE | 42.7% | 34.8% | Pro +7.9 |
Независимые и вендорские данные рисуют разные картины. По независимым оценкам Pro и Flash находятся в одном широком capability-тире — большинство метрик расходятся на единицы. По собственным бенчмаркам DeepSeek (Terminal-Bench 2.0, SimpleQA, BrowseComp) Pro отрывается заметнее.
Три вывода, которые выдерживают проверку обоими датасетами.
Первый: V4-Pro 0813 — существенное обновление по сравнению с ранним preview. Artificial Analysis зафиксировал скачок Intelligence Index с ~45.3 до 53 и Agentic Index с ~37.8 до 49.6.
Второй: на рутинных задачах кодирования и agent-работы Flash на независимых оценках соответствует или почти соответствует Pro. Terminal-Bench v2.1 — ничья. SWE-bench Pro — разрыв 2.8 пункта.
Третий: преимущество Pro концентрируется на knowledge-intensive и многошаговых agentic задачах — SimpleQA, BrowseComp, HLE — где цена ошибки на первом шаге высока.
Паритет функций
Обе модели разделяют одинаковый API-интерфейс:
| Функция | V4-Pro | V4-Flash |
|---|---|---|
| Контекстное окно | 1M | 1M |
| Максимальный output | 384K | 384K |
| Режим reasoning | По умолчанию вкл., effort control | По умолчанию вкл., effort control |
| Уровни reasoning effort | low / high / max | low / high / max |
| Tool calling | Да | Да |
| JSON output | Да | Да |
| Responses API | Да | Да |
| Anthropic API формат | Да | Да |
| FIM completion (beta) | Только non-thinking | Только non-thinking |
| Chat prefix completion (beta) | Да | Да |
Управление reasoning effort идентично на обеих моделях. reasoning_effort: "low" → низкий effort; "high" → высокий; "max" → максимальный. Промежуточные значения ("medium", "xhigh") оба маппятся на высокий. Это позволяет использовать effort control как рычаг стоимости на уровне отдельного запроса, без переключения моделей.
Стратегия маршрутизации: когда какую использовать
Решение о routing между V4-Pro и V4-Flash — это не «Pro для сложного, Flash для простого». Правильный подход: Flash по умолчанию, переход на Pro, когда стоимость ошибки в первом ответе превышает 3× наценку за токены.
Начинайте с Flash
Flash — ваш маршрут по умолчанию для:
- Массовая генерация кода — задачи можно перезапустить, результат измерить, а Flash на 47% быстрее
- Классификация, извлечение, суммаризация — разница в качестве мала, throughput важнее
- Sub-agent workers — concurrency 2,500 поддерживает параллельный fan-out
- Прототипирование — постройте baseline на дешёвой модели перед тем, как платить за Pro
Когда переходить на Pro
Pro оправдывает 3× наценку, когда:
- Архитектурное планирование и кроссистемный debugging — ошибки каскадируют и создают дорогую переработку
- Knowledge-intensive запросы — разрыв Pro на SimpleQA (57.9% vs 34.1%) указывает на более сильную фактологическую основу
- Высокорисковая аналитика — когда стоимость human review ошибочного ответа превышает разницу в API-цене
- Многошаговые agentic задачи с ветвлением — разрыв на BrowseComp и Terminal-Bench 2.0 указывает на лучшую работу Pro в сложных agent-циклах
Паттерн Planner-Worker
Распространённый production-паттерн: Pro как planner (архитектурные решения, декомпозиция задач), Flash как worker (генерация кода, выполнение тестов, операции с файлами). Это концентрирует premium-модель там, где нужно качество суждений, а объёмную работу отдаёт Flash.
# Пример: маршрутизация по типу задачи через TheRouter
from openai import OpenAI
client = OpenAI(
base_url="https://therouter.ai/v1",
api_key="your-therouter-key"
)
# Планирование → V4-Pro
plan = client.chat.completions.create(
model="deepseek/deepseek-v4-pro",
messages=[{"role": "user", "content": "Спроектируй план миграции..."}],
reasoning_effort="high"
)
# Исполнение → V4-Flash
for task in plan_tasks:
result = client.chat.completions.create(
model="deepseek/deepseek-v4-flash",
messages=[{"role": "user", "content": task}],
reasoning_effort="low"
)
Оптимизация через пиковое/внепиковое расписание
Внепиковые тарифы — 50% от пиковых. Операторы, запускающие batch-задачи и нечувствительные к latency нагрузки, могут планировать их во внепиковые окна (10:00–01:00 UTC, 04:00–06:00 UTC). Комбинация Flash + внепиковое время даёт до 6× экономии по сравнению с Pro в пиковые часы.
Для latency-sensitive production-трафика пиковая/внепиковая разница менее значима — запросы обслуживаются по мере поступления. Но batch-оценка, регрессионное тестирование и data-pipeline задачи переносятся во внепиковое окно без проблем.
Routing через TheRouter
Обе модели доступны в каталоге TheRouter как deepseek/deepseek-v4-pro и deepseek/deepseek-v4-flash. Можно настроить model fallbacks для автоматической маршрутизации между ними.
Типичные конфигурации:
- Основной маршрут —
deepseek/deepseek-v4-flashдля cost-efficient routing - Fallback на
deepseek/deepseek-v4-proпри ошибках Flash или достижении concurrency-лимита - Или routing по метаданным задач — planning-промпты на Pro, execution-промпты на Flash
OpenAI-совместимый base_url означает, что переключение моделей — это изменение одного параметра model. Никаких изменений SDK, endpoint или аутентификации.
Когда Pro не оправдан
Pro не стоит наценки, когда:
- У вас нет task-level evaluation данных. Постройте baseline на Flash.
- Задача retriable с дешёвой проверкой (unit-тесты, format-чеки).
- Throughput важнее качества отдельного запроса. Flash с 5× concurrency и 47% скоростью доминирует.
- Вы работаете в пиковые часы, и стоимость — ограничение. Flash в пик ($1.32/1M output) дешевле Pro во внепик ($1.98/1M output).
Итог
V4-Pro 0813 — существенное обновление по сравнению с ранним preview, с заметным отрывом на knowledge-intensive и сложных agentic бенчмарках. V4-Flash 0731 на независимых оценках кодирования и reasoning соответствует или почти соответствует Pro, при этом работает на 47% быстрее, поддерживает в 5 раз больше concurrent requests и стоит ровно треть.
Для большинства production-нагрузок Flash — правильный выбор по умолчанию. Pro зарабатывает своё место в конкретных высокорисковых сценариях, где цена ошибки в первом ответе превышает 3× наценку за токены. Паттерн Planner-Worker — Pro для планирования, Flash для исполнения — позволяет получить лучшее от обеих моделей без перерасхода.
С введением пикового/внепикового ценообразования операторы, способные сдвинуть batch-нагрузки во внепиковые часы, получают дополнительную экономию. Маршрутизируйте обе модели через единый OpenAI-совместимый gateway и позвольте данным о ваших нагрузках, а не названиям моделей, управлять routing.
Источники:
- DeepSeek Models & Pricing — получено 2026-08-18
- DeepSeek V4-Pro GA Release Announcement — получено 2026-08-18
- DeepSeek Thinking Mode Documentation — получено 2026-08-18
- Artificial Analysis: DeepSeek V4 Pro 0813 — проверено 2026-08-13
- Artificial Analysis: DeepSeek V4 Flash 0731 — проверено 2026-08-13
- BenchLM: V4-Flash-0731 vs V4-Pro-0813 — получено 2026-08-18
- DeepSeek V4 Technical Report (PDF) — источник данных бенчмарков