Назад к моделям

DeepSeek V4 Flash

deepseekdeepseek/deepseek-v4-flash

DeepSeek V4 Flash — fast, cost-efficient model with 1M context window. Supports reasoning, tool calling, and structured output.

DeepSeek-V4-Flash — быстрый и экономичный вариант превью DeepSeek V4 апреля 2026 года. Это MoE-модель 284B параметров всего / 13B активных с контекстом 1M токенов и архитектурой Compressed Sparse Attention (CSA). Выпущена вместе с более крупной V4-Pro (1.6T / 49B активных). Flash ориентирована на продакшен-нагрузки, требующие frontier-уровня reasoning и агентного кодирования при радикально меньшей стоимости за токен.

Для оператора TheRouter V4-Flash — выбор по умолчанию среди open-weight моделей для высокоинтенсивного reasoning, длинноконтекстного RAG и агентов с инструментами. Поддерживает тот же API режима мышления, что и V4-Pro (non-thinking / high / max), и полностью OpenAI-совместима через api.therouter.ai/v1. DeepSeek сообщает, что при контексте 1M Flash использует лишь 10% FLOPs и 7% KV cache по сравнению с V3.2 — именно эта эффективность позволяет агрессивное ценообразование.

Когда выбирать
  • • Высоконагруженный продакшен reasoning и агентное кодирование — Flash при max-усилии даёт качество близкое к Pro, но стоимость вывода примерно в 3 раза ниже
  • • Длинноконтекстный RAG и анализ репозиториев — окно 1M токенов с радикально меньшими FLOPs и KV cache по сравнению с V3.2
  • • Агенты с tool calling и структурированным JSON на большом масштабе — OpenAI-совместимы, поддерживают tools и response_format, режим мышления возвращает reasoning_content
  • • Стоимостно-чувствительные нагрузки, ранее шедшие на GPT-5.4 Mini или Gemini 3 Flash, теперь могут получить более высокое качество reasoning по сопоставимой или меньшей цене
Когда не выбирать
  • • Максимальный frontier интеллект — V4-Pro (или закрытые модели) всё ещё лидирует на сложных агентных бенчмарках (Terminal-Bench, BrowseComp, SimpleQA-Verified) на 5–13 пунктов
  • • Vision или мультимодальный ввод — V4-Flash text-only; для изображений маршрутизируйте на Claude Opus 4.7, Amazon Nova 2 Lite или GPT-5.4
  • • Крайне чувствительные к задержкам чаты — когда даже overhead мышления Flash неприемлем; лучше non-thinking режим или меньшие модели

Чем обслуживание в TheRouter отличается от вендорского

Как её эксплуатирует вендор

Собственный сервис DeepSeek отдаёт V4-Flash как deepseek-v4-flash через OpenAI-format, Anthropic-format и Responses API; Hugging Face также публикует открытые веса для self-hosting.

На TheRouter

TheRouter предоставляет ту же текстовую модель под deepseek/deepseek-v4-flash на OpenAI-совместимой поверхности /v1. Цена, длина контекста, лимит вывода и поддерживаемые параметры берутся из live-реестра моделей, а не дублируются на этой curated-странице.

Размер контекста
1M
Максимальный вывод
384K
Цена Входза 1M токенов
$0.162за 1 млн токенов
Цена Выходза 1M токенов
$0.648за 1 млн токенов

Модальности

Текст→Текст

Разбивка цен

ТипСтавка
Вход$0.162 за 1 млн токенов
Выход$0.648 за 1 млн токенов

Поддерживаемые параметры

temperaturetop_pfrequency_penaltypresence_penaltymax_tokensmax_completion_tokensstoptoolstool_choiceresponse_formatstreamreasoning

Характеристики

Дата релиза (превью)2026-04-24api-docs.deepseek.com ↗проверено
Архитектура284B всего / 13B активных MoE; Compressed Sparse Attention (CSA) + DeepSeek Sparse Attention (DSA); нативный контекст 1Mapi-docs.deepseek.com ↗проверено
Контекстное окно1 000 000 токеновapi-docs.deepseek.com ↗проверено
Максимальный вывод384 000 токеновapi-docs.deepseek.com ↗проверено
Режимы мышленияNon-thinking, Thinking (high / max); reasoning_content возвращается отдельноapi-docs.deepseek.com ↗проверено
Лицензия — кодMIThuggingface.co ↗проверено
Лицензия — весаDeepSeek Model License (коммерческое использование разрешено)huggingface.co ↗проверено
Открытые весаДа — доступны на Hugging Facehuggingface.co ↗проверено
Токены претрейна32T+huggingface.co ↗проверено

Бенчмарки

BenchmarkDistributionScoreSource
Terminal Bench 2.0
Результат V4-Flash Max в таблице DeepSeek comparison across modes; V4-Pro Max указан как 67.9%.
56.9%%huggingface.co ↗
LiveCodeBench Pass@1
V4-Pro Max: 93.5%. Разрыв 1.9 п.п.
91.6%%huggingface.co ↗
MMLU-Pro
V4-Pro Max: 87.5. Разрыв 1.3 п.п.
86.2huggingface.co ↗
GPQA Diamond
V4-Pro Max: 90.1. Разрыв 2.0 п.п.
88.1huggingface.co ↗
SWE-bench Verified
V4-Pro Max: 80.6. Разрыв 1.6 п.п.
79.0huggingface.co ↗
Codeforces rating (Max)
V4-Pro Max: 3,206 Elo. Разрыв 154 Elo.
3,052 Elohuggingface.co ↗

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "deepseek/deepseek-v4-flash",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

Chat completion

Стандартный OpenAI-совместимый chat эндпоинт. Добавьте reasoning_effort и thinking extra_body, чтобы включить chain-of-thought.

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek/deepseek-v4-flash",
    "messages": [{"role":"user","content":"Explain quantum computing in simple terms"}],
    "reasoning_effort": "high",
    "extra_body": {"thinking": {"type": "enabled"}}
  }'

Ещё от deepseek

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2026-04-24

DeepSeek выпускает превью V4 — контекст 1M токенов по open-weight frontier-ценам

24 апреля 2026 DeepSeek выпустила V4-Pro и V4-Flash. Обе модели используют Compressed Sparse Attention и поддерживают контекст 1M токенов при радикально меньших FLOPs и KV cache, чем V3.2. Flash (284B/13B) ориентирована на cost-sensitive продакшен; Pro (1.6T/49B) — на максимальный интеллект. Веса под MIT и доступны на Hugging Face.

переработано TheRouterapi-docs.deepseek.com ↗

Свежие материалы

Частые вопросы

Как V4-Flash сравнивается с V4-Pro на реальных агентных нагрузках?

На LiveCodeBench, SWE-bench Verified и MMLU-Pro разрыв 1.3–1.9 пункта. На более сложных агентных бенчмарках (Terminal-Bench, BrowseComp, SimpleQA) разрыв растёт до 5–13 пунктов. Для большинства продакшен-задач кодирования и tool-use Flash@max находится в приемлемом диапазоне от Pro@high, при этом стоимость вывода примерно в 3 раза ниже.

переработано TheRoutercodersera.com ↗
Поддерживает ли V4-Flash тот же API режима мышления, что и V4-Pro?

Да. Обе модели предоставляют одинаковый переключатель мышления через extra_body и одинаковые уровни reasoning_effort (high / max). Поле reasoning_content возвращается на том же уровне, что и content, и должно быть конкатенировано в последующие ходы при использовании tool calls.

Что изменилось в API V4-Flash в июльском обновлении 2026 года?

На странице цен DeepSeek текущая обслуживаемая версия указана как DeepSeek-V4-Flash-0731; окно 1M и максимальный вывод 384K сохранены, а Responses API на момент проверки отмечен как доступный только для V4-Flash. DeepSeek также сообщил, что старые маршруты deepseek-chat и deepseek-reasoner будут выведены после 24 июля 2026 года и до вывода уже маршрутизировались на V4-Flash.

Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Дата релиза (превью)api-docs.deepseek.com ↗2026-05-25проверено
Архитектураapi-docs.deepseek.com ↗2026-05-25проверено
Контекстное окноapi-docs.deepseek.com ↗2026-05-25проверено
Максимальный выводapi-docs.deepseek.com ↗2026-05-25проверено
Режимы мышленияapi-docs.deepseek.com ↗2026-05-25проверено
Лицензия — кодhuggingface.co ↗2026-05-25проверено
Лицензия — весаhuggingface.co ↗2026-05-25проверено
Открытые весаhuggingface.co ↗2026-05-25проверено
Токены претрейнаhuggingface.co ↗2026-08-12проверено
Terminal Bench 2.0huggingface.co ↗2026-08-12проверено
LiveCodeBench Pass@1huggingface.co ↗2026-08-12проверено
MMLU-Prohuggingface.co ↗2026-08-12проверено
GPQA Diamondhuggingface.co ↗2026-08-12проверено
SWE-bench Verifiedhuggingface.co ↗2026-08-12проверено
Codeforces rating (Max)huggingface.co ↗2026-08-12проверено
DeepSeek выпускает превью V4 — контекст 1M токенов по open-weight frontier-ценамapi-docs.deepseek.com ↗2026-05-25проверено
Как V4-Flash сравнивается с V4-Pro на реальных агентных нагрузках?codersera.com ↗2026-05-25к проверке
Поддерживает ли V4-Flash тот же API режима мышления, что и V4-Pro?api-docs.deepseek.com ↗2026-05-25к проверке
Что изменилось в API V4-Flash в июльском обновлении 2026 года?api-docs.deepseek.com ↗2026-08-12к проверке
Помощь и контакты