Полное руководство по DeepSeek V4.1 Flash API: архитектура 552B MoE, нативное зрение и маршрутизация с оптимизацией затрат
Всё, что нужно для работы с DeepSeek V4.1 Flash — моделью на 552B параметров MoE, которая активирует лишь 8B на входе. Разбираем архитектуру Causal Encoder-Decoder, нативную поддержку изображений, цены (от $0.15/M входных токенов в непиковые часы), режим reasoning, вызов инструментов и подключение V4.1 Flash к мультипровайдерной маршрутизации.
DeepSeek V4.1 Flash — это модель Mixture-of-Experts на 552B параметров, активирующая всего 8B параметров на входной токен и 16B на выходной. Она запущена 10 сентября 2026 года и заменяет сразу V4 Flash и V4-Flash-Vision-Exp единым мультимодальным endpoint. Чтобы вызвать её, достаточно указать model: "deepseek-flash" и тот же https://api.deepseek.com — существующий код на OpenAI SDK работает без изменений.
Мы написали это руководство, потому что V4.1 Flash серьёзно перестраивает модельную линейку DeepSeek. V4 Flash и V4-Flash-Vision-Exp выведены из эксплуатации немедленно; с 14 сентября запросы к V4 Pro тоже будут обслуживаться V4.1 Flash. Если вы используете DeepSeek в production, стоит разобраться, что поменялось, как выглядят новые цены и куда V4.1 Flash вписывается в мультипровайдерную маршрутизацию.
Начало работы за 3 минуты
Шаг 1: Создайте аккаунт. Откройте platform.deepseek.com и зарегистрируйтесь через email или Google OAuth.
Шаг 2: Получите API key. Перейдите на страницу API Keys, нажмите «Create API Key» и скопируйте ключ. Он показывается только один раз.
Шаг 3: Сделайте первый вызов.
pip install --upgrade openai
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_KEY",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-flash",
messages=[{"role": "user", "content": "Что такое DeepSeek V4.1 Flash?"}],
)
print(response.choices[0].message.content)
На этом интеграция закончена. API DeepSeek следует формату OpenAI chat completions, поэтому любая библиотека или фреймворк с поддержкой OpenAI-совместимых endpoint работает из коробки.
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
Обзор архитектуры: Causal Encoder-Decoder с асимметричной активацией
V4.1 Flash вводит новую архитектуру Causal Encoder-Decoder (CED). Модель содержит 40 слоёв Transformer: 20-слойный каузальный encoder и 20-слойный decoder. Глобальный KV cache decoder проецируется из финальных скрытых состояний encoder, а не вычисляется независимо на каждом слое.
Практическое следствие такого дизайна: на этапе prefill (обработка входа) модель активирует 8B параметров на токен, на этапе decode (генерация выхода) — 16B параметров на токен. Для задач с большим объёмом входных данных — анализ длинных документов, RAG, агентные циклы с tool calling — затраты на вычисления по входу значительно ниже, чем можно ожидать от 552B суммарных параметров.
Слой MoE содержит 1 общего эксперта и 384 маршрутизируемых, из которых на каждый токен активируются 6. Модель также включает 196B-параметровую Engram conditional memory, доступ к которой осуществляется разреженно через token-based lookup.
Сжатие KV cache. V4.1 Flash использует Compressed Sparse Attention 2 (CSA2), которая назначает каждому слою внимания один из трёх статических режимов — Full, Reindex или Reuse — для совместного использования KV-состояний между слоями. В сочетании с FP4-кэшированием основных KV (формат E2M1) объём глобального KV cache снижается до примерно 890 байт на токен. По сравнению с V4 Flash это примерно 1/4 по HBM и 1/8 по SSD для постоянного кэша.
Для пользователей API улучшение KV cache напрямую отражается в более низкой цене cache hit и меньшей задержке первого токена на длинных контекстах.
Нативная мультимодальность: поддержка изображений
V4.1 Flash обрабатывает изображения нативно. В отличие от V4-Flash-Vision-Exp (где vision encoder был добавлен поверх V4 Flash), V4.1 Flash обучена с нуля как мультимодальная модель — vision encoder (DeepSeek-ViT с 2D-RoPE и 3×3 pixel-unshuffle downsampling) и двухслойный MLP-проектор участвовали в предобучении на 45T токенах вместе с текстом.
Отправка изображения выглядит так:
response = client.chat.completions.create(
model="deepseek-flash",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Опишите эту архитектурную диаграмму."},
{
"type": "image_url",
"image_url": {"url": "https://example.com/diagram.png"},
},
],
}
],
)
Поддерживается и base64-кодированные изображения. Работа с изображениями доступна на том же slug deepseek-flash — отдельное имя модели не требуется.
По внутренним бенчмаркам DeepSeek, V4.1 Flash показывает 56.5 на MMMU-Pro, 77.9 на CVBench и 95.6 на DocVQA (LLM-Judge). V4 Pro не поддерживает работу с изображениями вообще.
Цены: пиковые, внепиковые и экономика кэширования
V4.1 Flash использует тарификацию по времени суток. Внепиковые цены составляют 50% от пиковых. Пиковые часы — 01:00–04:00 и 06:00–10:00 UTC по рабочим дням; всё остальное время — внепиковое.
| Внепиковые | Пиковые | |
|---|---|---|
| Вход (cache miss) | $0.15 / 1M tokens | $0.30 / 1M tokens |
| Вход (cache hit) | $0.003 / 1M tokens | $0.006 / 1M tokens |
| Выход | $0.60 / 1M tokens | $1.20 / 1M tokens |
Цена входных токенов при cache hit на 98% ниже, чем при cache miss. Для агентных нагрузок, где каждый запрос повторно отправляет длинный system prompt или определения инструментов, процент cache hit напрямую определяет реальную стоимость. Сжатие KV cache в V4.1 Flash позволяет DeepSeek предлагать эти низкие цены за cache hit, одновременно размещая больше параллельных контекстов на GPU.
Сравнение с V4 Pro:
| V4.1 Flash (внепиковые) | V4 Pro (внепиковые) | |
|---|---|---|
| Вход (cache miss) | $0.15 | $0.66 |
| Вход (cache hit) | $0.003 | $0.022 |
| Выход | $0.60 | $1.98 |
V4.1 Flash примерно в 4 раза дешевле по входу и в 3 раза дешевле по выходу по сравнению с V4 Pro во внепиковые часы, при этом превосходит V4 Pro по большинству бенчмарков.
Источник: DeepSeek Models & Pricing, получено 11 сентября 2026 года.
Режим reasoning и возможности рассуждения
V4.1 Flash поддерживает как thinking, так и non-thinking режим. Thinking включён по умолчанию — модель генерирует цепочку рассуждений в поле reasoning_content перед финальным ответом.
Отключение thinking:
response = client.chat.completions.create(
model="deepseek-flash",
messages=[{"role": "user", "content": "Кратко изложите этот текст."}],
extra_body={"thinking": {"type": "disabled"}},
)
V4.1 Flash также поддерживает непрерывно настраиваемый reasoning effort от 1 до 100. На максимальном уровне (100) она достигает рейтинга Codeforces 3471 (V4 Pro — 3348), 90.9 на GPQA Diamond и 65.6 на MathArena Apex.
На агентных бенчмарках при максимальном effort V4.1 Flash выделяется:
- Terminal-Bench 2.1: 90.6 (Opus 5.0 — 89.1, GPT-5.6 Sol — 88.8)
- DeepSWE v1.1: 74.2 (GPT-5.6 Sol — 73.0)
- AutomationBench: 54.8 (Opus 5.0 — 50.3)
- Agent's Last Exam: 31.8 (лучший результат среди всех перечисленных моделей)
Это данные, опубликованные производителем. Модель только вышла, независимые оценки ещё формируются.
Источник: DeepSeek V4.1 Flash Technical Report, получено 11 сентября 2026 года.
Поддерживаемые возможности
| Возможность | Поддержка |
|---|---|
| JSON Output | Да |
| Tool Calls / Function Calling | Да |
| Responses API | Да |
| Формат Anthropic API | Да |
| Chat Prefix Completion (Beta) | Да |
| FIM Completion (Beta) | Только в non-thinking mode |
| Ввод изображений | Да |
| Длина контекста | 1M tokens |
| Максимальный выход | 384K tokens |
| Лимит параллельных запросов | 2 500 |
DeepSeek также поддерживает формат Anthropic messages API по адресу https://api.deepseek.com/anthropic. Если ваш стек использует Anthropic SDK, можно направить его на DeepSeek без перехода на формат OpenAI.
Источник: DeepSeek API Docs, получено 11 сентября 2026 года.
Миграция имён моделей: что выведено из эксплуатации
V4.1 Flash немедленно заменяет две модели:
| Выведенная модель | Legacy slug | Поведение маршрутизации |
|---|---|---|
| V4 Flash | deepseek-v4-flash | Теперь маршрутизируется на V4.1 Flash по тарифам V4.1 Flash |
| V4-Flash-Vision-Exp | deepseek-v4-flash-vision-exp | Теперь маршрутизируется на V4.1 Flash по тарифам V4.1 Flash |
С 14 сентября 2026 года, 04:00 UTC, запросы к deepseek-v4-pro тоже будут маршрутизироваться на V4.1 Flash по тарифам V4.1 Flash. Позже DeepSeek уточнил, что API-сервис V4 Pro продолжит работать после 14 сентября с прежней тарификацией; дополнительные уведомления будут опубликованы при изменениях.
Если ваш код использует deepseek-v4-flash или deepseek-v4-flash-vision-exp, он продолжит работать — slug-и молча резолвятся в V4.1 Flash. Но мы рекомендуем перейти на deepseek-flash, чтобы избежать путаницы при запуске V4.1 Pro.
Источник: DeepSeek V4.1 Flash Announcement, получено 11 сентября 2026 года.
Типичные ошибки и подводные камни
429 Too Many Requests. У V4.1 Flash лимит 2 500 параллельных запросов на аккаунт. Если получаете 429, можно подать заявку на расширение без дополнительной платы. Запрос считается одним параллельным соединением от отправки до завершения ответа модели.
Thinking включён по умолчанию. При миграции с V4 Flash, если вы ожидаете поведение без рассуждений, thinking нужно явно отключать в каждом запросе. Значение по умолчанию изменилось.
Legacy-имена моделей продолжают работать, но тарификация другая. deepseek-v4-flash и deepseek-v4-flash-vision-exp теперь тарифицируются по ценам V4.1 Flash, которые ниже оригинальных цен V4 Flash. Ваши затраты могут снизиться без изменений в коде.
FIM Completion требует отключения thinking. Fill-in-the-Middle completion работает только при отключённом thinking. Отправка FIM-запроса с включённым thinking вернёт ошибку.
Учёт токенов для изображений. Изображения потребляют токены в зависимости от разрешения после downsampling. Диаграмма высокого разрешения может потребить значительно больше входных токенов, чем ожидалось. Отслеживайте потребление токенов при первом использовании vision.
Лимиты запросов и параллелизм
| Модель | Лимит параллелизма |
|---|---|
deepseek-flash (V4.1 Flash) | 2 500 |
deepseek-v4-pro | 500 |
Лимиты действуют на уровне аккаунта, независимо от используемого API key. Для изоляции по пользователям передавайте параметр user_id. DeepSeek использует его для изоляции безопасности контента, KV cache и планировщика.
Источник: DeepSeek Rate Limit & Isolation, получено 11 сентября 2026 года.
Интеграция с TheRouter: V4.1 Flash в цепочках fallback
TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров, поэтому V4.1 Flash можно добавить в конфигурацию маршрутизации наряду с другими моделями.
Практичный паттерн: V4.1 Flash как модель по умолчанию для общих задач, с fallback на другого провайдера при 5xx или таймауте от DeepSeek.
# Пример: V4.1 Flash — основная, Qwen3.7-Max — резервная
models:
- provider: deepseek
model: deepseek-flash
priority: 1
- provider: dashscope
model: qwen3.7-max
priority: 2
Лимит параллелизма 2 500 и низкие цены V4.1 Flash делают её сильным кандидатом на первую позицию в высоконагруженных конфигурациях маршрутизации. Для задач с visual input V4.1 Flash — одна из самых доступных мультимодальных моделей через OpenAI-совместимый API.
Подробнее о fallback-маршрутизации — в нашем руководстве по model fallbacks.
Чеклист перед production-запуском
Перед деплоем V4.1 Flash в production проверьте:
- Обновите model slug. Замените
deepseek-v4-flash/deepseek-v4-flash-vision-expнаdeepseek-flash. - Явно указывайте режим thinking. Не полагайтесь на значение по умолчанию. Если нужно поведение без рассуждений, отключайте thinking в каждом запросе.
- Протестируйте visual input при миграции с Vision-Exp. Vision encoder в V4.1 Flash отличается от экспериментальной версии. Прогоните тесты обработки изображений на новой модели.
- Мониторьте cache hit rate. Сжатый KV cache в V4.1 Flash меняет поведение кэширования. Отслеживайте
prompt_tokens_details.cached_tokensв ответах для понимания реальной стоимости входа. - Оцените запас по параллелизму. Лимит по умолчанию вырос до 2 500. Если раньше вы упирались в ограничения, теперь может быть место для увеличения throughput.
- Планируйте гибкие задачи на внепиковые часы. Внепиковые цены вдвое ниже пиковых. Батч-задачи, оценки и не чувствительные к задержке процессы лучше запускать вне пиковых часов (всё кроме 01:00–04:00 и 06:00–10:00 UTC по рабочим дням).
Итоги
DeepSeek V4.1 Flash объединяет в одной модели многое: 552B MoE-параметров с асимметричной активацией 8B/16B, нативную поддержку изображений, контекст на 1M токенов, режим thinking с настраиваемым effort и цены от $0.15/M входных токенов во внепиковые часы. Одним обновлением она заменяет V4 Flash, V4-Flash-Vision-Exp и частично V4 Pro.
Для операторов маршрутизации ключевые факты: модель OpenAI-совместима по адресу https://api.deepseek.com, slug — deepseek-flash, лимит параллелизма — 2 500, агентные бенчмарки на уровне frontier-моделей при значительно меньшей стоимости.