← Все статьи

Полное руководство по DeepSeek V4.1 Flash API: архитектура 552B MoE, нативное зрение и маршрутизация с оптимизацией затрат

Всё, что нужно для работы с DeepSeek V4.1 Flash — моделью на 552B параметров MoE, которая активирует лишь 8B на входе. Разбираем архитектуру Causal Encoder-Decoder, нативную поддержку изображений, цены (от $0.15/M входных токенов в непиковые часы), режим reasoning, вызов инструментов и подключение V4.1 Flash к мультипровайдерной маршрутизации.

· TheRouter

DeepSeek V4.1 Flash — это модель Mixture-of-Experts на 552B параметров, активирующая всего 8B параметров на входной токен и 16B на выходной. Она запущена 10 сентября 2026 года и заменяет сразу V4 Flash и V4-Flash-Vision-Exp единым мультимодальным endpoint. Чтобы вызвать её, достаточно указать model: "deepseek-flash" и тот же https://api.deepseek.com — существующий код на OpenAI SDK работает без изменений.

Мы написали это руководство, потому что V4.1 Flash серьёзно перестраивает модельную линейку DeepSeek. V4 Flash и V4-Flash-Vision-Exp выведены из эксплуатации немедленно; с 14 сентября запросы к V4 Pro тоже будут обслуживаться V4.1 Flash. Если вы используете DeepSeek в production, стоит разобраться, что поменялось, как выглядят новые цены и куда V4.1 Flash вписывается в мультипровайдерную маршрутизацию.

Начало работы за 3 минуты

Шаг 1: Создайте аккаунт. Откройте platform.deepseek.com и зарегистрируйтесь через email или Google OAuth.

Шаг 2: Получите API key. Перейдите на страницу API Keys, нажмите «Create API Key» и скопируйте ключ. Он показывается только один раз.

Шаг 3: Сделайте первый вызов.

pip install --upgrade openai
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_KEY",
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[{"role": "user", "content": "Что такое DeepSeek V4.1 Flash?"}],
)

print(response.choices[0].message.content)

На этом интеграция закончена. API DeepSeek следует формату OpenAI chat completions, поэтому любая библиотека или фреймворк с поддержкой OpenAI-совместимых endpoint работает из коробки.

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Обзор архитектуры: Causal Encoder-Decoder с асимметричной активацией

V4.1 Flash вводит новую архитектуру Causal Encoder-Decoder (CED). Модель содержит 40 слоёв Transformer: 20-слойный каузальный encoder и 20-слойный decoder. Глобальный KV cache decoder проецируется из финальных скрытых состояний encoder, а не вычисляется независимо на каждом слое.

Практическое следствие такого дизайна: на этапе prefill (обработка входа) модель активирует 8B параметров на токен, на этапе decode (генерация выхода) — 16B параметров на токен. Для задач с большим объёмом входных данных — анализ длинных документов, RAG, агентные циклы с tool calling — затраты на вычисления по входу значительно ниже, чем можно ожидать от 552B суммарных параметров.

Слой MoE содержит 1 общего эксперта и 384 маршрутизируемых, из которых на каждый токен активируются 6. Модель также включает 196B-параметровую Engram conditional memory, доступ к которой осуществляется разреженно через token-based lookup.

Сжатие KV cache. V4.1 Flash использует Compressed Sparse Attention 2 (CSA2), которая назначает каждому слою внимания один из трёх статических режимов — Full, Reindex или Reuse — для совместного использования KV-состояний между слоями. В сочетании с FP4-кэшированием основных KV (формат E2M1) объём глобального KV cache снижается до примерно 890 байт на токен. По сравнению с V4 Flash это примерно 1/4 по HBM и 1/8 по SSD для постоянного кэша.

Для пользователей API улучшение KV cache напрямую отражается в более низкой цене cache hit и меньшей задержке первого токена на длинных контекстах.

Нативная мультимодальность: поддержка изображений

V4.1 Flash обрабатывает изображения нативно. В отличие от V4-Flash-Vision-Exp (где vision encoder был добавлен поверх V4 Flash), V4.1 Flash обучена с нуля как мультимодальная модель — vision encoder (DeepSeek-ViT с 2D-RoPE и 3×3 pixel-unshuffle downsampling) и двухслойный MLP-проектор участвовали в предобучении на 45T токенах вместе с текстом.

Отправка изображения выглядит так:

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "Опишите эту архитектурную диаграмму."},
                {
                    "type": "image_url",
                    "image_url": {"url": "https://example.com/diagram.png"},
                },
            ],
        }
    ],
)

Поддерживается и base64-кодированные изображения. Работа с изображениями доступна на том же slug deepseek-flash — отдельное имя модели не требуется.

По внутренним бенчмаркам DeepSeek, V4.1 Flash показывает 56.5 на MMMU-Pro, 77.9 на CVBench и 95.6 на DocVQA (LLM-Judge). V4 Pro не поддерживает работу с изображениями вообще.

Цены: пиковые, внепиковые и экономика кэширования

V4.1 Flash использует тарификацию по времени суток. Внепиковые цены составляют 50% от пиковых. Пиковые часы — 01:00–04:00 и 06:00–10:00 UTC по рабочим дням; всё остальное время — внепиковое.

ВнепиковыеПиковые
Вход (cache miss)$0.15 / 1M tokens$0.30 / 1M tokens
Вход (cache hit)$0.003 / 1M tokens$0.006 / 1M tokens
Выход$0.60 / 1M tokens$1.20 / 1M tokens

Цена входных токенов при cache hit на 98% ниже, чем при cache miss. Для агентных нагрузок, где каждый запрос повторно отправляет длинный system prompt или определения инструментов, процент cache hit напрямую определяет реальную стоимость. Сжатие KV cache в V4.1 Flash позволяет DeepSeek предлагать эти низкие цены за cache hit, одновременно размещая больше параллельных контекстов на GPU.

Сравнение с V4 Pro:

V4.1 Flash (внепиковые)V4 Pro (внепиковые)
Вход (cache miss)$0.15$0.66
Вход (cache hit)$0.003$0.022
Выход$0.60$1.98

V4.1 Flash примерно в 4 раза дешевле по входу и в 3 раза дешевле по выходу по сравнению с V4 Pro во внепиковые часы, при этом превосходит V4 Pro по большинству бенчмарков.

Источник: DeepSeek Models & Pricing, получено 11 сентября 2026 года.

Режим reasoning и возможности рассуждения

V4.1 Flash поддерживает как thinking, так и non-thinking режим. Thinking включён по умолчанию — модель генерирует цепочку рассуждений в поле reasoning_content перед финальным ответом.

Отключение thinking:

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[{"role": "user", "content": "Кратко изложите этот текст."}],
    extra_body={"thinking": {"type": "disabled"}},
)

V4.1 Flash также поддерживает непрерывно настраиваемый reasoning effort от 1 до 100. На максимальном уровне (100) она достигает рейтинга Codeforces 3471 (V4 Pro — 3348), 90.9 на GPQA Diamond и 65.6 на MathArena Apex.

На агентных бенчмарках при максимальном effort V4.1 Flash выделяется:

  • Terminal-Bench 2.1: 90.6 (Opus 5.0 — 89.1, GPT-5.6 Sol — 88.8)
  • DeepSWE v1.1: 74.2 (GPT-5.6 Sol — 73.0)
  • AutomationBench: 54.8 (Opus 5.0 — 50.3)
  • Agent's Last Exam: 31.8 (лучший результат среди всех перечисленных моделей)

Это данные, опубликованные производителем. Модель только вышла, независимые оценки ещё формируются.

Источник: DeepSeek V4.1 Flash Technical Report, получено 11 сентября 2026 года.

Поддерживаемые возможности

ВозможностьПоддержка
JSON OutputДа
Tool Calls / Function CallingДа
Responses APIДа
Формат Anthropic APIДа
Chat Prefix Completion (Beta)Да
FIM Completion (Beta)Только в non-thinking mode
Ввод изображенийДа
Длина контекста1M tokens
Максимальный выход384K tokens
Лимит параллельных запросов2 500

DeepSeek также поддерживает формат Anthropic messages API по адресу https://api.deepseek.com/anthropic. Если ваш стек использует Anthropic SDK, можно направить его на DeepSeek без перехода на формат OpenAI.

Источник: DeepSeek API Docs, получено 11 сентября 2026 года.

Миграция имён моделей: что выведено из эксплуатации

V4.1 Flash немедленно заменяет две модели:

Выведенная модельLegacy slugПоведение маршрутизации
V4 Flashdeepseek-v4-flashТеперь маршрутизируется на V4.1 Flash по тарифам V4.1 Flash
V4-Flash-Vision-Expdeepseek-v4-flash-vision-expТеперь маршрутизируется на V4.1 Flash по тарифам V4.1 Flash

С 14 сентября 2026 года, 04:00 UTC, запросы к deepseek-v4-pro тоже будут маршрутизироваться на V4.1 Flash по тарифам V4.1 Flash. Позже DeepSeek уточнил, что API-сервис V4 Pro продолжит работать после 14 сентября с прежней тарификацией; дополнительные уведомления будут опубликованы при изменениях.

Если ваш код использует deepseek-v4-flash или deepseek-v4-flash-vision-exp, он продолжит работать — slug-и молча резолвятся в V4.1 Flash. Но мы рекомендуем перейти на deepseek-flash, чтобы избежать путаницы при запуске V4.1 Pro.

Источник: DeepSeek V4.1 Flash Announcement, получено 11 сентября 2026 года.

Типичные ошибки и подводные камни

429 Too Many Requests. У V4.1 Flash лимит 2 500 параллельных запросов на аккаунт. Если получаете 429, можно подать заявку на расширение без дополнительной платы. Запрос считается одним параллельным соединением от отправки до завершения ответа модели.

Thinking включён по умолчанию. При миграции с V4 Flash, если вы ожидаете поведение без рассуждений, thinking нужно явно отключать в каждом запросе. Значение по умолчанию изменилось.

Legacy-имена моделей продолжают работать, но тарификация другая. deepseek-v4-flash и deepseek-v4-flash-vision-exp теперь тарифицируются по ценам V4.1 Flash, которые ниже оригинальных цен V4 Flash. Ваши затраты могут снизиться без изменений в коде.

FIM Completion требует отключения thinking. Fill-in-the-Middle completion работает только при отключённом thinking. Отправка FIM-запроса с включённым thinking вернёт ошибку.

Учёт токенов для изображений. Изображения потребляют токены в зависимости от разрешения после downsampling. Диаграмма высокого разрешения может потребить значительно больше входных токенов, чем ожидалось. Отслеживайте потребление токенов при первом использовании vision.

Лимиты запросов и параллелизм

МодельЛимит параллелизма
deepseek-flash (V4.1 Flash)2 500
deepseek-v4-pro500

Лимиты действуют на уровне аккаунта, независимо от используемого API key. Для изоляции по пользователям передавайте параметр user_id. DeepSeek использует его для изоляции безопасности контента, KV cache и планировщика.

Источник: DeepSeek Rate Limit & Isolation, получено 11 сентября 2026 года.

Интеграция с TheRouter: V4.1 Flash в цепочках fallback

TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров, поэтому V4.1 Flash можно добавить в конфигурацию маршрутизации наряду с другими моделями.

Практичный паттерн: V4.1 Flash как модель по умолчанию для общих задач, с fallback на другого провайдера при 5xx или таймауте от DeepSeek.

# Пример: V4.1 Flash — основная, Qwen3.7-Max — резервная
models:
  - provider: deepseek
    model: deepseek-flash
    priority: 1
  - provider: dashscope
    model: qwen3.7-max
    priority: 2

Лимит параллелизма 2 500 и низкие цены V4.1 Flash делают её сильным кандидатом на первую позицию в высоконагруженных конфигурациях маршрутизации. Для задач с visual input V4.1 Flash — одна из самых доступных мультимодальных моделей через OpenAI-совместимый API.

Подробнее о fallback-маршрутизации — в нашем руководстве по model fallbacks.

Чеклист перед production-запуском

Перед деплоем V4.1 Flash в production проверьте:

  1. Обновите model slug. Замените deepseek-v4-flash / deepseek-v4-flash-vision-exp на deepseek-flash.
  2. Явно указывайте режим thinking. Не полагайтесь на значение по умолчанию. Если нужно поведение без рассуждений, отключайте thinking в каждом запросе.
  3. Протестируйте visual input при миграции с Vision-Exp. Vision encoder в V4.1 Flash отличается от экспериментальной версии. Прогоните тесты обработки изображений на новой модели.
  4. Мониторьте cache hit rate. Сжатый KV cache в V4.1 Flash меняет поведение кэширования. Отслеживайте prompt_tokens_details.cached_tokens в ответах для понимания реальной стоимости входа.
  5. Оцените запас по параллелизму. Лимит по умолчанию вырос до 2 500. Если раньше вы упирались в ограничения, теперь может быть место для увеличения throughput.
  6. Планируйте гибкие задачи на внепиковые часы. Внепиковые цены вдвое ниже пиковых. Батч-задачи, оценки и не чувствительные к задержке процессы лучше запускать вне пиковых часов (всё кроме 01:00–04:00 и 06:00–10:00 UTC по рабочим дням).

Итоги

DeepSeek V4.1 Flash объединяет в одной модели многое: 552B MoE-параметров с асимметричной активацией 8B/16B, нативную поддержку изображений, контекст на 1M токенов, режим thinking с настраиваемым effort и цены от $0.15/M входных токенов во внепиковые часы. Одним обновлением она заменяет V4 Flash, V4-Flash-Vision-Exp и частично V4 Pro.

Для операторов маршрутизации ключевые факты: модель OpenAI-совместима по адресу https://api.deepseek.com, slug — deepseek-flash, лимит параллелизма — 2 500, агентные бенчмарки на уровне frontier-моделей при значительно меньшей стоимости.

Модели, упомянутые в статье

Помощь и контакты