← Все статьи

DeepSeek V4.1 Flash vs Qwen3.8-Flash-Next: сравнение flash-моделей на DashScope для операторов маршрутизации

Прямое сравнение DeepSeek V4.1 Flash и Qwen3.8-Flash-Next — двух ведущих flash-моделей на DashScope — по архитектуре, ценам, бенчмаркам, мультимодальности и стратегиям маршрутизации через OpenAI-совместимый шлюз.

· updated 2026-09-15· TheRouter

На OpenAI-совместимом endpoint DashScope теперь работают две flash-модели одновременно. DeepSeek V4.1 Flash появился 10 сентября 2026 года, Qwen3.8-Flash-Next — 26 августа. Они используют один base_url, один API-ключ Aliyun и один биллинг-аккаунт. Оператору достаточно поменять поле model — и выбор правильного значения является темой этого сравнения.

Мы рассмотрели архитектуру, pricing через прямой DeepSeek API и DashScope, данные бенчмарков от независимых оценщиков, а также практические сценарии routing.

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Сводная таблица

ПараметрDeepSeek V4.1 FlashQwen3.8-Flash-Next
Всего параметров552B backbone (763B с vision)125B (176B с vision)
Активных параметров8B input / 16B output6B на token
АрхитектураCausal Encoder-Decoder MoEHybrid Attention MoE (QSA + Gated DeltaNet)
Контекстное окно1M tokens1M tokens
Макс. output384K tokensНе опубликовано
МультимодальностьТекст + изображения (нативно)Текст + изображения + аудио + видео
Thinking modeДа (по умолчанию вкл., переключаемый)Да (гибридный, переключаемый)
DeepSeek API (off-peak, input/1M)$0.15Н/Д
DeepSeek API (off-peak, output/1M)$0.60Н/Д
DashScope (input/1M)¥1 (~$0.14)¥1.1 (~$0.15)
DashScope (output/1M)¥2 (~$0.28)¥3.4 (~$0.47)
Cache hit (DeepSeek)$0.003/1M off-peakН/Д
KV Cache footprint~890 байт/token (4× меньше V4 Flash)Стандартный
ЛицензияMITQwen Community License 1.0
Дата релиза10 сентября 202626 августа 2026

Кратко. V4.1 Flash дешевле по output-токенам, имеет документированный лимит output в 384K, использует самое агрессивное сжатие KV cache среди flash-моделей и лидирует на бенчмарках agentic coding. Flash-Next поддерживает больше входных модальностей (аудио и видео помимо изображений), немного дешевле по input-токенам на DashScope и демонстрирует конкурентоспособную производительность при значительно меньшем количестве параметров.

Архитектура

DeepSeek V4.1 Flash

Ключевая инновация V4.1 Flash — архитектура Causal Encoder-Decoder (CED). 40 слоёв Transformer разделены на две половины: 20-слойный causal encoder обрабатывает input, 20-слойный decoder генерирует output. Глобальный KV cache декодера проецируется один раз из финальных hidden states энкодера и затем переиспользуется всеми слоями декодера. Поэтому на этапе prefill активируются только 8B параметров, а на этапе decode — 16B.

Поверх CED работает Compressed Sparse Attention 2 (CSA2). Каждый attention-слой получает один из трёх статических режимов — Full, Reindex или Reuse — для совместного использования KV-данных и sparse-attention индексов между слоями вместо независимого пересчёта. Итоговый footprint KV cache составляет около 890 байт на token. По данным DeepSeek, это в 4 раза меньше, чем у V4 Flash, и в 437 раз меньше, чем у DeepSeek V1.

FP4-квантизация в формате E2M1 с масштабирующими факторами E4M3 на 16 каналов дополнительно сжимает хранение без отдельного этапа квантизации.

Модель также включает 196B-параметровую Engram conditional memory (разреженный доступ по token-based lookup), DSpark speculative decoding и vision encoder (DeepSeek-ViT), обученный с нуля.

Qwen3.8-Flash-Next

Flash-Next использует другой подход. Это 125B-параметровая MoE-модель с 6B активных параметров на token плюс 51B vision encoder — итого 176B с мультимодальными компонентами. Архитектура вводит Hybrid Attention с Query-Shared Attention (QSA) и Gated DeltaNet, комбинируя стандартный Transformer-attention с вариантами линейного attention для снижения потребления памяти при работе с длинным контекстом.

Модель поддерживает текст, изображения, аудио и видео — более широкий мультимодальный охват, чем у V4.1 Flash с его текстом и изображениями.

При общем количестве параметров примерно в 6 раз меньше, чем у V4.1 Flash, Flash-Next компенсирует масштаб архитектурной эффективностью attention-механизма.

Pricing

DeepSeek Direct API (только V4.1 Flash)

Off-peakPeak
Input (cache miss)$0.15/1M$0.30/1M
Input (cache hit)$0.003/1M$0.006/1M
Output$0.60/1M$1.20/1M

Peak-часы: 01:00–04:00 и 06:00–10:00 UTC, пн–пт. Всё остальное — off-peak, включая выходные. Для нагрузок, которые можно перенести на off-peak, прямой DeepSeek API даёт самую низкую стоимость flash-tier среди всех крупных провайдеров.

Cache hit rate имеет критическое значение. При $0.003/1M agent-workload с длинными системными промтами и повторяющимися tool-output-ами обходится в доли от номинальной цены input.

DashScope (обе модели)

DeepSeek V4.1 FlashQwen3.8-Flash-Next
Input¥1/1M (~$0.14)¥1.1/1M (~$0.15)
Output¥2/1M (~$0.28)¥3.4/1M (~$0.47)
Implicit cache hit¥0.2/1M (~$0.028)¥0.11/1M (~$0.015)

На DashScope V4.1 Flash значительно дешевле по output: ¥2 против ¥3.4 — разница 41%. Input-pricing почти одинаков. Для output-интенсивных нагрузок (генерация кода, длинные ответы, цепочки reasoning в agent-режиме) V4.1 Flash экономичнее даже внутри экосистемы DashScope.

Flash-Next имеет более низкую цену implicit cache hit (¥0.11 против ¥0.2), поэтому при интенсивном переиспользовании контекстных prefix-ов разрыв в стоимости запроса сужается. Но в большинстве сценариев разница в цене output-токенов определяет итоговые затраты.

Бенчмарки

По данным независимого сравнения llm-stats.com (получено 15 сентября 2026), из 5 бенчмарков, по которым обе модели имеют данные, DeepSeek V4.1 Flash лидирует в 3, Qwen3.8-Flash-Next — в 2.

БенчмаркV4.1 FlashFlash-NextЛидер
DeepSWE v1.1 (agentic coding)74.2ОтстаётV4.1 Flash
Humanity's Last ExamВышеНижеV4.1 Flash
NL2RepoВышеНижеV4.1 Flash
Agents' Last ExamНижеВышеFlash-Next
GPQA (вопросы уровня аспирантуры)НижеВышеFlash-Next

V4.1 Flash также показывает Codeforces Rating 3471 (наивысший среди сравниваемых моделей), Terminal-Bench 2.1 — 90.6, CyberGym — 88.1. Эти данные из технического отчёта DeepSeek; независимого воспроизведения на единой evaluation-suite пока нет.

Flash-Next, по официальным данным Alibaba, «сопоставим по возможностям с Qwen3.7-Plus», особенно в задачах coding и agent-взаимодействия. При 6B активных параметров на token это впечатляющий уровень эффективности.

Закономерность из имеющихся данных: V4.1 Flash лидирует на agentic coding и tool-use бенчмарках, Flash-Next конкурентоспособен на reasoning и general knowledge, что особенно заметно при его в 3 раза меньшем count активных параметров.

Мультимодальность

Обе модели принимают текст и изображения. Разница в охвате.

DeepSeek V4.1 Flash поддерживает текст и изображения через нативный DeepSeek-ViT vision encoder, обученный совместно с языковой моделью. Аудио и видео не поддерживаются.

Qwen3.8-Flash-Next поддерживает текст, изображения, аудио и видео. Это единственная flash-модель на DashScope, способная обрабатывать аудио-фрагменты или видео-кадры наряду с текстом.

Если ваш pipeline ограничен текстом и изображениями, оба варианта подходят. Если требуется транскрипция аудио, анализ видео-кадров или мультимодальный reasoning с четырьмя типами входных данных, Flash-Next — единственный выбор в этом tier.

Контекстное окно и лимит output

Обе модели поддерживают контекстные окна до 1M tokens. Практическая разница — в лимитах output.

V4.1 Flash документирует 384K максимальный output — самый высокий опубликованный output-лимит среди flash-моделей.

Qwen3.8-Flash-Next не публикует максимальное количество output-токенов. На практике действует дефолтный max_tokens DashScope, и эффективный лимит, вероятно, ниже документированного потолка V4.1 Flash.

Для задач, требующих очень длинных output-ов (генерация целых файлов, комплексные аналитические отчёты, multi-file code generation), документированный лимит 384K у V4.1 Flash даёт конкретную гарантию, которой Flash-Next публично не соответствует.

Скорость и throughput

Асимметричная активация V4.1 Flash (8B input / 16B output) напрямую ускоряет prefill-фазу. Обработка длинного промта задействует вдвое меньше параметров, чем генерация, что даёт более быстрый time-to-first-token для prompt-интенсивных нагрузок.

DeepSeek устанавливает лимит concurrency на прямом API в 2 500 RPM — в 5 раз больше, чем 500 RPM у V4 Pro. Rate limits DashScope для обеих моделей определяются уровневой системой Aliyun и не публикуются для отдельных моделей.

Активные 6B параметров Flash-Next теоретически тоже обеспечивают быстрый inference, но Alibaba не публикует throughput-бенчмарки Flash-Next в tokens/sec, что делает прямое сравнение скорости невозможным.

Для latency-критичных приложений прямой DeepSeek API с лимитом 2 500 RPM и off-peak pricing обеспечивает наиболее предсказуемый throughput-профиль.

Когда выбирать какую модель

DeepSeek V4.1 Flash

  • Нагрузка текст или текст + изображения, нужна минимальная стоимость output в flash-tier
  • Требуются длинные output-ы (до 384K tokens)
  • Основной сценарий — agentic coding (лидерство на Terminal-Bench, DeepSWE, CyberGym)
  • Нагрузки можно перенести на off-peak для снижения стоимости вдвое
  • Экономика KV cache важна: 890 байт/token означает кардинально дешёвые cache-intensive agent-циклы
  • Нужен прямой DeepSeek API как fallback-путь помимо DashScope

Qwen3.8-Flash-Next

  • Нагрузке нужен аудио- или видео-input наряду с текстом и изображениями
  • Reasoning и general knowledge важнее coding-производительности
  • Все вызовы должны идти через единый DashScope-аккаунт без дополнительного DeepSeek API-ключа
  • Implicit cache hit ¥0.11/1M выгоднее для конкретного паттерна переиспользования prefix-ов
  • Нужна консистентность с экосистемой Qwen в routing-конфигурации

Оба через TheRouter

V4.1 Flash как primary для текстовых/image-нагрузок и coding. Flash-Next как fallback для запросов с аудио/видео или при повышенной latency DeepSeek API. Обе модели на одном DashScope endpoint, routing-конфигурация меняет только параметр model.

# TheRouter fallback: DashScope flash tier
- provider: dashscope
  model: deepseek-v4-flash        # Routes to V4.1 Flash
  priority: 1
- provider: dashscope
  model: qwen3.8-flash-next       # Fallback
  priority: 2

Часто задаваемые вопросы

Обе модели доступны через один endpoint DashScope?

Да. Обе используют https://dashscope.aliyuncs.com/compatible-mode/v1 с одним API-ключом. Разница только в значении параметра model.

Можно ли использовать прямой DeepSeek API для V4.1 Flash вместо DashScope?

Да. V4.1 Flash доступен на https://api.deepseek.com под именем deepseek-flash. Прямой API имеет peak/off-peak pricing и лимит 2 500 RPM. Qwen3.8-Flash-Next через DeepSeek API недоступен.

Какая модель лучше для coding?

V4.1 Flash лидирует на опубликованных бенчмарках agentic coding (DeepSWE v1.1, Terminal-Bench 2.1, Codeforces Rating 3471). Flash-Next конкурентоспособен, но уступает на этих конкретных evaluation-ах. Для чистых coding-нагрузок V4.1 Flash — более сильный выбор.

Какая модель принимает больше типов input?

Flash-Next поддерживает текст, изображения, аудио и видео. V4.1 Flash — текст и изображения. Если pipeline включает аудио или видео, Flash-Next — единственный вариант в этом tier.

Как сравнить экономику KV cache?

V4.1 Flash имеет footprint KV cache 890 байт/token (4× меньше V4 Flash), что даёт дешёвый cache hit на прямом DeepSeek API ($0.003/1M off-peak). На DashScope ситуация обратная: implicit cache hit Flash-Next дешевле (¥0.11 vs ¥0.2). Итог зависит от маршрута API и процента cache hit.

Обе модели поддерживают function calling?

Да. Через DashScope endpoint обе поддерживают OpenAI-совместимый function calling. V4.1 Flash через прямой DeepSeek API дополнительно поддерживает JSON output и Responses API.

Источники

Помощь и контакты