DeepSeek V4.1 Flash vs Qwen3.8-Flash-Next: сравнение flash-моделей на DashScope для операторов маршрутизации
Прямое сравнение DeepSeek V4.1 Flash и Qwen3.8-Flash-Next — двух ведущих flash-моделей на DashScope — по архитектуре, ценам, бенчмаркам, мультимодальности и стратегиям маршрутизации через OpenAI-совместимый шлюз.
На OpenAI-совместимом endpoint DashScope теперь работают две flash-модели одновременно. DeepSeek V4.1 Flash появился 10 сентября 2026 года, Qwen3.8-Flash-Next — 26 августа. Они используют один base_url, один API-ключ Aliyun и один биллинг-аккаунт. Оператору достаточно поменять поле model — и выбор правильного значения является темой этого сравнения.
Мы рассмотрели архитектуру, pricing через прямой DeepSeek API и DashScope, данные бенчмарков от независимых оценщиков, а также практические сценарии routing.
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
Сводная таблица
| Параметр | DeepSeek V4.1 Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Всего параметров | 552B backbone (763B с vision) | 125B (176B с vision) |
| Активных параметров | 8B input / 16B output | 6B на token |
| Архитектура | Causal Encoder-Decoder MoE | Hybrid Attention MoE (QSA + Gated DeltaNet) |
| Контекстное окно | 1M tokens | 1M tokens |
| Макс. output | 384K tokens | Не опубликовано |
| Мультимодальность | Текст + изображения (нативно) | Текст + изображения + аудио + видео |
| Thinking mode | Да (по умолчанию вкл., переключаемый) | Да (гибридный, переключаемый) |
| DeepSeek API (off-peak, input/1M) | $0.15 | Н/Д |
| DeepSeek API (off-peak, output/1M) | $0.60 | Н/Д |
| DashScope (input/1M) | ¥1 (~$0.14) | ¥1.1 (~$0.15) |
| DashScope (output/1M) | ¥2 (~$0.28) | ¥3.4 (~$0.47) |
| Cache hit (DeepSeek) | $0.003/1M off-peak | Н/Д |
| KV Cache footprint | ~890 байт/token (4× меньше V4 Flash) | Стандартный |
| Лицензия | MIT | Qwen Community License 1.0 |
| Дата релиза | 10 сентября 2026 | 26 августа 2026 |
Кратко. V4.1 Flash дешевле по output-токенам, имеет документированный лимит output в 384K, использует самое агрессивное сжатие KV cache среди flash-моделей и лидирует на бенчмарках agentic coding. Flash-Next поддерживает больше входных модальностей (аудио и видео помимо изображений), немного дешевле по input-токенам на DashScope и демонстрирует конкурентоспособную производительность при значительно меньшем количестве параметров.
Архитектура
DeepSeek V4.1 Flash
Ключевая инновация V4.1 Flash — архитектура Causal Encoder-Decoder (CED). 40 слоёв Transformer разделены на две половины: 20-слойный causal encoder обрабатывает input, 20-слойный decoder генерирует output. Глобальный KV cache декодера проецируется один раз из финальных hidden states энкодера и затем переиспользуется всеми слоями декодера. Поэтому на этапе prefill активируются только 8B параметров, а на этапе decode — 16B.
Поверх CED работает Compressed Sparse Attention 2 (CSA2). Каждый attention-слой получает один из трёх статических режимов — Full, Reindex или Reuse — для совместного использования KV-данных и sparse-attention индексов между слоями вместо независимого пересчёта. Итоговый footprint KV cache составляет около 890 байт на token. По данным DeepSeek, это в 4 раза меньше, чем у V4 Flash, и в 437 раз меньше, чем у DeepSeek V1.
FP4-квантизация в формате E2M1 с масштабирующими факторами E4M3 на 16 каналов дополнительно сжимает хранение без отдельного этапа квантизации.
Модель также включает 196B-параметровую Engram conditional memory (разреженный доступ по token-based lookup), DSpark speculative decoding и vision encoder (DeepSeek-ViT), обученный с нуля.
Qwen3.8-Flash-Next
Flash-Next использует другой подход. Это 125B-параметровая MoE-модель с 6B активных параметров на token плюс 51B vision encoder — итого 176B с мультимодальными компонентами. Архитектура вводит Hybrid Attention с Query-Shared Attention (QSA) и Gated DeltaNet, комбинируя стандартный Transformer-attention с вариантами линейного attention для снижения потребления памяти при работе с длинным контекстом.
Модель поддерживает текст, изображения, аудио и видео — более широкий мультимодальный охват, чем у V4.1 Flash с его текстом и изображениями.
При общем количестве параметров примерно в 6 раз меньше, чем у V4.1 Flash, Flash-Next компенсирует масштаб архитектурной эффективностью attention-механизма.
Pricing
DeepSeek Direct API (только V4.1 Flash)
| Off-peak | Peak | |
|---|---|---|
| Input (cache miss) | $0.15/1M | $0.30/1M |
| Input (cache hit) | $0.003/1M | $0.006/1M |
| Output | $0.60/1M | $1.20/1M |
Peak-часы: 01:00–04:00 и 06:00–10:00 UTC, пн–пт. Всё остальное — off-peak, включая выходные. Для нагрузок, которые можно перенести на off-peak, прямой DeepSeek API даёт самую низкую стоимость flash-tier среди всех крупных провайдеров.
Cache hit rate имеет критическое значение. При $0.003/1M agent-workload с длинными системными промтами и повторяющимися tool-output-ами обходится в доли от номинальной цены input.
DashScope (обе модели)
| DeepSeek V4.1 Flash | Qwen3.8-Flash-Next | |
|---|---|---|
| Input | ¥1/1M (~$0.14) | ¥1.1/1M (~$0.15) |
| Output | ¥2/1M (~$0.28) | ¥3.4/1M (~$0.47) |
| Implicit cache hit | ¥0.2/1M (~$0.028) | ¥0.11/1M (~$0.015) |
На DashScope V4.1 Flash значительно дешевле по output: ¥2 против ¥3.4 — разница 41%. Input-pricing почти одинаков. Для output-интенсивных нагрузок (генерация кода, длинные ответы, цепочки reasoning в agent-режиме) V4.1 Flash экономичнее даже внутри экосистемы DashScope.
Flash-Next имеет более низкую цену implicit cache hit (¥0.11 против ¥0.2), поэтому при интенсивном переиспользовании контекстных prefix-ов разрыв в стоимости запроса сужается. Но в большинстве сценариев разница в цене output-токенов определяет итоговые затраты.
Бенчмарки
По данным независимого сравнения llm-stats.com (получено 15 сентября 2026), из 5 бенчмарков, по которым обе модели имеют данные, DeepSeek V4.1 Flash лидирует в 3, Qwen3.8-Flash-Next — в 2.
| Бенчмарк | V4.1 Flash | Flash-Next | Лидер |
|---|---|---|---|
| DeepSWE v1.1 (agentic coding) | 74.2 | Отстаёт | V4.1 Flash |
| Humanity's Last Exam | Выше | Ниже | V4.1 Flash |
| NL2Repo | Выше | Ниже | V4.1 Flash |
| Agents' Last Exam | Ниже | Выше | Flash-Next |
| GPQA (вопросы уровня аспирантуры) | Ниже | Выше | Flash-Next |
V4.1 Flash также показывает Codeforces Rating 3471 (наивысший среди сравниваемых моделей), Terminal-Bench 2.1 — 90.6, CyberGym — 88.1. Эти данные из технического отчёта DeepSeek; независимого воспроизведения на единой evaluation-suite пока нет.
Flash-Next, по официальным данным Alibaba, «сопоставим по возможностям с Qwen3.7-Plus», особенно в задачах coding и agent-взаимодействия. При 6B активных параметров на token это впечатляющий уровень эффективности.
Закономерность из имеющихся данных: V4.1 Flash лидирует на agentic coding и tool-use бенчмарках, Flash-Next конкурентоспособен на reasoning и general knowledge, что особенно заметно при его в 3 раза меньшем count активных параметров.
Мультимодальность
Обе модели принимают текст и изображения. Разница в охвате.
DeepSeek V4.1 Flash поддерживает текст и изображения через нативный DeepSeek-ViT vision encoder, обученный совместно с языковой моделью. Аудио и видео не поддерживаются.
Qwen3.8-Flash-Next поддерживает текст, изображения, аудио и видео. Это единственная flash-модель на DashScope, способная обрабатывать аудио-фрагменты или видео-кадры наряду с текстом.
Если ваш pipeline ограничен текстом и изображениями, оба варианта подходят. Если требуется транскрипция аудио, анализ видео-кадров или мультимодальный reasoning с четырьмя типами входных данных, Flash-Next — единственный выбор в этом tier.
Контекстное окно и лимит output
Обе модели поддерживают контекстные окна до 1M tokens. Практическая разница — в лимитах output.
V4.1 Flash документирует 384K максимальный output — самый высокий опубликованный output-лимит среди flash-моделей.
Qwen3.8-Flash-Next не публикует максимальное количество output-токенов. На практике действует дефолтный max_tokens DashScope, и эффективный лимит, вероятно, ниже документированного потолка V4.1 Flash.
Для задач, требующих очень длинных output-ов (генерация целых файлов, комплексные аналитические отчёты, multi-file code generation), документированный лимит 384K у V4.1 Flash даёт конкретную гарантию, которой Flash-Next публично не соответствует.
Скорость и throughput
Асимметричная активация V4.1 Flash (8B input / 16B output) напрямую ускоряет prefill-фазу. Обработка длинного промта задействует вдвое меньше параметров, чем генерация, что даёт более быстрый time-to-first-token для prompt-интенсивных нагрузок.
DeepSeek устанавливает лимит concurrency на прямом API в 2 500 RPM — в 5 раз больше, чем 500 RPM у V4 Pro. Rate limits DashScope для обеих моделей определяются уровневой системой Aliyun и не публикуются для отдельных моделей.
Активные 6B параметров Flash-Next теоретически тоже обеспечивают быстрый inference, но Alibaba не публикует throughput-бенчмарки Flash-Next в tokens/sec, что делает прямое сравнение скорости невозможным.
Для latency-критичных приложений прямой DeepSeek API с лимитом 2 500 RPM и off-peak pricing обеспечивает наиболее предсказуемый throughput-профиль.
Когда выбирать какую модель
DeepSeek V4.1 Flash
- Нагрузка текст или текст + изображения, нужна минимальная стоимость output в flash-tier
- Требуются длинные output-ы (до 384K tokens)
- Основной сценарий — agentic coding (лидерство на Terminal-Bench, DeepSWE, CyberGym)
- Нагрузки можно перенести на off-peak для снижения стоимости вдвое
- Экономика KV cache важна: 890 байт/token означает кардинально дешёвые cache-intensive agent-циклы
- Нужен прямой DeepSeek API как fallback-путь помимо DashScope
Qwen3.8-Flash-Next
- Нагрузке нужен аудио- или видео-input наряду с текстом и изображениями
- Reasoning и general knowledge важнее coding-производительности
- Все вызовы должны идти через единый DashScope-аккаунт без дополнительного DeepSeek API-ключа
- Implicit cache hit ¥0.11/1M выгоднее для конкретного паттерна переиспользования prefix-ов
- Нужна консистентность с экосистемой Qwen в routing-конфигурации
Оба через TheRouter
V4.1 Flash как primary для текстовых/image-нагрузок и coding. Flash-Next как fallback для запросов с аудио/видео или при повышенной latency DeepSeek API. Обе модели на одном DashScope endpoint, routing-конфигурация меняет только параметр model.
# TheRouter fallback: DashScope flash tier
- provider: dashscope
model: deepseek-v4-flash # Routes to V4.1 Flash
priority: 1
- provider: dashscope
model: qwen3.8-flash-next # Fallback
priority: 2
Часто задаваемые вопросы
Обе модели доступны через один endpoint DashScope?
Да. Обе используют https://dashscope.aliyuncs.com/compatible-mode/v1 с одним API-ключом. Разница только в значении параметра model.
Можно ли использовать прямой DeepSeek API для V4.1 Flash вместо DashScope?
Да. V4.1 Flash доступен на https://api.deepseek.com под именем deepseek-flash. Прямой API имеет peak/off-peak pricing и лимит 2 500 RPM. Qwen3.8-Flash-Next через DeepSeek API недоступен.
Какая модель лучше для coding?
V4.1 Flash лидирует на опубликованных бенчмарках agentic coding (DeepSWE v1.1, Terminal-Bench 2.1, Codeforces Rating 3471). Flash-Next конкурентоспособен, но уступает на этих конкретных evaluation-ах. Для чистых coding-нагрузок V4.1 Flash — более сильный выбор.
Какая модель принимает больше типов input?
Flash-Next поддерживает текст, изображения, аудио и видео. V4.1 Flash — текст и изображения. Если pipeline включает аудио или видео, Flash-Next — единственный вариант в этом tier.
Как сравнить экономику KV cache?
V4.1 Flash имеет footprint KV cache 890 байт/token (4× меньше V4 Flash), что даёт дешёвый cache hit на прямом DeepSeek API ($0.003/1M off-peak). На DashScope ситуация обратная: implicit cache hit Flash-Next дешевле (¥0.11 vs ¥0.2). Итог зависит от маршрута API и процента cache hit.
Обе модели поддерживают function calling?
Да. Через DashScope endpoint обе поддерживают OpenAI-совместимый function calling. V4.1 Flash через прямой DeepSeek API дополнительно поддерживает JSON output и Responses API.
Источники
- DeepSeek V4.1 Flash announcement — api-docs.deepseek.com/news/news260910 (получено 15 сентября 2026)
- DeepSeek API pricing — api-docs.deepseek.com/quick_start/pricing (получено 15 сентября 2026)
- DashScope model pricing — help.aliyun.com/zh/model-studio/model-pricing (получено 15 сентября 2026)
- V4.1 Flash architecture specs — mindstudio.ai/blog/deepseek-v4-1-flash-specs-architecture (получено 15 сентября 2026)
- llm-stats.com head-to-head — llm-stats.com/models/compare/deepseek-v4.1-flash-vs-qwen3.8-flash-next (получено 15 сентября 2026)
- Qwen3.8-Flash-Next announcement — qwen.ai/blog?id=qwen3.8-flash-next (получено 15 сентября 2026)
- DashScope DeepSeek V4 Flash model page — help.aliyun.com/en/model-studio/deepseek-v4-flash (получено 15 сентября 2026)