← Все статьи

DeepSeek V4.1 Flash vs Qwen3.8-Max: кросс-уровневое сравнение для операторов маршрутизации DashScope

DeepSeek V4.1 Flash активирует 8B параметров на входной токен и стоит ¥1/млн на DashScope. Qwen3.8-Max содержит 2.4T параметров и нативно понимает видео. Оба работают через один и тот же OpenAI-совместимый endpoint DashScope. Мы сравнили архитектуру, цены, бенчмарки и мультимодальные возможности, чтобы помочь операторам маршрутизации выбрать подходящую модель.

· updated 2026-10-05· TheRouter

На DashScope сейчас работают две принципиально разные модели. DeepSeek V4.1 Flash вышла 10 сентября 2026 года — это flash-уровень, который при этом превосходит флагман предыдущего поколения V4 Pro по всем опубликованным бенчмаркам. Qwen3.8-Max появилась 3 августа 2026 года — 2.4 триллиона параметров, самый высокий композитный балл среди китайских моделей на независимых агрегаторах, самое широкое мультимодальное покрытие.

Обе модели используют один и тот же base_url, один API-ключ, и отличаются только полем model. Но разница в цене, возможностях и подходящих сценариях настолько велика, что их имеет смысл использовать вместе в одной конфигурации маршрутизации. Ошибка в выборе означает либо переплату в 12–18 раз на простых задачах, либо недостаточное качество там, где нужна глубина флагмана.

Мы сравнили архитектуру, цены на DashScope и через прямой DeepSeek API, данные BenchLM (независимый агрегатор), мультимодальные возможности и практические паттерны маршрутизации.

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Сводная таблица

ПараметрDeepSeek V4.1 FlashQwen3.8-Max
Всего параметров552B (763B с vision)2.4T (sparse MoE)
Активных параметров8B вход / 16B выход~95B на токен
АрхитектураCausal Encoder-Decoder MoESparse MoE
Контекстное окно1M токенов1M токенов
Макс. выход384K токенов131K токенов
Мультимодальный входТекст + изображенияТекст + изображения + видео
Режим рассужденийДа (по умолчанию вкл.)Да (переключаемый)
DashScope вход¥1/1M (~$0.14)¥12/1M (~$1.65)
DashScope выход¥2/1M (~$0.28)¥36/1M (~$4.95)
DeepSeek Direct (off-peak вход)$0.15/1MН/Д
DeepSeek Direct (off-peak выход)$0.60/1MН/Д
BenchLM общий балл64.6572.12
ЛицензияMITApache 2.0
Дата выхода10 сентября 20263 августа 2026

Если коротко: V4.1 Flash дешевле Qwen3.8-Max примерно в 12 раз по входу и в 18 раз по выходу на DashScope, лидирует в бенчмарках агентного программирования, а предел выхода (384K) почти втрое превышает лимит Max. Qwen3.8-Max набирает больше баллов в независимых композитных оценках, нативно принимает видео, доминирует в мультимодальных бенчмарках, шире покрывает задачи агентного взаимодействия. Ценовой разрыв достаточно велик, чтобы использовать обе модели в одной конфигурации маршрутизации.

Архитектура: асимметричная эффективность против масштаба

DeepSeek V4.1 Flash

V4.1 Flash использует архитектуру Causal Encoder-Decoder (CED) — 40 слоёв Transformer разделены на 20-слойный каузальный encoder и 20-слойный decoder. KV-кэш decoder формируется из финальных скрытых состояний encoder, а не вычисляется независимо на каждом слое. В результате на фазе prefill (обработка входа) активируются только 8B параметров, на фазе decode (генерация выхода) — 16B.

MoE-слой содержит 384 маршрутизируемых эксперта (6 активных на токен) плюс 1 общий эксперт. Модель также включает 196B-параметровую Engram conditional memory, доступную через token-level lookup. Compressed Sparse Attention 2 (CSA2) назначает каждому слою внимания один из трёх статических режимов (Full, Reindex, Reuse), что в сочетании с FP4 KV-кэшированием в формате E2M1 снижает потребление памяти до примерно 890 байт на токен.

Для потребителей API это означает низкую задержку первого токена на длинных входах, крайне дешёвый cache hit ($0.003/1M в off-peak на прямом API) и лимит параллельности 2,500 RPM.

Qwen3.8-Max

Qwen3.8-Max — sparse MoE модель с 2.4 триллионами параметров, из которых примерно 95B активируются на каждый токен. Alibaba не опубликовала точное число экспертов и механизм маршрутизации, но позиционирует модель как флагман DashScope.

Модель нативно поддерживает текст, изображения и видео на входе, function calling, structured output, web search и context cache (implicit и explicit). Контекстное окно в 1M токенов допускает до 991K входных токенов (983K с включённым режимом рассуждений) и 131K выходных, с отдельным бюджетом рассуждений в 262K.

Компромисс сводится к объёму активных параметров. Qwen3.8-Max активирует примерно в 6 раз больше параметров на токен, чем decode-фаза V4.1 Flash, и в 12 раз больше, чем prefill-фаза. Больше активных параметров дают более высокие композитные баллы и одновременно обуславливают 12–18-кратную разницу в цене.

Цены: разрыв, оправдывающий кросс-уровневую маршрутизацию

DashScope (обе модели)

DeepSeek V4.1 FlashQwen3.8-MaxРазница
Вход¥1/1M (~$0.14)¥12/1M (~$1.65)12x
Выход¥2/1M (~$0.28)¥36/1M (~$4.95)18x
Implicit cache hit¥0.2/1M (~$0.028)¥1.2/1M (~$0.17)6x
Batch (скидка 50%)¥0.5 / ¥1¥6 / ¥1812x

Международные цены Qwen3.8-Max: $2.00/1M вход, $6.00/1M выход (Alibaba Cloud International). Implicit cache reads $0.25/1M.

Прямой DeepSeek API (только V4.1 Flash)

Off-peakPeak
Вход (cache miss)$0.15/1M$0.30/1M
Вход (cache hit)$0.003/1M$0.006/1M
Выход$0.60/1M$1.20/1M

Peak-часы: 01:00–04:00 и 06:00–10:00 UTC, понедельник–пятница (кроме китайских государственных праздников).

Пример стоимости запроса

Типичный запрос с 10,000 входных и 2,000 выходных токенов на DashScope:

V4.1 FlashQwen3.8-Max
Вход¥0.01¥0.12
Выход¥0.004¥0.072
Итого¥0.014¥0.192
Экономия93% дешевлеБазовая линия

Один запрос к Qwen3.8-Max обходится примерно в 14 раз дороже аналогичного запроса к V4.1 Flash. При высокой нагрузке маршрутизация простых задач на Flash и сложных на Max сокращает затраты на 80–90%.

Сравнение бенчмарков

BenchLM (независимый агрегатор, обновлён 2 октября 2026 года) предоставляет наиболее полное кросс-модельное сравнение с указанием источников данных. Ниже приведены данные с их страницы head-to-head, дополненные вендорскими бенчмарками там, где результаты есть только для одной модели.

Где лидирует V4.1 Flash

БенчмаркV4.1 FlashQwen3.8-MaxКатегория
Terminal-Bench 2.190.6%86.6%Агентный / код
Terminal-Bench 2.1 (Vals)74.5%67.4%Агентный
DeepSWE v1.174.2%56.6%Код
NL2Repo65.4%55.9%Код
AutomationBench54.8%27.3%Агентный
HLE w/ tools63.9%56.2%Агентный

V4.1 Flash уверенно лидирует в бенчмарках агентного программирования. Самый большой разрыв — AutomationBench (54.8% против 27.3%). Terminal-Bench, DeepSWE и NL2Repo измеряют реальную software-engineering и кодирующего агента производительность, и V4.1 Flash впереди по каждому из них.

Где лидирует Qwen3.8-Max

БенчмаркV4.1 FlashQwen3.8-MaxКатегория
Agents' Last Exam31.8%52.4%Агентный
GPQA Diamond90.9%92.6%Знания
HLE36.8%43.6%Знания
BabyVision w/ Python89.6%91.3%Мультимодальный
OpenHarmony Bench60.3%60.8%Код

Qwen3.8-Max лидирует в knowledge-интенсивных бенчмарках (GPQA, HLE), задачах агентного сотрудничества (Agents' Last Exam) и мультимодальных оценках. Мультимодальный разрыв особенно заметен, если учесть бенчмарки, по которым результаты есть только у Qwen3.8-Max: MMMU-Pro (82.3%), MathVision w/ Python (97.7%), Video-MME (90.4%), CharXiv (93.5%), OSWorld-Verified (86.1%).

Категорийные баллы BenchLM

КатегорияV4.1 FlashQwen3.8-Max
Общий64.6572.12
Агентный61.1 (#20/119)65.2 (#14/119)
Код58.8 (#23/144)55.4 (#30/144)
Знания64.9 (#25/171)66.1 (#23/171)
Мультимодальный74.5 (1 rankable)88.4 (#5/49)

Закономерность: V4.1 Flash лидирует в коде, конкурирует в агентных задачах (у каждой модели свои сильные стороны), заметно отстаёт в мультимодальных и knowledge-композитах. Более высокий общий балл Qwen3.8-Max (72.12 против 64.65) обеспечивается более широким охватом бенчмарков (60 бенчмарков с результатами против 26 у V4.1 Flash) и мультимодальным превосходством.

Прямое сравнение покрывает 14 общих бенчмарков. У Qwen3.8-Max ещё 46 бенчмарков, по которым V4.1 Flash пока не оценён, и это раздувает coverage-adjusted композит.

Источники: BenchLM head-to-head (получено 5 октября 2026), Flowtivity V4.1 Flash benchmarks (получено 5 октября 2026), Qwen3.8-Max blog (получено 5 октября 2026).

Мультимодальные возможности

Это самое чёткое различие между моделями.

DeepSeek V4.1 Flash принимает текст и изображения через нативный vision encoder DeepSeek-ViT с 2D-RoPE, обученный с нуля вместе с языковой моделью. Аудио и видео не поддерживаются.

Qwen3.8-Max принимает текст, изображения и видео. Image understanding встроен в 2.4T MoE, video understanding принимает URL видео или последовательности кадров. На BenchLM мультимодальный рейтинг #5/49 с сильными результатами по OCR (OmniDocBench 1.5: 92.1%), анализу диаграмм (CharXiv: 93.5%), видеопониманию (Video-MME: 90.4%) и математическому зрению (MathVision w/ Python: 97.7%).

Если ваш workflow включает анализ видео, масштабный OCR документов или мультимодальные рассуждения с одновременной обработкой изображений и видео, Qwen3.8-Max — единственный вариант. Для text-only или текст+изображения задач V4.1 Flash справляется с изображениями компетентно при стоимости в разы ниже.

Лимиты выхода и задачи длинной генерации

V4.1 Flash поддерживает максимальный выход 384K токенов — самый высокий опубликованный лимит среди моделей DashScope, почти втрое выше потолка Qwen3.8-Max в 131K.

Для задач, требующих очень длинного выхода (полные кодовые базы, комплексные аналитические отчёты, multi-file scaffolding), потолок V4.1 Flash — практическое преимущество. Агентные циклы с накоплением многих раундов tool-выхода тоже выигрывают от большего бюджета выхода.

131K у Qwen3.8-Max щедры по отраслевым стандартам, но бюджет рассуждений в 262K (при включённом thinking mode) может потребить основную часть выходной ёмкости на thinking-токены, оставляя ограниченное место для собственно ответа.

Скорость и пропускная способность

Независимые замеры OpenRouter (получено 5 октября 2026) показывают медианную скорость генерации V4.1 Flash в 99.0 токенов/с против 30.0 токенов/с у Qwen3.8-Max. Artificial Analysis сообщает 206 токенов/с для V4.1 Flash при time-to-first-token 1.09 с.

Разрыв в скорости соответствует архитектурным различиям. V4.1 Flash активирует 8–16B параметров на токен; Qwen3.8-Max — примерно 95B. Трёхкратное превышение по активным параметрам приблизительно соответствует трёхкратному увеличению задержки.

На прямом DeepSeek API лимит параллельности V4.1 Flash составляет 2,500 RPM. На DashScope у Qwen3.8-Max — 2M TPM / 15K RPM.

Рекомендации по маршрутизации

Выбирайте DeepSeek V4.1 Flash, когда:

  • Агентное программирование — основная задача. V4.1 Flash лидирует по Terminal-Bench, DeepSWE, AutomationBench, NL2Repo, CyberGym.
  • Стоимость критична. В 12–18 раз дешевле Qwen3.8-Max на DashScope, экономия масштабируется линейно.
  • Нужен длинный выход. Потолок 384K — почти втрое выше лимита Qwen3.8-Max.
  • Важна задержка. Медианная пропускная способность примерно в 3 раза выше, что улучшает интерактивные сценарии.
  • Cache-интенсивные workflow (агентные циклы, RAG со стабильными префиксами) выигрывают от cache hit стоимостью $0.003/1M на прямом DeepSeek API.
  • Нужен запасной канал провайдера. V4.1 Flash работает и на DashScope, и через прямой DeepSeek API — если один endpoint деградирует, можно переключиться на другой.

Выбирайте Qwen3.8-Max, когда:

  • Нужно понимание видео. V4.1 Flash не поддерживает видео.
  • Мультимодальная глубина критична. OCR документов, анализ диаграмм, медицинские изображения — задачи, где рейтинг #5/49 у Qwen3.8-Max конвертируется в ощутимо лучший результат.
  • Knowledge-интенсивные рассуждения (вопросы graduate-уровня, исследовательский синтез, сложные доменные задачи), где GPQA Diamond 92.6% и HLE 43.6% превышают V4.1 Flash.
  • Агентное сотрудничество с широкой tool-оркестрацией, web search, multi-agent координацией (Agents' Last Exam: 52.4% против 31.8%).
  • Регуляторные или экосистемные требования предписывают использование семейства Qwen в рамках единого аккаунта DashScope.

Используйте обе модели за router

Разрыв в цене в 12–18 раз делает кросс-уровневую маршрутизацию наиболее экономичной стратегией для смешанных нагрузок. Направляйте кодирование, генерацию и latency-sensitive задачи на V4.1 Flash. Мультимодальные, knowledge-интенсивные и видео-задачи — на Qwen3.8-Max.

Обе модели используют один и тот же DashScope base_url, конфигурация маршрутизации меняет только параметр model:

# TheRouter кросс-уровневая маршрутизация: DashScope
- provider: dashscope
  model: deepseek-v4-flash        # V4.1 Flash — код, скорость, экономия
  priority: 1
- provider: dashscope
  model: qwen3.8-max              # Флагман — мультимодал, рассуждения
  priority: 2

Для coding-agent нагрузок можно добавить прямой DeepSeek API как второй канал:

# Coding agent fallback chain
- provider: deepseek
  model: deepseek-flash           # Прямой API — off-peak экономия
  priority: 1
- provider: dashscope
  model: deepseek-v4-flash        # DashScope fallback
  priority: 2
- provider: dashscope
  model: qwen3.8-max              # Финальный fallback — флагман
  priority: 3

Часто задаваемые вопросы

Можно ли использовать один DashScope API key для обеих моделей?

Да. Обе модели используют https://dashscope.aliyuncs.com/compatible-mode/v1 с одним API-ключом. Меняется только параметр model: deepseek-v4-flash для V4.1 Flash, qwen3.8-max для Qwen3.8-Max.

V4.1 Flash обходит V4 Pro по бенчмаркам — это точно flash-уровень?

DeepSeek сам позиционирует модель как flash (замена V4 Flash) и устанавливает цену на flash-уровне ($0.15–$0.30/1M вход). Но результаты бенчмарков действительно превышают V4 Pro по всем метрикам. Название отражает ценовой уровень и архитектурную линейку, а не потолок качества. С точки зрения маршрутизации V4.1 Flash конкурирует по качеству с моделями, стоящими в 10–20 раз дороже.

Какая модель лучше для кодирования?

V4.1 Flash лидирует во всех совместных кодовых бенчмарках: Terminal-Bench 2.1 (90.6% против 86.6%), DeepSWE v1.1 (74.2% против 56.6%), NL2Repo (65.4% против 55.9%). Codeforces рейтинг — 3471. Qwen3.8-Max показывает сильные результаты в бенчмарках, по которым V4.1 Flash ещё не оценён (SWE-bench Pro: 67.7%, FrontierSWE: 73.5%). По имеющимся данным для агентного программирования V4.1 Flash — более сильный выбор.

Какая модель поддерживает видео?

Только Qwen3.8-Max. V4.1 Flash работает с текстом и изображениями, но не с видео. Если видеопонимание — обязательное требование, Qwen3.8-Max — единственный вариант.

Сколько можно сэкономить, маршрутизируя простые задачи на V4.1 Flash?

Нагрузка, направляющая 80% запросов на V4.1 Flash и 20% на Qwen3.8-Max (по сравнению с полным использованием Max), экономит около 93% на Flash-доле. При обработке 100M токенов/мес (80M Flash, 20M Max) ежемесячные расходы снижаются с примерно ¥4,800 (всё на Max) до примерно ¥1,120 (смешанная маршрутизация). Фактическая экономия зависит от соотношения входных и выходных токенов.

Поддерживает ли V4.1 Flash function calling и structured output?

Да. V4.1 Flash поддерживает JSON output, tool calls, Responses API, Anthropic API формат, chat prefix completion (beta) и FIM completion (beta, только non-thinking mode). Qwen3.8-Max также поддерживает function calling и structured output через DashScope endpoint.

Как обстоят дела с context caching на DashScope?

Обе модели поддерживают implicit context cache DashScope. Cache hit V4.1 Flash стоит ¥0.2/1M; Qwen3.8-Max — ¥1.2/1M. На прямом DeepSeek API cache hit V4.1 Flash падает до $0.003/1M (off-peak) — это самый низкий cache hit среди крупных провайдеров LLM API.

Источники

Помощь и контакты