DeepSeek V4.1 Flash vs Qwen3.8-Max: кросс-уровневое сравнение для операторов маршрутизации DashScope
DeepSeek V4.1 Flash активирует 8B параметров на входной токен и стоит ¥1/млн на DashScope. Qwen3.8-Max содержит 2.4T параметров и нативно понимает видео. Оба работают через один и тот же OpenAI-совместимый endpoint DashScope. Мы сравнили архитектуру, цены, бенчмарки и мультимодальные возможности, чтобы помочь операторам маршрутизации выбрать подходящую модель.
На DashScope сейчас работают две принципиально разные модели. DeepSeek V4.1 Flash вышла 10 сентября 2026 года — это flash-уровень, который при этом превосходит флагман предыдущего поколения V4 Pro по всем опубликованным бенчмаркам. Qwen3.8-Max появилась 3 августа 2026 года — 2.4 триллиона параметров, самый высокий композитный балл среди китайских моделей на независимых агрегаторах, самое широкое мультимодальное покрытие.
Обе модели используют один и тот же base_url, один API-ключ, и отличаются только полем model. Но разница в цене, возможностях и подходящих сценариях настолько велика, что их имеет смысл использовать вместе в одной конфигурации маршрутизации. Ошибка в выборе означает либо переплату в 12–18 раз на простых задачах, либо недостаточное качество там, где нужна глубина флагмана.
Мы сравнили архитектуру, цены на DashScope и через прямой DeepSeek API, данные BenchLM (независимый агрегатор), мультимодальные возможности и практические паттерны маршрутизации.
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
Сводная таблица
| Параметр | DeepSeek V4.1 Flash | Qwen3.8-Max |
|---|---|---|
| Всего параметров | 552B (763B с vision) | 2.4T (sparse MoE) |
| Активных параметров | 8B вход / 16B выход | ~95B на токен |
| Архитектура | Causal Encoder-Decoder MoE | Sparse MoE |
| Контекстное окно | 1M токенов | 1M токенов |
| Макс. выход | 384K токенов | 131K токенов |
| Мультимодальный вход | Текст + изображения | Текст + изображения + видео |
| Режим рассуждений | Да (по умолчанию вкл.) | Да (переключаемый) |
| DashScope вход | ¥1/1M (~$0.14) | ¥12/1M (~$1.65) |
| DashScope выход | ¥2/1M (~$0.28) | ¥36/1M (~$4.95) |
| DeepSeek Direct (off-peak вход) | $0.15/1M | Н/Д |
| DeepSeek Direct (off-peak выход) | $0.60/1M | Н/Д |
| BenchLM общий балл | 64.65 | 72.12 |
| Лицензия | MIT | Apache 2.0 |
| Дата выхода | 10 сентября 2026 | 3 августа 2026 |
Если коротко: V4.1 Flash дешевле Qwen3.8-Max примерно в 12 раз по входу и в 18 раз по выходу на DashScope, лидирует в бенчмарках агентного программирования, а предел выхода (384K) почти втрое превышает лимит Max. Qwen3.8-Max набирает больше баллов в независимых композитных оценках, нативно принимает видео, доминирует в мультимодальных бенчмарках, шире покрывает задачи агентного взаимодействия. Ценовой разрыв достаточно велик, чтобы использовать обе модели в одной конфигурации маршрутизации.
Архитектура: асимметричная эффективность против масштаба
DeepSeek V4.1 Flash
V4.1 Flash использует архитектуру Causal Encoder-Decoder (CED) — 40 слоёв Transformer разделены на 20-слойный каузальный encoder и 20-слойный decoder. KV-кэш decoder формируется из финальных скрытых состояний encoder, а не вычисляется независимо на каждом слое. В результате на фазе prefill (обработка входа) активируются только 8B параметров, на фазе decode (генерация выхода) — 16B.
MoE-слой содержит 384 маршрутизируемых эксперта (6 активных на токен) плюс 1 общий эксперт. Модель также включает 196B-параметровую Engram conditional memory, доступную через token-level lookup. Compressed Sparse Attention 2 (CSA2) назначает каждому слою внимания один из трёх статических режимов (Full, Reindex, Reuse), что в сочетании с FP4 KV-кэшированием в формате E2M1 снижает потребление памяти до примерно 890 байт на токен.
Для потребителей API это означает низкую задержку первого токена на длинных входах, крайне дешёвый cache hit ($0.003/1M в off-peak на прямом API) и лимит параллельности 2,500 RPM.
Qwen3.8-Max
Qwen3.8-Max — sparse MoE модель с 2.4 триллионами параметров, из которых примерно 95B активируются на каждый токен. Alibaba не опубликовала точное число экспертов и механизм маршрутизации, но позиционирует модель как флагман DashScope.
Модель нативно поддерживает текст, изображения и видео на входе, function calling, structured output, web search и context cache (implicit и explicit). Контекстное окно в 1M токенов допускает до 991K входных токенов (983K с включённым режимом рассуждений) и 131K выходных, с отдельным бюджетом рассуждений в 262K.
Компромисс сводится к объёму активных параметров. Qwen3.8-Max активирует примерно в 6 раз больше параметров на токен, чем decode-фаза V4.1 Flash, и в 12 раз больше, чем prefill-фаза. Больше активных параметров дают более высокие композитные баллы и одновременно обуславливают 12–18-кратную разницу в цене.
Цены: разрыв, оправдывающий кросс-уровневую маршрутизацию
DashScope (обе модели)
| DeepSeek V4.1 Flash | Qwen3.8-Max | Разница | |
|---|---|---|---|
| Вход | ¥1/1M (~$0.14) | ¥12/1M (~$1.65) | 12x |
| Выход | ¥2/1M (~$0.28) | ¥36/1M (~$4.95) | 18x |
| Implicit cache hit | ¥0.2/1M (~$0.028) | ¥1.2/1M (~$0.17) | 6x |
| Batch (скидка 50%) | ¥0.5 / ¥1 | ¥6 / ¥18 | 12x |
Международные цены Qwen3.8-Max: $2.00/1M вход, $6.00/1M выход (Alibaba Cloud International). Implicit cache reads $0.25/1M.
Прямой DeepSeek API (только V4.1 Flash)
| Off-peak | Peak | |
|---|---|---|
| Вход (cache miss) | $0.15/1M | $0.30/1M |
| Вход (cache hit) | $0.003/1M | $0.006/1M |
| Выход | $0.60/1M | $1.20/1M |
Peak-часы: 01:00–04:00 и 06:00–10:00 UTC, понедельник–пятница (кроме китайских государственных праздников).
Пример стоимости запроса
Типичный запрос с 10,000 входных и 2,000 выходных токенов на DashScope:
| V4.1 Flash | Qwen3.8-Max | |
|---|---|---|
| Вход | ¥0.01 | ¥0.12 |
| Выход | ¥0.004 | ¥0.072 |
| Итого | ¥0.014 | ¥0.192 |
| Экономия | 93% дешевле | Базовая линия |
Один запрос к Qwen3.8-Max обходится примерно в 14 раз дороже аналогичного запроса к V4.1 Flash. При высокой нагрузке маршрутизация простых задач на Flash и сложных на Max сокращает затраты на 80–90%.
Сравнение бенчмарков
BenchLM (независимый агрегатор, обновлён 2 октября 2026 года) предоставляет наиболее полное кросс-модельное сравнение с указанием источников данных. Ниже приведены данные с их страницы head-to-head, дополненные вендорскими бенчмарками там, где результаты есть только для одной модели.
Где лидирует V4.1 Flash
| Бенчмарк | V4.1 Flash | Qwen3.8-Max | Категория |
|---|---|---|---|
| Terminal-Bench 2.1 | 90.6% | 86.6% | Агентный / код |
| Terminal-Bench 2.1 (Vals) | 74.5% | 67.4% | Агентный |
| DeepSWE v1.1 | 74.2% | 56.6% | Код |
| NL2Repo | 65.4% | 55.9% | Код |
| AutomationBench | 54.8% | 27.3% | Агентный |
| HLE w/ tools | 63.9% | 56.2% | Агентный |
V4.1 Flash уверенно лидирует в бенчмарках агентного программирования. Самый большой разрыв — AutomationBench (54.8% против 27.3%). Terminal-Bench, DeepSWE и NL2Repo измеряют реальную software-engineering и кодирующего агента производительность, и V4.1 Flash впереди по каждому из них.
Где лидирует Qwen3.8-Max
| Бенчмарк | V4.1 Flash | Qwen3.8-Max | Категория |
|---|---|---|---|
| Agents' Last Exam | 31.8% | 52.4% | Агентный |
| GPQA Diamond | 90.9% | 92.6% | Знания |
| HLE | 36.8% | 43.6% | Знания |
| BabyVision w/ Python | 89.6% | 91.3% | Мультимодальный |
| OpenHarmony Bench | 60.3% | 60.8% | Код |
Qwen3.8-Max лидирует в knowledge-интенсивных бенчмарках (GPQA, HLE), задачах агентного сотрудничества (Agents' Last Exam) и мультимодальных оценках. Мультимодальный разрыв особенно заметен, если учесть бенчмарки, по которым результаты есть только у Qwen3.8-Max: MMMU-Pro (82.3%), MathVision w/ Python (97.7%), Video-MME (90.4%), CharXiv (93.5%), OSWorld-Verified (86.1%).
Категорийные баллы BenchLM
| Категория | V4.1 Flash | Qwen3.8-Max |
|---|---|---|
| Общий | 64.65 | 72.12 |
| Агентный | 61.1 (#20/119) | 65.2 (#14/119) |
| Код | 58.8 (#23/144) | 55.4 (#30/144) |
| Знания | 64.9 (#25/171) | 66.1 (#23/171) |
| Мультимодальный | 74.5 (1 rankable) | 88.4 (#5/49) |
Закономерность: V4.1 Flash лидирует в коде, конкурирует в агентных задачах (у каждой модели свои сильные стороны), заметно отстаёт в мультимодальных и knowledge-композитах. Более высокий общий балл Qwen3.8-Max (72.12 против 64.65) обеспечивается более широким охватом бенчмарков (60 бенчмарков с результатами против 26 у V4.1 Flash) и мультимодальным превосходством.
Прямое сравнение покрывает 14 общих бенчмарков. У Qwen3.8-Max ещё 46 бенчмарков, по которым V4.1 Flash пока не оценён, и это раздувает coverage-adjusted композит.
Источники: BenchLM head-to-head (получено 5 октября 2026), Flowtivity V4.1 Flash benchmarks (получено 5 октября 2026), Qwen3.8-Max blog (получено 5 октября 2026).
Мультимодальные возможности
Это самое чёткое различие между моделями.
DeepSeek V4.1 Flash принимает текст и изображения через нативный vision encoder DeepSeek-ViT с 2D-RoPE, обученный с нуля вместе с языковой моделью. Аудио и видео не поддерживаются.
Qwen3.8-Max принимает текст, изображения и видео. Image understanding встроен в 2.4T MoE, video understanding принимает URL видео или последовательности кадров. На BenchLM мультимодальный рейтинг #5/49 с сильными результатами по OCR (OmniDocBench 1.5: 92.1%), анализу диаграмм (CharXiv: 93.5%), видеопониманию (Video-MME: 90.4%) и математическому зрению (MathVision w/ Python: 97.7%).
Если ваш workflow включает анализ видео, масштабный OCR документов или мультимодальные рассуждения с одновременной обработкой изображений и видео, Qwen3.8-Max — единственный вариант. Для text-only или текст+изображения задач V4.1 Flash справляется с изображениями компетентно при стоимости в разы ниже.
Лимиты выхода и задачи длинной генерации
V4.1 Flash поддерживает максимальный выход 384K токенов — самый высокий опубликованный лимит среди моделей DashScope, почти втрое выше потолка Qwen3.8-Max в 131K.
Для задач, требующих очень длинного выхода (полные кодовые базы, комплексные аналитические отчёты, multi-file scaffolding), потолок V4.1 Flash — практическое преимущество. Агентные циклы с накоплением многих раундов tool-выхода тоже выигрывают от большего бюджета выхода.
131K у Qwen3.8-Max щедры по отраслевым стандартам, но бюджет рассуждений в 262K (при включённом thinking mode) может потребить основную часть выходной ёмкости на thinking-токены, оставляя ограниченное место для собственно ответа.
Скорость и пропускная способность
Независимые замеры OpenRouter (получено 5 октября 2026) показывают медианную скорость генерации V4.1 Flash в 99.0 токенов/с против 30.0 токенов/с у Qwen3.8-Max. Artificial Analysis сообщает 206 токенов/с для V4.1 Flash при time-to-first-token 1.09 с.
Разрыв в скорости соответствует архитектурным различиям. V4.1 Flash активирует 8–16B параметров на токен; Qwen3.8-Max — примерно 95B. Трёхкратное превышение по активным параметрам приблизительно соответствует трёхкратному увеличению задержки.
На прямом DeepSeek API лимит параллельности V4.1 Flash составляет 2,500 RPM. На DashScope у Qwen3.8-Max — 2M TPM / 15K RPM.
Рекомендации по маршрутизации
Выбирайте DeepSeek V4.1 Flash, когда:
- Агентное программирование — основная задача. V4.1 Flash лидирует по Terminal-Bench, DeepSWE, AutomationBench, NL2Repo, CyberGym.
- Стоимость критична. В 12–18 раз дешевле Qwen3.8-Max на DashScope, экономия масштабируется линейно.
- Нужен длинный выход. Потолок 384K — почти втрое выше лимита Qwen3.8-Max.
- Важна задержка. Медианная пропускная способность примерно в 3 раза выше, что улучшает интерактивные сценарии.
- Cache-интенсивные workflow (агентные циклы, RAG со стабильными префиксами) выигрывают от cache hit стоимостью $0.003/1M на прямом DeepSeek API.
- Нужен запасной канал провайдера. V4.1 Flash работает и на DashScope, и через прямой DeepSeek API — если один endpoint деградирует, можно переключиться на другой.
Выбирайте Qwen3.8-Max, когда:
- Нужно понимание видео. V4.1 Flash не поддерживает видео.
- Мультимодальная глубина критична. OCR документов, анализ диаграмм, медицинские изображения — задачи, где рейтинг #5/49 у Qwen3.8-Max конвертируется в ощутимо лучший результат.
- Knowledge-интенсивные рассуждения (вопросы graduate-уровня, исследовательский синтез, сложные доменные задачи), где GPQA Diamond 92.6% и HLE 43.6% превышают V4.1 Flash.
- Агентное сотрудничество с широкой tool-оркестрацией, web search, multi-agent координацией (Agents' Last Exam: 52.4% против 31.8%).
- Регуляторные или экосистемные требования предписывают использование семейства Qwen в рамках единого аккаунта DashScope.
Используйте обе модели за router
Разрыв в цене в 12–18 раз делает кросс-уровневую маршрутизацию наиболее экономичной стратегией для смешанных нагрузок. Направляйте кодирование, генерацию и latency-sensitive задачи на V4.1 Flash. Мультимодальные, knowledge-интенсивные и видео-задачи — на Qwen3.8-Max.
Обе модели используют один и тот же DashScope base_url, конфигурация маршрутизации меняет только параметр model:
# TheRouter кросс-уровневая маршрутизация: DashScope
- provider: dashscope
model: deepseek-v4-flash # V4.1 Flash — код, скорость, экономия
priority: 1
- provider: dashscope
model: qwen3.8-max # Флагман — мультимодал, рассуждения
priority: 2
Для coding-agent нагрузок можно добавить прямой DeepSeek API как второй канал:
# Coding agent fallback chain
- provider: deepseek
model: deepseek-flash # Прямой API — off-peak экономия
priority: 1
- provider: dashscope
model: deepseek-v4-flash # DashScope fallback
priority: 2
- provider: dashscope
model: qwen3.8-max # Финальный fallback — флагман
priority: 3
Часто задаваемые вопросы
Можно ли использовать один DashScope API key для обеих моделей?
Да. Обе модели используют https://dashscope.aliyuncs.com/compatible-mode/v1 с одним API-ключом. Меняется только параметр model: deepseek-v4-flash для V4.1 Flash, qwen3.8-max для Qwen3.8-Max.
V4.1 Flash обходит V4 Pro по бенчмаркам — это точно flash-уровень?
DeepSeek сам позиционирует модель как flash (замена V4 Flash) и устанавливает цену на flash-уровне ($0.15–$0.30/1M вход). Но результаты бенчмарков действительно превышают V4 Pro по всем метрикам. Название отражает ценовой уровень и архитектурную линейку, а не потолок качества. С точки зрения маршрутизации V4.1 Flash конкурирует по качеству с моделями, стоящими в 10–20 раз дороже.
Какая модель лучше для кодирования?
V4.1 Flash лидирует во всех совместных кодовых бенчмарках: Terminal-Bench 2.1 (90.6% против 86.6%), DeepSWE v1.1 (74.2% против 56.6%), NL2Repo (65.4% против 55.9%). Codeforces рейтинг — 3471. Qwen3.8-Max показывает сильные результаты в бенчмарках, по которым V4.1 Flash ещё не оценён (SWE-bench Pro: 67.7%, FrontierSWE: 73.5%). По имеющимся данным для агентного программирования V4.1 Flash — более сильный выбор.
Какая модель поддерживает видео?
Только Qwen3.8-Max. V4.1 Flash работает с текстом и изображениями, но не с видео. Если видеопонимание — обязательное требование, Qwen3.8-Max — единственный вариант.
Сколько можно сэкономить, маршрутизируя простые задачи на V4.1 Flash?
Нагрузка, направляющая 80% запросов на V4.1 Flash и 20% на Qwen3.8-Max (по сравнению с полным использованием Max), экономит около 93% на Flash-доле. При обработке 100M токенов/мес (80M Flash, 20M Max) ежемесячные расходы снижаются с примерно ¥4,800 (всё на Max) до примерно ¥1,120 (смешанная маршрутизация). Фактическая экономия зависит от соотношения входных и выходных токенов.
Поддерживает ли V4.1 Flash function calling и structured output?
Да. V4.1 Flash поддерживает JSON output, tool calls, Responses API, Anthropic API формат, chat prefix completion (beta) и FIM completion (beta, только non-thinking mode). Qwen3.8-Max также поддерживает function calling и structured output через DashScope endpoint.
Как обстоят дела с context caching на DashScope?
Обе модели поддерживают implicit context cache DashScope. Cache hit V4.1 Flash стоит ¥0.2/1M; Qwen3.8-Max — ¥1.2/1M. На прямом DeepSeek API cache hit V4.1 Flash падает до $0.003/1M (off-peak) — это самый низкий cache hit среди крупных провайдеров LLM API.
Источники
- DeepSeek API pricing — api-docs.deepseek.com/quick_start/pricing (получено 5 октября 2026)
- DeepSeek V4.1 Flash model card — huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash (получено 5 октября 2026)
- DashScope model pricing — help.aliyun.com/zh/model-studio/model-pricing (получено 5 октября 2026)
- BenchLM head-to-head — benchlm.ai/compare/deepseek-v4-1-flash-vs-qwen3-8-max (получено 5 октября 2026)
- Qwen3.8-Max blog — qwen.ai/blog?id=qwen3.8 (получено 5 октября 2026)
- V4.1 Flash benchmark data — flowtivity.ai/blog/deepseek-v4-1-flash-benchmarks (получено 5 октября 2026)
- V4.1 Flash architecture specs — mindstudio.ai/blog/deepseek-v4-1-flash-specs-architecture (получено 5 октября 2026)
- OpenRouter speed comparison — openrouter.ai/compare (получено 5 октября 2026)