Qwen3.8-Flash vs Qwen3.8-Max: стоимость, скорость и стратегии маршрутизации через OpenAI SDK (2026)
Подробное сравнение Qwen3.8-Flash и Qwen3.8-Max — цены, скорость, мультимодальные возможности, режим мышления и стратегии маршрутизации для OpenAI-совместимого gateway.
26 августа 2026 года Alibaba Cloud выпустила Qwen3.8-Flash на DashScope. Для тех, кто уже использует Qwen3.8-Max через DashScope, практический вопрос прост: какие запросы можно перенаправить на более дешёвую Flash-модель, а какие стоит оставить на Max?
В этом руководстве мы разбираем спецификации, цены, возможности и паттерны маршрутизации обеих моделей. Все примеры кода работают через OpenAI-совместимый endpoint DashScope и стандартные SDK openai для Python и Node.
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
Сравнение в одной таблице
| Параметр | Qwen3.8-Flash | Qwen3.8-Max |
|---|---|---|
| Model ID | qwen3.8-flash | qwen3.8-max |
| Архитектура | MoE (параметры не раскрыты) | ~2.4T MoE (~95B активных) |
| Контекстное окно | 1M tokens | 1M tokens |
| Мультимодальный вход | Текст + изображения | Текст + изображения + видео |
| Режим мышления | Да (per-request toggle) | Да (per-request toggle) |
| Цена input (DashScope, /1M токенов) | Flash-тариф | ¥12 (~$1.65) |
| Цена output (DashScope, /1M токенов) | Flash-тариф | ¥36 (~$4.95) |
| Разница в стоимости | 1x | ~33x по output |
| Протоколы API | OpenAI, Anthropic, DashScope | OpenAI, Anthropic, DashScope |
| Кэширование контекста | Ожидается (не подтверждено) | Поддерживается (implicit + explicit) |
| Batch API | Ожидается (не подтверждено) | Поддерживается (скидка 50%) |
| Лучше всего для | Высокая пропускная способность, агентные циклы | Сложный reasoning, генерация кода |
Главная цифра — разница в стоимости output-токенов. Flash обходится примерно в 30–40 раз дешевле, чем Max. Для задач, где Flash справляется на приемлемом уровне, эта разница напрямую превращается в экономию.
Что умеет Qwen3.8-Flash
Согласно странице DashScope, Qwen3.8-Flash позиционируется как мультимодальная модель с сильными возможностями генерации и высокой скоростью отклика. Основные характеристики:
- Нативное контекстное окно 1M токенов — обработка длинных документов, репозиториев кода и сложных диалогов в одном запросе
- Режим глубокого мышления — гибридный reasoning с переключением per-request, как у Max
- Визуальное понимание — приём изображений для анализа диаграмм, парсинга документов и визуального reasoning
- Совместимость с OpenAI и Anthropic протоколами — работает с Claude Code, Codex и другими инструментами
- Coding и агентные сценарии — исправление кода, управление десктопными приложениями, многошаговое выполнение задач
Модель попадает в Flash-тариф DashScope. Текущая модель qwen-flash стоит ¥0.35 input / ¥2.8 output за миллион токенов ($0.05 / $0.40). Точные цены Qwen3.8-Flash могут отличаться — проверяйте на официальной странице.
Чем Max превосходит Flash
Qwen3.8-Max — флагманская модель с 2.4 триллионами параметров (MoE, ~95B активных на токен). GA на DashScope состоялся 3 августа 2026.
Преимущества Max:
Видео на входе. Max принимает видео вместе с текстом и изображениями. В описании Flash упоминаются только текст и изображения.
Больше активных параметров. Больше вычислений на каждый forward pass — лучше результаты в сложном reasoning, генерации кода и долгосрочных агентных задачах.
Подтверждённые бенчмарки. Qwen3.8-Max набирает 79.2/100 на BenchLM (#6 из 226), особенно сильны результаты в coding и software engineering.
Batch API. Подтверждена поддержка со скидкой 50%.
Кэширование контекста. Документировано implicit и explicit кэширование. Чтение из explicit-кэша стоит ~10% от стандартной цены input.
Обратная сторона — стоимость. При ¥12/¥36 за миллион токенов каждый запрос, не требующий Max-уровня, обходится дороже, чем нужно.
Детали ценообразования
Цены за миллион токенов в юанях (регион Beijing). Доллары по курсу ~¥7.28 = $1.
| Модель | Input (¥/1M) | Output (¥/1M) | Input ($/1M) | Output ($/1M) | Контекст |
|---|---|---|---|---|---|
| qwen3.8-flash | ~¥0.35 | ~¥2.8 | ~$0.05 | ~$0.40 | 1M |
| qwen3.8-max | ¥12 | ¥36 | $1.65 | $4.95 | 1M |
| qwen3.8-max-prime | ¥24 | ¥72 | $3.30 | $9.90 | 1M |
| qwen3.7-max (promo) | ¥6 | ¥18 | $0.82 | $2.47 | 1M |
| qwen3.7-flash | Flash-тариф | Flash-тариф | ~$0.05 | ~$0.40 | 1M |
Важные примечания:
- Цена Qwen3.8-Flash — оценка на основе Flash-тарифа. Модель появилась менее суток назад, точная строка в прайсе может ещё не быть опубликована. Актуальные данные — на официальной странице.
- Qwen3.8-Max использует единый тариф на весь 1M-контекст без ступенчатого повышения по длине input. Это редкость для DashScope и упрощает прогнозирование затрат.
- Qwen3.7-Max по-прежнему доступен с 50% промо-скидкой (¥6/¥18), по стоимости между Flash и Max.
Когда направлять на Flash, когда на Max
Flash подходит для:
- Высокопроизводительная классификация, тегирование и извлечение данных — структурированный output при минимальных затратах
- Простые Q&A и RAG — контекст уже содержит ответ, модели нужно только извлечь его
- Внутренние циклы агентов — итеративные вызовы инструментов порождают много коротких запросов, Flash минимизирует стоимость каждого
- Первичное суммирование — предварительные сводки длинных документов, которые затем ревьюит человек или дорабатывает сильная модель
- Бюджетные задачи с изображениями — базовый OCR, чтение диаграмм, парсинг документов
Max нужен для:
- Сложный многошаговый reasoning — математика, логика, глубокий анализ
- Продакшн-код — написание, отладка и ревью кода для production
- Долгосрочные агентные задачи — автономное программирование и проектная работа, требующие планирования и самокоррекции
- Видеоанализ — Max принимает видео, Flash — нет (по текущим данным)
- Критически важные тексты — юридические, финансовые или медицинские документы, где ошибка стоит дороже, чем inference
Гибридный паттерн: Flash по умолчанию, Max как fallback
Самая экономичная схема для большинства операторов — уровневая маршрутизация:
- Все запросы по умолчанию идут на Flash
- При ошибке или низкой уверенности — эскалация на Max
- Известные сложные категории сразу идут на Max — список типов задач (сложный coding, видеоанализ и т.д.)
Такой паттерн обычно оставляет 70–90% трафика на Flash-тарифе, сохраняя Max-качество для запросов, которым оно действительно нужно.
from openai import OpenAI
# Обе модели на одном OpenAI-совместимом endpoint DashScope
client = OpenAI(
api_key="your-dashscope-api-key",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)
def route_completion(messages, task_type="general"):
"""Маршрутизация на Flash или Max по типу задачи."""
hard_tasks = {"code_generation", "video_analysis", "complex_reasoning"}
model = "qwen3.8-max" if task_type in hard_tasks else "qwen3.8-flash"
response = client.chat.completions.create(
model=model,
messages=messages,
)
return response
Настройка API: OpenAI SDK + DashScope
Обе модели доступны через один endpoint. Единственная разница — параметр model.
from openai import OpenAI
client = OpenAI(
api_key="your-dashscope-api-key",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)
# Flash — оптимизация по стоимости
flash_response = client.chat.completions.create(
model="qwen3.8-flash",
messages=[{"role": "user", "content": "Summarize this document..."}],
)
# Max — флагманский reasoning
max_response = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Debug this function and explain the fix..."}],
)
Режим глубокого мышления работает одинаково для обеих моделей:
response = client.chat.completions.create(
model="qwen3.8-flash", # или qwen3.8-max
messages=[{"role": "user", "content": "Solve this step by step..."}],
extra_body={"enable_thinking": True},
)
Anthropic-совместимый endpoint тоже поддерживается — замените base_url на путь /apps/anthropic и используйте Anthropic SDK. Flash и Max доступны через оба протокола.
Qwen3.8-Flash и Qwen3.8-Flash-Next — разные модели
Важный нюанс. 26 августа Alibaba также опубликовала Qwen3.8-Flash-Next как open-weight модель на Hugging Face. Это отдельная модель — 125 миллиардов параметров (6 миллиардов активных), позиционируется как превью архитектуры Qwen4. Нативный контекст 262K (расширяется до 1M через YaRN), поддержка vision и управление reasoning effort.
Qwen3.8-Flash-Next — это open-weight research-модель. Qwen3.8-Flash (без «Next») — проприетарная API-модель на DashScope. Связь между их архитектурами официально не раскрыта. Для маршрутизации через API используйте model ID qwen3.8-flash на DashScope.
Интеграция с TheRouter
TheRouter маршрутизирует OpenAI-совместимые запросы через настроенные провайдеры, включая DashScope. Для операторов, работающих с Flash и Max одновременно, конфигурация маршрутизации позволяет задать Flash как основной путь, а Max — как fallback.
На момент публикации qwen3.8-flash ещё не добавлен в реестр моделей TheRouter. После добавления он будет маршрутизируем наравне с qwen3.8-max через стандартную конфигурацию провайдера.
FAQ
Можно ли использовать Qwen3.8-Flash с Claude Code или Codex?
Да. В описании DashScope явно упоминается совместимость с Claude Code и Codex через endpoint-ы OpenAI и Anthropic. Укажите base URL DashScope и model ID qwen3.8-flash.
Flash поддерживает контекст 1M токенов, как и Max?
Да. Обе модели заявляют 1M нативного контекста. Структура ценообразования может отличаться — Max использует единый тариф на весь контекст, Flash исторически применяет ступенчатое повышение по длине input. Проверяйте актуальные данные на официальной странице.
Flash достаточно хорош для coding?
Для рутинных задач (форматирование, простой рефакторинг, генерация шаблонного кода) Flash, скорее всего, справится. Для сложной отладки, архитектурных решений и ревью production-кода Max — более надёжный выбор. DashScope описывает Flash как «outstanding» для coding, но независимые бенчмарки API-модели пока не опубликованы.
Какие rate limits?
DashScope устанавливает rate limits по модели и уровню аккаунта. Flash-модели обычно имеют более высокие лимиты concurrency, что делает их подходящими для высокопроизводительных агентных нагрузок. Конкретные лимиты для qwen3.8-flash пока не опубликованы.
Стоит ли переходить с Qwen3.7-Flash?
Если вы уже на qwen3.7-flash, Qwen3.8-Flash — естественный путь обновления. Модель наследует Flash-тариф, добавляя улучшения поколения 3.8 в coding, агентном выполнении и визуальном понимании. Протестируйте на реальной нагрузке перед переключением production-трафика.
Источники: DashScope Newly Released Models (дата обращения: 2026-08-27), DashScope Model Pricing (дата обращения: 2026-08-27), Alibaba Cloud Model Studio Models (дата обращения: 2026-08-27), BenchLM Qwen3.8 Max (дата обращения: 2026-08-27), BenchLM Qwen3.8-Flash-Next (дата обращения: 2026-08-27), Fello AI Qwen Pricing (дата обращения: 2026-08-27)