← Все статьи

Qwen3.8-Flash vs Qwen3.8-Max: стоимость, скорость и стратегии маршрутизации через OpenAI SDK (2026)

Подробное сравнение Qwen3.8-Flash и Qwen3.8-Max — цены, скорость, мультимодальные возможности, режим мышления и стратегии маршрутизации для OpenAI-совместимого gateway.

· updated 2026-08-27· TheRouter

26 августа 2026 года Alibaba Cloud выпустила Qwen3.8-Flash на DashScope. Для тех, кто уже использует Qwen3.8-Max через DashScope, практический вопрос прост: какие запросы можно перенаправить на более дешёвую Flash-модель, а какие стоит оставить на Max?

В этом руководстве мы разбираем спецификации, цены, возможности и паттерны маршрутизации обеих моделей. Все примеры кода работают через OpenAI-совместимый endpoint DashScope и стандартные SDK openai для Python и Node.

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Сравнение в одной таблице

ПараметрQwen3.8-FlashQwen3.8-Max
Model IDqwen3.8-flashqwen3.8-max
АрхитектураMoE (параметры не раскрыты)~2.4T MoE (~95B активных)
Контекстное окно1M tokens1M tokens
Мультимодальный входТекст + изображенияТекст + изображения + видео
Режим мышленияДа (per-request toggle)Да (per-request toggle)
Цена input (DashScope, /1M токенов)Flash-тариф ¥0.35 ($0.05)¥12 (~$1.65)
Цена output (DashScope, /1M токенов)Flash-тариф ¥2.8 ($0.40)¥36 (~$4.95)
Разница в стоимости1x~33x по output
Протоколы APIOpenAI, Anthropic, DashScopeOpenAI, Anthropic, DashScope
Кэширование контекстаОжидается (не подтверждено)Поддерживается (implicit + explicit)
Batch APIОжидается (не подтверждено)Поддерживается (скидка 50%)
Лучше всего дляВысокая пропускная способность, агентные циклыСложный reasoning, генерация кода

Главная цифра — разница в стоимости output-токенов. Flash обходится примерно в 30–40 раз дешевле, чем Max. Для задач, где Flash справляется на приемлемом уровне, эта разница напрямую превращается в экономию.

Что умеет Qwen3.8-Flash

Согласно странице DashScope, Qwen3.8-Flash позиционируется как мультимодальная модель с сильными возможностями генерации и высокой скоростью отклика. Основные характеристики:

  • Нативное контекстное окно 1M токенов — обработка длинных документов, репозиториев кода и сложных диалогов в одном запросе
  • Режим глубокого мышления — гибридный reasoning с переключением per-request, как у Max
  • Визуальное понимание — приём изображений для анализа диаграмм, парсинга документов и визуального reasoning
  • Совместимость с OpenAI и Anthropic протоколами — работает с Claude Code, Codex и другими инструментами
  • Coding и агентные сценарии — исправление кода, управление десктопными приложениями, многошаговое выполнение задач

Модель попадает в Flash-тариф DashScope. Текущая модель qwen-flash стоит ¥0.35 input / ¥2.8 output за миллион токенов ($0.05 / $0.40). Точные цены Qwen3.8-Flash могут отличаться — проверяйте на официальной странице.

Чем Max превосходит Flash

Qwen3.8-Max — флагманская модель с 2.4 триллионами параметров (MoE, ~95B активных на токен). GA на DashScope состоялся 3 августа 2026.

Преимущества Max:

Видео на входе. Max принимает видео вместе с текстом и изображениями. В описании Flash упоминаются только текст и изображения.

Больше активных параметров. Больше вычислений на каждый forward pass — лучше результаты в сложном reasoning, генерации кода и долгосрочных агентных задачах.

Подтверждённые бенчмарки. Qwen3.8-Max набирает 79.2/100 на BenchLM (#6 из 226), особенно сильны результаты в coding и software engineering.

Batch API. Подтверждена поддержка со скидкой 50%.

Кэширование контекста. Документировано implicit и explicit кэширование. Чтение из explicit-кэша стоит ~10% от стандартной цены input.

Обратная сторона — стоимость. При ¥12/¥36 за миллион токенов каждый запрос, не требующий Max-уровня, обходится дороже, чем нужно.

Детали ценообразования

Цены за миллион токенов в юанях (регион Beijing). Доллары по курсу ~¥7.28 = $1.

МодельInput (¥/1M)Output (¥/1M)Input ($/1M)Output ($/1M)Контекст
qwen3.8-flash~¥0.35~¥2.8~$0.05~$0.401M
qwen3.8-max¥12¥36$1.65$4.951M
qwen3.8-max-prime¥24¥72$3.30$9.901M
qwen3.7-max (promo)¥6¥18$0.82$2.471M
qwen3.7-flashFlash-тарифFlash-тариф~$0.05~$0.401M

Важные примечания:

  • Цена Qwen3.8-Flash — оценка на основе Flash-тарифа. Модель появилась менее суток назад, точная строка в прайсе может ещё не быть опубликована. Актуальные данные — на официальной странице.
  • Qwen3.8-Max использует единый тариф на весь 1M-контекст без ступенчатого повышения по длине input. Это редкость для DashScope и упрощает прогнозирование затрат.
  • Qwen3.7-Max по-прежнему доступен с 50% промо-скидкой (¥6/¥18), по стоимости между Flash и Max.

Когда направлять на Flash, когда на Max

Flash подходит для:

  • Высокопроизводительная классификация, тегирование и извлечение данных — структурированный output при минимальных затратах
  • Простые Q&A и RAG — контекст уже содержит ответ, модели нужно только извлечь его
  • Внутренние циклы агентов — итеративные вызовы инструментов порождают много коротких запросов, Flash минимизирует стоимость каждого
  • Первичное суммирование — предварительные сводки длинных документов, которые затем ревьюит человек или дорабатывает сильная модель
  • Бюджетные задачи с изображениями — базовый OCR, чтение диаграмм, парсинг документов

Max нужен для:

  • Сложный многошаговый reasoning — математика, логика, глубокий анализ
  • Продакшн-код — написание, отладка и ревью кода для production
  • Долгосрочные агентные задачи — автономное программирование и проектная работа, требующие планирования и самокоррекции
  • Видеоанализ — Max принимает видео, Flash — нет (по текущим данным)
  • Критически важные тексты — юридические, финансовые или медицинские документы, где ошибка стоит дороже, чем inference

Гибридный паттерн: Flash по умолчанию, Max как fallback

Самая экономичная схема для большинства операторов — уровневая маршрутизация:

  1. Все запросы по умолчанию идут на Flash
  2. При ошибке или низкой уверенности — эскалация на Max
  3. Известные сложные категории сразу идут на Max — список типов задач (сложный coding, видеоанализ и т.д.)

Такой паттерн обычно оставляет 70–90% трафика на Flash-тарифе, сохраняя Max-качество для запросов, которым оно действительно нужно.

from openai import OpenAI

# Обе модели на одном OpenAI-совместимом endpoint DashScope
client = OpenAI(
    api_key="your-dashscope-api-key",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)

def route_completion(messages, task_type="general"):
    """Маршрутизация на Flash или Max по типу задачи."""
    hard_tasks = {"code_generation", "video_analysis", "complex_reasoning"}

    model = "qwen3.8-max" if task_type in hard_tasks else "qwen3.8-flash"

    response = client.chat.completions.create(
        model=model,
        messages=messages,
    )
    return response

Настройка API: OpenAI SDK + DashScope

Обе модели доступны через один endpoint. Единственная разница — параметр model.

from openai import OpenAI

client = OpenAI(
    api_key="your-dashscope-api-key",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)

# Flash — оптимизация по стоимости
flash_response = client.chat.completions.create(
    model="qwen3.8-flash",
    messages=[{"role": "user", "content": "Summarize this document..."}],
)

# Max — флагманский reasoning
max_response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "Debug this function and explain the fix..."}],
)

Режим глубокого мышления работает одинаково для обеих моделей:

response = client.chat.completions.create(
    model="qwen3.8-flash",  # или qwen3.8-max
    messages=[{"role": "user", "content": "Solve this step by step..."}],
    extra_body={"enable_thinking": True},
)

Anthropic-совместимый endpoint тоже поддерживается — замените base_url на путь /apps/anthropic и используйте Anthropic SDK. Flash и Max доступны через оба протокола.

Qwen3.8-Flash и Qwen3.8-Flash-Next — разные модели

Важный нюанс. 26 августа Alibaba также опубликовала Qwen3.8-Flash-Next как open-weight модель на Hugging Face. Это отдельная модель — 125 миллиардов параметров (6 миллиардов активных), позиционируется как превью архитектуры Qwen4. Нативный контекст 262K (расширяется до 1M через YaRN), поддержка vision и управление reasoning effort.

Qwen3.8-Flash-Next — это open-weight research-модель. Qwen3.8-Flash (без «Next») — проприетарная API-модель на DashScope. Связь между их архитектурами официально не раскрыта. Для маршрутизации через API используйте model ID qwen3.8-flash на DashScope.

Интеграция с TheRouter

TheRouter маршрутизирует OpenAI-совместимые запросы через настроенные провайдеры, включая DashScope. Для операторов, работающих с Flash и Max одновременно, конфигурация маршрутизации позволяет задать Flash как основной путь, а Max — как fallback.

На момент публикации qwen3.8-flash ещё не добавлен в реестр моделей TheRouter. После добавления он будет маршрутизируем наравне с qwen3.8-max через стандартную конфигурацию провайдера.

FAQ

Можно ли использовать Qwen3.8-Flash с Claude Code или Codex?

Да. В описании DashScope явно упоминается совместимость с Claude Code и Codex через endpoint-ы OpenAI и Anthropic. Укажите base URL DashScope и model ID qwen3.8-flash.

Flash поддерживает контекст 1M токенов, как и Max?

Да. Обе модели заявляют 1M нативного контекста. Структура ценообразования может отличаться — Max использует единый тариф на весь контекст, Flash исторически применяет ступенчатое повышение по длине input. Проверяйте актуальные данные на официальной странице.

Flash достаточно хорош для coding?

Для рутинных задач (форматирование, простой рефакторинг, генерация шаблонного кода) Flash, скорее всего, справится. Для сложной отладки, архитектурных решений и ревью production-кода Max — более надёжный выбор. DashScope описывает Flash как «outstanding» для coding, но независимые бенчмарки API-модели пока не опубликованы.

Какие rate limits?

DashScope устанавливает rate limits по модели и уровню аккаунта. Flash-модели обычно имеют более высокие лимиты concurrency, что делает их подходящими для высокопроизводительных агентных нагрузок. Конкретные лимиты для qwen3.8-flash пока не опубликованы.

Стоит ли переходить с Qwen3.7-Flash?

Если вы уже на qwen3.7-flash, Qwen3.8-Flash — естественный путь обновления. Модель наследует Flash-тариф, добавляя улучшения поколения 3.8 в coding, агентном выполнении и визуальном понимании. Протестируйте на реальной нагрузке перед переключением production-трафика.


Источники: DashScope Newly Released Models (дата обращения: 2026-08-27), DashScope Model Pricing (дата обращения: 2026-08-27), Alibaba Cloud Model Studio Models (дата обращения: 2026-08-27), BenchLM Qwen3.8 Max (дата обращения: 2026-08-27), BenchLM Qwen3.8-Flash-Next (дата обращения: 2026-08-27), Fello AI Qwen Pricing (дата обращения: 2026-08-27)

Модели, упомянутые в статье

Помощь и контакты