Все статьи

Qwen3.8-Max API: полное руководство по флагманской модели DashScope на 2.4T параметров

Практическое руководство по Qwen3.8-Max — флагманской MoE-модели Alibaba на 2.4 триллиона параметров в DashScope. API-интеграция, тарифы, режим reasoning, мультимодальный ввод и маршрутизация через OpenAI-совместимый gateway.

· TheRouter

Qwen3.8-Max — новая флагманская модель Alibaba, выпущенная 3 августа 2026 года. Это sparse Mixture-of-Experts модель на 2.4 триллиона параметров, принимающая текст, изображения и видео на вход и генерирующая текст. Контекстное окно — 1M token, встроенный режим reasoning и OpenAI-совместимый API — интеграция занимает менее трёх минут: достаточно изменить две строки в любом OpenAI SDK клиенте.

Мы написали это руководство, потому что Qwen3.8-Max демонстрирует значительный прогресс по сравнению с серией Qwen3.7 в кодинге, агентных и мультимодальных benchmark. Если вы оцениваете китайских LLM API провайдеров или ищете экономичную модель frontier-класса — Qwen3.8-Max стоит протестировать.

Qwen3.8-Max: обзор

ХарактеристикаЗначение
Параметры2.4 триллиона (sparse MoE)
МодальностиТекст + изображения + видео → текст
Контекстное окно1 000 000 token
Макс. ввод991 232 token (983 040 с reasoning)
Макс. вывод131 072 token
Бюджет reasoning262 144 token
Rate limits2M TPM, 15K RPM
Режим reasoningДа (thinking + non-thinking)
Context cacheДа (implicit + explicit)
Batch-вызовыДа (скидка 50%)
Function callingДа
Structured outputДа
API-совместимостьOpenAI-compatible, Anthropic-compatible, DashScope native
Model IDqwen3.8-max

Источники: Alibaba Cloud Model Studio — тарифы, блог Qwen3.8-Max, MarkTechPost. Получено 2026-08-03.

Быстрый старт за 3 минуты

Шаг 1: Получите API-ключ DashScope

Зарегистрируйтесь в Alibaba Cloud Model Studio (百炼). Перейдите в раздел API Keys в консоли и сгенерируйте новый ключ. Международные пользователи могут зарегистрироваться через Alibaba Cloud International.

Шаг 2: Установите OpenAI SDK

pip install openai

Шаг 3: Отправьте первый запрос

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

from openai import OpenAI

client = OpenAI(
    api_key="sk-your-dashscope-api-key",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {"role": "user", "content": "Объясните разницу между MoE и dense transformer архитектурами в двух абзацах."}
    ],
)

print(response.choices[0].message.content)

DashScope endpoint совместим с протоколом OpenAI, поэтому любой инструмент, поддерживающий OpenAI chat completions — Cursor, Claude Code с custom endpoint, LiteLLM или ваш собственный SDK-wrapper — работает без дополнительных изменений.

Источник: Alibaba Cloud — совместимость с OpenAI. Получено 2026-08-03.

Режим reasoning (расширенные рассуждения)

Qwen3.8-Max поддерживает режимы thinking и non-thinking. В режиме thinking модель генерирует внутреннюю цепочку рассуждений перед выдачей финального ответа — аналогично o-серии OpenAI или extended thinking Claude.

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {"role": "user", "content": "Докажите, что квадратный корень из 2 иррационален."}
    ],
    extra_body={"enable_thinking": True},
    stream=True,
)

for chunk in response:
    delta = chunk.choices[0].delta
    # reasoning-контент в delta.reasoning_content
    # финальный ответ в delta.content
    if hasattr(delta, "reasoning_content") and delta.reasoning_content:
        print(f"[reasoning] {delta.reasoning_content}", end="")
    if delta.content:
        print(delta.content, end="")

Ключевые детали:

  • Режим reasoning использует отдельный бюджет до 262 144 token
  • Как reasoning-token, так и token ответа учитываются в биллинге вывода
  • При включённом reasoning максимальный ввод снижается до 983 040 token (с 991 232)
  • Параметр thinking_budget контролирует длину рассуждений

Источник: DashScope — генерация текста. Получено 2026-08-03.

Мультимодальный ввод: изображения и видео

Qwen3.8-Max нативно принимает изображения и видеокадры. В отличие от Qwen3.7-Max (только текст), переключение на отдельную модель для мультимодальных задач не требуется.

Ввод изображений

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "Опишите архитектурную диаграмму на этом изображении."},
                {"type": "image_url", "image_url": {"url": "https://example.com/arch-diagram.png"}},
            ],
        }
    ],
)

Ввод видео

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "Кратко опишите, что происходит в этом видео."},
                {"type": "video_url", "video_url": {"url": "https://example.com/demo.mp4"}},
            ],
        }
    ],
)

Это существенное улучшение по сравнению с серией Qwen3.7, где для vision-задач требовался Qwen3.7-Plus, а для reasoning — Qwen3.7-Max. Qwen3.8-Max объединяет обе возможности в одном model ID.

Сравнение тарифов

МодельВвод (за 1M token)Вывод (за 1M token)Контекст
Qwen3.8-Max¥12 (~$1.65)¥36 (~$4.95)1M
Qwen3.7-Max¥12 (промо 50%: ¥6)¥36 (промо 50%: ¥18)1M
Qwen3.7-Plus¥2 (промо 20%: ¥1.60)¥8 (промо 20%: ¥6.40)1M
Qwen3-Max¥2.50–¥7 (уровневая)¥10–¥28 (уровневая)256K
Claude Opus 4.8$15$75200K

Цены указаны для региона Китай (Пекин). Международные регионы (Сингапур, США Вирджиния, Франкфурт, Токио) имеют другие тарифы. Qwen3.7-Max сейчас имеет ограниченную по времени скидку 50%; Qwen3.8-Max запущен по стандартным тарифам без вводной скидки.

Международные тарифы: $2.00/1M input token, $6.00/1M output token. Implicit cache reads — $0.25/1M, explicit cache creation — $2.50/1M, explicit cache reads — $0.17/1M.

Источники: Alibaba Cloud Model Studio — тарифы, QwenCloud. Получено 2026-08-03.

Производительность: Qwen3.8-Max vs Qwen3.7-Max

Данные benchmark из официального анонса Alibaba. Независимые оценки на момент написания отсутствуют.

BenchmarkQwen3.8-MaxQwen3.7-MaxРазница
Terminal-Bench 2.186.6
SWE-bench Pro67.7
FrontierSWE73.540.7+32.8
DeepSWE 1.156.621.6+35.0
JobBench53.431.3+22.1
PaperBench93.0
GPQA Diamond92.692.4+0.2
IFBench82.8
OSWorld-Verified86.1
OmniDocBench 1.592.1

Оговорки:

  • Все данные benchmark заявлены производителем. Независимые оценки пока не опубликованы.
  • Мультимодальные сравнения в официальном блоге проводятся с Qwen3.7-Plus (не Qwen3.7-Max), что завышает межпоколенческую разницу.
  • Количество активных параметров не раскрыто — опубликовано только общее количество (2.4T).

Источники: блог Qwen3.8-Max, MarkTechPost. Получено 2026-08-03.

Model ID и версионирование

DashScope сейчас предлагает один model ID для Qwen3.8-Max:

  • qwen3.8-max — rolling alias, указывающий на последнюю стабильную версию

В отличие от серии Qwen3.7 (у которой есть dated snapshot вроде qwen3.7-max-2026-05-20 и qwen3.7-max-2026-06-08), для Qwen3.8-Max dated snapshot пока не опубликованы. Если version pinning важен для production — следите за страницей новых моделей DashScope.

О лучших практиках версионирования моделей у разных провайдеров — в нашем руководстве по версионированию и alias LLM API.

Типичные ошибки и решения

ОшибкаПричинаРешение
InvalidParameter: model not foundНеверный model ID или регионИспользуйте qwen3.8-max. Убедитесь, что API-ключ принадлежит региону с развёрнутой моделью (Пекин, Сингапур, США Вирджиния, Франкфурт, Токио).
429 Too Many RequestsПревышен rate limitDashScope допускает 2M TPM и 15K RPM. Используйте exponential backoff. См. наш справочник по обработке ошибок.
context_length_exceededВвод превышает 991K token (983K в режиме reasoning)Сократите или суммаризуйте ввод. Рассмотрите context cache для повторяющихся prefix.
Reasoning token не появляются в streamРежим reasoning не включёнПередайте extra_body={"enable_thinking": True}. Reasoning-контент приходит в delta.reasoning_content, не в delta.content.
Vision-запрос возвращает text-only ошибкуURL изображения недоступенУбедитесь, что URL изображения публично доступен. DashScope получает изображения на стороне сервера. Base64-кодирование тоже работает.

Источник: DashScope — коды ошибок. Получено 2026-08-03.

Чек-лист для production

Перед выводом Qwen3.8-Max в production проверьте:

  • Ротация API-ключей — храните ключи в secrets manager, не в коде. См. наше руководство по управлению API-ключами.
  • Стратегия version pinning — решите, следовать rolling alias qwen3.8-max или ждать dated snapshot. Rolling alias может изменить поведение без уведомления.
  • Цепочка fallback — настройте fallback на Qwen3.7-Max или другого провайдера. См. наше руководство по fallback-маршрутизации.
  • Мониторинг затрат — отслеживайте потребление token по модели. Режим reasoning может генерировать до 262K reasoning token за запрос, и все они учитываются в биллинге вывода.
  • Запас по rate limit — 2M TPM и 15K RPM достаточно для большинства задач, но batch-нагрузки могут упереться в лимит. Реализуйте retry с backoff по нашему руководству по timeout и retry.
  • Context cache — для задач со стабильными prefix (системные промпты, few-shot примеры) включите implicit или explicit context cache для снижения стоимости ввода до 90%.
  • Тестируйте мультимодальность отдельно — при миграции с text-only модели (Qwen3.7-Max) проверьте, что prompt-шаблоны случайно не отправляют image_url контент, который новая модель интерпретирует иначе.

Интеграция с TheRouter

TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров, включая DashScope. Если ваш deployment использует TheRouter для provider routing и fallback, добавьте Qwen3.8-Max как model target на DashScope provider:

  1. Настройте DashScope как provider с API-ключом и base URL https://dashscope.aliyuncs.com/compatible-mode/v1
  2. Добавьте qwen3.8-max как model entry, указывающий на DashScope provider
  3. Опционально настройте fallback chain: qwen3.8-max → qwen3.7-max → qwen3.7-plus

Поскольку и DashScope, и TheRouter используют протокол OpenAI, код вашего приложения не меняется — обновляется только routing-конфигурация. Детали настройки — в нашем руководстве по Aliyun Bailian API и OpenAI-совместимые API-провайдеры.

Примечание: Qwen3.8-Max пока не добавлен в models-data.ts TheRouter. Актуальный список поддерживаемых моделей — на странице DashScope provider.

Полезные ссылки

Поддержка