Qwen3.8-Max API: полное руководство по флагманской модели DashScope на 2.4T параметров
Практическое руководство по Qwen3.8-Max — флагманской MoE-модели Alibaba на 2.4 триллиона параметров в DashScope. API-интеграция, тарифы, режим reasoning, мультимодальный ввод и маршрутизация через OpenAI-совместимый gateway.
Qwen3.8-Max — новая флагманская модель Alibaba, выпущенная 3 августа 2026 года. Это sparse Mixture-of-Experts модель на 2.4 триллиона параметров, принимающая текст, изображения и видео на вход и генерирующая текст. Контекстное окно — 1M token, встроенный режим reasoning и OpenAI-совместимый API — интеграция занимает менее трёх минут: достаточно изменить две строки в любом OpenAI SDK клиенте.
Мы написали это руководство, потому что Qwen3.8-Max демонстрирует значительный прогресс по сравнению с серией Qwen3.7 в кодинге, агентных и мультимодальных benchmark. Если вы оцениваете китайских LLM API провайдеров или ищете экономичную модель frontier-класса — Qwen3.8-Max стоит протестировать.
Qwen3.8-Max: обзор
| Характеристика | Значение |
|---|---|
| Параметры | 2.4 триллиона (sparse MoE) |
| Модальности | Текст + изображения + видео → текст |
| Контекстное окно | 1 000 000 token |
| Макс. ввод | 991 232 token (983 040 с reasoning) |
| Макс. вывод | 131 072 token |
| Бюджет reasoning | 262 144 token |
| Rate limits | 2M TPM, 15K RPM |
| Режим reasoning | Да (thinking + non-thinking) |
| Context cache | Да (implicit + explicit) |
| Batch-вызовы | Да (скидка 50%) |
| Function calling | Да |
| Structured output | Да |
| API-совместимость | OpenAI-compatible, Anthropic-compatible, DashScope native |
| Model ID | qwen3.8-max |
Источники: Alibaba Cloud Model Studio — тарифы, блог Qwen3.8-Max, MarkTechPost. Получено 2026-08-03.
Быстрый старт за 3 минуты
Шаг 1: Получите API-ключ DashScope
Зарегистрируйтесь в Alibaba Cloud Model Studio (百炼). Перейдите в раздел API Keys в консоли и сгенерируйте новый ключ. Международные пользователи могут зарегистрироваться через Alibaba Cloud International.
Шаг 2: Установите OpenAI SDK
pip install openai
Шаг 3: Отправьте первый запрос
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
from openai import OpenAI
client = OpenAI(
api_key="sk-your-dashscope-api-key",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{"role": "user", "content": "Объясните разницу между MoE и dense transformer архитектурами в двух абзацах."}
],
)
print(response.choices[0].message.content)
DashScope endpoint совместим с протоколом OpenAI, поэтому любой инструмент, поддерживающий OpenAI chat completions — Cursor, Claude Code с custom endpoint, LiteLLM или ваш собственный SDK-wrapper — работает без дополнительных изменений.
Источник: Alibaba Cloud — совместимость с OpenAI. Получено 2026-08-03.
Режим reasoning (расширенные рассуждения)
Qwen3.8-Max поддерживает режимы thinking и non-thinking. В режиме thinking модель генерирует внутреннюю цепочку рассуждений перед выдачей финального ответа — аналогично o-серии OpenAI или extended thinking Claude.
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{"role": "user", "content": "Докажите, что квадратный корень из 2 иррационален."}
],
extra_body={"enable_thinking": True},
stream=True,
)
for chunk in response:
delta = chunk.choices[0].delta
# reasoning-контент в delta.reasoning_content
# финальный ответ в delta.content
if hasattr(delta, "reasoning_content") and delta.reasoning_content:
print(f"[reasoning] {delta.reasoning_content}", end="")
if delta.content:
print(delta.content, end="")
Ключевые детали:
- Режим reasoning использует отдельный бюджет до 262 144 token
- Как reasoning-token, так и token ответа учитываются в биллинге вывода
- При включённом reasoning максимальный ввод снижается до 983 040 token (с 991 232)
- Параметр
thinking_budgetконтролирует длину рассуждений
Источник: DashScope — генерация текста. Получено 2026-08-03.
Мультимодальный ввод: изображения и видео
Qwen3.8-Max нативно принимает изображения и видеокадры. В отличие от Qwen3.7-Max (только текст), переключение на отдельную модель для мультимодальных задач не требуется.
Ввод изображений
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Опишите архитектурную диаграмму на этом изображении."},
{"type": "image_url", "image_url": {"url": "https://example.com/arch-diagram.png"}},
],
}
],
)
Ввод видео
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Кратко опишите, что происходит в этом видео."},
{"type": "video_url", "video_url": {"url": "https://example.com/demo.mp4"}},
],
}
],
)
Это существенное улучшение по сравнению с серией Qwen3.7, где для vision-задач требовался Qwen3.7-Plus, а для reasoning — Qwen3.7-Max. Qwen3.8-Max объединяет обе возможности в одном model ID.
Сравнение тарифов
| Модель | Ввод (за 1M token) | Вывод (за 1M token) | Контекст |
|---|---|---|---|
| Qwen3.8-Max | ¥12 (~$1.65) | ¥36 (~$4.95) | 1M |
| Qwen3.7-Max | ¥12 (промо 50%: ¥6) | ¥36 (промо 50%: ¥18) | 1M |
| Qwen3.7-Plus | ¥2 (промо 20%: ¥1.60) | ¥8 (промо 20%: ¥6.40) | 1M |
| Qwen3-Max | ¥2.50–¥7 (уровневая) | ¥10–¥28 (уровневая) | 256K |
| Claude Opus 4.8 | $15 | $75 | 200K |
Цены указаны для региона Китай (Пекин). Международные регионы (Сингапур, США Вирджиния, Франкфурт, Токио) имеют другие тарифы. Qwen3.7-Max сейчас имеет ограниченную по времени скидку 50%; Qwen3.8-Max запущен по стандартным тарифам без вводной скидки.
Международные тарифы: $2.00/1M input token, $6.00/1M output token. Implicit cache reads — $0.25/1M, explicit cache creation — $2.50/1M, explicit cache reads — $0.17/1M.
Источники: Alibaba Cloud Model Studio — тарифы, QwenCloud. Получено 2026-08-03.
Производительность: Qwen3.8-Max vs Qwen3.7-Max
Данные benchmark из официального анонса Alibaba. Независимые оценки на момент написания отсутствуют.
| Benchmark | Qwen3.8-Max | Qwen3.7-Max | Разница |
|---|---|---|---|
| Terminal-Bench 2.1 | 86.6 | — | — |
| SWE-bench Pro | 67.7 | — | — |
| FrontierSWE | 73.5 | 40.7 | +32.8 |
| DeepSWE 1.1 | 56.6 | 21.6 | +35.0 |
| JobBench | 53.4 | 31.3 | +22.1 |
| PaperBench | 93.0 | — | — |
| GPQA Diamond | 92.6 | 92.4 | +0.2 |
| IFBench | 82.8 | — | — |
| OSWorld-Verified | 86.1 | — | — |
| OmniDocBench 1.5 | 92.1 | — | — |
Оговорки:
- Все данные benchmark заявлены производителем. Независимые оценки пока не опубликованы.
- Мультимодальные сравнения в официальном блоге проводятся с Qwen3.7-Plus (не Qwen3.7-Max), что завышает межпоколенческую разницу.
- Количество активных параметров не раскрыто — опубликовано только общее количество (2.4T).
Источники: блог Qwen3.8-Max, MarkTechPost. Получено 2026-08-03.
Model ID и версионирование
DashScope сейчас предлагает один model ID для Qwen3.8-Max:
qwen3.8-max— rolling alias, указывающий на последнюю стабильную версию
В отличие от серии Qwen3.7 (у которой есть dated snapshot вроде qwen3.7-max-2026-05-20 и qwen3.7-max-2026-06-08), для Qwen3.8-Max dated snapshot пока не опубликованы. Если version pinning важен для production — следите за страницей новых моделей DashScope.
О лучших практиках версионирования моделей у разных провайдеров — в нашем руководстве по версионированию и alias LLM API.
Типичные ошибки и решения
| Ошибка | Причина | Решение |
|---|---|---|
InvalidParameter: model not found | Неверный model ID или регион | Используйте qwen3.8-max. Убедитесь, что API-ключ принадлежит региону с развёрнутой моделью (Пекин, Сингапур, США Вирджиния, Франкфурт, Токио). |
429 Too Many Requests | Превышен rate limit | DashScope допускает 2M TPM и 15K RPM. Используйте exponential backoff. См. наш справочник по обработке ошибок. |
context_length_exceeded | Ввод превышает 991K token (983K в режиме reasoning) | Сократите или суммаризуйте ввод. Рассмотрите context cache для повторяющихся prefix. |
| Reasoning token не появляются в stream | Режим reasoning не включён | Передайте extra_body={"enable_thinking": True}. Reasoning-контент приходит в delta.reasoning_content, не в delta.content. |
| Vision-запрос возвращает text-only ошибку | URL изображения недоступен | Убедитесь, что URL изображения публично доступен. DashScope получает изображения на стороне сервера. Base64-кодирование тоже работает. |
Источник: DashScope — коды ошибок. Получено 2026-08-03.
Чек-лист для production
Перед выводом Qwen3.8-Max в production проверьте:
- Ротация API-ключей — храните ключи в secrets manager, не в коде. См. наше руководство по управлению API-ключами.
- Стратегия version pinning — решите, следовать rolling alias
qwen3.8-maxили ждать dated snapshot. Rolling alias может изменить поведение без уведомления. - Цепочка fallback — настройте fallback на Qwen3.7-Max или другого провайдера. См. наше руководство по fallback-маршрутизации.
- Мониторинг затрат — отслеживайте потребление token по модели. Режим reasoning может генерировать до 262K reasoning token за запрос, и все они учитываются в биллинге вывода.
- Запас по rate limit — 2M TPM и 15K RPM достаточно для большинства задач, но batch-нагрузки могут упереться в лимит. Реализуйте retry с backoff по нашему руководству по timeout и retry.
- Context cache — для задач со стабильными prefix (системные промпты, few-shot примеры) включите implicit или explicit context cache для снижения стоимости ввода до 90%.
- Тестируйте мультимодальность отдельно — при миграции с text-only модели (Qwen3.7-Max) проверьте, что prompt-шаблоны случайно не отправляют image_url контент, который новая модель интерпретирует иначе.
Интеграция с TheRouter
TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров, включая DashScope. Если ваш deployment использует TheRouter для provider routing и fallback, добавьте Qwen3.8-Max как model target на DashScope provider:
- Настройте DashScope как provider с API-ключом и base URL
https://dashscope.aliyuncs.com/compatible-mode/v1 - Добавьте
qwen3.8-maxкак model entry, указывающий на DashScope provider - Опционально настройте fallback chain:
qwen3.8-max → qwen3.7-max → qwen3.7-plus
Поскольку и DashScope, и TheRouter используют протокол OpenAI, код вашего приложения не меняется — обновляется только routing-конфигурация. Детали настройки — в нашем руководстве по Aliyun Bailian API и OpenAI-совместимые API-провайдеры.
Примечание: Qwen3.8-Max пока не добавлен в models-data.ts TheRouter. Актуальный список поддерживаемых моделей — на странице DashScope provider.
Полезные ссылки
- DashScope Qwen3.7 — полное руководство — предыдущая серия
- Qwen3.7-Max мультимодальный vs GPT-4o vs Claude Sonnet 4
- Qwen3 → Qwen3.7: руководство по миграции
- Aliyun Bailian API — руководство
- Сравнение LLM API провайдеров 2026
- OpenAI-совместимые API-провайдеры
- DashScope provider
- OpenAI-совместимая интеграция