Qwen3.8-Max — теперь топовая модель DashScope: что смена флагмана меняет в вашей routing-политике
qwen3.8-max появился на DashScope: 2.4T параметров, 1M контекст и режим размышлений — а qwen3.7-max переведён в legacy. Что меняется для команд, маршрутизирующих трафик на флагманский уровень Qwen.

3 августа 2026 года Alibaba выпустила qwen3.8-max — 2.4 триллиона параметров суммарно, 95 миллиардов активных через sparse MoE, контекстное окно в 1 миллион токенов. Уже через 48 часов официальная документация DashScope по text generation перевела qwen3.7-max в раздел legacy и заменила его на qwen3.8-max как единственную рекомендованную модель высшего уровня. Для команд, маршрутизирующих трафик на флагманский уровень Qwen, изменились два ключевых параметра: model ID для вызовов и базовый уровень возможностей, на который можно рассчитывать.
Что изменилось на DashScope
В основной таблице рекомендованных моделей DashScope теперь указан qwen3.8-max с четырьмя включёнными флагами: режим размышлений (параметр enable_thinking), Function Calling, встроенные инструменты (веб-поиск, code interpreter) и structured output. Семейство qwen3.7-max — включая снапшоты qwen3.7-max-preview, qwen3.7-max-2026-06-08, qwen3.7-max-2026-05-20, qwen3.7-max-2026-05-17 — по-прежнему доступно для вызова, но страница явно помечает его как "旧版模型" (legacy). Автоматического перенаправления alias не задокументировано.
Контекстное окно qwen3.8-max — 1M токенов, как и у qwen3.7-max. Responses API управляет глубиной размышлений через reasoning.effort; Chat Completions API использует булев параметр enable_thinking. Эти параметры перешли без изменений из поколения Qwen3.7. На qwen3.8-max пока нет суффикса с датой снапшота — модель существует в "плавающем" виде, что обычно предшествует появлению версии с датой (например, qwen3.8-max-2026-08-03) в течение нескольких дней или недель.
Четыре региона, где DashScope предоставляет эту модель: Beijing (cn-beijing), Singapore (ap-southeast-1), US East (us-east-1) и Frankfurt (eu-central-1). При запуске SLA по задержке между регионами не объявлялся.
Что это значит для AI engineering-команд
Перевод qwen3.7-max в legacy — ваш сигнал к миграции. В отличие от событий deprecation с явной датой отключения, тихий переход DashScope в статус legacy означает, что qwen3.7-max остаётся доступным для вызова, но перестаёт получать обновления функций, приоритет по capacity и новые версии снапшотов. Команды, запинившие конкретный снапшот (qwen3.7-max-2026-06-08), защищены от дрейфа alias, но команды, маршрутизирующие на неверсионированную строку qwen3.7-max, в какой-то момент столкнутся с изменениями. Операционально безопасный шаг — плановая миграция на qwen3.8-max.
Model ID на DashScope отличается от старых alias Qwen. Устаревший alias qwen-max (доступен на DashScope) поддерживает лишь 32k контекста и предшествует целому поколению Qwen3. Команды, не перешедшие явно на версионированные ID qwen3.x-max, фактически маршрутизируют трафик на принципиально другой уровень возможностей. qwen3.8-max — текущий топовый ID, не qwen-max и не qwen3-max (256k контекста, более раннее поколение).
Параметры режима размышлений переносятся без изменений. Если ваш routing layer сейчас выставляет enable_thinking: true для Qwen3.7-Max, запросы к qwen3.8-max работают так же. Путь через reasoning.effort в Responses API (low, medium, high) тоже сохраняется. Параметры мигрировать не нужно.
Архитектура MoE меняет расчёт задержки. При 95B активных параметров из 2.4T суммарных qwen3.8-max тратит на каждый токен примерно столько же вычислений, сколько плотная модель на ~95B параметров. Для команд, строящих политики маршрутизации с учётом задержки, это лучше, чем можно было ожидать от 2.4T плотной архитектуры. Тем не менее задержка первого токена при запросах на 1M контекста отличается от коротких запросов — учитывайте это при настройке timeout на вашем AI gateway.
Взгляд оператора и роутера
Без автоматического обновления alias — только явная миграция. В отличие от провайдеров с плавающим alias (например, gpt-4o, указывающий на новую версию), переход qwen3.7-max → qwen3.8-max требует ручного изменения routing config. Никакого redirect не объявлено. Проверьте поле model в каждом маршруте, направленном на qwen3.7-max или его снапшоты, и замените на qwen3.8-max.
Контекст сравнения с другими провайдерами. Официальная документация DashScope позиционирует qwen3.8-max как эквивалент GPT-5.5, Claude Opus 4.7 и Gemini 3.1 Pro по уровню возможностей. Для команд с multi-provider routing и quality-based model selection qwen3.8-max попадает в high-capability lane — тот же уровень, что Claude Opus 4.7 или GPT-5.5 в вашей fallback-цепочке.
Пока нет pinned снапшота — qwen3.8-max ведёт себя как floating ID. Пока не появится версия с датой (например, qwen3.8-max-2026-08-03), model ID qwen3.8-max неверсионирован и может быть тихо обновлён. Для production-нагрузок, где важна воспроизводимость, следите за первой версией снапшота и немедленно закрепляйте её в routing config после появления. Судя по паттерну команды Qwen (первый снапшот qwen3.7-max-2026-05-17 появился через несколько дней после релиза), именованный снапшот выйдет скоро.
Открытые веса — на следующей неделе, новый fallback-путь. Alibaba объявила об открытии весов qwen3.8-max в течение недели после запуска API. Для команд с self-hosted inference (vLLM, SGLang и аналоги) это открывает путь для маршрутизации пиковой нагрузки или latency-чувствительного трафика на локальный endpoint с той же моделью. Это меняет fallback-архитектуру: вместо DashScope → другой облачный провайдер появляется вариант DashScope → self-hosted веса qwen3.8-max.
Ценовой уровень. При запуске qwen3.8-max позиционирован как premium tier. Подписка Token Plan для DashScope (анонсирована 4 августа) охватывает мультимодальный доступ, но per-token ценообразование для флагманского уровня соответствует прежним ценам qwen3.7-max в топовом сегменте. Промо-ценообразования или кредитных льгот при запуске не объявлено.
На что обратить внимание и что попробовать
- Обновите routing-конфиги: замените
qwen3.7-maxнаqwen3.8-maxв таблице маршрутизации моделей. Проверьте тестовым вызовом, что параметрыenable_thinkingиreasoning.effortработают как ожидается. - Следите за снапшотами: подпишитесь на changelog DashScope или release notes Alibaba Cloud Model Studio, чтобы не пропустить первый снапшот
qwen3.8-max-YYYY-MM-DD. Сразу закрепите его в routing config для воспроизводимости. - Проверьте региональную доступность: если вы маршрутизируете в конкретный регион DashScope (например, Singapore для снижения задержки в APAC), убедитесь в доступности
qwen3.8-maxи ожидаемой задержке в этом регионе до переключения сqwen3.7-max. - Проведите аудит старых alias Qwen: если в routing config остались маршруты с
qwen-max(legacy 32k alias) илиqwen3-max(256k, более раннее поколение), составьте план явной миграции.qwen3.8-max— текущая топовая модель. - Отслеживайте открытые веса: после публикации оцените, имеет ли смысл self-hosted
qwen3.8-maxв качестве fallback-ветки в вашей multi-provider routing-архитектуре.
Модели, упомянутые в статье
Похожие материалы
Новости AI-роутинга и провайдеров →
Qwen-MT Turbo: специализированный translation API от Alibaba и параметры extra_body, которые стандартные прокси могут терять
Новый qwen-mt-turbo от Alibaba Cloud приходит через OpenAI-совместимые endpoint, но его translation-контроли живут внутри extra_body — паттерн, который ломается на любом middleware, отрезающем нестандартные поля. Что нужно держать в голове routing-командам.

qwen3.8-max DashScope Routing Policy: endpoints, reasoning and region checks
qwen3.8-max DashScope routing policy now starts with region-scoped endpoints, Responses API reasoning budgets, and preserving reasoning_content in the gateway.

DashScope rate-limit fallback routing: Alibaba превращает 429 в модельную политику
DashScope rate-limit fallback routing стал явным operator-паттерном: Alibaba описывает RPM, TPM, burst protection, backup models, Batch API и временное повышение TPM на 30 дней.