← Все статьи

Qwen3.8 Open-Source (2.4T-A95B) vs Qwen3.8-Max: что значат открытые веса для API-маршрутизации

Alibaba опубликовала открытые веса Qwen3.8-2.4T-A95B 12 августа 2026 года — та же архитектура на 2,4 триллиона параметров, что и у закрытого Qwen3.8-Max. Сравниваем различия в возможностях, ценах на DashScope и SiliconFlow, а также настройку маршрутизации через OpenAI-совместимый шлюз.

· TheRouter

3 августа 2026 года Alibaba выпустила Qwen3.8-Max как закрытую API-модель. Через девять дней, 12 августа, команда опубликовала открытые веса Qwen3.8-2.4T-A95B на Hugging Face и ModelScope. Обе модели построены на одной архитектуре sparse Mixture-of-Experts: 2,4 триллиона параметров, из которых 95 миллиардов активируются при каждом forward pass.

Это не один и тот же продукт. Открытая версия работает только с текстом. Закрытая Max сохраняет встроенную поддержку изображений и видео, structured outputs, встроенные инструменты и проприетарный post-training от Alibaba. Разница в цене столь же существенна: сторонние inference-провайдеры обслуживают открытую версию за малую долю стоимости Max на DashScope.

Ниже — сравнение по архитектуре, ценам, сценариям использования и настройке маршрутизации.

Архитектура: один каркас, разные возможности

Qwen3.8-2.4T-A95B и Qwen3.8-Max — MoE-модели с 2,4T параметров, 95B активных на токен, контекстным окном 1M токенов и поддержкой thinking mode (расширенная цепочка рассуждений).

Открытая версия — модель исключительно для генерации текста. Vision encoder не включён. Изображения и видеокадры передать нельзя. Закрытая Max принимает текст, изображения и видео.

Max также предоставляет возможности, зависящие от серверной инфраструктуры Alibaba: function calling, structured outputs (JSON mode), batch processing, prefix completion и пять встроенных инструментов в Responses API (code_interpreter, web_search, web_extractor, t2i_search, i2i_search). Открытый checkpoint не поддерживает их нативно, но framework-ы вроде vLLM могут реализовать function calling и JSON mode поверх.

СвойствоQwen3.8-2.4T-A95B (open)Qwen3.8-Max (proprietary)
Всего параметров2,4T2,4T
Активных параметров95B95B
Контекстное окно1M токенов1M токенов
Модальности вводаТолько текстТекст, изображения, видео
Thinking modeДаДа
Function callingЗависит от frameworkНативный
Structured outputЗависит от frameworkНативный (JSON mode)
Batch APIНетДа
Встроенные инструментыНет5 инструментов в Responses API
ЛицензияApache 2.0Проприетарная (API)
Веса доступныДа (HuggingFace, ModelScope)Нет

Источники: блог Qwen, ModelScope, MarktechPost. Получено 2026-08-20.

Цены: разрыв значителен

Qwen3.8-Max на DashScope (регион Пекин) стоит ¥12 за миллион входных токенов и ¥36 за миллион выходных, примерно $2,00 и $6,00. Кэшированный ввод — $0,25/M. Единая ставка на весь 1M-контекст, без ступенчатого тарифа.

Открытый Qwen3.8-2.4T-A95B доступен через сторонних inference-провайдеров по значительно более низкой цене. SiliconFlow предлагает $0,14 за миллион входных токенов — на 93% дешевле Max на DashScope. OpenRouter тоже хостит открытую версию.

DashScope сам публикует model ID qwen3.8-2.4t-a95b, но ценник идентичен Max: ¥12/¥36. Преимущество в цене появляется только при вызове через стороннего провайдера.

ПровайдерМодельInput (/M токенов)Output (/M токенов)
DashScopeqwen3.8-max$2,00$6,00
DashScopeqwen3.8-2.4t-a95b$2,00$6,00
SiliconFlowQwen3.8-2.4T-A95B$0,14варьируется
OpenRouterqwen/qwen3.8-2.4t-a95bварьируетсяварьируется

Источники: DashScope pricing, SiliconFlow. Получено 2026-08-20.

Сравнивая цены API между провайдерами, всегда нормализуйте кUSD за миллион токенов и разделяйте input и output. Большинство провайдеров берёт за output токены в 2–5 раз дороже, чем за input, поэтому нагрузка с длинными completion'ами при одной и той же номинальной цене обходится дороже.

  • Одна валюта (USD) — конвертация на дату публикации с указанием курса.
  • Разделяйте input/output — никогда не публикуйте смешанную цифру.
  • Цитируйте каждую строку со страницы цен провайдера + дата извлечения.
  • Указывайте тарифы длинного контекста — они часто скачут вверх.

Когда какую модель использовать

Выбор определяется тремя факторами: нужно ли vision, нужна ли минимальная цена текстового inference, нужен ли проприетарный инструментарий.

Выбирайте Qwen3.8-Max, когда:

  • Рабочие нагрузки включают изображения или видео (OCR документов, анализ скриншотов, индексация видео)
  • Нужен нативный function calling, structured outputs или batch processing без overhead на стороне framework
  • Нужны встроенные инструменты (code_interpreter, web_search) без собственного управления
  • Кэширование контекста на DashScope ($0,25/M) делает Max конкурентоспособным по цене при высокой степени переиспользования промптов

Выбирайте Qwen3.8-2.4T-A95B (открытые веса), когда:

  • Нагрузка — чистый текст: coding agents, исследовательские задачи, генерация документов
  • Нужна минимальная стоимость за токен с маршрутизацией через SiliconFlow или self-hosting
  • Данные должны оставаться в вашей инфраструктуре (compliance, air-gapped среды)
  • Нужно fine-tuning модели под конкретный домен

Маршрутизация между обеими моделями:

  • Основной поток — текст (SiliconFlow, экономия), меньшая часть запросов содержит изображения (DashScope Max)
  • Нужен fallback chain: сначала дешёвый endpoint с открытыми весами, при недоступности — Max

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Настройка маршрутизации

Обе модели используют OpenAI Chat Completions protocol. При использовании OpenAI-совместимого шлюза переключение — это смена model ID и base URL.

# Текстовый запрос → маршрут на SiliconFlow (открытые веса, дешевле)
from openai import OpenAI

client = OpenAI(
    base_url="https://api.siliconflow.cn/v1",
    api_key="YOUR_SILICONFLOW_KEY",
)

response = client.chat.completions.create(
    model="Qwen/Qwen3.8-2.4T-A95B",
    messages=[{"role": "user", "content": "Перепишите эту функцию с async/await."}],
)
# Vision-запрос → маршрут на DashScope (закрытый Max, мультимодальный)
client = OpenAI(
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
    api_key="YOUR_DASHSCOPE_KEY",
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Опишите, что изображено на этом скриншоте."},
            {"type": "image_url", "image_url": {"url": "https://example.com/screenshot.png"}},
        ],
    }],
)

OpenAI-совместимый routing layer может проверять тип содержимого запроса и направлять текстовые запросы на дешёвый endpoint с открытыми весами, а мультимодальные — на DashScope Max.

Бенчмарки: насколько открытая версия близка к Max

Alibaba опубликовала бенчмарки для Qwen3.8-Max, но не выпустила отдельную таблицу для открытого checkpoint. Карточка модели на ModelScope подтверждает идентичную архитектуру (2,4T всего, 95B активных), но не содержит оценок.

BenchLM оценивает Qwen3.8-Max на 79,9/100, шестое место из 221 модели. Terminal-Bench 2.1 — 86,6 (ниже GPT-5.6 Sol 88,8, выше Claude Opus 4.8 84,6), GPQA Diamond — 92,6, PaperBench — 93,0.

Для открытой версии ожидается близкий результат на чисто текстовых бенчмарках, поскольку архитектура и количество параметров идентичны. Разрыв проявится на любом evaluation, требующем визуального ввода.

По состоянию на 20 августа 2026 года независимые бенчмарки, нацеленные именно на Qwen3.8-2.4T-A95B, ещё появляются.

Источники: BenchLM, блог Qwen, MarktechPost. Получено 2026-08-20.

Self-hosting: практические соображения

Открытый checkpoint выпущен под лицензией Apache 2.0. Его можно скачать с Hugging Face или ModelScope и развернуть на собственной инфраструктуре.

Практическая сложность — масштаб. 2,4T параметров, даже с MoE-разрежённостью (95B активных), требуют значительного объёма GPU-памяти. Одна нода с 8x H100 (80 ГБ каждая, 640 ГБ суммарно) может оказаться недостаточной в зависимости от overhead framework для маршрутизации экспертов. Мультинодные развёртывания — реалистичный путь для продакшн self-hosting.

Для команд, которым нужен on-premise inference без multi-node кластера, Qwen3.8-27B (dense-модель, выпущена 19 августа, тоже Apache 2.0) помещается на одном 80 ГБ GPU и даёт возможности поколения Qwen3.8 в меньшем масштабе.

Практичный путь для большинства команд: использовать SiliconFlow для hosted inference 2,4T-модели и развёрнуть 27B dense вариант локально для latency-sensitive или air-gapped нагрузок.

Итог

ПараметрОткрытые веса (2.4T-A95B)Закрытая (Max)
Лучшая цена (текст)~$0,14/M input через SiliconFlow$2,00/M input через DashScope
VisionНетДа
ИнструментарийЗависит от frameworkНативный
Self-hostingДа (Apache 2.0)Нет
Роль в маршрутизацииПо умолчанию для текстовых задач, высокий объёмМультимодальные задачи, зависимость от нативных инструментов

Открытые веса превращают Qwen3.8 из API одного вендора в модель, доступную у нескольких провайдеров. Для текстовых нагрузок маршрутизация через SiliconFlow по $0,14/M вместо DashScope по $2,00/M — это экономия 93% на той же архитектуре. Для любых задач с изображениями или видео в семействе Qwen3.8 остаётся только закрытая Max.

Настроить маршрутизацию между ними — прагматичное решение для большинства команд.

Источники, цитируемые в статье:

  1. Анонс Qwen3.8-Max — блог Qwen (получено 2026-08-20)
  2. Цены DashScope — Alibaba Cloud (получено 2026-08-20)
  3. Карточка Qwen3.8-2.4T-A95B — ModelScope (получено 2026-08-20)
  4. Анонс SiliconFlow — X/Twitter (получено 2026-08-20)
  5. Бенчмарки Qwen3.8-Max — BenchLM (получено 2026-08-20)
  6. MarktechPost о Qwen3.8-Max (получено 2026-08-20)
  7. Анализ цен Qwen API — Spheron (получено 2026-08-20)
  8. Страница цен SiliconFlow (получено 2026-08-20)
Помощь и контакты