Qwen3.8 Open-Source (2.4T-A95B) vs Qwen3.8-Max: что значат открытые веса для API-маршрутизации
Alibaba опубликовала открытые веса Qwen3.8-2.4T-A95B 12 августа 2026 года — та же архитектура на 2,4 триллиона параметров, что и у закрытого Qwen3.8-Max. Сравниваем различия в возможностях, ценах на DashScope и SiliconFlow, а также настройку маршрутизации через OpenAI-совместимый шлюз.
3 августа 2026 года Alibaba выпустила Qwen3.8-Max как закрытую API-модель. Через девять дней, 12 августа, команда опубликовала открытые веса Qwen3.8-2.4T-A95B на Hugging Face и ModelScope. Обе модели построены на одной архитектуре sparse Mixture-of-Experts: 2,4 триллиона параметров, из которых 95 миллиардов активируются при каждом forward pass.
Это не один и тот же продукт. Открытая версия работает только с текстом. Закрытая Max сохраняет встроенную поддержку изображений и видео, structured outputs, встроенные инструменты и проприетарный post-training от Alibaba. Разница в цене столь же существенна: сторонние inference-провайдеры обслуживают открытую версию за малую долю стоимости Max на DashScope.
Ниже — сравнение по архитектуре, ценам, сценариям использования и настройке маршрутизации.
Архитектура: один каркас, разные возможности
Qwen3.8-2.4T-A95B и Qwen3.8-Max — MoE-модели с 2,4T параметров, 95B активных на токен, контекстным окном 1M токенов и поддержкой thinking mode (расширенная цепочка рассуждений).
Открытая версия — модель исключительно для генерации текста. Vision encoder не включён. Изображения и видеокадры передать нельзя. Закрытая Max принимает текст, изображения и видео.
Max также предоставляет возможности, зависящие от серверной инфраструктуры Alibaba: function calling, structured outputs (JSON mode), batch processing, prefix completion и пять встроенных инструментов в Responses API (code_interpreter, web_search, web_extractor, t2i_search, i2i_search). Открытый checkpoint не поддерживает их нативно, но framework-ы вроде vLLM могут реализовать function calling и JSON mode поверх.
| Свойство | Qwen3.8-2.4T-A95B (open) | Qwen3.8-Max (proprietary) |
|---|---|---|
| Всего параметров | 2,4T | 2,4T |
| Активных параметров | 95B | 95B |
| Контекстное окно | 1M токенов | 1M токенов |
| Модальности ввода | Только текст | Текст, изображения, видео |
| Thinking mode | Да | Да |
| Function calling | Зависит от framework | Нативный |
| Structured output | Зависит от framework | Нативный (JSON mode) |
| Batch API | Нет | Да |
| Встроенные инструменты | Нет | 5 инструментов в Responses API |
| Лицензия | Apache 2.0 | Проприетарная (API) |
| Веса доступны | Да (HuggingFace, ModelScope) | Нет |
Источники: блог Qwen, ModelScope, MarktechPost. Получено 2026-08-20.
Цены: разрыв значителен
Qwen3.8-Max на DashScope (регион Пекин) стоит ¥12 за миллион входных токенов и ¥36 за миллион выходных, примерно $2,00 и $6,00. Кэшированный ввод — $0,25/M. Единая ставка на весь 1M-контекст, без ступенчатого тарифа.
Открытый Qwen3.8-2.4T-A95B доступен через сторонних inference-провайдеров по значительно более низкой цене. SiliconFlow предлагает $0,14 за миллион входных токенов — на 93% дешевле Max на DashScope. OpenRouter тоже хостит открытую версию.
DashScope сам публикует model ID qwen3.8-2.4t-a95b, но ценник идентичен Max: ¥12/¥36. Преимущество в цене появляется только при вызове через стороннего провайдера.
| Провайдер | Модель | Input (/M токенов) | Output (/M токенов) |
|---|---|---|---|
| DashScope | qwen3.8-max | $2,00 | $6,00 |
| DashScope | qwen3.8-2.4t-a95b | $2,00 | $6,00 |
| SiliconFlow | Qwen3.8-2.4T-A95B | $0,14 | варьируется |
| OpenRouter | qwen/qwen3.8-2.4t-a95b | варьируется | варьируется |
Источники: DashScope pricing, SiliconFlow. Получено 2026-08-20.
Сравнивая цены API между провайдерами, всегда нормализуйте кUSD за миллион токенов и разделяйте input и output. Большинство провайдеров берёт за output токены в 2–5 раз дороже, чем за input, поэтому нагрузка с длинными completion'ами при одной и той же номинальной цене обходится дороже.
- Одна валюта (USD) — конвертация на дату публикации с указанием курса.
- Разделяйте input/output — никогда не публикуйте смешанную цифру.
- Цитируйте каждую строку со страницы цен провайдера + дата извлечения.
- Указывайте тарифы длинного контекста — они часто скачут вверх.
Когда какую модель использовать
Выбор определяется тремя факторами: нужно ли vision, нужна ли минимальная цена текстового inference, нужен ли проприетарный инструментарий.
Выбирайте Qwen3.8-Max, когда:
- Рабочие нагрузки включают изображения или видео (OCR документов, анализ скриншотов, индексация видео)
- Нужен нативный function calling, structured outputs или batch processing без overhead на стороне framework
- Нужны встроенные инструменты (code_interpreter, web_search) без собственного управления
- Кэширование контекста на DashScope ($0,25/M) делает Max конкурентоспособным по цене при высокой степени переиспользования промптов
Выбирайте Qwen3.8-2.4T-A95B (открытые веса), когда:
- Нагрузка — чистый текст: coding agents, исследовательские задачи, генерация документов
- Нужна минимальная стоимость за токен с маршрутизацией через SiliconFlow или self-hosting
- Данные должны оставаться в вашей инфраструктуре (compliance, air-gapped среды)
- Нужно fine-tuning модели под конкретный домен
Маршрутизация между обеими моделями:
- Основной поток — текст (SiliconFlow, экономия), меньшая часть запросов содержит изображения (DashScope Max)
- Нужен fallback chain: сначала дешёвый endpoint с открытыми весами, при недоступности — Max
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
Настройка маршрутизации
Обе модели используют OpenAI Chat Completions protocol. При использовании OpenAI-совместимого шлюза переключение — это смена model ID и base URL.
# Текстовый запрос → маршрут на SiliconFlow (открытые веса, дешевле)
from openai import OpenAI
client = OpenAI(
base_url="https://api.siliconflow.cn/v1",
api_key="YOUR_SILICONFLOW_KEY",
)
response = client.chat.completions.create(
model="Qwen/Qwen3.8-2.4T-A95B",
messages=[{"role": "user", "content": "Перепишите эту функцию с async/await."}],
)
# Vision-запрос → маршрут на DashScope (закрытый Max, мультимодальный)
client = OpenAI(
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
api_key="YOUR_DASHSCOPE_KEY",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Опишите, что изображено на этом скриншоте."},
{"type": "image_url", "image_url": {"url": "https://example.com/screenshot.png"}},
],
}],
)
OpenAI-совместимый routing layer может проверять тип содержимого запроса и направлять текстовые запросы на дешёвый endpoint с открытыми весами, а мультимодальные — на DashScope Max.
Бенчмарки: насколько открытая версия близка к Max
Alibaba опубликовала бенчмарки для Qwen3.8-Max, но не выпустила отдельную таблицу для открытого checkpoint. Карточка модели на ModelScope подтверждает идентичную архитектуру (2,4T всего, 95B активных), но не содержит оценок.
BenchLM оценивает Qwen3.8-Max на 79,9/100, шестое место из 221 модели. Terminal-Bench 2.1 — 86,6 (ниже GPT-5.6 Sol 88,8, выше Claude Opus 4.8 84,6), GPQA Diamond — 92,6, PaperBench — 93,0.
Для открытой версии ожидается близкий результат на чисто текстовых бенчмарках, поскольку архитектура и количество параметров идентичны. Разрыв проявится на любом evaluation, требующем визуального ввода.
По состоянию на 20 августа 2026 года независимые бенчмарки, нацеленные именно на Qwen3.8-2.4T-A95B, ещё появляются.
Источники: BenchLM, блог Qwen, MarktechPost. Получено 2026-08-20.
Self-hosting: практические соображения
Открытый checkpoint выпущен под лицензией Apache 2.0. Его можно скачать с Hugging Face или ModelScope и развернуть на собственной инфраструктуре.
Практическая сложность — масштаб. 2,4T параметров, даже с MoE-разрежённостью (95B активных), требуют значительного объёма GPU-памяти. Одна нода с 8x H100 (80 ГБ каждая, 640 ГБ суммарно) может оказаться недостаточной в зависимости от overhead framework для маршрутизации экспертов. Мультинодные развёртывания — реалистичный путь для продакшн self-hosting.
Для команд, которым нужен on-premise inference без multi-node кластера, Qwen3.8-27B (dense-модель, выпущена 19 августа, тоже Apache 2.0) помещается на одном 80 ГБ GPU и даёт возможности поколения Qwen3.8 в меньшем масштабе.
Практичный путь для большинства команд: использовать SiliconFlow для hosted inference 2,4T-модели и развёрнуть 27B dense вариант локально для latency-sensitive или air-gapped нагрузок.
Итог
| Параметр | Открытые веса (2.4T-A95B) | Закрытая (Max) |
|---|---|---|
| Лучшая цена (текст) | ~$0,14/M input через SiliconFlow | $2,00/M input через DashScope |
| Vision | Нет | Да |
| Инструментарий | Зависит от framework | Нативный |
| Self-hosting | Да (Apache 2.0) | Нет |
| Роль в маршрутизации | По умолчанию для текстовых задач, высокий объём | Мультимодальные задачи, зависимость от нативных инструментов |
Открытые веса превращают Qwen3.8 из API одного вендора в модель, доступную у нескольких провайдеров. Для текстовых нагрузок маршрутизация через SiliconFlow по $0,14/M вместо DashScope по $2,00/M — это экономия 93% на той же архитектуре. Для любых задач с изображениями или видео в семействе Qwen3.8 остаётся только закрытая Max.
Настроить маршрутизацию между ними — прагматичное решение для большинства команд.
Источники, цитируемые в статье:
- Анонс Qwen3.8-Max — блог Qwen (получено 2026-08-20)
- Цены DashScope — Alibaba Cloud (получено 2026-08-20)
- Карточка Qwen3.8-2.4T-A95B — ModelScope (получено 2026-08-20)
- Анонс SiliconFlow — X/Twitter (получено 2026-08-20)
- Бенчмарки Qwen3.8-Max — BenchLM (получено 2026-08-20)
- MarktechPost о Qwen3.8-Max (получено 2026-08-20)
- Анализ цен Qwen API — Spheron (получено 2026-08-20)
- Страница цен SiliconFlow (получено 2026-08-20)