← Все статьи

Qwen3.8-27B Dense: локальное развёртывание и API-маршрутизация для лучшей open-weight визуально-языковой модели

Qwen3.8-27B — dense визуально-языковая модель с 27,78 миллиарда параметров, которую можно запустить на одном GPU. Руководство охватывает локальное развёртывание через vLLM и SGLang, доступ через DashScope API, требования к оборудованию и маршрутизацию запросов через OpenAI-совместимый шлюз.

· TheRouter

Qwen3.8-27B — это dense визуально-языковая модель с 27,78 миллиарда параметров от команды Qwen (Alibaba), выпущенная 14 августа 2026 года. Модель принимает текст, изображения и видео, распространяется под Apache 2.0 и имеет нативное контекстное окно 262 144 tokens. Ключевое слово здесь — dense. В отличие от Qwen3.8-Max с 2,4 триллиона параметров (sparse MoE), эта модель помещается на один GPU, позволяя командам организовать self-hosting без многоузлового кластера.

Мы подготовили это руководство, потому что выбор между dense и MoE — практическое инженерное решение, а не теоретическое. Если Qwen3.8-27B справляется с вашими задачами по написанию кода, анализу документов или агентными workflow локально, вы полностью убираете расходы на API с оплатой за token. Когда локальных ресурсов не хватает (пиковые часы, всплески трафика, контекст длиннее бюджета VRAM), запросы переключаются на managed API через OpenAI-совместимый routing.

Qwen3.8-27B: обзор

ПараметрЗначение
Количество параметров27 781 427 952 (dense)
Архитектура64 decoder-слоя (48 Gated DeltaNet + 16 full-attention)
МодальностиТекст + изображения + видео → текст
Контекстное окно262 144 tokens нативно (до 1M через YaRN)
ЛицензияApache 2.0
Режим рассужденийДа (thinking + non-thinking)
Hidden / FFN5 120 / 17 408
Внимание24 query heads, 4 KV heads, head dim 256 (GQA)
DashScope model IDqwen3.8-27b
Hugging FaceQwen/Qwen3.8-27B

Источники: Hugging Face model card (получено 2026-08-21), DashScope newly-released models (получено 2026-08-21), Kingy.ai specifications review (получено 2026-08-21).

Почему dense важен для self-hosting

Семейство Qwen3.8 сейчас представлено в двух вариантах развёртывания.

МодельАрхитектураПараметрыАктивация на шагМин. VRAM (полная точность)На одном GPU?
Qwen3.8-MaxSparse MoE2,4T~95BМногоузловой кластерНет
Qwen3.8-27BDense27,78B27,78B (все активны)~56 ГБ (BF16)Да

MoE-модель с 2,4 триллиона параметров требует нескольких high-end GPU только для размещения весов. Стоимость аренды inference-кластера — тысячи долларов в месяц. Dense-модель на 27B помещается на один GPU с 80 ГБ при BF16, а при 4-bit квантовании — даже на потребительскую видеокарту с 24 ГБ.

Практическая ценность Qwen3.8-27B: команды, которые не могут или не хотят разворачивать кластер под Qwen3.8-Max, получают сильные возможности в коде, рассуждениях и vision на локальном оборудовании.

Подробное сравнение MoE и open-weight вариантов — в нашем сравнении Qwen3.8 Open-Source 2.4T vs. Proprietary Max.

Результаты бенчмарков

Результаты, опубликованные командой Qwen (все оценки получены самой командой; независимые воспроизведения ещё формируются по состоянию на 21 августа 2026 года).

БенчмаркQwen3.8-27BQwen3.6-27BРазница
Terminal-Bench 2.173.063.4+9.6
DeepSWE 1.142.213.3+28.9
SWE-bench Pro61.7——
OSWorld-Verified84.363.9+20.4
SWE-MM38.625.7+12.9
GPQA Diamond89.2——
Humanity's Last Exam30.8——

Улучшения в программировании и агентных задачах по сравнению с Qwen3.6-27B значительны. Terminal-Bench, DeepSWE и OSWorld показывают существенные скачки, что совпадает с описанием в release notes DashScope.

Важно: все перечисленные оценки — от самой команды Qwen. Часть бенчмарков использует внутренние или модифицированные harness. Независимая верификация от сообщества пока на ранней стадии.

Источники: Hugging Face model card (получено 2026-08-21), Kingy.ai benchmark analysis (получено 2026-08-21), Northflank deployment guide (получено 2026-08-21).

Требования к оборудованию

Полная точность (BF16 / FP8)

Сами веса модели занимают около 55,6 ГБ в BF16. С учётом KV cache для разумного контекстного окна:

  • 80 ГБ GPU (A100 / H100 / H200) — комфортный BF16 inference с контекстом до 128K.
  • 48 ГБ GPU (A6000 / L40S) — работает с FP8-квантованием при строгом контроле контекста.

Квантованный inference (4-bit / GGUF)

На Hugging Face доступны сторонние GGUF-конвертации. При 4-bit квантовании:

  • 24 ГБ GPU (RTX 4090 / RTX 5090) — модель помещается, но практический контекст ~8K-16K tokens.
  • 32-48 ГБ unified memory (Apple M-серия) — через Ollama или llama.cpp с большим запасом для контекста.

Типичная ошибка: 24 ГБ хватает только для весов. KV cache растёт линейно с длиной последовательности. 4-bit модель на 24 ГБ GPU при 262K контексте выходит за пределы памяти. Для комфортной работы с квантованной моделью рекомендуем 32-48 ГБ.

Рекомендация для production

# Один H100 80GB или A100 80GB
# BF16 или FP8 inference, контекст 32K-128K
# Ожидаемая скорость генерации 40-80 tokens/сек (зависит от batch size)

Источники: Kingy.ai hardware analysis (получено 2026-08-21), Northflank GPU requirements (получено 2026-08-21).

Локальное развёртывание с vLLM

vLLM обеспечивает высокопроизводительный inference с OpenAI-совместимым API.

pip install vllm

vllm serve Qwen/Qwen3.8-27B \
  --host 0.0.0.0 \
  --port 8000 \
  --max-model-len 32768 \
  --dtype bfloat16

После запуска сервера можно вызывать модель через OpenAI SDK:

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="not-needed",
)

response = client.chat.completions.create(
    model="Qwen/Qwen3.8-27B",
    messages=[
        {"role": "user", "content": "Объясните разницу между dense и MoE архитектурами в трёх предложениях."}
    ],
)
print(response.choices[0].message.content)

FP8 inference на H100 для экономии VRAM:

vllm serve Qwen/Qwen3.8-27B \
  --host 0.0.0.0 \
  --port 8000 \
  --max-model-len 65536 \
  --dtype float16 \
  --quantization fp8

Локальное развёртывание с SGLang

SGLang — ещё один высокопроизводительный вариант с нативной поддержкой Qwen3.8-27B.

pip install sglang[all]

python -m sglang.launch_server \
  --model-path Qwen/Qwen3.8-27B \
  --host 0.0.0.0 \
  --port 8000 \
  --context-length 32768

SGLang также предоставляет OpenAI-совместимый endpoint /v1/chat/completions, поэтому клиентский код из раздела vLLM работает без изменений.

Источник: SGLang Qwen3.8-27B cookbook (получено 2026-08-21).

Развёртывание через Ollama (потребительское оборудование)

Для рабочих станций и ноутбуков Ollama — самый простой способ:

ollama run qwen3.8:27b

Автоматически загружает квантованный GGUF и запускается на Apple Silicon (рекомендуется 32 ГБ+) или NVIDIA GPU с 24 ГБ+ VRAM. OpenAI-совместимый API доступен по адресу http://localhost:11434/v1.

DashScope Managed API

Если self-hosting не нужен, Qwen3.8-27B доступна на DashScope (Alibaba Cloud Model Studio) с model ID qwen3.8-27b.

Ценообразование (регион Пекин)

По состоянию на 21 августа 2026 года, DashScope не опубликовал отдельную цену для qwen3.8-27b. Ожидается тот же ценовой уровень, что и у других моделей класса 27B. Актуальные тарифы — на странице ценообразования DashScope.

Сторонние API-провайдеры

Qwen3.8-27B также доступна через сторонних inference-провайдеров.

ПровайдерВход (за 1M tokens)Выход (за 1M tokens)Источник
OpenRouter$0.40$3.00openrouter.ai (получено 2026-08-21)
SiliconFlow~$0.30-0.45~$3.20siliconflow.com/pricing (получено 2026-08-21)

Для команд, уже использующих SiliconFlow или DashScope через OpenAI-совместимый routing, добавление Qwen3.8-27B — изменение одного параметра конфигурации.

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Быстрый старт с DashScope API

from openai import OpenAI

client = OpenAI(
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
    api_key="sk-your-dashscope-key",
)

response = client.chat.completions.create(
    model="qwen3.8-27b",
    messages=[
        {"role": "user", "content": "Какие преимущества dense-моделей перед MoE для локального развёртывания?"}
    ],
)
print(response.choices[0].message.content)

Визуальный ввод

Qwen3.8-27B — нативная визуально-языковая модель. Изображения передаются в содержимом сообщения:

response = client.chat.completions.create(
    model="qwen3.8-27b",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "Опишите содержимое этой архитектурной диаграммы."},
                {"type": "image_url", "image_url": {"url": "https://example.com/diagram.png"}},
            ],
        }
    ],
)

Гибридная маршрутизация: local-first с API fallback

Наиболее экономичная схема развёртывания Qwen3.8-27B сочетает локальный self-hosting с managed API fallback. Идея проста.

  1. Основной путь — запросы направляются на локальный vLLM/SGLang инстанс.
  2. Fallback — при исчерпании локальных ресурсов (глубина очереди, загрузка GPU, контекст длиннее бюджета VRAM) запросы автоматически переключаются на DashScope или SiliconFlow.
  3. Специальный путь — для задач, требующих MoE-флагмана (анализ сверхдлинного контекста, сложные многошаговые рассуждения), запросы направляются напрямую на qwen3.8-max в DashScope.

Схема работает, потому что и Qwen3.8-27B, и managed DashScope API используют OpenAI-совместимый протокол chat completions. OpenAI-совместимый routing gateway переключается между локальным и облачным endpoint без изменений кода приложения.

TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров. Если локальный endpoint и DashScope настроены как провайдеры, routing-слой автоматически обрабатывает failover.

Self-hosting или API?

СценарийРекомендация
Постоянный высоконагруженный inference (тысячи запросов/час)Self-host — амортизированная стоимость GPU ниже потокенной оплаты
Чувствительные к конфиденциальности задачи (медицина, юриспруденция, финансы)Self-host — данные не покидают вашу инфраструктуру
Всплески трафика или непредсказуемая нагрузкаAPI — оплата по факту, мгновенное масштабирование
Контекст 1M+ tokensAPI (Qwen3.8-Max) — YaRN-расширение 27B до 1M пока экспериментально
Coding agent с умеренным контекстом (8K-32K)Self-host — идеальная зона для 27B dense на одном GPU
Мультимодальный анализ документовЗависит от объёма и требований к latency

Типичные проблемы при развёртывании

Out of Memory на длинном контексте

Нативный контекст 262K не означает, что ваш GPU его потянет. KV cache растёт линейно с длиной последовательности. На 24 ГБ GPU с 4-bit весами практический контекст — 8K-16K. Для 128K+ выделяйте 80 ГБ VRAM.

Высокая latency первого token

Dense-модели на 27B имеют более высокую latency первого token, чем компактные модели вроде Qwen3.7-Flash. Для ответа быстрее 200 мс рассмотрите FP8 inference на H100 или managed API.

Качество GGUF vs. официальных весов

На Hugging Face только BF16 и FP8 checkpoint — официальные артефакты Qwen. Все GGUF-файлы — сторонние конвертации. Качество при агрессивном квантовании (2-bit, 3-bit) заметно падает. Мы рекомендуем 4-bit (Q4_K_M или Q4_K_S) как практический минимум для production.

Чеклист для production

  • GPU подобран правильно — 80 ГБ для BF16/FP8, 24-48 ГБ для квантованных моделей
  • Контекстный бюджет установлен — --max-model-len соответствует реальному VRAM, а не максимуму 262K
  • Health checks настроены — vLLM и SGLang предоставляют endpoint /health
  • Fallback-провайдер сконфигурирован — DashScope или SiliconFlow на случай недоступности локального сервера
  • Rate limiting установлен — защита GPU от перегрузки очереди при пиках трафика
  • Мониторинг работает — отслеживание GPU utilization, глубины очереди и p99 latency

Qwen3.8-27B vs. сопоставимые open-weight модели

МодельПараметрыDense/MoEVisionКонтекстЛицензияSWE-bench Pro
Qwen3.8-27B27,78BDenseДа262KApache 2.061.7
Qwen3.6-27B~27BDenseДа131KApache 2.0—
DeepSeek-V4-Flash284B всего / 13B активныхMoEНет1MModel License—
GLM-5.3Open-weightDenseНет1M——

В классе dense-моделей на 27B у Qwen3.8-27B сейчас нет прямого конкурента, сочетающего визуальный ввод, сильные coding-бенчмарки и лицензию Apache 2.0.

Итоги

Qwen3.8-27B — наиболее сильная open-weight dense модель, которую мы видели, для локального развёртывания мультимодальных, coding и агентных задач. Она работает на одном GPU, поддерживает OpenAI-совместимый API и может использоваться в гибридной архитектуре с managed API fallback.

Если вы оцениваете self-hosted модели для coding agent, анализа документов или inference с повышенными требованиями к конфиденциальности, Qwen3.8-27B — тот checkpoint, который стоит протестировать. Начните с DashScope API для валидации use case, затем переходите на локальный inference, когда экономика это оправдывает.


Источники, цитируемые в статье:

  1. Hugging Face — Qwen/Qwen3.8-27B model card (получено 2026-08-21)
  2. DashScope — Newly Released Models (получено 2026-08-21)
  3. DashScope — Model Pricing (получено 2026-08-21)
  4. Kingy.ai — Qwen3.8-27B Specs, Benchmarks and Verdict (получено 2026-08-21)
  5. Kingy.ai — Qwen3.8-27B Local Hardware Guide (получено 2026-08-21)
  6. Northflank — Qwen3.8-27B Performance, Benchmarks, GPU Requirements (получено 2026-08-21)
  7. SGLang — Qwen3.8-27B Deployment Cookbook (получено 2026-08-21)
  8. OpenRouter — Qwen3.8-27B Pricing (получено 2026-08-21)
  9. SiliconFlow — Pricing (получено 2026-08-21)
Помощь и контакты