Qwen3.8-27B Dense: локальное развёртывание и API-маршрутизация для лучшей open-weight визуально-языковой модели
Qwen3.8-27B — dense визуально-языковая модель с 27,78 миллиарда параметров, которую можно запустить на одном GPU. Руководство охватывает локальное развёртывание через vLLM и SGLang, доступ через DashScope API, требования к оборудованию и маршрутизацию запросов через OpenAI-совместимый шлюз.
Qwen3.8-27B — это dense визуально-языковая модель с 27,78 миллиарда параметров от команды Qwen (Alibaba), выпущенная 14 августа 2026 года. Модель принимает текст, изображения и видео, распространяется под Apache 2.0 и имеет нативное контекстное окно 262 144 tokens. Ключевое слово здесь — dense. В отличие от Qwen3.8-Max с 2,4 триллиона параметров (sparse MoE), эта модель помещается на один GPU, позволяя командам организовать self-hosting без многоузлового кластера.
Мы подготовили это руководство, потому что выбор между dense и MoE — практическое инженерное решение, а не теоретическое. Если Qwen3.8-27B справляется с вашими задачами по написанию кода, анализу документов или агентными workflow локально, вы полностью убираете расходы на API с оплатой за token. Когда локальных ресурсов не хватает (пиковые часы, всплески трафика, контекст длиннее бюджета VRAM), запросы переключаются на managed API через OpenAI-совместимый routing.
Qwen3.8-27B: обзор
| Параметр | Значение |
|---|---|
| Количество параметров | 27 781 427 952 (dense) |
| Архитектура | 64 decoder-слоя (48 Gated DeltaNet + 16 full-attention) |
| Модальности | Текст + изображения + видео → текст |
| Контекстное окно | 262 144 tokens нативно (до 1M через YaRN) |
| Лицензия | Apache 2.0 |
| Режим рассуждений | Да (thinking + non-thinking) |
| Hidden / FFN | 5 120 / 17 408 |
| Внимание | 24 query heads, 4 KV heads, head dim 256 (GQA) |
| DashScope model ID | qwen3.8-27b |
| Hugging Face | Qwen/Qwen3.8-27B |
Источники: Hugging Face model card (получено 2026-08-21), DashScope newly-released models (получено 2026-08-21), Kingy.ai specifications review (получено 2026-08-21).
Почему dense важен для self-hosting
Семейство Qwen3.8 сейчас представлено в двух вариантах развёртывания.
| Модель | Архитектура | Параметры | Активация на шаг | Мин. VRAM (полная точность) | На одном GPU? |
|---|---|---|---|---|---|
| Qwen3.8-Max | Sparse MoE | 2,4T | ~95B | Многоузловой кластер | Нет |
| Qwen3.8-27B | Dense | 27,78B | 27,78B (все активны) | ~56 ГБ (BF16) | Да |
MoE-модель с 2,4 триллиона параметров требует нескольких high-end GPU только для размещения весов. Стоимость аренды inference-кластера — тысячи долларов в месяц. Dense-модель на 27B помещается на один GPU с 80 ГБ при BF16, а при 4-bit квантовании — даже на потребительскую видеокарту с 24 ГБ.
Практическая ценность Qwen3.8-27B: команды, которые не могут или не хотят разворачивать кластер под Qwen3.8-Max, получают сильные возможности в коде, рассуждениях и vision на локальном оборудовании.
Подробное сравнение MoE и open-weight вариантов — в нашем сравнении Qwen3.8 Open-Source 2.4T vs. Proprietary Max.
Результаты бенчмарков
Результаты, опубликованные командой Qwen (все оценки получены самой командой; независимые воспроизведения ещё формируются по состоянию на 21 августа 2026 года).
| Бенчмарк | Qwen3.8-27B | Qwen3.6-27B | Разница |
|---|---|---|---|
| Terminal-Bench 2.1 | 73.0 | 63.4 | +9.6 |
| DeepSWE 1.1 | 42.2 | 13.3 | +28.9 |
| SWE-bench Pro | 61.7 | — | — |
| OSWorld-Verified | 84.3 | 63.9 | +20.4 |
| SWE-MM | 38.6 | 25.7 | +12.9 |
| GPQA Diamond | 89.2 | — | — |
| Humanity's Last Exam | 30.8 | — | — |
Улучшения в программировании и агентных задачах по сравнению с Qwen3.6-27B значительны. Terminal-Bench, DeepSWE и OSWorld показывают существенные скачки, что совпадает с описанием в release notes DashScope.
Важно: все перечисленные оценки — от самой команды Qwen. Часть бенчмарков использует внутренние или модифицированные harness. Независимая верификация от сообщества пока на ранней стадии.
Источники: Hugging Face model card (получено 2026-08-21), Kingy.ai benchmark analysis (получено 2026-08-21), Northflank deployment guide (получено 2026-08-21).
Требования к оборудованию
Полная точность (BF16 / FP8)
Сами веса модели занимают около 55,6 ГБ в BF16. С учётом KV cache для разумного контекстного окна:
- 80 ГБ GPU (A100 / H100 / H200) — комфортный BF16 inference с контекстом до 128K.
- 48 ГБ GPU (A6000 / L40S) — работает с FP8-квантованием при строгом контроле контекста.
Квантованный inference (4-bit / GGUF)
На Hugging Face доступны сторонние GGUF-конвертации. При 4-bit квантовании:
- 24 ГБ GPU (RTX 4090 / RTX 5090) — модель помещается, но практический контекст ~8K-16K tokens.
- 32-48 ГБ unified memory (Apple M-серия) — через Ollama или llama.cpp с большим запасом для контекста.
Типичная ошибка: 24 ГБ хватает только для весов. KV cache растёт линейно с длиной последовательности. 4-bit модель на 24 ГБ GPU при 262K контексте выходит за пределы памяти. Для комфортной работы с квантованной моделью рекомендуем 32-48 ГБ.
Рекомендация для production
# Один H100 80GB или A100 80GB
# BF16 или FP8 inference, контекст 32K-128K
# Ожидаемая скорость генерации 40-80 tokens/сек (зависит от batch size)
Источники: Kingy.ai hardware analysis (получено 2026-08-21), Northflank GPU requirements (получено 2026-08-21).
Локальное развёртывание с vLLM
vLLM обеспечивает высокопроизводительный inference с OpenAI-совместимым API.
pip install vllm
vllm serve Qwen/Qwen3.8-27B \
--host 0.0.0.0 \
--port 8000 \
--max-model-len 32768 \
--dtype bfloat16
После запуска сервера можно вызывать модель через OpenAI SDK:
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:8000/v1",
api_key="not-needed",
)
response = client.chat.completions.create(
model="Qwen/Qwen3.8-27B",
messages=[
{"role": "user", "content": "Объясните разницу между dense и MoE архитектурами в трёх предложениях."}
],
)
print(response.choices[0].message.content)
FP8 inference на H100 для экономии VRAM:
vllm serve Qwen/Qwen3.8-27B \
--host 0.0.0.0 \
--port 8000 \
--max-model-len 65536 \
--dtype float16 \
--quantization fp8
Локальное развёртывание с SGLang
SGLang — ещё один высокопроизводительный вариант с нативной поддержкой Qwen3.8-27B.
pip install sglang[all]
python -m sglang.launch_server \
--model-path Qwen/Qwen3.8-27B \
--host 0.0.0.0 \
--port 8000 \
--context-length 32768
SGLang также предоставляет OpenAI-совместимый endpoint /v1/chat/completions, поэтому клиентский код из раздела vLLM работает без изменений.
Источник: SGLang Qwen3.8-27B cookbook (получено 2026-08-21).
Развёртывание через Ollama (потребительское оборудование)
Для рабочих станций и ноутбуков Ollama — самый простой способ:
ollama run qwen3.8:27b
Автоматически загружает квантованный GGUF и запускается на Apple Silicon (рекомендуется 32 ГБ+) или NVIDIA GPU с 24 ГБ+ VRAM. OpenAI-совместимый API доступен по адресу http://localhost:11434/v1.
DashScope Managed API
Если self-hosting не нужен, Qwen3.8-27B доступна на DashScope (Alibaba Cloud Model Studio) с model ID qwen3.8-27b.
Ценообразование (регион Пекин)
По состоянию на 21 августа 2026 года, DashScope не опубликовал отдельную цену для qwen3.8-27b. Ожидается тот же ценовой уровень, что и у других моделей класса 27B. Актуальные тарифы — на странице ценообразования DashScope.
Сторонние API-провайдеры
Qwen3.8-27B также доступна через сторонних inference-провайдеров.
| Провайдер | Вход (за 1M tokens) | Выход (за 1M tokens) | Источник |
|---|---|---|---|
| OpenRouter | $0.40 | $3.00 | openrouter.ai (получено 2026-08-21) |
| SiliconFlow | ~$0.30-0.45 | ~$3.20 | siliconflow.com/pricing (получено 2026-08-21) |
Для команд, уже использующих SiliconFlow или DashScope через OpenAI-совместимый routing, добавление Qwen3.8-27B — изменение одного параметра конфигурации.
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
Быстрый старт с DashScope API
from openai import OpenAI
client = OpenAI(
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
api_key="sk-your-dashscope-key",
)
response = client.chat.completions.create(
model="qwen3.8-27b",
messages=[
{"role": "user", "content": "Какие преимущества dense-моделей перед MoE для локального развёртывания?"}
],
)
print(response.choices[0].message.content)
Визуальный ввод
Qwen3.8-27B — нативная визуально-языковая модель. Изображения передаются в содержимом сообщения:
response = client.chat.completions.create(
model="qwen3.8-27b",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Опишите содержимое этой архитектурной диаграммы."},
{"type": "image_url", "image_url": {"url": "https://example.com/diagram.png"}},
],
}
],
)
Гибридная маршрутизация: local-first с API fallback
Наиболее экономичная схема развёртывания Qwen3.8-27B сочетает локальный self-hosting с managed API fallback. Идея проста.
- Основной путь — запросы направляются на локальный vLLM/SGLang инстанс.
- Fallback — при исчерпании локальных ресурсов (глубина очереди, загрузка GPU, контекст длиннее бюджета VRAM) запросы автоматически переключаются на DashScope или SiliconFlow.
- Специальный путь — для задач, требующих MoE-флагмана (анализ сверхдлинного контекста, сложные многошаговые рассуждения), запросы направляются напрямую на
qwen3.8-maxв DashScope.
Схема работает, потому что и Qwen3.8-27B, и managed DashScope API используют OpenAI-совместимый протокол chat completions. OpenAI-совместимый routing gateway переключается между локальным и облачным endpoint без изменений кода приложения.
TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров. Если локальный endpoint и DashScope настроены как провайдеры, routing-слой автоматически обрабатывает failover.
Self-hosting или API?
| Сценарий | Рекомендация |
|---|---|
| Постоянный высоконагруженный inference (тысячи запросов/час) | Self-host — амортизированная стоимость GPU ниже потокенной оплаты |
| Чувствительные к конфиденциальности задачи (медицина, юриспруденция, финансы) | Self-host — данные не покидают вашу инфраструктуру |
| Всплески трафика или непредсказуемая нагрузка | API — оплата по факту, мгновенное масштабирование |
| Контекст 1M+ tokens | API (Qwen3.8-Max) — YaRN-расширение 27B до 1M пока экспериментально |
| Coding agent с умеренным контекстом (8K-32K) | Self-host — идеальная зона для 27B dense на одном GPU |
| Мультимодальный анализ документов | Зависит от объёма и требований к latency |
Типичные проблемы при развёртывании
Out of Memory на длинном контексте
Нативный контекст 262K не означает, что ваш GPU его потянет. KV cache растёт линейно с длиной последовательности. На 24 ГБ GPU с 4-bit весами практический контекст — 8K-16K. Для 128K+ выделяйте 80 ГБ VRAM.
Высокая latency первого token
Dense-модели на 27B имеют более высокую latency первого token, чем компактные модели вроде Qwen3.7-Flash. Для ответа быстрее 200 мс рассмотрите FP8 inference на H100 или managed API.
Качество GGUF vs. официальных весов
На Hugging Face только BF16 и FP8 checkpoint — официальные артефакты Qwen. Все GGUF-файлы — сторонние конвертации. Качество при агрессивном квантовании (2-bit, 3-bit) заметно падает. Мы рекомендуем 4-bit (Q4_K_M или Q4_K_S) как практический минимум для production.
Чеклист для production
- GPU подобран правильно — 80 ГБ для BF16/FP8, 24-48 ГБ для квантованных моделей
- Контекстный бюджет установлен —
--max-model-lenсоответствует реальному VRAM, а не максимуму 262K - Health checks настроены — vLLM и SGLang предоставляют endpoint
/health - Fallback-провайдер сконфигурирован — DashScope или SiliconFlow на случай недоступности локального сервера
- Rate limiting установлен — защита GPU от перегрузки очереди при пиках трафика
- Мониторинг работает — отслеживание GPU utilization, глубины очереди и p99 latency
Qwen3.8-27B vs. сопоставимые open-weight модели
| Модель | Параметры | Dense/MoE | Vision | Контекст | Лицензия | SWE-bench Pro |
|---|---|---|---|---|---|---|
| Qwen3.8-27B | 27,78B | Dense | Да | 262K | Apache 2.0 | 61.7 |
| Qwen3.6-27B | ~27B | Dense | Да | 131K | Apache 2.0 | — |
| DeepSeek-V4-Flash | 284B всего / 13B активных | MoE | Нет | 1M | Model License | — |
| GLM-5.3 | Open-weight | Dense | Нет | 1M | — | — |
В классе dense-моделей на 27B у Qwen3.8-27B сейчас нет прямого конкурента, сочетающего визуальный ввод, сильные coding-бенчмарки и лицензию Apache 2.0.
Итоги
Qwen3.8-27B — наиболее сильная open-weight dense модель, которую мы видели, для локального развёртывания мультимодальных, coding и агентных задач. Она работает на одном GPU, поддерживает OpenAI-совместимый API и может использоваться в гибридной архитектуре с managed API fallback.
Если вы оцениваете self-hosted модели для coding agent, анализа документов или inference с повышенными требованиями к конфиденциальности, Qwen3.8-27B — тот checkpoint, который стоит протестировать. Начните с DashScope API для валидации use case, затем переходите на локальный inference, когда экономика это оправдывает.
Источники, цитируемые в статье:
- Hugging Face — Qwen/Qwen3.8-27B model card (получено 2026-08-21)
- DashScope — Newly Released Models (получено 2026-08-21)
- DashScope — Model Pricing (получено 2026-08-21)
- Kingy.ai — Qwen3.8-27B Specs, Benchmarks and Verdict (получено 2026-08-21)
- Kingy.ai — Qwen3.8-27B Local Hardware Guide (получено 2026-08-21)
- Northflank — Qwen3.8-27B Performance, Benchmarks, GPU Requirements (получено 2026-08-21)
- SGLang — Qwen3.8-27B Deployment Cookbook (получено 2026-08-21)
- OpenRouter — Qwen3.8-27B Pricing (получено 2026-08-21)
- SiliconFlow — Pricing (получено 2026-08-21)