Назад к моделям

Qwen3-8B — компактная dense causal language model от команды Alibaba Qwen с 8,2B параметрами: начальный эффективный уровень в линейке Qwen3 dense. Построена на 36 слоях transformer с GQA 32/8, выпущена под Apache 2.0 в апреле 2025 года. Согласно техническому отчёту Qwen3, базовая модель Qwen3-8B соответствует по производительности Qwen2.5-14B-Base, демонстрируя полное поколение параметрической эффективности: возможности уровня 14B предыдущего поколения при 8B параметрах и значительно более низкой стоимости инференса.

Как и все инструктивные модели Qwen3, Qwen3-8B поставляется с hybrid thinking в качестве нативной функции: единый checkpoint переключается между deep-reasoning thinking mode (пошаговые рассуждения в блоках <think>) и быстрым non-thinking mode, управляется per-request через enable_thinking или токены /think / /no_think. При $0,03 / $0,06 за миллион input/output токенов Qwen3-8B — самый доступный вариант в dense линейке Qwen3: правильный выбор по умолчанию для высокопоточных пайплайнов, быстрых черновиков и задач классификации, где скорость и стоимость важнее абсолютного reasoning-потолка. Команды, которым нужен шаг вверх по качеству для более сложных аналитических или многошаговых задач, могут перейти на qwen/qwen3-14b ($0,03/$0,06 против $0,07/$0,21) без изменения API-интеграции.

Когда выбирать
  • • Высокопоточные, cost-sensitive пайплайны — при $0,03/$0,06 за M токенов Qwen3-8B — самый дешёвый вариант в dense линейке Qwen3; идеален для задач, где объём и latency важнее глубины рассуждений
  • • Задачи классификации, маршрутизации и извлечения — прямолинейные NLU нагрузки, где возможности Qwen3-8B уровня Qwen2.5-14B значительно превышают необходимую планку качества
  • • Лёгкие agentic loops с tool calling — поддерживает tools и tool_choice в обоих режимах; более низкая per-call стоимость по сравнению с Qwen3-14B для agent loops с множеством коротких ходов
  • • Многоязычные текстовые задачи — поддержка 119 языков и диалектов, унаследованная от семейства Qwen3; подходит для перевода, суммаризации и многоязычной классификации при низкой стоимости
  • • Edge, on-device или self-hosted инференс — около 8B параметров, Qwen3-8B комфортно помещается на одном потребительском GPU (например, RTX 3090/4070 при 4-bit) или Apple Silicon с высокой эффективностью производительности к энергопотреблению; Apache 2.0 для неограниченного коммерческого использования
Когда не выбирать
  • • Сложный многошаговый reasoning, конкурсная математика или генерация сложного кода — маршрутизируйте на qwen/qwen3-14b или qwen/qwen3-32b, когда глубина рассуждений является узким местом; Qwen3-8B — начальный уровень, а не потолок
  • • Batch-задачи с максимальной пропускной способностью, где важна ещё более низкая per-token стоимость — qwen/qwen3-30b-a3b (MoE, 3B активных параметров) достигает более низкой стоимости обслуживания per token в масштабе, несмотря на больший общий параметрический счёт
  • • Нативный image или audio input — Qwen3-8B text-in/text-out only; для vision-language задач при схожем размере модели используйте qwen/qwen3-vl-8b
Размер контекста
131K
Максимальный вывод
33K
Цена Входза 1M токенов
$0.1944за 1 млн токенов
Цена Выходза 1M токенов
$0.756за 1 млн токенов

Модальности

Текст→Текст

Разбивка цен

ТипСтавка
Вход$0.1944 за 1 млн токенов
Выход$0.756 за 1 млн токенов

Поддерживаемые параметры

temperaturemax_tokenstop_ptoolstool_choiceresponse_formatstop

Характеристики

Всего параметров8,2Bhuggingface.co/Qwen ↗проверено
АрхитектураDense causal transformer, 36 слоёв, GQA 32/8 (Q/KV heads)huggingface.co/Qwen ↗проверено
Длина контекста131 072 токена (нативные 32 768; расширено до 131 072 через YaRN)huggingface.co/Qwen ↗проверено
Макс. токенов в ответе32 768huggingface.co/Qwen ↗проверено
ЛицензияApache 2.0huggingface.co/Qwen ↗проверено
Дата релизаАпрель 2025qwenlm.github.io ↗проверено
Этап обученияPretraining & Post-training (instruct модель)huggingface.co/Qwen ↗проверено
Эффективность по сравнению с предыдущим поколениемСоответствует Qwen2.5-14B-Base при 8B параметрах — выигрыш целого поколения параметрической эффективностиqwenlm.github.io ↗проверено

Бенчмарки

BenchmarkDistributionScoreSource
MMLU
Базовая модель; 5-shot
76.57%arxiv.org — Qwen3 technical report ↗
MMLU-Pro
Базовая модель
55.92%arxiv.org — Qwen3 technical report ↗
BBH (BIG-Bench Hard)
Базовая модель; 3-shot CoT
76.84%arxiv.org — Qwen3 technical report ↗
GSM8K
Базовая модель; 4-shot
88.93%arxiv.org — Qwen3 technical report ↗
GPQA
Базовая модель; вопросы аспирантского уровня по науке
36.87%arxiv.org — Qwen3 technical report ↗

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "qwen/qwen3-8b",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

Ещё от qwen

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2025-04-29

Выпущено семейство Qwen3 — Qwen3-8B среди шести open-weight dense моделей

Alibaba Qwen выпустила полный комплект Qwen3, включая Qwen3-8B как dense causal LM с 8,2B параметрами, hybrid thinking modes, 128K context (YaRN-extended), поддержкой 119 языков и лицензией Apache 2.0. В анонсе подчёркивалось, что базовая модель Qwen3-8B достигает паритета с Qwen2.5-14B-Base, представляя полное поколение улучшения параметрической эффективности. При $0,03/$0,06 за миллион input/output токенов — наиболее доступный по стоимости вариант в dense линейке Qwen3.

переработано TheRouterqwenlm.github.io ↗
2025-05-15

Технический отчёт Qwen3 опубликован на arXiv

Команда Qwen выпустила полный технический отчёт (arXiv 2505.09388), охватывающий pretraining, post-training, hybrid thinking архитектуру, многоязычные возможности и сравнительные бенчмарки для всей линейки Qwen3, включая Qwen3-8B. Отчёт документирует бенчмарки базовой модели: Qwen3-8B — MMLU 76,57, BBH 76,84, GSM8K 88,93, GPQA 36,87.

переработано TheRouterarxiv.org ↗

Частые вопросы

Как Qwen3-8B соотносится с Qwen3-14B?

Qwen3-8B (36 слоёв, GQA 32/8, 8,2B параметров) — начальный уровень; Qwen3-14B (40 слоёв, GQA 40/8, 14,8B параметров) — следующий размер. Обе поддерживают hybrid thinking и 128K context. База Qwen3-8B соответствует Qwen2.5-14B-Base; база Qwen3-14B — Qwen2.5-32B-Base: полный дополнительный шаг в параметрическом размере по возможностям. По стоимости: Qwen3-8B — $0,03/$0,06 за M токенов против Qwen3-14B — $0,07/$0,21. Используйте Qwen3-8B для высокопоточных или более простых задач; переходите на 14B, когда глубина reasoning или качество ответов становятся ограничением.

Как переключаться между thinking и non-thinking режимом?

Через TheRouter — параметр reasoning на /v1/chat/completions. При self-hosting — enable_thinking=True или enable_thinking=False в chat template, или /think / /no_think в системном промпте или первом сообщении пользователя. Thinking mode — по умолчанию. При активном thinking mode ответы содержат блок <think>...</think>, который следует разобрать или убрать перед показом конечным пользователям.

Каков фактический context window для qwen/qwen3-8b на TheRouter?

Нативный контекст модели — 32 768 токенов, расширенный до 131 072 токенов через YaRN позиционную интерполяцию. TheRouter устанавливает context_length 131 072 и max_completion 32 768. На дальнем конце YaRN-диапазона производительность может снижаться на очень сложных промптах; проверяйте наибольшие входы перед production rollout.

Поддерживает ли Qwen3-8B tool calling и structured output?

Да. Qwen3-8B поддерживает tools и tool_choice для function calling, а также response_format для structured output через стандартные OpenAI-compatible параметры на TheRouter. Поддержка tool calling сохраняется в обоих режимах, что делает её подходящей для лёгких agentic пайплайнов.

Можно ли использовать Qwen3-8B из Cursor, Cline или другого OpenAI-compatible клиента?

Да. TheRouter предоставляет qwen/qwen3-8b через OpenAI-compatible endpoint /v1/chat/completions. Укажите base URL вашего клиента как TheRouter endpoint, настройте API key и установите model в qwen/qwen3-8b. Поддерживаются streaming, tools и response_format.

Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Всего параметровhuggingface.co/Qwen ↗2026-06-09проверено
Архитектураhuggingface.co/Qwen ↗2026-06-09проверено
Длина контекстаhuggingface.co/Qwen ↗2026-06-09проверено
Макс. токенов в ответеhuggingface.co/Qwen ↗2026-06-09проверено
Лицензияhuggingface.co/Qwen ↗2026-06-09проверено
Дата релизаqwenlm.github.io ↗2026-06-09проверено
Этап обученияhuggingface.co/Qwen ↗2026-06-09проверено
Эффективность по сравнению с предыдущим поколениемqwenlm.github.io ↗2026-06-09проверено
MMLUarxiv.org — Qwen3 technical report ↗2026-06-09проверено
MMLU-Proarxiv.org — Qwen3 technical report ↗2026-06-09проверено
BBH (BIG-Bench Hard)arxiv.org — Qwen3 technical report ↗2026-06-09проверено
GSM8Karxiv.org — Qwen3 technical report ↗2026-06-09проверено
GPQAarxiv.org — Qwen3 technical report ↗2026-06-09проверено
Выпущено семейство Qwen3 — Qwen3-8B среди шести open-weight dense моделейqwenlm.github.io ↗2026-06-09проверено
Технический отчёт Qwen3 опубликован на arXivarxiv.org ↗2026-06-09проверено
Как Qwen3-8B соотносится с Qwen3-14B?qwenlm.github.io ↗2026-06-09к проверке
Как переключаться между thinking и non-thinking режимом?huggingface.co ↗2026-06-09к проверке
Каков фактический context window для qwen/qwen3-8b на TheRouter?huggingface.co ↗2026-06-09к проверке
Поддерживает ли Qwen3-8B tool calling и structured output?huggingface.co ↗2026-06-09к проверке
Можно ли использовать Qwen3-8B из Cursor, Cline или другого OpenAI-compatible клиента?qwenlm.github.io ↗2026-06-09к проверке
Помощь и контакты