Qwen3 выпускает dense 32B open-weight model с hybrid thinking modes
Релиз Alibaba Qwen3 включает Qwen3-32B вместе с пятью другими dense models и двумя MoE, с акцентом на hybrid thinking/non-thinking, tool use и multilingual coverage.
Qwen3 dense 32B model. Excellent reasoning and coding at moderate size with thinking mode support.
Qwen3 32B — плотная open-weight reasoning-модель Alibaba Qwen с 32,8 млрд параметров. Она находится между меньшими плотными Qwen3 и крупными MoE-флагманами: её ещё реально обслуживать контролируемо, но мощности хватает для coding, math, multilingual chat и tool-using agents.
TheRouter exposes модель как qwen/qwen3-32b через OpenAI-compatible chat completions с маршрутизацией 131K context, tools, JSON mode и параметром reasoning. Берите её, когда нужен один Qwen, умеющий переключаться между быстрыми non-thinking ответами и более глубоким thinking-mode reasoning без перехода на намного более крупный flagship.
| Тип | Ставка |
|---|---|
| Вход | $0.1728 за 1 млн токенов |
| Выход | $0.6912 за 1 млн токенов |
| Архитектура | Dense causal language model (все 32,8B параметров активны на каждый токен)huggingface.co ↗ | проверено |
| Параметры | 32,8B всего (31,2B без эмбеддингов)huggingface.co ↗ | проверено |
| Слои | 64 слоя Transformerhuggingface.co ↗ | проверено |
| Головы внимания (GQA) | 64 query heads / 8 KV heads (GQA)huggingface.co ↗ | проверено |
| Нативный контекст | 32 768 токенов (нативный); 131 072 токена с YaRN позиционной интерполяциейhuggingface.co ↗ | проверено |
| Режим мышления | Гибридный: единый checkpoint поддерживает thinking (chain-of-thought в блоках <think>) и non-thinking; переключение через enable_thinking или /think / /no_think токенhuggingface.co ↗ | проверено |
| Поддерживаемые языки | 119 языков и диалектов (индоевропейские, сино-тибетские, афразийские, австронезийские, дравидийские, тюркские, тай-кадайские, уральские и другие)qwenlm.github.io ↗ | проверено |
| Лицензия | Apache 2.0huggingface.co ↗ | проверено |
| Данные предобучения | ~36 триллионов токенов на 119 языках (примерно в 2× больше 18T Qwen2.5); включает веб, PDF-извлечение, синтетические math/code данныеqwenlm.github.io ↗ | проверено |
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
AIME 2024 Thinking mode; из официального блога Qwen3, таблица оценок Qwen3-32B. | 85.7%% | qwenlm.github.io ↗ | |
MATH-500 Thinking mode; из официального блога Qwen3. | 95.5%% | qwenlm.github.io ↗ | |
LiveCodeBench Thinking mode; из официального блога Qwen3. | 65.9%% | qwenlm.github.io ↗ | |
BFCL (Berkeley Function-Calling Leaderboard) Benchmark tool calling; non-thinking mode; из официального блога Qwen3. | 70.8%% | qwenlm.github.io ↗ | |
MMLU-Pro Non-thinking mode; из официального блога Qwen3. | 74.9%% | qwenlm.github.io ↗ | |
C-Eval Китайская комплексная оценка; из официального блога Qwen3. | 91.8%% | qwenlm.github.io ↗ |
Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.
curl https://api.therouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -d '{
"model": "qwen/qwen3-32b",
"messages": [
{"role": "user", "content": "Summarize the key points from this input."}
]
}'Стандартные OpenAI-совместимые chat completions. Опустите reasoning для non-thinking (быстрого) режима; установите reasoning: {} или бюджет для thinking mode.
curl https://api.therouter.ai/v1/chat/completions \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen/qwen3-32b",
"messages": [
{"role": "user", "content": "Explain the tradeoffs between dense and MoE architectures for inference."}
],
"temperature": 0.7,
"max_tokens": 2048
}'Релиз Alibaba Qwen3 включает Qwen3-32B вместе с пятью другими dense models и двумя MoE, с акцентом на hybrid thinking/non-thinking, tool use и multilingual coverage.
Используйте её как balanced general reasoning model: coding help, math-heavy analysis, multilingual support, JSON/tool workflows и medium-stakes agents, где dense 32B достаточно, а более крупный flagship съест margin.
Да. Qwen3 была запущена с hybrid thinking и non-thinking modes. В TheRouter вызывайте qwen/qwen3-32b через OpenAI-compatible endpoint и передавайте параметр reasoning, когда нужно более глубокое reasoning behavior.
Официальная карточка модели указывает 32 768 native tokens и 131 072 tokens with YaRN. Каталог TheRouter exposes routed context length 131K tokens для qwen/qwen3-32b.
Qwen describes Qwen3-32B as open-weight dense model under Apache 2.0. Лицензия — это source-level permission; production API usage всё равно зависит от выбранного provider route и billing path TheRouter.
Берите qwen/qwen3-32b, когда задача смешивает code с general reasoning, math, multilingual product context или tool use. Берите qwen/qwen3-coder-30b, когда workload в основном code generation, autocomplete, tests и lower-latency coding throughput.
| источник | URL | получено | |
|---|---|---|---|
| Архитектура | huggingface.co ↗ | 2026-06-08 | проверено |
| Параметры | huggingface.co ↗ | 2026-06-08 | проверено |
| Слои | huggingface.co ↗ | 2026-06-08 | проверено |
| Головы внимания (GQA) | huggingface.co ↗ | 2026-06-08 | проверено |
| Нативный контекст | huggingface.co ↗ | 2026-06-08 | проверено |
| Режим мышления | huggingface.co ↗ | 2026-06-08 | проверено |
| Поддерживаемые языки | qwenlm.github.io ↗ | 2026-06-08 | проверено |
| Лицензия | huggingface.co ↗ | 2026-06-08 | проверено |
| Данные предобучения | qwenlm.github.io ↗ | 2026-06-08 | проверено |
| AIME 2024 | qwenlm.github.io ↗ | 2026-06-08 | проверено |
| MATH-500 | qwenlm.github.io ↗ | 2026-06-08 | проверено |
| LiveCodeBench | qwenlm.github.io ↗ | 2026-06-08 | проверено |
| BFCL (Berkeley Function-Calling Leaderboard) | qwenlm.github.io ↗ | 2026-06-08 | проверено |
| MMLU-Pro | qwenlm.github.io ↗ | 2026-06-08 | проверено |
| C-Eval | qwenlm.github.io ↗ | 2026-06-08 | проверено |
| Qwen3 выпускает dense 32B open-weight model с hybrid thinking modes | Qwen3 announcement ↗ | 2026-06-08 | проверено |