Назад к моделям

Qwen3 32B

qwenqwen/qwen3-32b

Qwen3 dense 32B model. Excellent reasoning and coding at moderate size with thinking mode support.

Qwen3 32B — плотная open-weight reasoning-модель Alibaba Qwen с 32,8 млрд параметров. Она находится между меньшими плотными Qwen3 и крупными MoE-флагманами: её ещё реально обслуживать контролируемо, но мощности хватает для coding, math, multilingual chat и tool-using agents.

TheRouter exposes модель как qwen/qwen3-32b через OpenAI-compatible chat completions с маршрутизацией 131K context, tools, JSON mode и параметром reasoning. Берите её, когда нужен один Qwen, умеющий переключаться между быстрыми non-thinking ответами и более глубоким thinking-mode reasoning без перехода на намного более крупный flagship.

Когда выбирать
  • • Cost-controlled reasoning и coding agents, которым нужны tools, JSON responses и более крупная dense-модель, чем 8B/14B siblings
  • • Multilingual support, translation и analysis, где важен охват Qwen3 в 100+ языках
  • • Long-context summaries и document workflows, где 131K routed context важнее frontier-model quality
Когда не выбирать
  • • Highest-stakes autonomous repo edits — при высокой цене ошибки ведите на qwen/qwen3-coder-480b или frontier coding model
  • • Vision или multimodal input — используйте qwen/qwen3-vl-plus или другую vision-capable model
  • • Ultra-low-latency autocomplete — если bottleneck в p95 latency, берите qwen/qwen3-coder-30b или меньшую non-reasoning model
Размер контекста
131K
Максимальный вывод
33K
Цена Входза 1M токенов
$0.1728за 1 млн токенов
Цена Выходза 1M токенов
$0.6912за 1 млн токенов

Модальности

Текст→Текст

Разбивка цен

ТипСтавка
Вход$0.1728 за 1 млн токенов
Выход$0.6912 за 1 млн токенов

Поддерживаемые параметры

temperaturemax_tokenstop_ptoolstool_choiceresponse_formatreasoningstop

Характеристики

АрхитектураDense causal language model (все 32,8B параметров активны на каждый токен)huggingface.co ↗проверено
Параметры32,8B всего (31,2B без эмбеддингов)huggingface.co ↗проверено
Слои64 слоя Transformerhuggingface.co ↗проверено
Головы внимания (GQA)64 query heads / 8 KV heads (GQA)huggingface.co ↗проверено
Нативный контекст32 768 токенов (нативный); 131 072 токена с YaRN позиционной интерполяциейhuggingface.co ↗проверено
Режим мышленияГибридный: единый checkpoint поддерживает thinking (chain-of-thought в блоках <think>) и non-thinking; переключение через enable_thinking или /think / /no_think токенhuggingface.co ↗проверено
Поддерживаемые языки119 языков и диалектов (индоевропейские, сино-тибетские, афразийские, австронезийские, дравидийские, тюркские, тай-кадайские, уральские и другие)qwenlm.github.io ↗проверено
ЛицензияApache 2.0huggingface.co ↗проверено
Данные предобучения~36 триллионов токенов на 119 языках (примерно в 2× больше 18T Qwen2.5); включает веб, PDF-извлечение, синтетические math/code данныеqwenlm.github.io ↗проверено

Бенчмарки

BenchmarkDistributionScoreSource
AIME 2024
Thinking mode; из официального блога Qwen3, таблица оценок Qwen3-32B.
85.7%%qwenlm.github.io ↗
MATH-500
Thinking mode; из официального блога Qwen3.
95.5%%qwenlm.github.io ↗
LiveCodeBench
Thinking mode; из официального блога Qwen3.
65.9%%qwenlm.github.io ↗
BFCL (Berkeley Function-Calling Leaderboard)
Benchmark tool calling; non-thinking mode; из официального блога Qwen3.
70.8%%qwenlm.github.io ↗
MMLU-Pro
Non-thinking mode; из официального блога Qwen3.
74.9%%qwenlm.github.io ↗
C-Eval
Китайская комплексная оценка; из официального блога Qwen3.
91.8%%qwenlm.github.io ↗

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "qwen/qwen3-32b",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

Chat completion

Стандартные OpenAI-совместимые chat completions. Опустите reasoning для non-thinking (быстрого) режима; установите reasoning: {} или бюджет для thinking mode.

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen/qwen3-32b",
    "messages": [
      {"role": "user", "content": "Explain the tradeoffs between dense and MoE architectures for inference."}
    ],
    "temperature": 0.7,
    "max_tokens": 2048
  }'

Ещё от qwen

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2025-04-29

Qwen3 выпускает dense 32B open-weight model с hybrid thinking modes

Релиз Alibaba Qwen3 включает Qwen3-32B вместе с пятью другими dense models и двумя MoE, с акцентом на hybrid thinking/non-thinking, tool use и multilingual coverage.

переработано TheRouterQwen3 announcement ↗

Частые вопросы

Для чего лучше всего использовать qwen/qwen3-32b в TheRouter?

Используйте её как balanced general reasoning model: coding help, math-heavy analysis, multilingual support, JSON/tool workflows и medium-stakes agents, где dense 32B достаточно, а более крупный flagship съест margin.

Поддерживает ли Qwen3 32B thinking mode?

Да. Qwen3 была запущена с hybrid thinking и non-thinking modes. В TheRouter вызывайте qwen/qwen3-32b через OpenAI-compatible endpoint и передавайте параметр reasoning, когда нужно более глубокое reasoning behavior.

Какой context window у Qwen3 32B?

Официальная карточка модели указывает 32 768 native tokens и 131 072 tokens with YaRN. Каталог TheRouter exposes routed context length 131K tokens для qwen/qwen3-32b.

Qwen3 32B open source?

Qwen describes Qwen3-32B as open-weight dense model under Apache 2.0. Лицензия — это source-level permission; production API usage всё равно зависит от выбранного provider route и billing path TheRouter.

Для coding выбрать qwen/qwen3-32b или qwen/qwen3-coder-30b?

Берите qwen/qwen3-32b, когда задача смешивает code с general reasoning, math, multilingual product context или tool use. Берите qwen/qwen3-coder-30b, когда workload в основном code generation, autocomplete, tests и lower-latency coding throughput.

Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Архитектураhuggingface.co ↗2026-06-08проверено
Параметрыhuggingface.co ↗2026-06-08проверено
Слоиhuggingface.co ↗2026-06-08проверено
Головы внимания (GQA)huggingface.co ↗2026-06-08проверено
Нативный контекстhuggingface.co ↗2026-06-08проверено
Режим мышленияhuggingface.co ↗2026-06-08проверено
Поддерживаемые языкиqwenlm.github.io ↗2026-06-08проверено
Лицензияhuggingface.co ↗2026-06-08проверено
Данные предобученияqwenlm.github.io ↗2026-06-08проверено
AIME 2024qwenlm.github.io ↗2026-06-08проверено
MATH-500qwenlm.github.io ↗2026-06-08проверено
LiveCodeBenchqwenlm.github.io ↗2026-06-08проверено
BFCL (Berkeley Function-Calling Leaderboard)qwenlm.github.io ↗2026-06-08проверено
MMLU-Proqwenlm.github.io ↗2026-06-08проверено
C-Evalqwenlm.github.io ↗2026-06-08проверено
Qwen3 выпускает dense 32B open-weight model с hybrid thinking modesQwen3 announcement ↗2026-06-08проверено
Помощь и контакты