Назад к моделям

Qwen3-14B — dense causal language model от команды Alibaba Qwen с 14,8B параметрами: средний уровень в линейке Qwen3 dense между эффективным Qwen3-8B и более крупным Qwen3-32B. Построена на 40 слоях transformer с GQA 40/8, выпущена под Apache 2.0 в апреле 2025 года. Ключевой архитектурный факт из технического отчёта Qwen3: базовая модель Qwen3-14B соответствует по производительности Qwen2.5-32B-Base — то есть поколение Qwen3 делает качественный скачок в параметрической эффективности. Конкретно: вы получаете уровень Qwen2.5-32B при менее чем половине параметров и значительно более низкой стоимости инференса.

Как и все инструктивные модели Qwen3, Qwen3-14B поставляется с hybrid thinking в качестве нативной функции: единый checkpoint переключается между deep-reasoning thinking mode (пошаговые рассуждения в блоках <think>) и быстрым non-thinking mode, управляется per-request через enable_thinking или токены /think / /no_think. Это важно для маршрутизации: команды могут использовать один model ID для быстрых completions и более сложных аналитических задач, разграничивая поведение параметром reasoning TheRouter без управления двумя отдельными deployments. При $0,084 / $0,252 за миллион input/output токенов Qwen3-14B — точка перегиба по соотношению цена/качество в dense линейке Qwen3: дешевле Qwen3-32B ($0,20 / $0,80), при этом ощутимо превосходя Qwen3-8B по качеству на сложных reasoning задачах.

Когда выбирать
  • • Cost-sensitive reasoning задачи, превосходящие потолок качества Qwen3-8B — Qwen3-14B повышает производительность на многошаговой математике, логике и структурированном анализе, оставаясь значительно дешевле Qwen3-32B
  • • Многоязычные приложения — поддержка 119 языков и диалектов с высоким качеством следования инструкциям и перевода для европейских, CJK и малораспространённых языковых семей
  • • Agentic пайплайны и tool-calling workflows в масштабе — сильные возможности function calling в обоих режимах, с более низкой стоимостью per-request чем 32B для высокообъёмных agent loops
  • • Кодирование общего назначения, code review и объяснение — охватывает широкий спектр языков программирования; thinking mode обеспечивает более глубокий анализ для сложной отладки или архитектурного ревью
  • • Команды, оценивающие локальную или self-hosted open-weight модель среднего класса — при 14,8B параметрах Qwen3-14B работает на одном высококлассном потребительском GPU (например, RTX 4090 при 4-bit) или скромных multi-GPU конфигурациях; Apache 2.0 для неограниченного коммерческого использования
Когда не выбирать
  • • Сложнейшие frontier reasoning или coding бенчмарки — Qwen3-32B, Qwen3-235B-A22B или закрытые frontier модели (o3, Gemini 2.5 Pro) обеспечивают более высокий потолок качества для задач конкурсного уровня
  • • Batch-задачи с максимальной пропускной способностью при доминирующей стоимости в масштабе — маршрутизируйте на qwen/qwen3-30b-a3b (MoE, 3B active) для снижения per-token стоимости обслуживания, когда объём вывода — главное ограничение
  • • Нативный image или audio input — Qwen3-14B text-in/text-out only; для мультимодального ввода используйте qwen/qwen3-vl-32b или другую vision-модель
Размер контекста
131K
Максимальный вывод
33K
Цена Входза 1M токенов
$0.378за 1 млн токенов
Цена Выходза 1M токенов
$1.51за 1 млн токенов

Модальности

Текст→Текст

Разбивка цен

ТипСтавка
Вход$0.378 за 1 млн токенов
Выход$1.51 за 1 млн токенов

Поддерживаемые параметры

temperaturemax_tokenstop_ptoolstool_choiceresponse_formatstop

Характеристики

Всего параметров14,8B (13,2B без эмбеддингов)huggingface.co/Qwen ↗проверено
АрхитектураDense causal transformer, 40 слоёв, GQA 40/8 (Q/KV heads)huggingface.co/Qwen ↗проверено
Длина контекста131 072 токена (нативные 32 768; расширено до 131 072 через YaRN)huggingface.co/Qwen ↗проверено
Макс. токенов в ответе32 768huggingface.co/Qwen ↗проверено
ЛицензияApache 2.0huggingface.co/Qwen ↗проверено
Этап обученияPretraining & Post-training (instruct модель)huggingface.co/Qwen ↗проверено
Эффективность по сравнению с предыдущим поколениемСоответствует Qwen2.5-32B-Base при 14B параметрах — выигрыш целого поколения параметрической эффективностиqwenlm.github.io ↗проверено

Бенчмарки

BenchmarkDistributionScoreSource
MMLU
Базовая модель; 5-shot
81.05%arxiv.org — Qwen3 technical report ↗
MMLU-Pro
Базовая модель
61.03%arxiv.org — Qwen3 technical report ↗
BBH (BIG-Bench Hard)
Базовая модель; 3-shot CoT
81.07%arxiv.org — Qwen3 technical report ↗
GSM8K
Базовая модель; 4-shot
92.49%arxiv.org — Qwen3 technical report ↗
GPQA
Базовая модель; вопросы аспирантского уровня по науке
39.90%arxiv.org — Qwen3 technical report ↗

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "qwen/qwen3-14b",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

Ещё от qwen

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2025-04-29

Выпущено семейство Qwen3 — Qwen3-14B среди шести open-weight dense моделей

Alibaba Qwen выпустила полный комплект Qwen3, включая Qwen3-14B как dense causal LM с 14,8B параметрами, hybrid thinking modes, 128K context (YaRN-extended), поддержкой 119 языков и лицензией Apache 2.0. В анонсе подчёркивалось, что базовая модель Qwen3-14B достигает паритета с Qwen2.5-32B-Base, представляя полное поколение улучшения параметрической эффективности.

переработано TheRouterqwenlm.github.io ↗
2025-05-15

Технический отчёт Qwen3 опубликован на arXiv

Команда Qwen выпустила полный технический отчёт (arXiv 2505.09388), охватывающий pretraining, post-training, hybrid thinking архитектуру, многоязычные возможности и сравнительные бенчмарки для всей линейки Qwen3, включая Qwen3-14B. Отчёт документирует бенчмарки базовой модели: Qwen3-14B — MMLU 81,05, BBH 81,07, GSM8K 92,49, GPQA 39,90.

переработано TheRouterarxiv.org ↗

Частые вопросы

Как Qwen3-14B соотносится с Qwen3-32B и Qwen3-8B?

Qwen3-14B — модель среднего класса в dense линейке Qwen3. Превосходит Qwen3-8B (36 слоёв, GQA 32/8) на reasoning-тяжёлых и многоязычных задачах, тогда как Qwen3-32B (64 слоя, GQA 64/8, 32,8B параметров) обеспечивает более высокий качественный потолок для сложнейших проблем. По стоимости: Qwen3-8B дешевле для простых задач; Qwen3-14B ($0,084/$0,252 за M токенов) — точка перегиба, дающая возможности уровня Qwen2.5-32B; Qwen3-32B ($0,20/$0,80 за M токенов) оправдан только когда качества 14B недостаточно.

Как переключаться между thinking и non-thinking режимом?

Через TheRouter — параметр reasoning на /v1/chat/completions. При self-hosting — enable_thinking=True или enable_thinking=False в chat template, или /think / /no_think в системном промпте или первом сообщении пользователя. Thinking mode — по умолчанию. При активном thinking mode ответы содержат блок <think>...</think>, который необходимо разобрать или убрать перед показом конечным пользователям.

Каков фактический context window для qwen/qwen3-14b на TheRouter?

Нативный контекст модели — 32 768 токенов, расширенный до 131 072 токенов через YaRN позиционную интерполяцию. TheRouter устанавливает context_length 131 072 и max_completion 32 768. На дальнем конце YaRN-диапазона производительность может снижаться на очень сложных промптах; проверяйте наибольшие входы перед production rollout.

Поддерживает ли Qwen3-14B tool calling и structured output?

Да. Qwen3-14B поддерживает tools и tool_choice для function calling, а также response_format для structured output — через стандартные OpenAI-compatible параметры на TheRouter. Поддержка tool calling сохраняется в обоих режимах, что делает её подходящей для agentic пайплайнов с опциональными reasoning traces вместе с выполнением инструментов.

Можно ли использовать Qwen3-14B из Cursor, Cline или другого OpenAI-compatible клиента?

Да. TheRouter предоставляет qwen/qwen3-14b через OpenAI-compatible endpoint /v1/chat/completions. Укажите base URL вашего клиента как TheRouter endpoint, настройте API key и установите model в qwen/qwen3-14b. Поддерживаются streaming, tools и response_format.

Почему Qwen3-14B описывается как имеющая возможности уровня Qwen2.5-32B?

Это утверждение взято непосредственно из официального анонса Qwen3: «Qwen3-1.7B/4B/8B/14B/32B-Base показывает результаты, аналогичные Qwen2.5-3B/7B/14B/32B/72B-Base соответственно». Иными словами, каждый уровень размера Qwen3 dense соответствует следующему большему уровню Qwen2.5, поэтому база Qwen3-14B равна базе Qwen2.5-32B. Это отражает прогресс в архитектуре модели, объёме обучающих данных и методологии обучения всего поколения Qwen3, а не какой-либо отдельный прорыв.

Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Всего параметровhuggingface.co/Qwen ↗2026-06-09проверено
Архитектураhuggingface.co/Qwen ↗2026-06-09проверено
Длина контекстаhuggingface.co/Qwen ↗2026-06-09проверено
Макс. токенов в ответеhuggingface.co/Qwen ↗2026-06-09проверено
Лицензияhuggingface.co/Qwen ↗2026-06-09проверено
Этап обученияhuggingface.co/Qwen ↗2026-06-09проверено
Эффективность по сравнению с предыдущим поколениемqwenlm.github.io ↗2026-06-09проверено
MMLUarxiv.org — Qwen3 technical report ↗2026-06-09проверено
MMLU-Proarxiv.org — Qwen3 technical report ↗2026-06-09проверено
BBH (BIG-Bench Hard)arxiv.org — Qwen3 technical report ↗2026-06-09проверено
GSM8Karxiv.org — Qwen3 technical report ↗2026-06-09проверено
GPQAarxiv.org — Qwen3 technical report ↗2026-06-09проверено
Выпущено семейство Qwen3 — Qwen3-14B среди шести open-weight dense моделейqwenlm.github.io ↗2026-06-09проверено
Технический отчёт Qwen3 опубликован на arXivarxiv.org ↗2026-06-09проверено
Как Qwen3-14B соотносится с Qwen3-32B и Qwen3-8B?qwenlm.github.io ↗2026-06-09к проверке
Как переключаться между thinking и non-thinking режимом?huggingface.co ↗2026-06-09к проверке
Каков фактический context window для qwen/qwen3-14b на TheRouter?huggingface.co ↗2026-06-09к проверке
Поддерживает ли Qwen3-14B tool calling и structured output?huggingface.co ↗2026-06-09к проверке
Можно ли использовать Qwen3-14B из Cursor, Cline или другого OpenAI-compatible клиента?qwenlm.github.io ↗2026-06-09к проверке
Почему Qwen3-14B описывается как имеющая возможности уровня Qwen2.5-32B?qwenlm.github.io ↗2026-06-09к проверке
Помощь и контакты