Назад к моделям

Qwen3-VL-32B — флагманская dense vision-language модель Alibaba Qwen в семействе Qwen3-VL, выпущенная 21 октября 2025 года. Она сочетает 32B языковой бэкбон с улучшенным ViT-энкодером и тремя ключевыми архитектурными обновлениями: Interleaved-MRoPE для пространственно-временного позиционного кодирования в интерлированных последовательностях, DeepStack для слияния multi-level ViT-признаков и Text–Timestamp Alignment для точного временного указания в видео. Доступны две редакции: Instruct (instruction-tuned) и Thinking (с пошаговыми CoT-трассировками), обе — через единый model ID qwen/qwen3-vl-32b на TheRouter.

Для пользователей TheRouter Qwen3-VL-32B — рекомендованная mid-range vision-language модель для нагрузок с серьёзными мультимодальными рассуждениями без стоимости 235B MoE флагмана. При $0,336 / $1,008 за миллион input/output токенов она справляется с image QA, OCR на 32 языках, GUI-агентными задачами, пониманием видео (native 256K, расширяемый до 1M), извлечением из таблиц/графиков и STEM визуальными рассуждениями. Thinking-редакция с цепочками мыслей позволяет строить образовательные, научные и math-heavy пайплайны без отдельной text reasoning модели.

Когда выбирать
  • • Интеллект документов и OCR — 32 языка, устойчивость к слабому освещению, размытию и наклону; структурированное извлечение из счетов, договоров, таблиц и длинных PDF с нативным 256K контекстом
  • • GUI и visual agent workflows — распознаёт UI-элементы, понимает их функции, вызывает инструменты и выполняет задачи на экранах ПК/мобильных устройств; сильный в screenshot-based agentic автоматизации
  • • STEM / визуальные математические рассуждения — Thinking-редакция для задач конкурсного уровня, встроенных в изображения, научных диаграмм и многошагового причинного анализа; превосходит Qwen2.5-VL-72B на MathVista и MathVision
  • • Длинное видео — индексирование на уровне секунд и полное воспроизведение из многочасовых видео; временное заземление через Text–Timestamp Alignment для поиска, суммаризации и QA по видеоархивам
  • • Мультимодальный кодинг — генерация Draw.io, HTML/CSS/JS и структурированных файлов из изображений или видео; полезно для design-to-code и реверс-инжиниринга UI-скриншотов
Когда не выбирать
  • • Чисто текстовые задачи без визуального ввода — 32B бэкбон способен, но qwen/qwen3-32b по более низкой цене — правильный выбор для text-only нагрузок
  • • Крупнейшие batch vision нагрузки, где стоимость на токен критична — рассмотрите qwen/qwen3-vl-8b для лёгких задач или qwen/qwen3-vl-235b (MoE, 22B active) для максимального качества в масштабе
  • • Генерация аудио или нативного видео — Qwen3-VL-32B принимает image+text, выдаёт text; аудио, видео или изображения на выходе не поддерживаются
Размер контекста
33K
Максимальный вывод
8K
Цена Входза 1M токенов
$0.1728за 1 млн токенов
Цена Выходза 1M токенов
$0.6912за 1 млн токенов

Модальности

ТекстИзображение→Текст

Возможности

Зрение

Разбивка цен

ТипСтавка
Вход$0.1728 за 1 млн токенов
Выход$0.6912 за 1 млн токенов

Поддерживаемые параметры

temperaturemax_tokenstop_ptoolstool_choicestop

Характеристики

Дата релиза2025-10-21github.com ↗проверено
АрхитектураDense transformer; ~32B параметров; улучшенный ViT-энкодер с Interleaved-MRoPE и DeepStackarxiv.org ↗проверено
Входные модальностиТекст, изображения, видео (поддерживаются чередующиеся последовательности)huggingface.co ↗проверено
Нативный контекст256K токенов (расширяемый до 1M)github.com ↗проверено
Языки OCR32 языкаhuggingface.co ↗проверено
ЛицензияApache 2.0huggingface.co ↗проверено
Дата отсечения данныхНе раскрытонеизвестно

Бенчмарки

BenchmarkDistributionScoreSource
MMMU
76.0%www.emergentmind.com ↗
MathVista_mini
83.8%www.emergentmind.com ↗
MathVision
63.4%www.emergentmind.com ↗
MMLongBench-Doc
54.6%www.emergentmind.com ↗

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "qwen/qwen3-vl-32b",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

Гид по API

Vision chat completion

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen/qwen3-vl-32b",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "image_url", "image_url": {"url": "https://therouter.ai/assets/vision-sample.png"}},
        {"type": "text", "text": "Describe what you see in this image."}
      ]
    }]
  }'

Ещё от qwen

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2025-11-27

Технический отчёт Qwen3-VL опубликован на arXiv (2511.21631)

Команда Qwen выпустила полный 42-страничный технический отчёт, охватывающий схему позиционного кодирования Interleaved-MRoPE, выравнивание DeepStack, temporal grounding по видео и комплексные бенчмарки семейства Qwen3-VL dense (2B/4B/8B/32B) и MoE (30B-A3B/235B-A22B).

переработано TheRouterarxiv.org ↗
2025-10-21

Выпущены редакции Qwen3-VL-32B Instruct и Thinking

Alibaba Qwen выпустила Qwen3-VL-32B в редакциях Instruct и Thinking на Hugging Face, завершив mid-tier развёртывание семейства Qwen3-VL. Thinking-редакция добавляет chain-of-thought рассуждения в vision-пайплайн, позволяя решать STEM и math-heavy визуальные задачи без отдельной text reasoning модели.

переработано TheRoutergithub.com/QwenLM ↗

Частые вопросы

В чём разница между Qwen3-VL-32B Instruct и Thinking на TheRouter?

Instruct оптимизирован для прямых, кратких ответов на визуальные вопросы — ниже latency, нет overhead от reasoning-трасс. Thinking генерирует пошаговые chain-of-thought рассуждения перед финальным ответом, увеличивая количество токенов и стоимость, но существенно повышая точность на STEM, математических задачах в изображениях и многошаговом визуальном рассуждении. На TheRouter qwen/qwen3-vl-32b по умолчанию маршрутизируется на Instruct; параметр для Thinking-редакции — в документации TheRouter.

Может ли Qwen3-VL-32B обрабатывать видео, или только изображения?

Qwen3-VL-32B нативно поддерживает видеовход в дополнение к изображениям и тексту, с контекстным окном 256K токенов, расширяемым до 1M. Обеспечивает временное индексирование на уровне секунд и полное воспроизведение из длинных видео через архитектуру Text–Timestamp Alignment. Доступность видео через /v1/chat/completions TheRouter может отличаться от прямого API — проверяйте текущую карточку модели на TheRouter для поддерживаемых типов ввода.

Как Qwen3-VL-32B сравнивается с Qwen2.5-VL-72B?

Qwen3-VL-32B Instruct сопоставим или превосходит Qwen2.5-VL-72B на MMMU (76,0 vs 77,7) и обходит его на MathVista (83,8 vs 79,4) и MathVision (63,4 vs 64,3) при меньше чем половине параметров. Thinking-редакция ещё больше увеличивает отрыв на math-heavy бенчмарках (MMMU 78,1, MathVista 85,9, MathVision 70,2). Для большинства продакшн мультимодальных нагрузок Qwen3-VL-32B предлагает лучшее соотношение цена/качество по сравнению с предыдущим 72B.

переработано TheRouterwww.emergentmind.com ↗
Можно ли использовать Qwen3-VL-32B из Cursor, Cline или другого OpenAI-compatible клиента?

Да. Установите base URL клиента https://api.therouter.ai/v1, настройте API-ключ TheRouter и задайте model qwen/qwen3-vl-32b. Изображения передаются в стандартном OpenAI vision формате (image_url content parts). Поддерживаются streaming и tool calling. Клиенты, отправляющие только текст, работают нормально — возможность vision является дополнительной.

Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Дата релизаgithub.com ↗2026-06-09проверено
Архитектураarxiv.org ↗2026-06-09проверено
Входные модальностиhuggingface.co ↗2026-06-09проверено
Нативный контекстgithub.com ↗2026-06-09проверено
Языки OCRhuggingface.co ↗2026-06-09проверено
Лицензияhuggingface.co ↗2026-06-09проверено
Дата отсечения данных——неизвестно
MMMUwww.emergentmind.com ↗2026-06-09к проверке
MathVista_miniwww.emergentmind.com ↗2026-06-09к проверке
MathVisionwww.emergentmind.com ↗2026-06-09к проверке
MMLongBench-Docwww.emergentmind.com ↗2026-06-09к проверке
Технический отчёт Qwen3-VL опубликован на arXiv (2511.21631)arxiv.org ↗2026-06-09проверено
Выпущены редакции Qwen3-VL-32B Instruct и Thinkinggithub.com/QwenLM ↗2026-06-09проверено
В чём разница между Qwen3-VL-32B Instruct и Thinking на TheRouter?huggingface.co ↗2026-06-09к проверке
Может ли Qwen3-VL-32B обрабатывать видео, или только изображения?github.com ↗2026-06-09к проверке
Как Qwen3-VL-32B сравнивается с Qwen2.5-VL-72B?www.emergentmind.com ↗2026-06-09к проверке
Можно ли использовать Qwen3-VL-32B из Cursor, Cline или другого OpenAI-compatible клиента?huggingface.co ↗2026-06-09к проверке
Помощь и контакты