Назад к моделям

Qwen3-VL-8B — компактная dense vision-language модель Alibaba Qwen в семействе Qwen3-VL, выпущенная 15 октября 2025 года. Она разделяет ту же архитектурную ДНК с более крупными сиблингами — Interleaved-MRoPE для пространственно-временного позиционного кодирования, DeepStack для слияния multi-level ViT-признаков и Text–Timestamp Alignment для точного временного указания в видео — упакованную в 8B-параметрическую форм-фактор, подходящую для cost-sensitive продакшн развёртываний, edge-инференса и latency-critical пайплайнов. Доступны две редакции: Instruct и Thinking, обе — через model ID qwen/qwen3-vl-8b на TheRouter.

Для пользователей TheRouter Qwen3-VL-8B — предпочтительная vision-language модель, когда стоимость на токен или footprint развёртывания важнее пиковой глубины рассуждений. Она достигает сильных результатов — DocVQA 96,1%, ScreenSpot 94,4%, OCRBench 89,6% — сопоставимых или превосходящих многие более крупные модели, что делает её практичной для высокообъёмной обработки документов, GUI-автоматизации и OCR на 32 языках. Thinking-редакция добавляет chain-of-thought, существенно повышая MMMU и MathVista для math-embedded и многошаговых визуальных задач.

Когда выбирать
  • • Высокообъёмный OCR документов — 32 языка, устойчивость к слабому освещению, размытию, наклону; структурированное извлечение из счетов, форм и чеков в масштабе, где стоимость на страницу является ключевым ограничением
  • • GUI и visual agent автоматизация — идентифицирует UI-элементы, понимает их функции, вызывает инструменты и выполняет задачи на экранах ПК/мобильных устройств; ScreenSpot 94,4% делает её конкурентоспособной для screenshot-driven agentic пайплайнов без стоимости 32B
  • • Cost-sensitive image QA и классификация — распознавание продуктов, знаменитостей/достопримечательностей/флоры-фауны, понимание графиков и таблиц для приложений, где пропускная способность и маржа важнее маржинальных прибавок точности
  • • Thinking-редакция для компактных STEM-рассуждений — когда нужно решать math-embedded визуальные задачи (прирост MathVista с CoT), но нельзя позволить себе 32B или 235B; идеально для edtech и пайплайнов научной аннотации изображений
  • • Edge и latency-constrained развёртывания — меньший memory footprint по сравнению с 32B позволяет развёртывать Qwen3-VL-8B на single-GPU или resource-constrained облачных инстансах, сохраняя полный набор возможностей Qwen3-VL
Когда не выбирать
  • • Задачи с наивысшей точностью мультимодального рассуждения — для MMMU, MathVision и сложных многошаговых визуальных бенчмарков qwen/qwen3-vl-32b (76,0 MMMU Instruct) или qwen/qwen3-vl-235b дают существенно лучшие результаты
  • • Чисто текстовые задачи без визуального ввода — qwen/qwen3-8b — правильный выбор для text-only нагрузок; vision бэкбон добавляет overhead без пользы
  • • Генерация аудио или нативного видео — Qwen3-VL-8B принимает image+text, выдаёт text; аудио, видео или изображения на выходе не поддерживаются
Размер контекста
33K
Максимальный вывод
8K
Цена Входза 1M токенов
$0.1944за 1 млн токенов
Цена Выходза 1M токенов
$0.756за 1 млн токенов

Модальности

ТекстИзображение→Текст

Возможности

Зрение

Разбивка цен

ТипСтавка
Вход$0.1944 за 1 млн токенов
Выход$0.756 за 1 млн токенов

Поддерживаемые параметры

temperaturemax_tokenstop_pstop

Характеристики

Дата релиза2025-10-15github.com ↗проверено
АрхитектураDense transformer; ~8B параметров; улучшенный ViT-энкодер с Interleaved-MRoPE и DeepStackarxiv.org ↗проверено
Входные модальностиТекст, изображения, видео (поддерживаются чередующиеся последовательности)huggingface.co ↗проверено
Нативный контекст256K токенов (расширяемый до 1M)github.com ↗проверено
Языки OCR32 языкаhuggingface.co ↗проверено
ЛицензияApache 2.0huggingface.co ↗проверено
Дата отсечения данныхНе раскрытонеизвестно

Бенчмарки

BenchmarkDistributionScoreSource
DocVQA (test)
96.1%%llm-stats.com ↗
ScreenSpot
94.4%%llm-stats.com ↗
OCRBench
89.6%%llm-stats.com ↗
AI2D
85.7%%llm-stats.com ↗
MMBench-V1.1
85.0%%llm-stats.com ↗

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "qwen/qwen3-vl-8b",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

Гид по API

Vision chat completion

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen/qwen3-vl-8b",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "image_url", "image_url": {"url": "https://therouter.ai/assets/vision-sample.png"}},
        {"type": "text", "text": "Describe what you see in this image."}
      ]
    }]
  }'

Ещё от qwen

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2025-11-27

Технический отчёт Qwen3-VL опубликован на arXiv (2511.21631)

Команда Qwen выпустила полный технический отчёт, охватывающий Interleaved-MRoPE, DeepStack, temporal grounding и бенчмарки для всего семейства Qwen3-VL, включая 8B dense модель.

переработано TheRouterarxiv.org ↗
2025-10-15

Выпущены редакции Qwen3-VL-8B Instruct и Thinking

Alibaba Qwen выпустила Qwen3-VL-8B в редакциях Instruct и Thinking на Hugging Face, совместно с Qwen3-VL-4B. 8B Instruct достигает DocVQA 96,1% и ScreenSpot 94,4%, сопоставимых с гораздо более крупными моделями; Thinking-редакция добавляет chain-of-thought для STEM-heavy сценариев.

переработано TheRoutergithub.com/QwenLM ↗

Частые вопросы

Когда выбрать Qwen3-VL-8B вместо Qwen3-VL-32B?

Выбирайте Qwen3-VL-8B, когда стоимость на токен или GPU memory footprint — жёсткое ограничение, нагрузка — документальный OCR, GUI-автоматизация или image QA (где 8B конкурентоспособна с более крупными моделями), или нужно запускать несколько concurrent запросов на фиксированном инстансе. Выбирайте Qwen3-VL-32B, когда точность на MMMU, MathVision или сложных многошаговых задачах важнее стоимости.

В чём разница между Qwen3-VL-8B Instruct и Thinking на TheRouter?

Instruct оптимизирован для прямых ответов — ниже latency и стоимость токенов. Thinking генерирует пошаговые chain-of-thought рассуждения, увеличивая количество токенов и стоимость, но повышая точность на math-embedded изображениях и многошаговых задачах. Для OCR документов, GUI-задач и image QA Instruct обычно лучший выбор. Для STEM, олимпийской математики или научных диаграмм Thinking-редакция сокращает разрыв с более крупными моделями.

Может ли Qwen3-VL-8B обрабатывать видео, или только изображения?

Qwen3-VL-8B нативно поддерживает видеовход в дополнение к изображениям и тексту, с контекстным окном 256K токенов, расширяемым до 1M. Обеспечивает временное индексирование на уровне секунд через Text–Timestamp Alignment. Доступность видео через /v1/chat/completions TheRouter может отличаться от прямого API — проверяйте текущую карточку модели.

Можно ли использовать Qwen3-VL-8B из Cursor, Cline или другого OpenAI-compatible клиента?

Да. Установите base URL https://api.therouter.ai/v1, API-ключ TheRouter, model qwen/qwen3-vl-8b. Изображения — в стандартном OpenAI vision формате (image_url content parts). Streaming и tool calling поддерживаются.

Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Дата релизаgithub.com ↗2026-06-09проверено
Архитектураarxiv.org ↗2026-06-09проверено
Входные модальностиhuggingface.co ↗2026-06-09проверено
Нативный контекстgithub.com ↗2026-06-09проверено
Языки OCRhuggingface.co ↗2026-06-09проверено
Лицензияhuggingface.co ↗2026-06-09проверено
Дата отсечения данных——неизвестно
DocVQA (test)llm-stats.com ↗2026-06-09к проверке
ScreenSpotllm-stats.com ↗2026-06-09к проверке
OCRBenchllm-stats.com ↗2026-06-09к проверке
AI2Dllm-stats.com ↗2026-06-09к проверке
MMBench-V1.1llm-stats.com ↗2026-06-09к проверке
Технический отчёт Qwen3-VL опубликован на arXiv (2511.21631)arxiv.org ↗2026-06-09проверено
Выпущены редакции Qwen3-VL-8B Instruct и Thinkinggithub.com/QwenLM ↗2026-06-09проверено
Когда выбрать Qwen3-VL-8B вместо Qwen3-VL-32B?github.com ↗2026-06-09к проверке
В чём разница между Qwen3-VL-8B Instruct и Thinking на TheRouter?huggingface.co ↗2026-06-09к проверке
Может ли Qwen3-VL-8B обрабатывать видео, или только изображения?github.com ↗2026-06-09к проверке
Можно ли использовать Qwen3-VL-8B из Cursor, Cline или другого OpenAI-compatible клиента?huggingface.co ↗2026-06-09к проверке
Помощь и контакты