Технический отчёт Qwen3-VL опубликован на arXiv (2511.21631)
Команда Qwen выпустила полный технический отчёт, охватывающий Interleaved-MRoPE, DeepStack, temporal grounding и бенчмарки для всего семейства Qwen3-VL, включая 8B dense модель.
Qwen3 VL 8B — compact vision-language model for image understanding tasks.
Qwen3-VL-8B — компактная dense vision-language модель Alibaba Qwen в семействе Qwen3-VL, выпущенная 15 октября 2025 года. Она разделяет ту же архитектурную ДНК с более крупными сиблингами — Interleaved-MRoPE для пространственно-временного позиционного кодирования, DeepStack для слияния multi-level ViT-признаков и Text–Timestamp Alignment для точного временного указания в видео — упакованную в 8B-параметрическую форм-фактор, подходящую для cost-sensitive продакшн развёртываний, edge-инференса и latency-critical пайплайнов. Доступны две редакции: Instruct и Thinking, обе — через model ID qwen/qwen3-vl-8b на TheRouter.
Для пользователей TheRouter Qwen3-VL-8B — предпочтительная vision-language модель, когда стоимость на токен или footprint развёртывания важнее пиковой глубины рассуждений. Она достигает сильных результатов — DocVQA 96,1%, ScreenSpot 94,4%, OCRBench 89,6% — сопоставимых или превосходящих многие более крупные модели, что делает её практичной для высокообъёмной обработки документов, GUI-автоматизации и OCR на 32 языках. Thinking-редакция добавляет chain-of-thought, существенно повышая MMMU и MathVista для math-embedded и многошаговых визуальных задач.
| Тип | Ставка |
|---|---|
| Вход | $0.1944 за 1 млн токенов |
| Выход | $0.756 за 1 млн токенов |
| Дата релиза | 2025-10-15github.com ↗ | проверено |
| Архитектура | Dense transformer; ~8B параметров; улучшенный ViT-энкодер с Interleaved-MRoPE и DeepStackarxiv.org ↗ | проверено |
| Входные модальности | Текст, изображения, видео (поддерживаются чередующиеся последовательности)huggingface.co ↗ | проверено |
| Нативный контекст | 256K токенов (расширяемый до 1M)github.com ↗ | проверено |
| Языки OCR | 32 языкаhuggingface.co ↗ | проверено |
| Лицензия | Apache 2.0huggingface.co ↗ | проверено |
| Дата отсечения данных | Не раскрыто | неизвестно |
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
DocVQA (test) | 96.1%% | llm-stats.com ↗ | |
ScreenSpot | 94.4%% | llm-stats.com ↗ | |
OCRBench | 89.6%% | llm-stats.com ↗ | |
AI2D | 85.7%% | llm-stats.com ↗ | |
MMBench-V1.1 | 85.0%% | llm-stats.com ↗ |
Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.
curl https://api.therouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -d '{
"model": "qwen/qwen3-vl-8b",
"messages": [
{"role": "user", "content": "Summarize the key points from this input."}
]
}'curl https://api.therouter.ai/v1/chat/completions \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen/qwen3-vl-8b",
"messages": [{
"role": "user",
"content": [
{"type": "image_url", "image_url": {"url": "https://therouter.ai/assets/vision-sample.png"}},
{"type": "text", "text": "Describe what you see in this image."}
]
}]
}'Команда Qwen выпустила полный технический отчёт, охватывающий Interleaved-MRoPE, DeepStack, temporal grounding и бенчмарки для всего семейства Qwen3-VL, включая 8B dense модель.
Alibaba Qwen выпустила Qwen3-VL-8B в редакциях Instruct и Thinking на Hugging Face, совместно с Qwen3-VL-4B. 8B Instruct достигает DocVQA 96,1% и ScreenSpot 94,4%, сопоставимых с гораздо более крупными моделями; Thinking-редакция добавляет chain-of-thought для STEM-heavy сценариев.
Выбирайте Qwen3-VL-8B, когда стоимость на токен или GPU memory footprint — жёсткое ограничение, нагрузка — документальный OCR, GUI-автоматизация или image QA (где 8B конкурентоспособна с более крупными моделями), или нужно запускать несколько concurrent запросов на фиксированном инстансе. Выбирайте Qwen3-VL-32B, когда точность на MMMU, MathVision или сложных многошаговых задачах важнее стоимости.
Instruct оптимизирован для прямых ответов — ниже latency и стоимость токенов. Thinking генерирует пошаговые chain-of-thought рассуждения, увеличивая количество токенов и стоимость, но повышая точность на math-embedded изображениях и многошаговых задачах. Для OCR документов, GUI-задач и image QA Instruct обычно лучший выбор. Для STEM, олимпийской математики или научных диаграмм Thinking-редакция сокращает разрыв с более крупными моделями.
Qwen3-VL-8B нативно поддерживает видеовход в дополнение к изображениям и тексту, с контекстным окном 256K токенов, расширяемым до 1M. Обеспечивает временное индексирование на уровне секунд через Text–Timestamp Alignment. Доступность видео через /v1/chat/completions TheRouter может отличаться от прямого API — проверяйте текущую карточку модели.
Да. Установите base URL https://api.therouter.ai/v1, API-ключ TheRouter, model qwen/qwen3-vl-8b. Изображения — в стандартном OpenAI vision формате (image_url content parts). Streaming и tool calling поддерживаются.
| источник | URL | получено | |
|---|---|---|---|
| Дата релиза | github.com ↗ | 2026-06-09 | проверено |
| Архитектура | arxiv.org ↗ | 2026-06-09 | проверено |
| Входные модальности | huggingface.co ↗ | 2026-06-09 | проверено |
| Нативный контекст | github.com ↗ | 2026-06-09 | проверено |
| Языки OCR | huggingface.co ↗ | 2026-06-09 | проверено |
| Лицензия | huggingface.co ↗ | 2026-06-09 | проверено |
| Дата отсечения данных | — | — | неизвестно |
| DocVQA (test) | llm-stats.com ↗ | 2026-06-09 | к проверке |
| ScreenSpot | llm-stats.com ↗ | 2026-06-09 | к проверке |
| OCRBench | llm-stats.com ↗ | 2026-06-09 | к проверке |
| AI2D | llm-stats.com ↗ | 2026-06-09 | к проверке |
| MMBench-V1.1 | llm-stats.com ↗ | 2026-06-09 | к проверке |
| Технический отчёт Qwen3-VL опубликован на arXiv (2511.21631) | arxiv.org ↗ | 2026-06-09 | проверено |
| Выпущены редакции Qwen3-VL-8B Instruct и Thinking | github.com/QwenLM ↗ | 2026-06-09 | проверено |
| Когда выбрать Qwen3-VL-8B вместо Qwen3-VL-32B? | github.com ↗ | 2026-06-09 | к проверке |
| В чём разница между Qwen3-VL-8B Instruct и Thinking на TheRouter? | huggingface.co ↗ | 2026-06-09 | к проверке |
| Может ли Qwen3-VL-8B обрабатывать видео, или только изображения? | github.com ↗ | 2026-06-09 | к проверке |
| Можно ли использовать Qwen3-VL-8B из Cursor, Cline или другого OpenAI-compatible клиента? | huggingface.co ↗ | 2026-06-09 | к проверке |