← Все статьи

Qwen3.8-Omni-Flash API: нативное понимание аудио, видео, изображений и текста на DashScope

Практическое руководство по интеграции Qwen3.8-Omni-Flash через OpenAI-совместимый API DashScope. Охватывает model ID, omni-modal ввод (текст + изображения + аудио + видео), thinking mode, function calling, realtime WebSocket вариант, тарификацию по модальностям и маршрутизацию через TheRouter.

· TheRouter

Qwen3.8-Omni-Flash — первая нативно omni-modal модель в семействе Qwen. С момента запуска на DashScope 17 сентября 2026 года она принимает текст, изображения, аудио и видео в одном API-вызове и возвращает текстовый ответ. Сопутствующий realtime вариант (qwen3.8-omni-flash-realtime) добавляет WebSocket и WebRTC streaming для интерактивных аудио-видео разговоров. Это руководство проведёт через оба варианта — от первого API-вызова до production-маршрутизации.

Чем Qwen3.8-Omni-Flash отличается от других моделей

Большинство multimodal моделей прикрепляют визуальные возможности к текстовому backbone. Qwen3.8-Omni-Flash изначально спроектирована как omni-modal agentic модель. Четыре модальности поступают на вход, текст выходит на выходе, и модель рассуждает по всем модальностям за один forward pass.

Ключевые характеристики из официального блога Qwen и списка моделей DashScope:

  • Входные модальности: текст, изображения, аудио, видео
  • Выход: текст (realtime вариант также выводит аудио)
  • Контекстное окно: 1M token
  • Thinking mode: поддерживается (цепочка рассуждений)
  • Function calling: поддерживается
  • Web search: поддерживается
  • Context caching: поддерживается
  • API-совместимость: OpenAI Chat Completions и Responses API через DashScope

Модель нацелена на реальные agentic-сценарии продуктивности. Помимо понимания multimodal контента она способна действовать через function calling и web search, а затем пошагово разбирать сложные задачи в thinking mode.

Два model ID, два паттерна доступа

DashScope предоставляет Qwen3.8-Omni-Flash через два model ID для разных сценариев:

Model IDПротоколВходВыходСценарий
qwen3.8-omni-flashHTTP (Chat Completions / Responses)Текст, изображения, аудио, видеоТекстПакетный анализ, обработка документов, асинхронные workflow
qwen3.8-omni-flash-realtimeWebSocket, WebRTCStreaming аудио, видеокадры, текстТекст + аудиоЖивые разговоры, голосовые ассистенты, видеозвонки

Offline-модель (qwen3.8-omni-flash) использует знакомый OpenAI-совместимый HTTP API. Realtime-модель (qwen3.8-omni-flash-realtime) требует постоянного соединения и непрерывной потоковой передачи ввода/вывода.

Начало работы с offline API

Шаг 1. Получите API-ключ

Зарегистрируйтесь на Alibaba Cloud Model Studio и сгенерируйте DashScope API-ключ в консоли.

Шаг 2. Настройте OpenAI SDK

from openai import OpenAI

client = OpenAI(
    api_key="your-dashscope-api-key",
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)

Для китайского региона используйте https://dashscope.aliyuncs.com/compatible-mode/v1.

Шаг 3. Понимание текста и изображений

response = client.chat.completions.create(
    model="qwen3.8-omni-flash",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "What components are shown in this architecture diagram?"},
                {"type": "image_url", "image_url": {"url": "https://example.com/architecture.png"}},
            ],
        }
    ],
)
print(response.choices[0].message.content)

Шаг 4. Понимание аудио

response = client.chat.completions.create(
    model="qwen3.8-omni-flash",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "Transcribe and summarize this meeting recording."},
                {"type": "audio_url", "audio_url": {"url": "https://example.com/meeting.mp3"}},
            ],
        }
    ],
)
print(response.choices[0].message.content)

Шаг 5. Анализ видео

response = client.chat.completions.create(
    model="qwen3.8-omni-flash",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "Describe what happens in this product demo."},
                {"type": "video_url", "video_url": {"url": "https://example.com/demo.mp4"}},
            ],
        }
    ],
)
print(response.choices[0].message.content)

Все три паттерна используют один и тот же Chat Completions endpoint. Модель самостоятельно определяет модальность входных данных и обрабатывает их нативно, без отдельных pipeline.

Thinking mode

Qwen3.8-Omni-Flash поддерживает явный режим рассуждений, который генерирует цепочку мыслей перед финальным ответом. Это полезно для сложных multimodal запросов, где модели нужно последовательно разобрать визуальные или звуковые данные.

Включение описано в документации DashScope по thinking mode. Точный формат параметров может меняться — сверяйтесь с актуальной документацией DashScope.

Function calling

Модель поддерживает OpenAI-совместимый function calling. Вы определяете tools, а Qwen3.8-Omni-Flash самостоятельно решает, когда их вызывать, опираясь на multimodal контекст.

tools = [
    {
        "type": "function",
        "function": {
            "name": "search_inventory",
            "description": "Search product inventory by visual description",
            "parameters": {
                "type": "object",
                "properties": {
                    "description": {"type": "string"},
                    "category": {"type": "string"}
                },
                "required": ["description"]
            }
        }
    }
]

response = client.chat.completions.create(
    model="qwen3.8-omni-flash",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "Find this item in our inventory."},
                {"type": "image_url", "image_url": {"url": "https://example.com/item.jpg"}},
            ],
        }
    ],
    tools=tools,
)

Модель также может использовать web search как встроенный инструмент, подтягивая актуальную информацию в дополнение к multimodal пониманию.

Realtime вариант

qwen3.8-omni-flash-realtime запущен 21 сентября 2026 года, через четыре дня после offline-модели. Он поддерживает три протокола подключения:

  • WebSocket — стандартный двусторонний streaming
  • WebRTC — оптимизирован для браузерного аудио/видео
  • AOQ — проприетарный протокол Alibaba с низкой задержкой

Realtime-модель добавляет многоканальную агрегацию аудио, агрегацию видеокадров и удалённый вызов MCP-инструментов поверх базовых возможностей. Она выводит текст и аудио одновременно, подходит для голосовых ассистентов и видеозвонков.

Документация по API realtime-варианта доступна в руководстве DashScope по realtime-моделям.

Тарификация

Qwen3.8-Omni-Flash относится к ценовой категории Flash на DashScope. Текстовые token rates по данным сторонних агрегаторов (сверены с OpenRouter и DashScope pricing):

МодальностьInput (за 1M token)Output (за 1M token)
Текст~$0.15~$0.47
АудиоВыше текстового тарифа (отдельный rate по модальности)Н/Д (только текстовый output)
ВидеоВыше текстового тарифа (отдельный rate по модальности)Н/Д (только текстовый output)
ИзображенияНа уровне vision-моделей (отдельный rate по модальности)Н/Д (только текстовый output)

Для realtime-варианта аудио-output тарифицируется отдельно от текстового output. Точные тарифы в юанях доступны на официальной странице тарификации; долларовые эквиваленты приблизительны и зависят от курса.

Context caching даёт скидку на кешированные input token по той же схеме, что и другие модели Qwen3.8 на DashScope.

Сравнение: Omni-Flash vs Qwen3.8-Flash vs GPT-4o

ХарактеристикаQwen3.8-Omni-FlashQwen3.8-FlashGPT-4o
Текстовый вводДаДаДа
Ввод изображенийДаДаДа
Ввод аудиоДаНетДа
Ввод видеоДаДа (кадры)Ограниченно
Вывод аудиоТолько realtime вариантНетТолько Realtime API
Контекстное окно1M1M128K
Thinking modeДаДаНет (o3/o4)
Function callingДаДаДа
Web searchДаДаЧерез tools
Realtime streamingWebSocket/WebRTC/AOQНетWebSocket
Текстовый input pricing~$0.15/1M~$0.15/1M$2.50/1M

Qwen3.8-Omni-Flash существенно выигрывает по стоимости multimodal нагрузок в сравнении с GPT-4o. Компромисс — зрелость экосистемы: у OpenAI шире набор инструментов и сторонних интеграций, тогда как OpenAI-совместимый endpoint DashScope покрывает основную поверхность API.

Командам, уже использующим Qwen3.8-Flash для текстовых и графических задач, Omni-Flash добавляет понимание аудио и видео без изменения паттерна интеграции. Единственное изменение в коде — смена model ID.

Маршрутизация через TheRouter

Если вы маршрутизируете OpenAI-совместимые запросы через TheRouter, можно настроить DashScope как провайдер и направлять omni-modal запросы на qwen3.8-omni-flash, а текстовые — на более дешёвые модели.

TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров, поддерживает провайдерный/модельный routing и fallback там, где это обеспечено продуктовыми путями, и предоставляет унифицированные поверхности billing/accounting в рамках реализованного функционала.

Стратегия routing по модальности здесь оправдана: запросы с аудио или видео отправлять в Omni-Flash, чисто текстовые или текст+изображение — маршрутизировать на Qwen3.8-Flash или Qwen3.8-Max в зависимости от сложности. Так простые запросы обходятся дешевле, а multimodal запросы гарантированно попадают на способную модель.

Настройка fallback описана в руководстве по model fallback.

Часто задаваемые вопросы

Может ли Qwen3.8-Omni-Flash генерировать аудио или изображения?

Offline-модель (qwen3.8-omni-flash) выдаёт только текст. Realtime-вариант (qwen3.8-omni-flash-realtime) может выводить аудио наряду с текстом. Ни один из вариантов не генерирует изображения или видео.

Какие аудиоформаты поддерживаются?

Модель принимает распространённые форматы, включая MP3 и WAV, через URL. Полный список поддерживаемых форматов и ограничения по размеру — в документации DashScope.

Как работает контекстное окно в 1M token с аудио и видео?

Аудио и видео токенизируются иначе, чем текст. Минутный аудиофрагмент или короткий видеоклип может занять значительную долю контекстного окна. Точное соотношение token/длительность зависит от кодирования и документировано в карточке модели на DashScope.

Доступна ли модель за пределами Китая?

Да. DashScope работает в сингапурском регионе (ap-southeast-1) через международный endpoint. Используйте https://dashscope-intl.aliyuncs.com/compatible-mode/v1 в качестве base URL.

Можно ли использовать с Claude Code или OpenAI Codex?

DashScope предоставляет OpenAI-совместимый endpoint, поэтому любой инструмент с поддержкой кастомного base_url может указать на DashScope и использовать qwen3.8-omni-flash как model ID. Однако omni-modal функции (аудио/видео ввод) требуют, чтобы инструмент передавал эти типы контента в массиве messages, чего большинство coding agent сейчас не делает.

В чём разница между Omni-Flash и Qwen3.5-Omni?

Qwen3.8-Omni-Flash — следующее поколение. Она построена на архитектуре Qwen3.8 с улучшенными agentic-возможностями, усиленным function calling, интеграцией web search и более высокими benchmark-показателями по multimodal задачам. Модели Qwen3.5-Omni остаются доступны, но для новых интеграций рекомендуется 3.8 Omni-Flash.

Источники

Помощь и контакты