Qwen3.8-Omni-Flash API: нативное понимание аудио, видео, изображений и текста на DashScope
Практическое руководство по интеграции Qwen3.8-Omni-Flash через OpenAI-совместимый API DashScope. Охватывает model ID, omni-modal ввод (текст + изображения + аудио + видео), thinking mode, function calling, realtime WebSocket вариант, тарификацию по модальностям и маршрутизацию через TheRouter.
Qwen3.8-Omni-Flash — первая нативно omni-modal модель в семействе Qwen. С момента запуска на DashScope 17 сентября 2026 года она принимает текст, изображения, аудио и видео в одном API-вызове и возвращает текстовый ответ. Сопутствующий realtime вариант (qwen3.8-omni-flash-realtime) добавляет WebSocket и WebRTC streaming для интерактивных аудио-видео разговоров. Это руководство проведёт через оба варианта — от первого API-вызова до production-маршрутизации.
Чем Qwen3.8-Omni-Flash отличается от других моделей
Большинство multimodal моделей прикрепляют визуальные возможности к текстовому backbone. Qwen3.8-Omni-Flash изначально спроектирована как omni-modal agentic модель. Четыре модальности поступают на вход, текст выходит на выходе, и модель рассуждает по всем модальностям за один forward pass.
Ключевые характеристики из официального блога Qwen и списка моделей DashScope:
- Входные модальности: текст, изображения, аудио, видео
- Выход: текст (realtime вариант также выводит аудио)
- Контекстное окно: 1M token
- Thinking mode: поддерживается (цепочка рассуждений)
- Function calling: поддерживается
- Web search: поддерживается
- Context caching: поддерживается
- API-совместимость: OpenAI Chat Completions и Responses API через DashScope
Модель нацелена на реальные agentic-сценарии продуктивности. Помимо понимания multimodal контента она способна действовать через function calling и web search, а затем пошагово разбирать сложные задачи в thinking mode.
Два model ID, два паттерна доступа
DashScope предоставляет Qwen3.8-Omni-Flash через два model ID для разных сценариев:
| Model ID | Протокол | Вход | Выход | Сценарий |
|---|---|---|---|---|
qwen3.8-omni-flash | HTTP (Chat Completions / Responses) | Текст, изображения, аудио, видео | Текст | Пакетный анализ, обработка документов, асинхронные workflow |
qwen3.8-omni-flash-realtime | WebSocket, WebRTC | Streaming аудио, видеокадры, текст | Текст + аудио | Живые разговоры, голосовые ассистенты, видеозвонки |
Offline-модель (qwen3.8-omni-flash) использует знакомый OpenAI-совместимый HTTP API. Realtime-модель (qwen3.8-omni-flash-realtime) требует постоянного соединения и непрерывной потоковой передачи ввода/вывода.
Начало работы с offline API
Шаг 1. Получите API-ключ
Зарегистрируйтесь на Alibaba Cloud Model Studio и сгенерируйте DashScope API-ключ в консоли.
Шаг 2. Настройте OpenAI SDK
from openai import OpenAI
client = OpenAI(
api_key="your-dashscope-api-key",
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
Для китайского региона используйте https://dashscope.aliyuncs.com/compatible-mode/v1.
Шаг 3. Понимание текста и изображений
response = client.chat.completions.create(
model="qwen3.8-omni-flash",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "What components are shown in this architecture diagram?"},
{"type": "image_url", "image_url": {"url": "https://example.com/architecture.png"}},
],
}
],
)
print(response.choices[0].message.content)
Шаг 4. Понимание аудио
response = client.chat.completions.create(
model="qwen3.8-omni-flash",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Transcribe and summarize this meeting recording."},
{"type": "audio_url", "audio_url": {"url": "https://example.com/meeting.mp3"}},
],
}
],
)
print(response.choices[0].message.content)
Шаг 5. Анализ видео
response = client.chat.completions.create(
model="qwen3.8-omni-flash",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Describe what happens in this product demo."},
{"type": "video_url", "video_url": {"url": "https://example.com/demo.mp4"}},
],
}
],
)
print(response.choices[0].message.content)
Все три паттерна используют один и тот же Chat Completions endpoint. Модель самостоятельно определяет модальность входных данных и обрабатывает их нативно, без отдельных pipeline.
Thinking mode
Qwen3.8-Omni-Flash поддерживает явный режим рассуждений, который генерирует цепочку мыслей перед финальным ответом. Это полезно для сложных multimodal запросов, где модели нужно последовательно разобрать визуальные или звуковые данные.
Включение описано в документации DashScope по thinking mode. Точный формат параметров может меняться — сверяйтесь с актуальной документацией DashScope.
Function calling
Модель поддерживает OpenAI-совместимый function calling. Вы определяете tools, а Qwen3.8-Omni-Flash самостоятельно решает, когда их вызывать, опираясь на multimodal контекст.
tools = [
{
"type": "function",
"function": {
"name": "search_inventory",
"description": "Search product inventory by visual description",
"parameters": {
"type": "object",
"properties": {
"description": {"type": "string"},
"category": {"type": "string"}
},
"required": ["description"]
}
}
}
]
response = client.chat.completions.create(
model="qwen3.8-omni-flash",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Find this item in our inventory."},
{"type": "image_url", "image_url": {"url": "https://example.com/item.jpg"}},
],
}
],
tools=tools,
)
Модель также может использовать web search как встроенный инструмент, подтягивая актуальную информацию в дополнение к multimodal пониманию.
Realtime вариант
qwen3.8-omni-flash-realtime запущен 21 сентября 2026 года, через четыре дня после offline-модели. Он поддерживает три протокола подключения:
- WebSocket — стандартный двусторонний streaming
- WebRTC — оптимизирован для браузерного аудио/видео
- AOQ — проприетарный протокол Alibaba с низкой задержкой
Realtime-модель добавляет многоканальную агрегацию аудио, агрегацию видеокадров и удалённый вызов MCP-инструментов поверх базовых возможностей. Она выводит текст и аудио одновременно, подходит для голосовых ассистентов и видеозвонков.
Документация по API realtime-варианта доступна в руководстве DashScope по realtime-моделям.
Тарификация
Qwen3.8-Omni-Flash относится к ценовой категории Flash на DashScope. Текстовые token rates по данным сторонних агрегаторов (сверены с OpenRouter и DashScope pricing):
| Модальность | Input (за 1M token) | Output (за 1M token) |
|---|---|---|
| Текст | ~$0.15 | ~$0.47 |
| Аудио | Выше текстового тарифа (отдельный rate по модальности) | Н/Д (только текстовый output) |
| Видео | Выше текстового тарифа (отдельный rate по модальности) | Н/Д (только текстовый output) |
| Изображения | На уровне vision-моделей (отдельный rate по модальности) | Н/Д (только текстовый output) |
Для realtime-варианта аудио-output тарифицируется отдельно от текстового output. Точные тарифы в юанях доступны на официальной странице тарификации; долларовые эквиваленты приблизительны и зависят от курса.
Context caching даёт скидку на кешированные input token по той же схеме, что и другие модели Qwen3.8 на DashScope.
Сравнение: Omni-Flash vs Qwen3.8-Flash vs GPT-4o
| Характеристика | Qwen3.8-Omni-Flash | Qwen3.8-Flash | GPT-4o |
|---|---|---|---|
| Текстовый ввод | Да | Да | Да |
| Ввод изображений | Да | Да | Да |
| Ввод аудио | Да | Нет | Да |
| Ввод видео | Да | Да (кадры) | Ограниченно |
| Вывод аудио | Только realtime вариант | Нет | Только Realtime API |
| Контекстное окно | 1M | 1M | 128K |
| Thinking mode | Да | Да | Нет (o3/o4) |
| Function calling | Да | Да | Да |
| Web search | Да | Да | Через tools |
| Realtime streaming | WebSocket/WebRTC/AOQ | Нет | WebSocket |
| Текстовый input pricing | ~$0.15/1M | ~$0.15/1M | $2.50/1M |
Qwen3.8-Omni-Flash существенно выигрывает по стоимости multimodal нагрузок в сравнении с GPT-4o. Компромисс — зрелость экосистемы: у OpenAI шире набор инструментов и сторонних интеграций, тогда как OpenAI-совместимый endpoint DashScope покрывает основную поверхность API.
Командам, уже использующим Qwen3.8-Flash для текстовых и графических задач, Omni-Flash добавляет понимание аудио и видео без изменения паттерна интеграции. Единственное изменение в коде — смена model ID.
Маршрутизация через TheRouter
Если вы маршрутизируете OpenAI-совместимые запросы через TheRouter, можно настроить DashScope как провайдер и направлять omni-modal запросы на qwen3.8-omni-flash, а текстовые — на более дешёвые модели.
TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров, поддерживает провайдерный/модельный routing и fallback там, где это обеспечено продуктовыми путями, и предоставляет унифицированные поверхности billing/accounting в рамках реализованного функционала.
Стратегия routing по модальности здесь оправдана: запросы с аудио или видео отправлять в Omni-Flash, чисто текстовые или текст+изображение — маршрутизировать на Qwen3.8-Flash или Qwen3.8-Max в зависимости от сложности. Так простые запросы обходятся дешевле, а multimodal запросы гарантированно попадают на способную модель.
Настройка fallback описана в руководстве по model fallback.
Часто задаваемые вопросы
Может ли Qwen3.8-Omni-Flash генерировать аудио или изображения?
Offline-модель (qwen3.8-omni-flash) выдаёт только текст. Realtime-вариант (qwen3.8-omni-flash-realtime) может выводить аудио наряду с текстом. Ни один из вариантов не генерирует изображения или видео.
Какие аудиоформаты поддерживаются?
Модель принимает распространённые форматы, включая MP3 и WAV, через URL. Полный список поддерживаемых форматов и ограничения по размеру — в документации DashScope.
Как работает контекстное окно в 1M token с аудио и видео?
Аудио и видео токенизируются иначе, чем текст. Минутный аудиофрагмент или короткий видеоклип может занять значительную долю контекстного окна. Точное соотношение token/длительность зависит от кодирования и документировано в карточке модели на DashScope.
Доступна ли модель за пределами Китая?
Да. DashScope работает в сингапурском регионе (ap-southeast-1) через международный endpoint. Используйте https://dashscope-intl.aliyuncs.com/compatible-mode/v1 в качестве base URL.
Можно ли использовать с Claude Code или OpenAI Codex?
DashScope предоставляет OpenAI-совместимый endpoint, поэтому любой инструмент с поддержкой кастомного base_url может указать на DashScope и использовать qwen3.8-omni-flash как model ID. Однако omni-modal функции (аудио/видео ввод) требуют, чтобы инструмент передавал эти типы контента в массиве messages, чего большинство coding agent сейчас не делает.
В чём разница между Omni-Flash и Qwen3.5-Omni?
Qwen3.8-Omni-Flash — следующее поколение. Она построена на архитектуре Qwen3.8 с улучшенными agentic-возможностями, усиленным function calling, интеграцией web search и более высокими benchmark-показателями по multimodal задачам. Модели Qwen3.5-Omni остаются доступны, но для новых интеграций рекомендуется 3.8 Omni-Flash.
Источники
- Официальный блог Qwen3.8-Omni-Flash — получено 2026-10-06
- DashScope: новые модели — получено 2026-10-06
- DashScope: тарификация — получено 2026-10-06
- Alibaba Cloud Model Studio: обзор моделей — получено 2026-10-06
- DashScope: совместимость с OpenAI — получено 2026-10-06
- OpenRouter: Qwen3.8-Flash pricing — получено 2026-10-06
- BenchLM: Qwen3.8-Omni-Flash benchmarks — получено 2026-10-06
- DashScope: руководство по realtime-моделям — получено 2026-10-06