Как работает DashScope: API Qwen-Image-2.0, async-задачи и маршрутизация медиапайплайнов

DashScope — это управляемая API-платформа Alibaba для семейства Qwen. С qwen-image-2.0-pro она вводит async-паттерн, отличный от DALL-E: отправь запрос, получи task ID, запрашивай результат через polling.

Опубликовано Обновлено источник Qwen Blog

Архивный материал, подготовленный с помощью ИИ по указанному источнику и опубликованный без индивидуальной проверки. Ответственный редактор: Joe Werner.

Абстрактная маршрутизационная схема: поток async media job между endpoint'ами генерации изображений Qwen и слоем gateway
Машинный перевод с английского оригинала — читать оригинал

Когда Alibaba на этой неделе выкатила Qwen-Image и Qwen-Image-Edit в DashScope, большая часть публикаций крутилась вокруг бенчмарков и качества рендеринга китайских иероглифов. Для команд маршрутизации AI важнее другой инженерный вопрос: как эти модели приземляются в API DashScope, и что это значит для любого gateway или proxy перед ними?

Последствия выходят за рамки экосистемы Alibaba. Каталог моделей DashScope теперь содержит qwen-image-2.0-pro как активную модель генерации изображений — рядом с уже существующими endpoint'ами для видео и речи. Если ваш router считает весь трафик DashScope единым namespace /chat/completions, вас ждёт несовпадение.

Что изменилось

Команда Qwen в Alibaba с разницей в несколько дней выпустила две связанные модели:

Qwen-Image — это foundation-модель для генерации изображений объёмом 20B на архитектуре MMDiT (Multimodal Diffusion Transformer), с двумя ключевыми возможностями: превосходный text rendering — включая многострочный китайский и английский текст с высокой точностью — и стабильное редактирование изображений. Доступна в Qwen Chat и через DashScope API под model ID qwen-image-2.0-pro.

Qwen-Image-Edit расширяет Qwen-Image задачами редактирования. Она обрабатывает как семантическое редактирование (style transfer, поворот объектов, IP creation), так и редактирование внешнего вида (добавление/удаление элементов, изменение цвета с контролируемым сохранением региона). Модель использует двухэнкодерную архитектуру: входное изображение подаётся в Qwen2.5-VL для семантического контроля и в VAE-энкодер — для точности на уровне пикселей. Точное двуязычное (китайский/английский) редактирование текста на существующих изображениях — отдельная заметная возможность.

Обе модели показывают state-of-the-art результаты на стандартных бенчмарках генерации и редактирования изображений, включая GenEval, DPG, GEdit и ImgEdit. По рендерингу китайского текста разрыв с предыдущими моделями весьма заметный.

Почему это важно для AI-инженерных команд

Команды, маршрутизирующие нагрузки на генерацию изображений — дизайн-инструменты, пайплайны e-commerce product image, редакторы документов, multimodal coding agents — встают перед тремя конкретными решениями:

1. Namespace для model ID. Генерация изображений в DashScope использует другое семейство моделей, чем генерация текста. Новый ID — это qwen-image-2.0-pro, а не вариант qwen3.7-max или qwen3.6-plus. Если ваша конфигурация маршрутизации мапит весь трафик DashScope на text-model ID, запросы на генерацию изображений уйдут не на тот endpoint и вы получите неожиданные ошибки либо тихо повреждённые ответы.

2. Различия в API-поверхности. Генерация изображений в DashScope живёт на другом API-пути, не на /chat/completions. Модель принимает prompts для генерации и редактирования изображений, но request- и response-схемы отличаются от стандартного chat completion. Gateway, который слепо пробрасывает запросы model: qwen-image-2.0-pro на endpoint генерации текста, упадёт способом, не очевидным на уровне приложения.

3. Жизненный цикл async job. Генерация изображений — будь то DashScope, OpenAI DALL-E или Replicate — обычно асинхронна: API принимает задачу, возвращает job ID, а клиент опрашивает её на завершение. Если ваш proxy-слой не умеет корректно обрабатывать жизненный цикл async job для генерации изображений (submit → poll /v1/jobs/:id → retrieve result), вы рискуете отдавать неполные ответы или молча проглатывать сбои job.

Способность к рендерингу китайского текста важна и для команд, работающих в двуязычных контекстах или на китайском рынке. Для document pipelines, генерации маркетинговых изображений или multimodal app-конструкторов, нацеленных на Китай, qwen-image-2.0-pro — сейчас самый сильный вариант в своём ярусе. Это должно отражаться в политике маршрутизации: задачи рендера китайского текста — на эту модель, а не на дефолтный DALL-E или Flux-endpoint.

Угол маршрутизации и эксплуатации

Большинство OpenAI-совместимых gateway (включая многие коммерческие proxy) обрабатывают /v1/images/generations как pass-through с минимальной логикой маршрутизации. Endpoint генерации изображений DashScope требует знания конкретного model ID и может требовать дополнительных параметров провайдера.

Что командам маршрутизации стоит проверить:

  • Реестр model ID: содержит ли реестр моделей вашего gateway qwen-image-2.0-pro, замапленный на правильный endpoint генерации изображений DashScope? Или его нет, и из-за этого происходит fallback на неверный endpoint?
  • Обработка async media: когда запрос на генерацию изображения DashScope возвращает task ID, а не сразу изображение, выдаёт ли gateway этот job ID клиенту корректно, или блокируется в ожидании синхронного ответа, который никогда не придёт?
  • Fallback-цепочки для генерации изображений: если у вас настроен fallback с DALL-E на DashScope (по стоимости или доступности), путь fallback должен мапиться на корректный endpoint и model ID именно для image API, а не для text completion.
  • Нормализация response-схемы: DALL-E возвращает изображения как base64 или URL в data[].b64_json или data[].url. Image-ответы DashScope могут иметь иную структуру. Gateway, нормализующий эти схемы для downstream-клиентов, нужно обновлять при добавлении image-endpoint нового провайдера.

Qwen-Image-Edit вводит ещё одно маршрутизационное решение: endpoint в стиле /images/edits, принимающий входное изображение плюс текстовую инструкцию. Модель относится к тому же семейству qwen-image-2.0-pro, но, скорее всего, к отдельному endpoint DashScope. Если вы сегодня маршрутизируете запросы на редактирование изображений (к GPT-Image-1.5 или Gemini Imagen 3), редакторские возможности qwen-image-2.0-pro — особенно для ассетов с китайским текстом — заслуживают оценки как альтернатива в вашей политике маршрутизации.

Стоимость и региональная маршрутизация: DashScope тарифицирует генерацию изображений за изображение, а не за токен. Командам, которые делают cost-optimized routing, нужно сравнивать с per-output-image ценой у DALL-E 3 / GPT-Image-1.5 / Flux. Региональные endpoint DashScope в Китае (Пекин) и международные endpoint в Вирджинии и Сингапуре также дают выбор по регионам, релевантный для latency и compliance.

Что стоит отслеживать или попробовать пользователям TheRouter

Командам, использующим TheRouter или строящим конфигурации маршрутизации на DashScope:

  • Добавьте qwen-image-2.0-pro в список моделей провайдера DashScope, если маршрутизируете нагрузки генерации изображений. Уточните, требуют ли endpoint генерации и endpoint редактирования отдельных конфигураций провайдера.
  • Проверьте обработку async media job в вашем слое маршрутизации. Async media path в TheRouter (документация Async Media) умеет работать с циклом submit/poll/retrieve для image-job. Если вы маршрутизируете запросы генерации изображений DashScope, убедитесь, что endpoint сконфигурирован под async-обработку, а не под блокирующий проброс chat completion.
  • Оцените модель под двуязычные или китайские пайплайны. Если ваше приложение генерирует изображения с встроенным китайским или mixed-language текстом, qwen-image-2.0-pro сейчас самый способный вариант в открытом каталоге DashScope. Рассмотрите правило маршрутизации, отправляющее именно такие запросы на эту модель.
  • Следите за доступностью на международных endpoint DashScope. На текущий момент модель подтверждена на китайском endpoint (dashscope.aliyuncs.com). Отслеживайте US-Virginia и Сингапур (dashscope-us.aliyuncs.com, dashscope-intl.aliyuncs.com) на предмет появления image-модели.

Главный вывод: Qwen-Image — это не просто очередной запуск image-модели. Это приход полноценного пайплайна генерации и редактирования изображений в OpenAI-совместимую поверхность DashScope — пайплайна, который требует собственной конфигурации маршрутизации, обработки async job и регистрации model ID, чтобы корректно работать в multi-provider gateway.

Абстрактная редакторская схема с тремя ветвями маршрутизации от gateway-слоя к трём моделям DashScope: wan2.7-image-pro, qwen-image-2.0-pro и z-image-turbo

wan2.7-image-pro теперь рекомендуемый Image API DashScope: руководство по маршрутизации для операторов

DashScope сделал wan2.7-image-pro рекомендуемым endpoint по умолчанию: единственная модель с 4K-выводом, рендерингом текста, фирменными цветами и консистентностью персонажей в одном model ID. Фреймворк маршрутизации vs qwen-image-2.0-pro и z-image-turbo.

источник Alibaba Cloud Model Studio
Абстрактная диаграмма сравнения S2S single-model path и ASR-LLM-TTS pipeline для мультимодального AI-роутинга

Qwen3.5-Omni S2S: голосовой роутинг через DashScope

Qwen3.5-Omni предоставляет speech-to-speech через WebSocket на DashScope, но выбор S2S вместо ASR-LLM-TTS пайплайна фиксирует архитектуру. Сравнение задержки, fallback, региональных endpoint'ов и голосовой маршрутизации.

источник Alibaba Cloud Model Studio
Помощь и контакты