DashScope Qwen API: как работает, актуальные версии и руководство по Qwen3.6
DashScope — это OpenAI-совместимая API-платформа Alibaba Cloud для моделей Qwen. Узнайте, чем DashScope отличается от Qwen, как работает API, какие версии актуальны (Qwen3.6-plus / Qwen3.6-flash) и что меняется в routing-конфигурации.
Архивный материал, подготовленный с помощью ИИ по указанному источнику и опубликованный без индивидуальной проверки. Ответственный редактор: Joe Werner.

Решение, которое здесь действительно важно, — не про бенчмарки. Оно про то, какие именно идентификаторы моделей вы должны вызывать сегодня и какие из них буквально за ночь стали новым legacy-уровнем.
Model Studio от Alibaba Cloud (百炼/DashScope) официально обновил каталог рекомендованных моделей: Qwen3.6-plus и Qwen3.6-flash теперь являются вариантом по умолчанию для подавляющего большинства agent- и production-нагрузок, а семейство Qwen3 (qwen3-max, qwen3-32b и так далее) перенесено в раздел «legacy и прочие модели» с явной пометкой: «Новые проекты должны использовать Qwen3.6 или Qwen3.5».
Если ваш routing-слой по-прежнему смотрит на qwen3-max, он продолжит работать — но вы теперь направляете трафик на модель, которую сама платформа неявно понизила в приоритете.
Что изменилось
Alibaba Cloud вывел в production API трёхуровневый стек Qwen3.x:
| Уровень | Модель | Контекст | Сравнимое позиционирование |
|---|---|---|---|
| Флагман | qwen3.7-max | 1M токенов | Класс GPT-5.5 / Claude Opus 4.7 |
| Сбалансированный (новый default) | qwen3.6-plus | 1M токенов | Класс GPT-5.4 / Claude Sonnet 4.6 |
| Низкая стоимость (новый default) | qwen3.6-flash | 1M токенов | Класс GPT-5.4-mini / Claude Haiku 4.5 |
Все три модели Qwen3.6 имеют общий набор возможностей:
- Контекстное окно на 1M токенов (как у qwen3.7-max)
- Function calling с полной поддержкой структурированного вывода
- Встроенные инструменты: web search, code interpreter, web scraping — включаются без дополнительной конфигурации
- Batch inference (асинхронные задания со сниженной стоимостью)
- Coding Plan subscription — вариант с фиксированной месячной оплатой специально для coding-агентов вроде Claude Code и Cursor, с выделенным base URL и отдельным API-ключом
Доступны зафиксированные версии (qwen3.6-plus-2026-04-02, qwen3.6-flash-2026-04-16) для команд, которым нужна стабильность между релизами.
Существует также Qwen3.6-max-preview как preview-уровень с 256k контекста, но без batch inference и встроенных инструментов.
Почему это важно для AI-инженерных команд
1. Риск дрейфа model alias вырос. Маршрутизация на плавающий alias qwen3.6-plus вместо зафиксированной версии (qwen3.6-plus-2026-04-02) означает, что приложение молча подхватит следующий снапшот, как только Alibaba Cloud обновит alias. Для большинства production-нагрузок поведение будет похожим, но для eval-ов или чувствительных к стоимости пайплайнов зафиксированные версии позволяют управлять моментом апгрейда.
2. Встроенные инструменты меняют контракт запроса. Qwen3.6-plus и qwen3.6-flash поддерживают нативные web search, code interpreter и web scraping как first-class built-in tools — никакой ручной инжекции tool schema не требуется. Это удобно, но также означает, что любой proxy или router между приложением и DashScope должен быть прозрачен к формату ответов с результатами инструментов. Наивный OpenAI-совместимый proxy, который «нормализует» поле tool_calls, может молча терять tool-ответы.
3. Закрепление за региональным endpoint-ом стало реальным операционным выбором. DashScope предоставляет четыре отдельных endpoint-а:
- Пекин:
https://dashscope.aliyuncs.com/compatible-mode/v1 - Сингапур:
https://dashscope-intl.aliyuncs.com/compatible-mode/v1 - США (Вирджиния):
https://dashscope-us.aliyuncs.com/compatible-mode/v1 - Франкфурт:
https://{WorkspaceId}.eu-central-1.maas.aliyuncs.com/compatible-mode/v1
API-ключи не взаимозаменяемы между регионами. Команда, выпустившая ключ для Пекина, не сможет автоматически уйти в fallback на Сингапур — нужны отдельные credentials для каждого региона. Это делает кросс-региональную маршрутизацию или fallback нетривиальной задачей без явного управления учётными данными на уровне gateway.
4. Доступность сторонних моделей в DashScope расширяет варианты маршрутизации. Новый каталог также перечисляет deepseek-v4-pro, deepseek-v4-flash, kimi-k2.6, glm-5.1, MiniMax-M2.7 и mimo-v2.5-pro под единым OpenAI-совместимым интерфейсом. Команды, которые маршрутизировали DeepSeek или Kimi через собственные provider-ключи, теперь могут консолидироваться через один аккаунт DashScope — правда, с разным паритетом возможностей (сторонние модели не всегда поддерживают встроенные инструменты DashScope или structured output).
5. Coding Plan меняет модель затрат для coding-агентов. Подписка Coding Plan предлагает фиксированную месячную плату для использования coding-агентов (Claude Code, Cursor, Hermes и т.д.) с выделенным endpoint-ом. Это другая биллинговая модель, отличная от pay-as-you-go по токенам. Команды, использующие coding-агенты на умеренном объёме, могут счесть Coding Plan дешевле, но план требует отдельный base URL и API-ключ — то есть конфигурация coding-агента и конфигурация API приложения не могут использовать одни и те же credentials.
Угол зрения router/operator
Для команд, использующих gateway-слой перед DashScope, ротация Qwen3.6 создаёт несколько конфигурационных решений:
Обновите списки model ID. Если ваша routing-конфигурация использует qwen3-max как основную или fallback-модель, пора оценить миграцию на qwen3.7-max или qwen3.6-plus. Старые модели всё ещё отвечают, но рекомендации самого Alibaba Cloud теперь указывают на новый уровень.
Различайте плавающие и зафиксированные alias-ы. Маршрутизируйте production-нагрузки на зафиксированные версии, когда вам нужна воспроизводимость между биллинговыми циклами. Плавающие alias-ы используйте только в eval- или прототипных контекстах, где обновления снапшота приемлемы.
Планируйте управление credentials в мульти-регионе. Кросс-региональный fallback DashScope требует отдельных API-ключей на регион. Routing gateway с поддержкой наборов credentials на провайдера может выразить это так: primary = endpoint Пекина + ключ A, fallback = endpoint Сингапура + ключ B. Без поддержки маршрутизации на уровне credentials команды ограничены доступом к DashScope в одном регионе.
Следите за passthrough ответов инструментов. Если ваш gateway переписывает или нормализует ответы chat-completion, протестируйте его на запросе к qwen3.6-plus, который запускает встроенный инструмент. Поля tool_calls и результатов инструментов должны проходить нетронутыми, иначе многошаговое рассуждение модели сломается ниже по цепочке.
Coding Plan и API приложения — это разные дорожки. Не переиспользуйте API-ключ Coding Plan для общего трафика приложения — квота Coding Plan расходуется запросами coding-агентов, и смешивание потребления создаст непредсказуемое истощение квоты.
За чем стоит следить пользователям TheRouter
Командам, маршрутизирующим в DashScope через TheRouter, стоит пересмотреть свои model-конфигурации и проверить, какие именно идентификаторы моделей Qwen активны. Ключевые вопросы:
- Вы всё ещё маршрутизируете на
qwen3-max? Сегодня это работает, но обновление доqwen3.7-maxилиqwen3.6-plusсоответствует текущему рекомендованному уровню Alibaba Cloud. - Ваши fallback-цепочки ссылаются на зафиксированные или плавающие alias-ы Qwen? Для надёжности в production предпочтительнее зафиксированные версии (
qwen3.6-plus-2026-04-02). - Вы обращаетесь к DashScope из нескольких регионов? Если команде нужна кросс-региональная избыточность, заведите отдельные provider-credentials для каждого регионального endpoint-а DashScope.
- Вы используете встроенные инструменты? Проверьте, что ваш request pipeline корректно пропускает ответы
tool_calls, когда активны встроенные инструменты Qwen3.6.
Полный обновлённый каталог моделей с контекстными окнами, матрицей поддержки фич и региональной доступностью задокументирован на странице text generation Alibaba Cloud Model Studio.
Похожие материалы
Новости AI-роутинга и провайдеров →
Qwen3.5-Omni S2S: голосовой роутинг через DashScope
Qwen3.5-Omni предоставляет speech-to-speech через WebSocket на DashScope, но выбор S2S вместо ASR-LLM-TTS пайплайна фиксирует архитектуру. Сравнение задержки, fallback, региональных endpoint'ов и голосовой маршрутизации.

DashScope OpenAI Responses API — compatible-mode/v1 теперь поддерживает Qwen с сохранением контекста и встроенными инструментами
DashScope OpenAI Responses API запущен на compatible-mode/v1 для моделей Qwen3.7-max, qwen3.6-plus, qwen3-coder-plus и др. Состоятельный previous_response_id, встроенный веб-поиск и интерпретатор кода, управление глубиной reasoning.effort, четыре глобальных региона.

OpenAI Prompt Cache Diagnostics стал GA: что нельзя убирать на уровне gateway
OpenAI выпустил Prompt Cache Diagnostics в GA для Responses API. Новые поля comparison_response_id и reason объясняют промахи кеша — но если gateway удаляет prompt_cache_options, диагностика молча исчезает.