← Все статьи

DashScope: отключение моделей в октябре 2026 — чеклист миграции за 27 дней

До 10 октября осталось 27 дней. DashScope (Bailian) жёстко отключит 100+ моделей — mainline-версии Qwen, снапшоты и все сторонние модели (DeepSeek, GLM, MiniMax, Kimi). QPM/TPM throttling уже идёт. Вот компактный чеклист последней миграции: аудит model ID, замена, получение ключей от вендоров и тестирование.

· TheRouter

DashScope: отключение моделей в октябре 2026 — чеклист миграции за 27 дней

10 октября 2026 года в 00:00 CST DashScope (Bailian) выполнит крупнейшую в своей истории волну отключений. Без переходного периода, без деградированного режима. QPM и TPM throttling для отключаемых моделей уже запущен. Если ваши сервисы до сих пор вызывают любой из этих model ID — время заканчивается.

В июле мы опубликовали полный гайд по миграции со списком всех моделей, анализом цен и готовыми diff-ами кода. Эта статья — не тот гайд. Это компактный чеклист действий на последние 27 дней.

  1. Меняйте три значения, а не три SDK. Замените api_key, base_url и model в существующем клиенте OpenAI. Код запроса и ответа оставьте неизменным.
  2. Сопоставьте model ID явно. ID модели у целевого провайдера почти никогда не совпадает с OpenAI ID. Держите словарь { openai_id: target_id } вне бизнес-логики.
  3. Проверьте формат streaming. SSE-чанки должны соответствовать контракту OpenAI: data: {...} + data: [DONE]. Прогоните один streaming вызов до продакшена.
  4. Проверьте rate-limit заголовки. Некоторые провайдеры не возвращают x-ratelimit-*. Добавьте обёртку с безопасным дефолтом.
  5. Оставьте путь отката. Раскатайте замену под feature flag, гоняйте оба endpoint в shadow-режиме 24 часа, затем переключайтесь.

Что отключается — за 30 секунд

Шесть официальных уведомлений, одна дата. Всё отключается 10 октября:

УведомлениеЧто уходитКол-во
#118344Qwen3 mainline: qwen3-max, qwen3-max-preview, qwen3.6-max-preview, qwen3-coder-plus, qwen3-vl-flash5
#118177Legacy mainline: qwen-turbo, qwen-vl-max/plus, qwq-plus, qvq-max/plus, qwen-math-turbo, qwen-coder-turbo/plus10
#118434Устаревшие mainline-моделиразн.
#11834560+ снапшотов + ВСЕ сторонние: DeepSeek V3/R1, MiniMax-M2.1, GLM-4.7/4.6, Kimi-K260+
#118331Voice mainline (cosyvoice, paraformer, gummy)15+
#118332Voice снапшотыразн.

Самая сложная часть — миграция сторонних моделей. DashScope рекомендует qwen3.7-plus как универсальную замену, но если вы выбрали DeepSeek R1 ради reasoning или GLM-4.7 ради длинного китайского контекста, подмена на другое семейство — это не миграция, а переписывание. Переходите на прямой API вендора.

Чеклист — 5 шагов, начинайте сейчас

Шаг 1: аудит использования моделей (день 1)

Откройте страницу телеметрии моделей DashScope и проверьте, есть ли активные вызовы к отключаемым model ID.

Затем найдите их в кодовой базе:

grep -rn "qwen3-max\|qwen3-max-preview\|qwen3.6-max-preview\|qwen3-coder-plus\|qwen3-vl-flash\|qwen-turbo\|qwen-vl-max\|qwen-vl-plus\|qwq-plus\|qvq-max\|qvq-plus\|qwen-math-turbo\|qwen-coder-turbo\|qwen-coder-plus\|deepseek-v3\|deepseek-r1\|MiniMax-M2.1\|glm-4.7\|glm-4.6\|Moonshot-Kimi-K2\|kimi-k2-thinking" \
  --include="*.py" --include="*.ts" --include="*.js" --include="*.yaml" --include="*.yml" --include="*.json" .

Если ничего не нашлось — вы в безопасности. Дальше можно не читать.

Шаг 2: замена model ID Qwen (дни 2–5)

Для моделей семейства Qwen миграция сводится к замене model ID. Тот же endpoint, тот же API key, тот же SDK.

Таблица замен:

Отключаемая модельЗаменаИзменение цены
qwen3-maxqwen3.7-max+380% input при <32K, −41% при 128K+
qwen3-max-previewqwen3.7-maxто же
qwen3.6-max-previewqwen3.7-maxсм. страницу цен
qwen3-coder-plusqwen3.7-plusминимально
qwen3-vl-flashqwen3.6-flashминимально
qwen-turboqwen3.6-flash−67% (дешевле)
qwq-plusqwen3.7-plus + enable_thinking: trueизменение API
qvq-max / qvq-plusqwen3.7-plus + enable_thinking: trueизменение API
qwen-coder-turbo / qwen-coder-plusqwen3.7-plusминимально

Если вы использовали reasoning-модели (qwq-plus, qvq-max, qvq-plus), замена меняет API-интерфейс. Серия Qwen3.7 использует параметр enable_thinking: true и возвращает цепочку рассуждений в поле reasoning_content. Thinking-токены тарифицируются по цене output. Подробности — в нашем гайде по серии Qwen3.7.

Для бюджетных команд: если цена qwen3.7-max (¥12/¥36 за миллион токенов) слишком высока, попробуйте qwen3.8-max по той же цене, но с более новой моделью, или перейдите на qwen3.7-plus за ¥2/¥8. Если критична латентность — оцените qwen3.8-max-prime (¥24/¥72).

Шаг 3: получение API-ключей у вендоров для сторонних моделей (дни 2–5)

Все сторонние модели, размещённые на DashScope, прекращают работу 10 октября. Qwen-модели не являются заменой для их уникальных возможностей. Переходите на прямой API вендора:

Отключаемая модель DashScopeВендорПрямой endpointГайд
deepseek-v3, deepseek-v3.1, deepseek-v3.2DeepSeekhttps://api.deepseek.comГайд по API DeepSeek
deepseek-r1, deepseek-r1-0528, distill-вариантыDeepSeekhttps://api.deepseek.comГайд по API DeepSeek
glm-4.7, glm-4.6Zhipu AIhttps://open.bigmodel.cnГайд по API GLM
Moonshot-Kimi-K2-Instruct, kimi-k2-thinkingMoonshot AIhttps://api.moonshot.cnГайд по API Kimi K3
MiniMax-M2.1MiniMaxhttps://api.minimax.chat—

Open-source модели (DeepSeek V3, R1, R1-distill) можно также маршрутизировать через SiliconFlow, который хостит их по конкурентным ценам. Подробности — в нашем гайде по бесплатным моделям SiliconFlow.

Пример изменения кода для прямого подключения к вендору:

# До — DeepSeek через DashScope (отключается 10 октября)
client = OpenAI(
    api_key="sk-dashscope-xxx",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
response = client.chat.completions.create(
    model="deepseek-v3",
    messages=[{"role": "user", "content": "Hello"}]
)

# После — DeepSeek напрямую
client = OpenAI(
    api_key="sk-deepseek-xxx",
    base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
    model="deepseek-chat",    # model ID вендора
    messages=[{"role": "user", "content": "Hello"}]
)

Шаг 4: тестирование замен (дни 5–14)

Запустите тестовый набор на замещающей модели. Обратите внимание на три момента:

  1. Формат вывода. Reasoning-модели (qwq-plus → qwen3.7-plus с thinking) возвращают цепочку рассуждений в другом поле. Формат структурированного вывода может отличаться между семействами моделей.
  2. Контекстное окно. qwen3-max имел ступенчатую тарификацию до 256K. qwen3.7-max — фиксированная цена до 1M. Ваши промпты будут работать, но счёт изменится.
  3. Латентность и rate limits. DashScope активно снижает throttling для отключаемых моделей. Замеры латентности на старых model ID ненадёжны.

Шаг 5: деплой и мониторинг (дни 14–27)

Выкатите обновлённые model ID и base URL в продакшн. Далее:

  • Следите за error rate. Если DashScope ещё больше снизит QPM/TPM в последние недели, старые endpoint-ы могут начать возвращать 429 ещё до 10 октября.
  • Настройте алерты по строкам model ID. Если после деплоя какой-то сервис продолжает обращаться к отключаемой модели — нужно поймать это до жёсткого стопа.
  • Если вы используете TheRouter, настройте model fallback с отключаемых ID на замены. TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров и поддерживает provider/model routing и fallback там, где это реализовано в продуктовом пути.

QPM/TPM throttling уже идёт

DashScope начал снижать rate limits на отключаемых моделях с даты публикации каждого уведомления. Самое раннее уведомление (#118177) вышло 13 апреля 2026 — QPM и TPM этих моделей уменьшаются уже пять месяцев. Если вы ранее запрашивали расширенные лимиты, они сначала сбрасываются к дефолтным, потом снижаются ниже дефолтных (механизм отключения, проверено 2026-09-13).

Если вы наблюдаете рост 429-ответов или снижение throughput на отключаемых моделях — это throttling. До 10 октября станет только жёстче.

Что произойдёт 10 октября в 00:00 CST

  • Инференс остановится. API-вызовы к отключаемым model ID начнут возвращать ошибки. Без fallback, без деградированного вывода.
  • Fine-tuned модели на базе отключённых могут продолжать работать, если уже развёрнуты, но новый fine-tuning на отключённых базах будет заблокирован.
  • Консоль и документация по отключённым моделям уйдут в офлайн.
  • Механизма продления нет. Дедлайны DashScope исторически сдвигались (дата отключения Qwen3 в сентябре была перенесена на 10 октября), но рассчитывать на очередное продление — азартная игра.

Связанные ресурсы по миграции

Полное сопоставление моделей с анализом цен и diff-ами кода — в нашем полном гайде по миграции DashScope октябрь 2026.

Путь обновления Qwen3 → Qwen3.7 — в гайде по апгрейду Qwen3 на Qwen3.7.

Таймлайн всех волн отключений DashScope — в справочнике по жизненному циклу моделей DashScope.


Источники: Aliyun Model Deprecation Page (проверено 2026-09-13), Model Pricing (проверено 2026-09-13), уведомления #118344, #118177, #118345, #118434, #118331, #118332.

Помощь и контакты