DashScope: отключение моделей в октябре 2026 — чеклист миграции за 27 дней
До 10 октября осталось 27 дней. DashScope (Bailian) жёстко отключит 100+ моделей — mainline-версии Qwen, снапшоты и все сторонние модели (DeepSeek, GLM, MiniMax, Kimi). QPM/TPM throttling уже идёт. Вот компактный чеклист последней миграции: аудит model ID, замена, получение ключей от вендоров и тестирование.
DashScope: отключение моделей в октябре 2026 — чеклист миграции за 27 дней
10 октября 2026 года в 00:00 CST DashScope (Bailian) выполнит крупнейшую в своей истории волну отключений. Без переходного периода, без деградированного режима. QPM и TPM throttling для отключаемых моделей уже запущен. Если ваши сервисы до сих пор вызывают любой из этих model ID — время заканчивается.
В июле мы опубликовали полный гайд по миграции со списком всех моделей, анализом цен и готовыми diff-ами кода. Эта статья — не тот гайд. Это компактный чеклист действий на последние 27 дней.
- Меняйте три значения, а не три SDK. Замените
api_key,base_urlиmodelв существующем клиенте OpenAI. Код запроса и ответа оставьте неизменным. - Сопоставьте model ID явно. ID модели у целевого провайдера почти никогда не совпадает с OpenAI ID. Держите словарь
{ openai_id: target_id }вне бизнес-логики. - Проверьте формат streaming. SSE-чанки должны соответствовать контракту OpenAI:
data: {...}+data: [DONE]. Прогоните один streaming вызов до продакшена. - Проверьте rate-limit заголовки. Некоторые провайдеры не возвращают
x-ratelimit-*. Добавьте обёртку с безопасным дефолтом. - Оставьте путь отката. Раскатайте замену под feature flag, гоняйте оба endpoint в shadow-режиме 24 часа, затем переключайтесь.
Что отключается — за 30 секунд
Шесть официальных уведомлений, одна дата. Всё отключается 10 октября:
| Уведомление | Что уходит | Кол-во |
|---|---|---|
| #118344 | Qwen3 mainline: qwen3-max, qwen3-max-preview, qwen3.6-max-preview, qwen3-coder-plus, qwen3-vl-flash | 5 |
| #118177 | Legacy mainline: qwen-turbo, qwen-vl-max/plus, qwq-plus, qvq-max/plus, qwen-math-turbo, qwen-coder-turbo/plus | 10 |
| #118434 | Устаревшие mainline-модели | разн. |
| #118345 | 60+ снапшотов + ВСЕ сторонние: DeepSeek V3/R1, MiniMax-M2.1, GLM-4.7/4.6, Kimi-K2 | 60+ |
| #118331 | Voice mainline (cosyvoice, paraformer, gummy) | 15+ |
| #118332 | Voice снапшоты | разн. |
Самая сложная часть — миграция сторонних моделей. DashScope рекомендует qwen3.7-plus как универсальную замену, но если вы выбрали DeepSeek R1 ради reasoning или GLM-4.7 ради длинного китайского контекста, подмена на другое семейство — это не миграция, а переписывание. Переходите на прямой API вендора.
Чеклист — 5 шагов, начинайте сейчас
Шаг 1: аудит использования моделей (день 1)
Откройте страницу телеметрии моделей DashScope и проверьте, есть ли активные вызовы к отключаемым model ID.
Затем найдите их в кодовой базе:
grep -rn "qwen3-max\|qwen3-max-preview\|qwen3.6-max-preview\|qwen3-coder-plus\|qwen3-vl-flash\|qwen-turbo\|qwen-vl-max\|qwen-vl-plus\|qwq-plus\|qvq-max\|qvq-plus\|qwen-math-turbo\|qwen-coder-turbo\|qwen-coder-plus\|deepseek-v3\|deepseek-r1\|MiniMax-M2.1\|glm-4.7\|glm-4.6\|Moonshot-Kimi-K2\|kimi-k2-thinking" \
--include="*.py" --include="*.ts" --include="*.js" --include="*.yaml" --include="*.yml" --include="*.json" .
Если ничего не нашлось — вы в безопасности. Дальше можно не читать.
Шаг 2: замена model ID Qwen (дни 2–5)
Для моделей семейства Qwen миграция сводится к замене model ID. Тот же endpoint, тот же API key, тот же SDK.
Таблица замен:
| Отключаемая модель | Замена | Изменение цены |
|---|---|---|
qwen3-max | qwen3.7-max | +380% input при <32K, −41% при 128K+ |
qwen3-max-preview | qwen3.7-max | то же |
qwen3.6-max-preview | qwen3.7-max | см. страницу цен |
qwen3-coder-plus | qwen3.7-plus | минимально |
qwen3-vl-flash | qwen3.6-flash | минимально |
qwen-turbo | qwen3.6-flash | −67% (дешевле) |
qwq-plus | qwen3.7-plus + enable_thinking: true | изменение API |
qvq-max / qvq-plus | qwen3.7-plus + enable_thinking: true | изменение API |
qwen-coder-turbo / qwen-coder-plus | qwen3.7-plus | минимально |
Если вы использовали reasoning-модели (qwq-plus, qvq-max, qvq-plus), замена меняет API-интерфейс. Серия Qwen3.7 использует параметр enable_thinking: true и возвращает цепочку рассуждений в поле reasoning_content. Thinking-токены тарифицируются по цене output. Подробности — в нашем гайде по серии Qwen3.7.
Для бюджетных команд: если цена qwen3.7-max (¥12/¥36 за миллион токенов) слишком высока, попробуйте qwen3.8-max по той же цене, но с более новой моделью, или перейдите на qwen3.7-plus за ¥2/¥8. Если критична латентность — оцените qwen3.8-max-prime (¥24/¥72).
Шаг 3: получение API-ключей у вендоров для сторонних моделей (дни 2–5)
Все сторонние модели, размещённые на DashScope, прекращают работу 10 октября. Qwen-модели не являются заменой для их уникальных возможностей. Переходите на прямой API вендора:
| Отключаемая модель DashScope | Вендор | Прямой endpoint | Гайд |
|---|---|---|---|
deepseek-v3, deepseek-v3.1, deepseek-v3.2 | DeepSeek | https://api.deepseek.com | Гайд по API DeepSeek |
deepseek-r1, deepseek-r1-0528, distill-варианты | DeepSeek | https://api.deepseek.com | Гайд по API DeepSeek |
glm-4.7, glm-4.6 | Zhipu AI | https://open.bigmodel.cn | Гайд по API GLM |
Moonshot-Kimi-K2-Instruct, kimi-k2-thinking | Moonshot AI | https://api.moonshot.cn | Гайд по API Kimi K3 |
MiniMax-M2.1 | MiniMax | https://api.minimax.chat | — |
Open-source модели (DeepSeek V3, R1, R1-distill) можно также маршрутизировать через SiliconFlow, который хостит их по конкурентным ценам. Подробности — в нашем гайде по бесплатным моделям SiliconFlow.
Пример изменения кода для прямого подключения к вендору:
# До — DeepSeek через DashScope (отключается 10 октября)
client = OpenAI(
api_key="sk-dashscope-xxx",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
response = client.chat.completions.create(
model="deepseek-v3",
messages=[{"role": "user", "content": "Hello"}]
)
# После — DeepSeek напрямую
client = OpenAI(
api_key="sk-deepseek-xxx",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-chat", # model ID вендора
messages=[{"role": "user", "content": "Hello"}]
)
Шаг 4: тестирование замен (дни 5–14)
Запустите тестовый набор на замещающей модели. Обратите внимание на три момента:
- Формат вывода. Reasoning-модели (
qwq-plus→qwen3.7-plusс thinking) возвращают цепочку рассуждений в другом поле. Формат структурированного вывода может отличаться между семействами моделей. - Контекстное окно.
qwen3-maxимел ступенчатую тарификацию до 256K.qwen3.7-max— фиксированная цена до 1M. Ваши промпты будут работать, но счёт изменится. - Латентность и rate limits. DashScope активно снижает throttling для отключаемых моделей. Замеры латентности на старых model ID ненадёжны.
Шаг 5: деплой и мониторинг (дни 14–27)
Выкатите обновлённые model ID и base URL в продакшн. Далее:
- Следите за error rate. Если DashScope ещё больше снизит QPM/TPM в последние недели, старые endpoint-ы могут начать возвращать 429 ещё до 10 октября.
- Настройте алерты по строкам model ID. Если после деплоя какой-то сервис продолжает обращаться к отключаемой модели — нужно поймать это до жёсткого стопа.
- Если вы используете TheRouter, настройте model fallback с отключаемых ID на замены. TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров и поддерживает provider/model routing и fallback там, где это реализовано в продуктовом пути.
QPM/TPM throttling уже идёт
DashScope начал снижать rate limits на отключаемых моделях с даты публикации каждого уведомления. Самое раннее уведомление (#118177) вышло 13 апреля 2026 — QPM и TPM этих моделей уменьшаются уже пять месяцев. Если вы ранее запрашивали расширенные лимиты, они сначала сбрасываются к дефолтным, потом снижаются ниже дефолтных (механизм отключения, проверено 2026-09-13).
Если вы наблюдаете рост 429-ответов или снижение throughput на отключаемых моделях — это throttling. До 10 октября станет только жёстче.
Что произойдёт 10 октября в 00:00 CST
- Инференс остановится. API-вызовы к отключаемым model ID начнут возвращать ошибки. Без fallback, без деградированного вывода.
- Fine-tuned модели на базе отключённых могут продолжать работать, если уже развёрнуты, но новый fine-tuning на отключённых базах будет заблокирован.
- Консоль и документация по отключённым моделям уйдут в офлайн.
- Механизма продления нет. Дедлайны DashScope исторически сдвигались (дата отключения Qwen3 в сентябре была перенесена на 10 октября), но рассчитывать на очередное продление — азартная игра.
Связанные ресурсы по миграции
Полное сопоставление моделей с анализом цен и diff-ами кода — в нашем полном гайде по миграции DashScope октябрь 2026.
Путь обновления Qwen3 → Qwen3.7 — в гайде по апгрейду Qwen3 на Qwen3.7.
Таймлайн всех волн отключений DashScope — в справочнике по жизненному циклу моделей DashScope.
Источники: Aliyun Model Deprecation Page (проверено 2026-09-13), Model Pricing (проверено 2026-09-13), уведомления #118344, #118177, #118345, #118434, #118331, #118332.