Kimi K2.6 отключён на NVIDIA NIM сегодня: три пути миграции, которые оператор должен оценить немедленно
NVIDIA NIM закрыла хостинговый endpoint Kimi K2.6 7 июля 2026 года. Если ваша конфигурация роутинга всё ещё указывает на NIM API для Kimi K2.6, запросы сейчас возвращают ошибки. Вот три конкретных пути миграции, которые каждый оператор должен оценить до конца дня.
Архивный материал, подготовленный с помощью ИИ по указанному источнику и опубликованный без индивидуальной проверки. Ответственный редактор: Joe Werner.

С 7 июля 2026 года NVIDIA NIM закрыла хостинговый endpoint Kimi K2.6. Если ваш AI gateway или приложение направляет трафик на https://integrate.api.nvidia.com/v1 с model: "moonshotai/kimi-k2.6", эти запросы теперь возвращают ошибки. Это не постепенное отключение — уведомление об устаревании на NIM прямо указывало, что API «не будет поддерживаться после 07.07.2026».
Решение, с которым вы сталкиваетесь прямо сейчас, — это не просто «какую модель выбрать взамен». Это миграция провайдера: NVIDIA NIM не добавила endpoint для Kimi K2.7 Code на замену K2.6. В отличие от перехода K2.5 → K2.6 на NIM (где K2.6 появился до отключения K2.5), endpoint moonshotai/kimi-k2.7-code на build.nvidia.com в настоящее время отсутствует. Вашему routing-слою нужно сменить провайдера, а не просто изменить имя модели.
Что произошло
Kimi K2.6 стала доступна на build.nvidia.com 29 апреля 2026 года как хостинговый trial endpoint. На той же странице NVIDIA опубликовала уведомление об устаревании: поддержка этого API прекратится 7 июля 2026 года — то есть сегодня.
Паттерн повторяет цикл K2.5: NVIDIA размещала Kimi K2.5 на NIM, объявила об её отключении с коротким предупреждением (10 дней в апреле), не добавила K2.6 сразу взамен, а затем всё же добавила K2.6. Цикл K2.6 прошёл с более длинным окном (около 10 недель), но подтверждённого endpoint для K2.7 Code на NIM пока нет.
Почему это важно для AI-инженерных команд
NVIDIA NIM был популярным backend для Kimi K2.6 по двум причинам: он предоставлял бесплатный tier endpoint для прототипирования без учётной записи Moonshot, а также OpenAI-совместимый API через URL-адрес NVIDIA, который корпоративные сетевые политики некоторых организаций находили проще для внесения в whitelist по сравнению с инфраструктурой китайских провайдеров.
Команды, использовавшие NIM для Kimi K2.6 в продакшене или на staging, должны сейчас ответить на конкретный вопрос: куда теперь направлять трафик Kimi K2.6?
Kimi K2.7 Code сегодня доступна через API платформы Moonshot. Это наиболее мощная кодинг-специализированная модель Moonshot: контекст 256K, постоянно включённый thinking-mode, и HighSpeed-вариант со скоростью около 180 t/s (до 260 t/s в сценариях с коротким контекстом). По сравнению с K2.6, K2.7 Code уже по сфере применения — она специализируется на кодировании и не поддерживает нативный мультимодальный ввод (изображения/видео) K2.6. Команды, использовавшие K2.6 преимущественно для генерации кода, получают прямое обновление; команды, зависящие от визуальных возможностей K2.6, нуждаются в другом пути.
Аспект router/operator
Три пути миграции в порядке возрастания сложности для оператора:
Путь 1: Прямой API Moonshot (минимальные усилия, рекомендуется для большинства команд)
Измените base_url в вашем routing-слое на https://api.moonshot.ai/v1, model — на kimi-k2.7-code (или kimi-k2.7-code-highspeed для чувствительных к задержке рабочих нагрузок). API платформы Kimi совместим с OpenAI — тот же паттерн переключения SDK применим здесь. Потребуется API-ключ Moonshot Platform, если его ещё нет. Профиль задержки отличается от хостинговой инференции NIM — запустите бенчмарки перед переключением продакшн-трафика.
Путь 2: Self-hosted через vLLM или HuggingFace (для команд с GPU-кластерами)
Kimi K2.7 Code выпущена с открытыми весами по лицензии Modified MIT и доступна на HuggingFace (moonshotai/Kimi-K2.7-Code). Если ваша команда уже использует vLLM для других open-weight моделей, это добавляет новую цель для развёртывания. vLLM Recipes (recipes.vllm.ai/moonshotai/Kimi-K2.7-Code) документирует процесс настройки. Этот путь сохраняет гарантии локализации данных и устраняет зависимость от внешних API, но требует GPU-мощностей для модели 1T MoE.
Путь 3: Fallback на K2.6 через Moonshot напрямую (если необходим мультимодальный ввод)
kimi-k2.6 по-прежнему активна в API платформы Moonshot (api.moonshot.ai/v1). Если ваша рабочая нагрузка зависит от возможностей K2.6 по вводу изображений/видео, вы можете временно направить трафик на K2.6 через прямой API Moonshot, пока оцениваете, подходит ли text-only область K2.7 Code. Это краткосрочное решение, а не конечное.
Последствия для routing-политики gateway-операторов:
- Немедленно обновите URL-адреса endpoint'ов, специфичных для NIM — они сейчас возвращают ошибки.
- Если ваш gateway использует
provider: nvidia_nim+model: kimi-k2.6, строку модели также нужно изменить;kimi-k2.7-codeна NIM не существует. - Проверьте, не включён ли NIM в fallback chain как вторичный провайдер для Kimi. Если да, этот fallback теперь неработоспособен и будет молча поглощать retry-запросы перед итоговым сбоем.
- Примечание по стоимости: прямой API Moonshot для K2.7 Code тарифицируется по использованию; free-tier квота NIM исчезает после этой миграции.
Что стоит сделать прямо сейчас
Если в вашей конфигурации роутинга NVIDIA NIM выступает backend для любой модели Kimi, проверьте её немедленно. Паттерн временного размещения Kimi на NIM с последующим отключением без аналогичной замены повторился уже дважды (K2.5 в апреле, K2.6 сегодня). Построение fallback-логики провайдера, которая не хардкодит NIM как основной маршрут для Kimi — и умеет переключаться на прямой API Moonshot или self-hosted endpoint — снизит влияние будущих изменений в цикле NIM.
Практический тест: отправьте прямо сейчас запрос на integrate.api.nvidia.com/v1 с model: moonshotai/kimi-k2.6. Если получаете ошибку — ваш NIM-маршрут сломан. Переключитесь на api.moonshot.ai/v1 с kimi-k2.7-code, проверьте поведение context и tool call, и только после этого переводите продакшн-трафик.
Модели, упомянутые в статье
Похожие материалы
Новости AI-роутинга и провайдеров →
Qwen3.8-Max — теперь топовая модель DashScope: что смена флагмана меняет в вашей routing-политике
qwen3.8-max появился на DashScope: 2.4T параметров, 1M контекст и режим размышлений — а qwen3.7-max переведён в legacy. Что меняется для команд, маршрутизирующих трафик на флагманский уровень Qwen.

Nano Banana 2 Lite — новый дефолтный эндпоинт Gemini для изображений: фреймворк принятия решений по маршрутизации
Nano Banana 2 Lite (gemini-3.1-flash-lite-image) вышел 30 июня по $0,034/тыс. изображений при задержке 4 секунды. Если вы ещё маршрутизируете на gemini-2.5-flash-image — вы на устаревшей модели. Трёхуровневый routing-фреймворк для operator teams.

Tencent Hy3 на TokenHub: что три режима рассуждений 295B MoE-модели означают для вашей политики API-роутинга
Tencent запустил Hy3 6 июля: API доступен на TokenHub, внедрение идёт на AI-gateway-платформах. Tencent Hy3 API routing operator: три режима рассуждений, 256K контекст и входная цена ниже $0.15 за млн токенов.