Kimi K2.6 API: цены ¥1.10/¥6.50/¥27 за 1M токенов для coding agents

Kimi K2.6 API стоит ¥1.10 за cache-hit input, ¥6.50 за cache-miss input и ¥27 за output на 1M токенов; доступны KVV-проверка, 256K context и OpenAI-compatible routing для coding agents.

Опубликовано источник Moonshot AI

Архивный материал, подготовленный с помощью ИИ по указанному источнику и опубликованный без индивидуальной проверки. Ответственный редактор: Joe Werner.

Тёмная техническая визуализация маршрутной сети, отражающая связность модели Kimi K2.6
Машинный перевод с английского оригинала — читать оригинал

Вопрос, с которым сегодня сталкивается любая AI-инженерная команда — не «какая модель умнее?», а «какая модель реально доводит задачу до конца, не разваливаясь на 40-м шаге?». Релиз Kimi K2.6 от Moonshot AI бьёт ровно в эту проблему. Это не запуск, построенный на бенчмарках. Это история про надёжность на длинной дистанции, подкреплённая бета-результатами от Augment Code, Factory, Fireworks, Baseten и Vercel — и поставляется она с полностью OpenAI-совместимым API, который делает её drop-in кандидатом для маршрутизации у любой команды, уже работающей с OpenAI SDK.

Что произошло

Moonshot AI выпустила Kimi K2.6 — преемницу Kimi K2.5 — и открывает её исходники одновременно с полной доступностью API по адресу https://api.moonshot.cn/v1. Модель поддерживает ввод текста, изображений и видео с контекстом 256K, оба режима — с рассуждениями и без, — а также полноценный function calling (tool use, JSON Mode, Partial Mode, web search).

Прайсинг уже доступен на платформе:

МодельВход (cache hit)Вход (cache miss)ВыходКонтекст
kimi-k2.6¥1.10 / 1M токенов¥6.50 / 1M токенов¥27.00 / 1M токенов256K

Модель доступна через стандартный OpenAI SDK с base_url="https://api.moonshot.cn/v1" и API-ключом Moonshot — кастомный клиент не нужен.

Почему это важно командам AI-инженерии

Главный сигнал здесь — не одна цифра в бенчмарке. Это паттерн улучшений:

  • Long-horizon надёжность: K2.6 проработала 13 часов в автономной задаче на 8-летнем движке финансовых сверок (свыше 1 000 tool calls, более 4 000 изменённых строк) и выжала прирост пропускной способности на 185%. Это уже не задача по кодингу — это автономная инженерная сессия.
  • Доля успешных tool-вызовов: CodeBuddy сообщает о 96,60% успешных tool-вызовов на K2.6 — показатель, который напрямую предсказывает, как часто цикл coding-агента доходит до завершения, а не застревает в сломанном function-call цикле.
  • Следование инструкциям на глубине: несколько корпоративных партнёров (Augment Code, Factory, OpenCode) отдельно отмечают «хирургическую точность в крупных кодовых базах» и «лучшее следование инструкциям» — те самые модели отказа, из-за которых раньше K2.5 бросала задачи на полпути.
  • +50%+ на бенчмарках Next.js (Vercel), +15% на внутренних бенчмарках Factory, +12% к точности генерации кода (CodeBuddy).
  • SWE-Bench Pro ставит K2.6 в один ряд с лидерами категории реальной разработки ПО — на уровне фронтирных закрытых моделей.

Командам, использующим coding-агентов вроде Claude Code, OpenCode или Cursor (через OpenAI-совместимый бэкенд), это значит одно: K2.6 теперь жизнеспособная цель маршрутизации для long-horizon задач, где раньше приходилось выбирать между GPT-5.x и Claude 4.x.

Угол router/operator

Что меняет этот релиз для команд, управляющих мультипровайдерной маршрутизацией:

1. Добавьте K2.6 в свой пул для coding-агентов. Модель использует стандартный OpenAI-совместимый endpoint. Достаточно подменить base_url и api_key в маршрутном конфиге. Правки SDK не нужны. Это упрощает A/B-тест K2.6 против текущих провайдеров на long-horizon задачах.

2. Маршрутизируйте по горизонту задачи, а не по рангу модели. Сильная сторона K2.6 — задачи, требующие 100+ tool calls, многочасового выполнения или контекста 256K. Короткие задачи (chat completions, генерация одной функции) вряд ли покажут заметную разницу. Имеет смысл отправлять long-horizon сессии coding-агентов на K2.6, оставляя latency-критичные и интерактивные задачи провайдерам с меньшей latency.

3. Позиционирование cost-perf. При ¥6.50/1M входных токенов (cache miss) K2.6 позиционируется как высокоспособный домашний провайдер. Сравнивайте её с фронтирными моделями того же класса при выстраивании политик стоимости маршрутизации. Цена при cache hit (¥1.10/1M) делает повторно используемые контексты в агентских циклах существенно дешевле на многотурновых прогонах.

4. Расширение мультимодальной маршрутизации. Нативный ввод видео наряду с изображениями и текстом в одном OpenAI-совместимом API-вызове открывает маршрутные пути для визуального дебага, инспекции UI и видео-чувствительных агентских задач, которые раньше требовали отдельных vision-провайдеров.

5. Верификация вендоров имеет значение. Moonshot публикует Kimi Vendor Verifier (KVV), чтобы отслеживать, какие сторонние провайдеры корректно обслуживают веса K2.6. Если вы маршрутизируете через сторонний inference endpoint, убедитесь в соответствии KVV, прежде чем переносить бенчмарковые цифры на свой продакшен.

6. Думающий vs недумающий режим. K2.6 поставляется в обоих режимах. Для маршрутной политики корректнее трактовать их как разные варианты модели — с разными профилями latency, стоимости и надёжности, — а не маршрутизировать просто на «kimi-k2.6» без указания режима.

За чем стоит следить пользователям TheRouter

  • Если ваша команда маршрутизирует нагрузку coding-агентов через OpenAI-совместимый gateway, K2.6 стоит добавить как кандидата в пул провайдеров. В настройках provider пропишите base_url: https://api.moonshot.cn/v1 и model: kimi-k2.6.
  • Отслеживайте долю успешных tool-вызовов в своём слое observability. 96,60% успешных tool-вызовов на K2.6 — это значимый продакшен-сигнал, а не просто бенчмарк. Смотрите, реально ли в ваших агентских сессиях падает доля зависших циклов по сравнению с текущим default-провайдером.
  • Следите за доступностью открытых весов K2.6 — это интересно командам, гоняющим self-hosted inference или оценивающим модель за собственным endpoint. Открытые веса означают возможность запуска в своей среде, что меняет governance- и data-residency-расчёт для корпоративных деплоев.
  • Кеширование контекста на API Moonshot встроено и работает автоматически. Для long-horizon coding-сессий, в которых раз за разом перечитывается один и тот же большой контекст, замерьте долю cache hit и закладывайте в cost-прогнозы ¥1.10/1M (вместо ¥6.50/1M).

Модели, упомянутые в статье

Схема routing для Kimi K2.7 Code API с обязательным режимом рассуждений и MCP tool-use flow

Kimi K2.7 Code API: обязательный режим рассуждений меняет архитектуру routing coding-агентов

12 июня Moonshot AI выпустила Kimi K2.7 Code. Kimi K2.7 Code API принудительно включает режим рассуждений — его отключение возвращает ошибку API — что меняет расчёт стоимости, routing-политику и логику fallback для команд с coding-агентами.

источник Moonshot AI
Помощь и контакты