Назад к моделям

Kimi K2 Thinking

moonshotmoonshot/kimi-k2-thinking

Moonshot AI's deep reasoning model (1T total, 32B active MoE). Specialist for 200-300 step stable tool orchestration, long-horizon planning, and complex coding. Text-only.

Kimi K2 Thinking, выпущенная 6 ноября 2025 года компанией Moonshot AI, — это мыслящая/рассуждающая версия открытой модели семейства Kimi K2. Она сохраняет ту же архитектуру Mixture-of-Experts (MoE) с 1 трлн параметров и 32 млрд активных — 384 эксперта, 8 на токен — но добавляет нативную цепочку рассуждений, объединённую с вызовом инструментов в реальном времени. Пост-тренинг использует QAT (quantization-aware training) с точностью INT4, сокращая размер модели с ~1 ТБ до ~600 ГБ без потери конкурентоспособности.

Ключевое отличие K2 Thinking — способность выдерживать 200–300 последовательных вызовов инструментов в одной цепочке рассуждений, сохраняя связность состояния. Большинство моделей быстро деградируют после 30–50 вызовов. Модель лидирует в агентских бенчмарках: BrowseComp (60.2%) и HLE с инструментами (44.9%), превосходя GPT-5 в обоих. Для операторов TheRouter K2 Thinking занимает премиальный слой рассуждений+агентов вместе с moonshot/kimi-k2.6, предлагая путь открытых весов для долгосрочных автономных исследований, многошаговой генерации кода и сложных пайплайнов поиска информации.

Когда выбирать
  • • Долгосрочные автономные исследования: просмотр, поиск, перекрёстные ссылки и синтез информации через 100+ вызовов инструментов без потери связности
  • • Агентское программирование с самокоррекцией: многошаговая генерация кода, воспроизведение ошибок, анализ логов, проверка гипотез и итеративная отладка через встроенные инструменты
  • • Глубокие рассуждения над сложными задачами: математические доказательства, многошаговые логические выводы, академические исследования с синтезом из нескольких источников
  • • Self-hosted пайплайны рассуждений: открытые веса (Modified MIT License) позволяют тонкую настройку на доменных траекториях и развёртывание на собственной GPU-инфраструктуре
Когда не выбирать
  • • Vision или мультимодальный ввод — K2 Thinking только текст; изображения/видео маршрутизируйте на moonshot/kimi-k2.5 или moonshot/kimi-k2.6, поддерживающие мультимодальный ввод
  • • Чат, чувствительный к задержкам — расширенная цепочка рассуждений добавляет заметную задержку; используйте moonshot/kimi-k2 (не-думающая) или moonshot/kimi-k2.6-instruct для более быстрых ответов
  • • Простые вопросы-ответы, где глубокие рассуждения избыточны — используйте стандартную не-думающую K2 или K2.6 для экономии
Размер контекста
256K
Максимальный вывод
64K
Цена Входза 1M токенов
$0.648за 1 млн токенов
Цена Выходза 1M токенов
$2.70за 1 млн токенов

Модальности

Текст→Текст

Разбивка цен

ТипСтавка
Вход$0.648 за 1 млн токенов
Выход$2.70 за 1 млн токенов

Поддерживаемые параметры

temperaturemax_tokenstop_ptoolstool_choiceresponse_formatreasoningstop

Характеристики

Дата релиза2025-11-06kimi-k2.org ↗проверено
АрхитектураMoE 1 трлн / 32B активных; 384 эксперта, 8 на токен; 61 слой; MLA-внимание; SwiGLU-активации; INT4 QAT пост-тренингhuggingface.co ↗проверено
Стоимость обучения$4.6 млн (по данным CNBC, независимо не подтверждено)cnbc.com ↗к проверке
Дисковое пространство (INT4)~600 ГБ (Hugging Face); vs ~1,03 ТБ для не-думающей K2huggingface.co ↗проверено
ЛицензияModified MIT License — код и весаhuggingface.co ↗проверено
Поддерживаемые движки инференсаvLLM, SGLang, KTransformers, NVIDIA NIM, mlx-lm (Apple Silicon)huggingface.co ↗проверено
Дата отсечения данныхНе раскрытонеизвестно

Бенчмарки

BenchmarkDistributionScoreSource
Humanity's Last Exam (w/ tools)
HLE с инструментами; усиленный режим (8 параллельных траекторий) достигает 51.0–51.3%. Для сравнения: GPT-5 = 41.7%, DeepSeek-R1 = 20.3%
44.9%%lambda.ai ↗
BrowseComp
Автономный веб-сёрфинг и синтез информации из нескольких источников. Сравнение: GPT-5 = 54.9%, Claude = 24.1%, DeepSeek = 40.1%
60.2%%lambda.ai ↗
SWE-bench Verified
Программная инженерия — реальные GitHub issues. Сравнение: GPT-5 = 74.9%, Claude = 77.2%, DeepSeek = 67.8%. Также CAISI NIST: 56.2%
71.3%%lambda.ai ↗
AIME 2025 (w/ Python)
Математическая олимпиада AIME 2025 с Python-инструментом. CAISI NIST OTIS-AIME 2025 (без инструментов): 84.3%
99.1%%www.reddit.com ↗
GPQA-Diamond
Вопросы-ответы уровня выпускника (физика, химия, биология). По независимой оценке CAISI NIST
83.8%%nist.gov ↗
MMLU-Pro
Massive Multitask Language Understanding (профессиональный). По независимой оценке CAISI NIST
89.3%%nist.gov ↗
CVE-Bench
Эксплуатация кибербезопасности. По независимой оценке CAISI NIST
50.5%%nist.gov ↗
SMT 2025
Stanford Math Tournament 2025. По оценке CAISI NIST. Сравнение: GPT-5 = 91.8%, DeepSeek-R1-0528 = 87.6%
93.1%%nist.gov ↗

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "moonshot/kimi-k2-thinking",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

Chat completion

Стандартный chat completion для K2 Thinking. Модель генерирует внутреннюю цепочку рассуждений перед итоговым ответом. Поддерживается потоковая передача токенов рассуждений.

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "moonshot/kimi-k2-thinking",
    "messages": [
      {"role": "system", "content": "You are a helpful AI assistant."},
      {"role": "user", "content": "Design a distributed caching strategy for a global e-commerce platform."}
    ],
    "max_tokens": 8192,
    "temperature": 0.7
  }'

Ещё от moonshot

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2025-11-06

Moonshot AI выпускает Kimi K2 Thinking — модель рассуждений с открытыми весами и 200+ последовательными вызовами инструментов

Moonshot AI анонсировала Kimi K2 Thinking — первую модель рассуждений с открытыми весами, нативно объединяющую цепочку рассуждений с вызовом инструментов в реальном времени. При стоимости обучения $4.6M модель достигла 44.9% на HLE (с инструментами) и 60.2% на BrowseComp, превзойдя GPT-5 в агентских бенчмарках веб-поиска. INT4 QAT-модель (~600 ГБ) доступна под лицензией Modified MIT.

переработано TheRouterkimi-k2.org ↗
2025-12-09

NIST CAISI оценивает Kimi K2 Thinking — самая сильная модель с открытыми весами от разработчика из КНР на момент выпуска

Центр AI-стандартов и инноваций (CAISI) при NIST США независимо оценил K2 Thinking и признал её самой способной моделью с открытыми весами от разработчика из КНР на момент выпуска, хотя она всё ещё отстаёт от лучших американских моделей в кибер- и программной инженерии. Отчёт подтвердил лидерство K2 Thinking среди китайских моделей на SWE-bench (56.2%), GPQA (83.8%) и SMT 2025 (93.1%).

переработано TheRouternist.gov ↗
2025-11-08

Kimi K2 Thinking запущена на 2× M3 Ultra с 15 ток/с через mlx-lm

Член команды Apple MLX Awni Hannun продемонстрировал работу K2 Thinking на двух M3 Ultra Mac Studios (по 512 ГБ) с использованием pipeline-parallelism в mlx-lm, достигнув ~15 ток/с. QAT INT4-формат модели работает в родной точности без потери качества, делая локальное развёртывание 1T-параметрической модели рассуждений практичным для кластеров Apple Silicon высокого класса.

переработано TheRoutersimonwillison.net ↗

Частые вопросы

В чём разница между Kimi K2 (Instruct) и Kimi K2 Thinking?

Kimi K2 Instruct — простая модель следования инструкциям (рефлекторного уровня), оптимизированная для быстрых ответов без явной цепочки рассуждений. K2 Thinking добавляет фазу полной цепочки рассуждений перед генерацией ответа и нативно объединяет рассуждение с вызовом инструментов — она может вызывать инструменты во время рассуждения, не дожидаясь его завершения. Это делает K2 Thinking значительно более мощной для сложных многошаговых задач, но также более медленной и дорогой на каждый запрос. Для простых вопросов K2 Instruct — более эффективный выбор.

Могу ли я запустить Kimi K2 Thinking на потребительском оборудовании?

Полная точность (FP8) требует ~1.3 ТБ+ видеопамяти — примерно 12–16× H100 GPU. INT4 QAT вариант (~600 ГБ) требует ~1.1 ТБ+ видеопамяти — рекомендуется минимум 8× H200. На Apple Silicon модель была запущена на 2× M3 Ultra (по 512 ГБ) через mlx-lm со скоростью ~15 ток/с. Потребительские GPU (один 4090, 5090) не могут запустить полную модель. Однако модель доступна через API через TheRouter и собственную платформу Moonshot без каких-либо требований к оборудованию.

Как K2 Thinking сравнивается с DeepSeek-R1?

K2 Thinking превосходит DeepSeek-R1 практически во всех бенчмарках. По данным сравнительной таблицы Moonshot: HLE с инструментами: 44.9% vs 20.3%; BrowseComp: 60.2% vs 40.1%; SWE-bench Verified: 71.3% vs 67.8%. Независимая оценка NIST CAISI подтверждает, что K2 Thinking опережает DeepSeek-R1-0528 на CVE-Bench (50.5 vs 36.0), GPQA (83.8 vs 81.3) и SMT 2025 (93.1 vs 87.6). Ключевое преимущество K2 Thinking — слияние рассуждения с нативным вызовом инструментов; DeepSeek-R1 требует отдельного цикла для оркестрации инструментов.

Является ли K2 Thinking полностью открытой?

Moonshot AI выпустила K2 Thinking под лицензией Modified MIT, которая разрешает использование, модификацию и распространение для большинства целей, но включает ограничение: модель не может использоваться для улучшения конкурирующих больших языковых моделей. Веса, код и методология обучения публично доступны на Hugging Face. Лицензия не одобрена OSI как open source, но широко считается «открытыми весами» и разрешает коммерческое использование.

Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Дата релизаkimi-k2.org ↗2026-05-28проверено
Архитектураhuggingface.co ↗2026-05-28проверено
Стоимость обученияcnbc.com ↗2026-05-28к проверке
Дисковое пространство (INT4)huggingface.co ↗2026-05-28проверено
Лицензияhuggingface.co ↗2026-05-28проверено
Поддерживаемые движки инференсаhuggingface.co ↗2026-05-28проверено
Дата отсечения данных——неизвестно
Humanity's Last Exam (w/ tools)lambda.ai ↗2026-05-28проверено
BrowseComplambda.ai ↗2026-05-28проверено
SWE-bench Verifiedlambda.ai ↗2026-05-28проверено
AIME 2025 (w/ Python)www.reddit.com ↗2026-05-28к проверке
GPQA-Diamondnist.gov ↗2026-05-28проверено
MMLU-Pronist.gov ↗2026-05-28проверено
CVE-Benchnist.gov ↗2026-05-28проверено
SMT 2025nist.gov ↗2026-05-28проверено
Moonshot AI выпускает Kimi K2 Thinking — модель рассуждений с открытыми весами и 200+ последовательными вызовами инструментовkimi-k2.org ↗2026-05-28проверено
NIST CAISI оценивает Kimi K2 Thinking — самая сильная модель с открытыми весами от разработчика из КНР на момент выпускаnist.gov ↗2026-05-28проверено
Kimi K2 Thinking запущена на 2× M3 Ultra с 15 ток/с через mlx-lmsimonwillison.net ↗2026-05-28проверено
В чём разница между Kimi K2 (Instruct) и Kimi K2 Thinking?kimi-k2.org ↗2026-05-28к проверке
Могу ли я запустить Kimi K2 Thinking на потребительском оборудовании?lambda.ai ↗2026-05-28к проверке
Как K2 Thinking сравнивается с DeepSeek-R1?lambda.ai ↗2026-05-28к проверке
Является ли K2 Thinking полностью открытой?huggingface.co ↗2026-05-28к проверке
Помощь и контакты