← Все статьи

Kimi K3 vs Qwen3.8 Max vs Claude Opus 5: сравнение API фронтирных моделей рассуждения (август 2026)

Прямое сравнение API трёх фронтирных моделей рассуждения, доступных в августе 2026 — Kimi K3 (2,8T) от Moonshot, Qwen3.8 Max (2,4T) от Alibaba и Claude Opus 5 от Anthropic. Архитектура, цены, бенчмарки, API-совместимость, контекстные окна и рекомендации по выбору.

· TheRouter

Летом 2026 года за шесть недель вышли три фронтирные модели рассуждения: Kimi K3 от Moonshot (16 июля), Qwen3.8 Max от Alibaba (3 августа) и Claude Opus 5 от Anthropic (24 июля). Все три предлагают контекстное окно в миллион токенов, постоянно включённое рассуждение и OpenAI-совместимый (или близкий к нему) API. Все три стоят в разы дешевле фронтирных моделей годичной давности. И все три заявляют лидерские позиции в бенчмарках.

В этом сравнении — конкретные цифры, архитектурные различия, которые эти цифры порождают, и матрица выбора по типу нагрузки. Каждое утверждение снабжено первоисточником. Если два вендора приводят разные баллы по одному бенчмарку, мы об этом говорим.

Источники: Kimi K3 Pricing, получено 2026-08-26; Kimi K3 Model Parameters, получено 2026-08-26; DashScope Model Pricing, получено 2026-08-26; Claude API Pricing, получено 2026-08-26; Qubrid K3 vs Qwen3.8 Max, получено 2026-08-26; Artificial Analysis, цитируется через сторонние публикации.

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Краткая сводка

Kimi K3Qwen3.8 MaxClaude Opus 5
РазработчикMoonshot AIAlibaba (Qwen)Anthropic
Запуск API16 июля 20263 августа 202624 июля 2026
АрхитектураSparse MoESparse MoEDense transformer
Параметры (всего)2,8T2,4TНе раскрыто
Активных на токен104B~95BНе раскрыто
Контекстное окно1 048 5761 000 0001 000 000
Макс. выходНе опубл.131K токенов128K токенов
Цена входа (за 1M)$3,00~$1,65 (¥12)$5,00
Цена выхода (за 1M)$15,00~$4,95 (¥36)$25,00
Цена кэш-хита$0,30/1M10% от входа$0,50/1M
Контроль рассужденияreasoning_effortenable_thinkingExtended thinking
Открытые весаДа (27 июля)АнонсированоНет
Лучше всего дляДолгий контекст, SWEАгентное управление ПК, multimodalСложное рассуждение, критичные по безопасности задачи

Сравнение архитектур

Kimi K3: гибридное внимание и экстремальная разреженность

2,8 триллиона параметров делают K3 крупнейшей моделью с открытыми весами. Архитектурная карта на Hugging Face описывает три механизма эффективности.

Kimi Delta Attention (KDA). Из 93 слоёв модели 69 используют KDA, 24 — Gated Multi-head Latent Attention. Такая гибридная схема ускоряет декодирование примерно в 6,3 раза по сравнению с поколением K2 (анализ Kili Technology, август 2026). Moonshot одновременно с весами выпустил реализацию для vLLM, что позволило развёртывать модель самостоятельно с первого дня.

Stable LatentMoE. K3 маршрутизирует 16 из 896 экспертов на токен, плюс 2 общих эксперта — 104B активных параметров. Разреженность ~1:27 даёт, по данным model card, примерно 2,5-кратный рост эффективности масштабирования по сравнению с K2.

Нативный MXFP4. K3 использует quantization-aware training начиная со стадии SFT: веса в MXFP4, активации в MXFP8. 4-битная форма — не постфактум-сжатие, а нативная точность обучения.

Qwen3.8 Max: масштабирование фундамента Qwen 3.5

Alibaba раскрыла архитектуру менее подробно. Подтверждено: 2,4 триллиона параметров суммарно, ~95 миллиардов активных на токен (разреженность ~1:25), нативная поддержка текста, изображений и видео. Модель построена на архитектурной основе Qwen 3.5 (анализ DataCamp).

Главные отличия Qwen3.8 Max проявляются на системном уровне:

  • Dynamic Workflows — оркестрация нескольких агентов с автоматической декомпозицией задач и параллельным выполнением
  • Vision-in-the-loop — самокоррекция в процессе агентного выполнения, когда модель инспектирует собственный промежуточный визуальный результат
  • Qwen-MM-Plugins — расширение для мультимодальной памяти и визуального tool use
  • Опубликованные лимиты: 2M TPM и 15K RPM

Число слоёв, количество экспертов, схема маршрутизации, тип внимания — всё это на момент публикации не раскрыто.

Claude Opus 5: плотный фронтирный reasoning

Флагман Anthropic идёт противоположным архитектурным путём: dense transformer, число параметров не раскрыто. Opus 5 вышел 24 июля 2026 года, заменив Opus 4.8 по той же цене $5/$25. Основные отличия от двух китайских флагманов:

  • Плотная архитектура вместо sparse MoE — стабильность обучения за счёт параметрической эффективности
  • Extended thinking с настраиваемым бюджетом max_tokens для рассуждения
  • Контекстное окно 1M токенов (в поколении 4.5 было 200K)
  • Нет открытых весов; inference только через API Anthropic, AWS Bedrock и Google Vertex AI

Сравнение бенчмарков

Все цифры ниже — от вендоров, если не указано иное. Ни один независимый оценщик пока не провёл head-to-head тестирование всех трёх моделей на одной версии бенчмарка.

БенчмаркKimi K3Qwen3.8 MaxClaude Opus 5Источник
Terminal-Bench 2.188,386,684,6 (Opus 4.8)Данные вендоров, GMICloud
FrontierSWE81,273,5—Данные вендоров, Qubrid
OSWorld-Verified84,886,1—Данные вендоров, Qubrid
SWE-bench Pro—Отстаёт от Fable 5 на ~12—emergent.sh
Intelligence Index (AA)5756—Artificial Analysis через The Decoder
Стоимость/задача ИИ$0,86$1,14—Artificial Analysis через The Decoder

Как читать эти числа:

  • K3 лидирует в задачах терминального и репозиторного инжиниринга (Terminal-Bench, FrontierSWE)
  • Qwen3.8 Max лидирует в задачах агентного управления десктопом (OSWorld-Verified)
  • Данные Claude Opus 5 по этим наборам тестов неполные. Opus 4.8 набрал 84,6 на Terminal-Bench 2.1. Opus 5, вероятно, не ниже, но опубликованных баллов именно для Opus 5 по этим бенчмаркам мы не нашли
  • Artificial Analysis Intelligence Index ставит K3 чуть выше Qwen3.8 Max (57 vs 56), при этом K3 дешевле в пересчёте на единицу интеллекта ($0,86 vs $1,14 за задачу)

Сравнение цен

Сравнивая цены API между провайдерами, всегда нормализуйте кUSD за миллион токенов и разделяйте input и output. Большинство провайдеров берёт за output токены в 2–5 раз дороже, чем за input, поэтому нагрузка с длинными completion'ами при одной и той же номинальной цене обходится дороже.

  • Одна валюта (USD) — конвертация на дату публикации с указанием курса.
  • Разделяйте input/output — никогда не публикуйте смешанную цифру.
  • Цитируйте каждую строку со страницы цен провайдера + дата извлечения.
  • Указывайте тарифы длинного контекста — они часто скачут вверх.

Прямые цены API (за 1M токенов)

ВходВыходКэш-хитBatch
Kimi K3$3,00$15,00$0,30—
Qwen3.8 Max¥12 (~$1,65)¥36 (~$4,95)10% от входа−50%
Claude Opus 5$5,00$25,00$0,50−50%

Расчёт на реальном примере

Допустим, один запрос — 100K токенов на входе, 2K на выходе:

  • Kimi K3: $0,33 вход + $0,03 выход = $0,36
  • Qwen3.8 Max: $0,17 вход + $0,01 выход = $0,18
  • Claude Opus 5: $0,50 вход + $0,05 выход = $0,55

По цене за токен Qwen3.8 Max примерно втрое дешевле Opus 5 и вдвое дешевле K3. Однако токенная цена — не вся картина. Бенчмарки Artificial Analysis показывают, что K3 расходует меньше выходных токенов для достижения того же качества ($0,86 vs $1,14 за задачу Intelligence), что частично компенсирует разницу.

DashScope (Qwen3.8 Max) и Anthropic (Opus 5) предлагают Batch-обработку со скидкой 50%. У Moonshot пакетной скидки для K3 пока нет.

Сравнение API-поверхности

Все три модели поддерживают формат OpenAI-совместимого Chat Completions с расширениями, специфичными для каждой платформы.

Контроль рассуждения

# Kimi K3 — reasoning_effort (low / high / max)
response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Объясни квантовую запутанность"}],
    extra_body={"reasoning_effort": "high"}
)

# Qwen3.8 Max — enable_thinking (через DashScope)
response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "Объясни квантовую запутанность"}],
    extra_body={"enable_thinking": True}
)

# Claude Opus 5 — extended thinking (Anthropic SDK)
response = anthropic_client.messages.create(
    model="claude-opus-5",
    max_tokens=16384,
    thinking={"type": "enabled", "budget_tokens": 10000},
    messages=[{"role": "user", "content": "Объясни квантовую запутанность"}]
)

Матрица поддержки функций

ФункцияKimi K3Qwen3.8 MaxClaude Opus 5
OpenAI Chat CompletionsДаДа (DashScope)Через proxy/адаптер
StreamingДаДаДа
Tool callingДа (auto/none/required)ДаДа
JSON modeДаДаДа
Визуальный входДа (изображения)Да (изображения, видео)Да (изображения)
Кэширование контекстаАвтоматическоеЯвное + неявноеНа основе TTL
Контроль рассужденияreasoning_effortenable_thinkingExtended thinking
Batch APIНетДа (−50%)Да (−50%)
Контроль temperatureФиксирован на 1.0НастраиваемыйНастраиваемый

Контекстное окно и работа с длинными документами

Все три модели поддерживают контекстное окно в миллион токенов, но детали отличаются.

  • Kimi K3: 1 048 576 токенов. Единая цена по всему контексту, без ступенчатых тарифов. Автоматическое кэширование контекста
  • Qwen3.8 Max: 1 000 000 токенов с разбивкой — максимальный вход 991K, с мышлением 983K, максимальный выход 131K, максимальный бюджет рассуждения 262K. DashScope поддерживает явное и неявное кэширование (qwen3.8-max использует единый тариф до 1M)
  • Claude Opus 5: 1 000 000 токенов, максимальный выход 128K. TTL-кэширование с уровнями записи 5 минут и 1 час

Для нагрузок, регулярно превышающих 128K токенов, единые тарифы K3 и Qwen3.8 Max позволяют избежать ступенчатых наценок, характерных для старых моделей.

Матрица выбора: когда какую модель выбрать

Выбирайте Kimi K3, когда

  • Основная нагрузка — терминальный кодинг и инжиниринг на уровне репозитория: K3 лидирует по Terminal-Bench и FrontierSWE
  • Нужны открытые веса для самостоятельного развёртывания или из соображений compliance
  • Вам важен максимальный интеллект на доллар по бенчмаркам Artificial Analysis
  • Единая цена по всему контексту 1M — ключевой фактор вашей экономики
  • Хотите управлять рассуждением через три уровня reasoning_effort (low/high/max)

Выбирайте Qwen3.8 Max, когда

  • Основная нагрузка — агентное управление десктопом: Qwen3.8 Max лидирует по OSWorld-Verified
  • Цена за токен — главное ограничение при больших объёмах
  • Нужен видео-вход наряду с текстом и изображениями
  • Нужна пакетная обработка со скидкой 50%
  • Вы уже работаете в экосистеме DashScope и хотите оставаться в рамках одного аккаунта
  • В вашем pipeline используется мультиагентная оркестрация с Dynamic Workflows

Выбирайте Claude Opus 5, когда

  • Нужны сильнейшие общие рассуждения от вендора, ориентированного на безопасность
  • Нужен Extended thinking с настраиваемым токенным бюджетом для сложных многошаговых задач
  • Compliance и корпоративные возможности (SOC 2, HIPAA BAA, AWS Bedrock / GCP Vertex) — обязательные требования
  • Для клиентских приложений важны гарантии безопасности и alignment Anthropic
  • Нужна пакетная обработка со скидкой 50%, и 24-часовое время обработки приемлемо

Маршрутизируйте через TheRouter

Выбирать одну модель не обязательно. Если приложение отправляет OpenAI-совместимые запросы через TheRouter, можно назначить Kimi K3 основным путём для кодинга, Qwen3.8 Max — экономичным fallback, а Claude Opus 5 — путём для критичных по безопасности задач. Всё за одним base_url. TheRouter поддерживает fallback-маршрутизацию, автоматически переключаясь на резервного провайдера при ошибке или таймауте.

FAQ

Доступен ли Kimi K3 через DashScope? Да. K3 появился на DashScope 19 августа 2026 года и доступен через тот же OpenAI-совместимый endpoint, что и модели Qwen. Цены DashScope могут отличаться от прямого API Moonshot.

Можно ли скачать веса Qwen3.8 Max? Alibaba объявила о публикации весов на неделе 10 августа 2026. Актуальный статус — на Hugging Face.

У какой модели лучше всего с независимыми бенчмарками? На 26 августа 2026 года Artificial Analysis опубликовал Intelligence Index для K3 и Qwen3.8 Max. Покрытие Claude Opus 5 по этим конкретным наборам тестов пока формируется. Вендорские баллы до независимой верификации следует воспринимать как промо-данные.

Можно ли использовать Claude Opus 5 через OpenAI-совместимый endpoint? Напрямую через API Anthropic — нет (формат /v1/messages вместо /v1/chat/completions). Через маршрутизаторы вроде TheRouter запросы транслируются между форматами, и Claude Opus 5 становится доступен прозрачно.

Чем отличаются механизмы контроля рассуждения? K3 использует reasoning_effort с тремя уровнями (low, high, max). Qwen3.8 Max — enable_thinking, булев переключатель. Claude Opus 5 — Extended thinking с параметром budget_tokens, который задаёт потолок токенов на рассуждение в рамках одного запроса. K3 даёт грубый контроль, Opus 5 — точный бюджетный, Qwen3.8 Max — простой вкл/выкл.


Данные актуальны на 26 августа 2026 года. Возможности и цены моделей часто меняются; перед принятием решений сверяйтесь с первоисточниками по приведённым ссылкам.

Модели, упомянутые в статье

Помощь и контакты