Kimi K3 vs Qwen3.8 Max vs Claude Opus 5: сравнение API фронтирных моделей рассуждения (август 2026)
Прямое сравнение API трёх фронтирных моделей рассуждения, доступных в августе 2026 — Kimi K3 (2,8T) от Moonshot, Qwen3.8 Max (2,4T) от Alibaba и Claude Opus 5 от Anthropic. Архитектура, цены, бенчмарки, API-совместимость, контекстные окна и рекомендации по выбору.
Летом 2026 года за шесть недель вышли три фронтирные модели рассуждения: Kimi K3 от Moonshot (16 июля), Qwen3.8 Max от Alibaba (3 августа) и Claude Opus 5 от Anthropic (24 июля). Все три предлагают контекстное окно в миллион токенов, постоянно включённое рассуждение и OpenAI-совместимый (или близкий к нему) API. Все три стоят в разы дешевле фронтирных моделей годичной давности. И все три заявляют лидерские позиции в бенчмарках.
В этом сравнении — конкретные цифры, архитектурные различия, которые эти цифры порождают, и матрица выбора по типу нагрузки. Каждое утверждение снабжено первоисточником. Если два вендора приводят разные баллы по одному бенчмарку, мы об этом говорим.
Источники: Kimi K3 Pricing, получено 2026-08-26; Kimi K3 Model Parameters, получено 2026-08-26; DashScope Model Pricing, получено 2026-08-26; Claude API Pricing, получено 2026-08-26; Qubrid K3 vs Qwen3.8 Max, получено 2026-08-26; Artificial Analysis, цитируется через сторонние публикации.
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
Краткая сводка
| Kimi K3 | Qwen3.8 Max | Claude Opus 5 | |
|---|---|---|---|
| Разработчик | Moonshot AI | Alibaba (Qwen) | Anthropic |
| Запуск API | 16 июля 2026 | 3 августа 2026 | 24 июля 2026 |
| Архитектура | Sparse MoE | Sparse MoE | Dense transformer |
| Параметры (всего) | 2,8T | 2,4T | Не раскрыто |
| Активных на токен | 104B | ~95B | Не раскрыто |
| Контекстное окно | 1 048 576 | 1 000 000 | 1 000 000 |
| Макс. выход | Не опубл. | 131K токенов | 128K токенов |
| Цена входа (за 1M) | $3,00 | ~$1,65 (¥12) | $5,00 |
| Цена выхода (за 1M) | $15,00 | ~$4,95 (¥36) | $25,00 |
| Цена кэш-хита | $0,30/1M | 10% от входа | $0,50/1M |
| Контроль рассуждения | reasoning_effort | enable_thinking | Extended thinking |
| Открытые веса | Да (27 июля) | Анонсировано | Нет |
| Лучше всего для | Долгий контекст, SWE | Агентное управление ПК, multimodal | Сложное рассуждение, критичные по безопасности задачи |
Сравнение архитектур
Kimi K3: гибридное внимание и экстремальная разреженность
2,8 триллиона параметров делают K3 крупнейшей моделью с открытыми весами. Архитектурная карта на Hugging Face описывает три механизма эффективности.
Kimi Delta Attention (KDA). Из 93 слоёв модели 69 используют KDA, 24 — Gated Multi-head Latent Attention. Такая гибридная схема ускоряет декодирование примерно в 6,3 раза по сравнению с поколением K2 (анализ Kili Technology, август 2026). Moonshot одновременно с весами выпустил реализацию для vLLM, что позволило развёртывать модель самостоятельно с первого дня.
Stable LatentMoE. K3 маршрутизирует 16 из 896 экспертов на токен, плюс 2 общих эксперта — 104B активных параметров. Разреженность ~1:27 даёт, по данным model card, примерно 2,5-кратный рост эффективности масштабирования по сравнению с K2.
Нативный MXFP4. K3 использует quantization-aware training начиная со стадии SFT: веса в MXFP4, активации в MXFP8. 4-битная форма — не постфактум-сжатие, а нативная точность обучения.
Qwen3.8 Max: масштабирование фундамента Qwen 3.5
Alibaba раскрыла архитектуру менее подробно. Подтверждено: 2,4 триллиона параметров суммарно, ~95 миллиардов активных на токен (разреженность ~1:25), нативная поддержка текста, изображений и видео. Модель построена на архитектурной основе Qwen 3.5 (анализ DataCamp).
Главные отличия Qwen3.8 Max проявляются на системном уровне:
- Dynamic Workflows — оркестрация нескольких агентов с автоматической декомпозицией задач и параллельным выполнением
- Vision-in-the-loop — самокоррекция в процессе агентного выполнения, когда модель инспектирует собственный промежуточный визуальный результат
- Qwen-MM-Plugins — расширение для мультимодальной памяти и визуального tool use
- Опубликованные лимиты: 2M TPM и 15K RPM
Число слоёв, количество экспертов, схема маршрутизации, тип внимания — всё это на момент публикации не раскрыто.
Claude Opus 5: плотный фронтирный reasoning
Флагман Anthropic идёт противоположным архитектурным путём: dense transformer, число параметров не раскрыто. Opus 5 вышел 24 июля 2026 года, заменив Opus 4.8 по той же цене $5/$25. Основные отличия от двух китайских флагманов:
- Плотная архитектура вместо sparse MoE — стабильность обучения за счёт параметрической эффективности
- Extended thinking с настраиваемым бюджетом
max_tokensдля рассуждения - Контекстное окно 1M токенов (в поколении 4.5 было 200K)
- Нет открытых весов; inference только через API Anthropic, AWS Bedrock и Google Vertex AI
Сравнение бенчмарков
Все цифры ниже — от вендоров, если не указано иное. Ни один независимый оценщик пока не провёл head-to-head тестирование всех трёх моделей на одной версии бенчмарка.
| Бенчмарк | Kimi K3 | Qwen3.8 Max | Claude Opus 5 | Источник |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 88,3 | 86,6 | 84,6 (Opus 4.8) | Данные вендоров, GMICloud |
| FrontierSWE | 81,2 | 73,5 | — | Данные вендоров, Qubrid |
| OSWorld-Verified | 84,8 | 86,1 | — | Данные вендоров, Qubrid |
| SWE-bench Pro | — | Отстаёт от Fable 5 на ~12 | — | emergent.sh |
| Intelligence Index (AA) | 57 | 56 | — | Artificial Analysis через The Decoder |
| Стоимость/задача ИИ | $0,86 | $1,14 | — | Artificial Analysis через The Decoder |
Как читать эти числа:
- K3 лидирует в задачах терминального и репозиторного инжиниринга (Terminal-Bench, FrontierSWE)
- Qwen3.8 Max лидирует в задачах агентного управления десктопом (OSWorld-Verified)
- Данные Claude Opus 5 по этим наборам тестов неполные. Opus 4.8 набрал 84,6 на Terminal-Bench 2.1. Opus 5, вероятно, не ниже, но опубликованных баллов именно для Opus 5 по этим бенчмаркам мы не нашли
- Artificial Analysis Intelligence Index ставит K3 чуть выше Qwen3.8 Max (57 vs 56), при этом K3 дешевле в пересчёте на единицу интеллекта ($0,86 vs $1,14 за задачу)
Сравнение цен
Сравнивая цены API между провайдерами, всегда нормализуйте кUSD за миллион токенов и разделяйте input и output. Большинство провайдеров берёт за output токены в 2–5 раз дороже, чем за input, поэтому нагрузка с длинными completion'ами при одной и той же номинальной цене обходится дороже.
- Одна валюта (USD) — конвертация на дату публикации с указанием курса.
- Разделяйте input/output — никогда не публикуйте смешанную цифру.
- Цитируйте каждую строку со страницы цен провайдера + дата извлечения.
- Указывайте тарифы длинного контекста — они часто скачут вверх.
Прямые цены API (за 1M токенов)
| Вход | Выход | Кэш-хит | Batch | |
|---|---|---|---|---|
| Kimi K3 | $3,00 | $15,00 | $0,30 | — |
| Qwen3.8 Max | ¥12 (~$1,65) | ¥36 (~$4,95) | 10% от входа | −50% |
| Claude Opus 5 | $5,00 | $25,00 | $0,50 | −50% |
Расчёт на реальном примере
Допустим, один запрос — 100K токенов на входе, 2K на выходе:
- Kimi K3: $0,33 вход + $0,03 выход = $0,36
- Qwen3.8 Max: $0,17 вход + $0,01 выход = $0,18
- Claude Opus 5: $0,50 вход + $0,05 выход = $0,55
По цене за токен Qwen3.8 Max примерно втрое дешевле Opus 5 и вдвое дешевле K3. Однако токенная цена — не вся картина. Бенчмарки Artificial Analysis показывают, что K3 расходует меньше выходных токенов для достижения того же качества ($0,86 vs $1,14 за задачу Intelligence), что частично компенсирует разницу.
DashScope (Qwen3.8 Max) и Anthropic (Opus 5) предлагают Batch-обработку со скидкой 50%. У Moonshot пакетной скидки для K3 пока нет.
Сравнение API-поверхности
Все три модели поддерживают формат OpenAI-совместимого Chat Completions с расширениями, специфичными для каждой платформы.
Контроль рассуждения
# Kimi K3 — reasoning_effort (low / high / max)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Объясни квантовую запутанность"}],
extra_body={"reasoning_effort": "high"}
)
# Qwen3.8 Max — enable_thinking (через DashScope)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Объясни квантовую запутанность"}],
extra_body={"enable_thinking": True}
)
# Claude Opus 5 — extended thinking (Anthropic SDK)
response = anthropic_client.messages.create(
model="claude-opus-5",
max_tokens=16384,
thinking={"type": "enabled", "budget_tokens": 10000},
messages=[{"role": "user", "content": "Объясни квантовую запутанность"}]
)
Матрица поддержки функций
| Функция | Kimi K3 | Qwen3.8 Max | Claude Opus 5 |
|---|---|---|---|
| OpenAI Chat Completions | Да | Да (DashScope) | Через proxy/адаптер |
| Streaming | Да | Да | Да |
| Tool calling | Да (auto/none/required) | Да | Да |
| JSON mode | Да | Да | Да |
| Визуальный вход | Да (изображения) | Да (изображения, видео) | Да (изображения) |
| Кэширование контекста | Автоматическое | Явное + неявное | На основе TTL |
| Контроль рассуждения | reasoning_effort | enable_thinking | Extended thinking |
| Batch API | Нет | Да (−50%) | Да (−50%) |
Контроль temperature | Фиксирован на 1.0 | Настраиваемый | Настраиваемый |
Контекстное окно и работа с длинными документами
Все три модели поддерживают контекстное окно в миллион токенов, но детали отличаются.
- Kimi K3: 1 048 576 токенов. Единая цена по всему контексту, без ступенчатых тарифов. Автоматическое кэширование контекста
- Qwen3.8 Max: 1 000 000 токенов с разбивкой — максимальный вход 991K, с мышлением 983K, максимальный выход 131K, максимальный бюджет рассуждения 262K. DashScope поддерживает явное и неявное кэширование (qwen3.8-max использует единый тариф до 1M)
- Claude Opus 5: 1 000 000 токенов, максимальный выход 128K. TTL-кэширование с уровнями записи 5 минут и 1 час
Для нагрузок, регулярно превышающих 128K токенов, единые тарифы K3 и Qwen3.8 Max позволяют избежать ступенчатых наценок, характерных для старых моделей.
Матрица выбора: когда какую модель выбрать
Выбирайте Kimi K3, когда
- Основная нагрузка — терминальный кодинг и инжиниринг на уровне репозитория: K3 лидирует по Terminal-Bench и FrontierSWE
- Нужны открытые веса для самостоятельного развёртывания или из соображений compliance
- Вам важен максимальный интеллект на доллар по бенчмаркам Artificial Analysis
- Единая цена по всему контексту 1M — ключевой фактор вашей экономики
- Хотите управлять рассуждением через три уровня
reasoning_effort(low/high/max)
Выбирайте Qwen3.8 Max, когда
- Основная нагрузка — агентное управление десктопом: Qwen3.8 Max лидирует по OSWorld-Verified
- Цена за токен — главное ограничение при больших объёмах
- Нужен видео-вход наряду с текстом и изображениями
- Нужна пакетная обработка со скидкой 50%
- Вы уже работаете в экосистеме DashScope и хотите оставаться в рамках одного аккаунта
- В вашем pipeline используется мультиагентная оркестрация с Dynamic Workflows
Выбирайте Claude Opus 5, когда
- Нужны сильнейшие общие рассуждения от вендора, ориентированного на безопасность
- Нужен Extended thinking с настраиваемым токенным бюджетом для сложных многошаговых задач
- Compliance и корпоративные возможности (SOC 2, HIPAA BAA, AWS Bedrock / GCP Vertex) — обязательные требования
- Для клиентских приложений важны гарантии безопасности и alignment Anthropic
- Нужна пакетная обработка со скидкой 50%, и 24-часовое время обработки приемлемо
Маршрутизируйте через TheRouter
Выбирать одну модель не обязательно. Если приложение отправляет OpenAI-совместимые запросы через TheRouter, можно назначить Kimi K3 основным путём для кодинга, Qwen3.8 Max — экономичным fallback, а Claude Opus 5 — путём для критичных по безопасности задач. Всё за одним base_url. TheRouter поддерживает fallback-маршрутизацию, автоматически переключаясь на резервного провайдера при ошибке или таймауте.
FAQ
Доступен ли Kimi K3 через DashScope? Да. K3 появился на DashScope 19 августа 2026 года и доступен через тот же OpenAI-совместимый endpoint, что и модели Qwen. Цены DashScope могут отличаться от прямого API Moonshot.
Можно ли скачать веса Qwen3.8 Max? Alibaba объявила о публикации весов на неделе 10 августа 2026. Актуальный статус — на Hugging Face.
У какой модели лучше всего с независимыми бенчмарками? На 26 августа 2026 года Artificial Analysis опубликовал Intelligence Index для K3 и Qwen3.8 Max. Покрытие Claude Opus 5 по этим конкретным наборам тестов пока формируется. Вендорские баллы до независимой верификации следует воспринимать как промо-данные.
Можно ли использовать Claude Opus 5 через OpenAI-совместимый endpoint?
Напрямую через API Anthropic — нет (формат /v1/messages вместо /v1/chat/completions). Через маршрутизаторы вроде TheRouter запросы транслируются между форматами, и Claude Opus 5 становится доступен прозрачно.
Чем отличаются механизмы контроля рассуждения?
K3 использует reasoning_effort с тремя уровнями (low, high, max). Qwen3.8 Max — enable_thinking, булев переключатель. Claude Opus 5 — Extended thinking с параметром budget_tokens, который задаёт потолок токенов на рассуждение в рамках одного запроса. K3 даёт грубый контроль, Opus 5 — точный бюджетный, Qwen3.8 Max — простой вкл/выкл.
Данные актуальны на 26 августа 2026 года. Возможности и цены моделей часто меняются; перед принятием решений сверяйтесь с первоисточниками по приведённым ссылкам.