← Все статьи

Kimi K3 vs Qwen3.8-Max vs DeepSeek V4 Pro: сравнение API китайских frontier-моделей для coding-агентов (сентябрь 2026)

Прямое сравнение трёх китайских frontier-моделей API для задач coding-агентов — Kimi K3, Qwen3.8-Max и DeepSeek V4 Pro — по архитектуре, ценам, бенчмаркам кодирования, tool calling и конфигурации routing через единый OpenAI-совместимый endpoint.

· updated 2026-09-18· TheRouter

Три китайские frontier-модели сейчас конкурируют за рабочие нагрузки coding-агентов: Kimi K3 (Moonshot AI, 2.8T dense-параметров), Qwen3.8-Max (Alibaba, 2.4T MoE) и DeepSeek V4 Pro (DeepSeek, 1.6T MoE). Все три поддерживают контекстное окно в 1M token, встроенные режимы рассуждений и OpenAI-совместимые endpoint. Все три доступны для routing через TheRouter уже сегодня.

Короткий ответ: DeepSeek V4 Pro — самый дешёвый ($0.66–$1.32 за миллион input-token в off-peak), Kimi K3 — самый плотный и дорогой ($3/$15 за миллион input/output token), а Qwen3.8-Max показывает лучшие результаты на агентских бенчмарках (SWE-Bench Pro 67.7%, CoWorkBench 74.8%). Выбор зависит от того, что приоритетнее — стоимость, сырое качество кодирования или надёжность агента.

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Сводная таблица

ХарактеристикаKimi K3Qwen3.8-MaxDeepSeek V4 Pro
ПровайдерMoonshot AIAlibaba (DashScope)DeepSeek
Параметры2.8T (dense)2.4T (MoE)1.6T (MoE)
Контекстное окно1M token1M token1M token
Макс. output——384K token
Input (cache miss)$3.00/M$2.00/M$0.66–$1.32/M
Input (cache hit)$0.30/M$0.25/M$0.022–$0.044/M
Output$15.00/M$6.00/M$1.98–$3.96/M
Режим рассужденийВсегда включён (effort: max)Thinking/non-thinking toggleThinking/non-thinking toggle
VisionДаТолько текстТолько текст (Flash поддерживает vision)
Tool callingДаДаДа
JSON modeДаДаДа
TheRouter model IDmoonshot/kimi-k3qwen/qwen3.8-maxdeepseek/deepseek-v4-pro

Источники цен: Kimi K3 Pricing (получено 2026-09-18), DeepSeek Pricing (получено 2026-09-18), DashScope Pricing (получено 2026-09-18). Цены DeepSeek V4 Pro показаны как диапазон off-peak/peak.

Сравнивая цены API между провайдерами, всегда нормализуйте кUSD за миллион токенов и разделяйте input и output. Большинство провайдеров берёт за output токены в 2–5 раз дороже, чем за input, поэтому нагрузка с длинными completion'ами при одной и той же номинальной цене обходится дороже.

  • Одна валюта (USD) — конвертация на дату публикации с указанием курса.
  • Разделяйте input/output — никогда не публикуйте смешанную цифру.
  • Цитируйте каждую строку со страницы цен провайдера + дата извлечения.
  • Указывайте тарифы длинного контекста — они часто скачут вверх.

Архитектура

Kimi K3 — Dense-гигант на 2.8T параметров

Kimi K3 — единственная dense (не MoE) модель в этом сравнении. 2.8 триллиона параметров активируются при каждом forward pass. Moonshot AI применяет проприетарный механизм KDA (Key-Dimension Attention), чтобы удержать inference-нагрузку в разумных пределах (источник, получено 2026-09-18).

Для coding-агентов dense-архитектура означает, что K3 обрабатывает каждый token через полную репрезентативную ёмкость. Это проявляется на сложных многофайловых рефакторингах, где модели нужно удерживать тонкие цепочки зависимостей по всему codebase. Обратная сторона — цена: при $15 за миллион output token каждая сгенерированная строка кода обходится недёшево.

Qwen3.8-Max — 2.4T MoE от Alibaba

Qwen3.8-Max использует архитектуру Mixture-of-Experts с 2.4 триллионами параметров, из которых активируется только подмножество. Alibaba позиционирует модель как «новый стандарт кодирования и совместной работы» — систему для многошаговых агентских workflow, где модель планирует, пишет, тестирует и итерирует самостоятельно (источник, получено 2026-09-18).

MoE делает Qwen3.8-Max дешевле в пересчёте на token, чем K3, при сопоставимых бенчмарках. $2/$6 за миллион input/output token — середина ценового диапазона в этой тройке.

DeepSeek V4 Pro — лидер по стоимости, 1.6T MoE

DeepSeek V4 Pro работает на MoE-архитектуре с 1.6 триллионами параметров — наименьший объём среди трёх. Но он компенсирует это экономией: off-peak-цена $0.66/$1.98 за миллион input/output token примерно в 7.5 раз дешевле K3 по output и в 3 раза дешевле Qwen3.8-Max (источник, получено 2026-09-18).

V4 Pro также предлагает самое большое окно output — 384K token. Для агентов, генерирующих объёмные отладочные логи или целые модули за один шаг, это реальное преимущество.

Детальный разбор цен

Для coding-агентов структура затрат отличается от обычного чата. Агенты генерируют значительно больше output token — задача SWE-bench может потребовать 50K–200K output token в циклах plan→write→test→fix. Расходы при типичных объёмах:

СценарийKimi K3Qwen3.8-MaxDeepSeek V4 Pro (off-peak)
Лёгкая задача (10K in / 20K out)$0.33$0.14$0.046
Средняя задача (50K in / 100K out)$1.65$0.70$0.231
Тяжёлый рефакторинг (200K in / 500K out)$8.10$3.40$1.122
Сессия на весь день (1M in / 2M out)$33.00$14.00$4.62

Арифметика прозрачна. При работе агента 8 часов в день на задачах средней сложности дневной бюджет DeepSeek V4 Pro (off-peak) сопоставим со стоимостью одного запуска Kimi K3. Для команд с несколькими параллельными агентами разница нарастает быстро.

Экономика кэширования

Все три модели дают скидку на cache hit, но масштаб экономии различается радикально:

  • DeepSeek V4 Pro: cache hit input падает до $0.022/M (off-peak) — 97% скидка от cache miss
  • Kimi K3: cache hit input $0.30/M — 90% скидка
  • Qwen3.8-Max: cache hit input $0.25/M — 87.5% скидка

Coding-агенты регулярно подают в контекст одни и те же файлы репозитория, документацию и тесты. При высоком cache hit rate, который характерен для хорошо спроектированных агентов, DeepSeek оказывается на порядок дешевле конкурентов.

Бенчмарки кодирования

Данные взяты из отчётов вендоров и независимых оценок. Не все модели протестированы на идентичных наборах, поэтому прямое сравнение по некоторым метрикам невозможно.

БенчмаркKimi K3Qwen3.8-MaxDeepSeek V4 Pro
SWE-bench Verified——80.6%
SWE-bench Pro—67.7%55.4%
Terminal-Bench 2.1—86.6%87.9%
LiveCodeBench (Vals)—87.9%87.5%
OpenHarmony Bench—60.8%59.0%
NL2Repo—55.9%61.5%
DeepSWE—56.6%62.7%
Arena Code WebDev#1——

Источники: BenchLM comparison (получено 2026-09-18), Artificial Analysis (получено 2026-09-18). «—» означает отсутствие независимой оценки на этом бенчмарке.

Картина получается неоднородной, и именно поэтому routing имеет значение:

  • Qwen3.8-Max лидирует на SWE-bench Pro (67.7% vs 55.4%) — более сложном варианте, тестирующем многошаговое исправление багов
  • DeepSeek V4 Pro лидирует на Terminal-Bench 2.1 (87.9% vs 86.6%) и задачах генерации реальных репозиториев (NL2Repo, DeepSWE)
  • Kimi K3 на первом месте Arena Code WebDev — community-рейтинг по фронтенд-генерации

Ни одна модель не доминирует по всем бенчмаркам. Это и есть аргумент в пользу routing — разные задачи выигрывают от разных моделей.

Tool Calling и агентские возможности

Для coding-агентов tool calling — ключевая функция API. Агент, который не может надёжно вызывать инструменты (чтение/запись файлов, выполнение в терминале, поиск), бесполезен вне зависимости от качества генерации кода.

Kimi K3

K3 поддерживает стандартный OpenAI-совместимый tool calling и «динамические инструменты», определяемые и изменяемые в ходе разговора. Moonshot заявляет, что K3 специально обучалась для надёжности tool calling в агентских workflow (источник, получено 2026-09-18). Режим reasoning effort зафиксирован на max — нет возможности снизить нагрузку thinking для простых tool call, что добавляет лишнюю задержку и расход token на тривиальных операциях.

Qwen3.8-Max

Qwen3.8-Max поддерживает thinking и non-thinking режимы с явным переключением. В циклах с интенсивным tool calling агент может переключаться в non-thinking для экономии, а для сложного планирования использовать thinking. Такая гибкость даёт операторам более тонкий контроль над балансом стоимости и качества на каждом шаге.

CoWorkBench (74.8%) измеряет именно многошаговое агентское взаимодействие — координацию tool call, отслеживание состояния и восстановление после ошибок (источник, получено 2026-09-18).

DeepSeek V4 Pro

DeepSeek V4 Pro поддерживает thinking/non-thinking toggle, tool calling и JSON mode. DeepSeek также предоставляет endpoint и в формате OpenAI, и в формате Anthropic, что упрощает интеграцию для команд, привыкших к Claude-стилю tool calling. 384K max output означает, что агент может генерировать очень длинные последовательности tool call без обрезки.

Поведение контекстного окна

Все три модели заявляют 1M token, но на практике ведут себя по-разному:

  • Kimi K3: 1,048,576 token, весь контекст обрабатывается через все 2.8T параметров, что теоретически сохраняет качество attention на экстремальных длинах, но увеличивает задержку на token.

  • Qwen3.8-Max: 1M token, MoE-routing, при экстремальных длинах (свыше ~500K token) выбор expert может стать более шумным. На практике большинство coding-сессий остаётся значительно ниже этого порога.

  • DeepSeek V4 Pro: 1M token на input, 384K max output. Ограничение по output — реальный лимит для задач с очень длинной генерацией. Для многотурновых агентских циклов с 10K–50K output на каждом шаге это редко становится проблемой.

Задержка и пропускная способность

Coding-агенты чувствительны к задержке во внутреннем цикле (план → код → тесты → чтение вывода → итерация). First-token latency и пропускная способность в token/s напрямую влияют на общее время выполнения задачи.

Общая картина по скорости:

  • DeepSeek V4 Pro — наименьшая first-token latency в thinking mode по большинству независимых оценок, за счёт агрессивного MoE-routing
  • Qwen3.8-Max — средняя задержка, non-thinking mode заметно быстрее thinking
  • Kimi K3 — самый медленный из трёх из-за dense-архитектуры, при этом нет контроля reasoning effort для ускорения простых шагов

Для агента, проходящего 50+ turns за задачу, 2 секунды экономии на каждом turn дают почти 2 минуты на задачу. В масштабе это существенно.

Матрица принятия решений

Выбирайте Kimi K3, если:

  • Основная нагрузка — фронтенд (K3 лидирует на Arena Code WebDev)
  • Нужен vision-input наряду с кодированием (K3 — единственная модель с vision в этом сравнении)
  • Бюджет вторичен, в приоритете качество output
  • Важно качество attention dense-архитектуры на сложных цепочках зависимостей

Выбирайте Qwen3.8-Max, если:

  • Нужен лучший результат SWE-bench Pro (67.7%) среди этих трёх
  • Нужен гибкий контроль режима рассуждений (thinking/non-thinking toggle)
  • Основной use case — многошаговое агентское взаимодействие (CoWorkBench 74.8%)
  • Нужны открытые веса для self-hosting

Выбирайте DeepSeek V4 Pro, если:

  • Стоимость — главное ограничение (off-peak $0.66/$1.98 за M token)
  • Агенты работают в большом объёме, нужен cache hit ниже $0.05/M
  • Нужно максимальное output-окно (384K token)
  • Агенты выигрывают от совместимости с Anthropic API format
  • Работа ведётся преимущественно в off-peak часы (половинная цена)

Конфигурация TheRouter

Все три модели доступны через TheRouter с OpenAI-совместимым routing. Пример fallback-цепочки для coding-агента:

# Оптимизация по стоимости: DeepSeek V4 Pro
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek/deepseek-v4-pro",
    "messages": [{"role": "user", "content": "Refactor the auth module to use JWT tokens"}],
    "tools": [...]
  }'
# Оптимизация по качеству: Qwen3.8-Max для сложных задач
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen/qwen3.8-max",
    "messages": [{"role": "user", "content": "Debug and fix the failing integration test suite"}],
    "tools": [...]
  }'

Для динамического routing TheRouter поддерживает fallback-цепочки:

  1. Primary: deepseek/deepseek-v4-pro — оптимален по стоимости для рутинных задач
  2. Fallback при ошибке/timeout: qwen/qwen3.8-max — сильнее на сложных многошаговых задачах
  3. Последний fallback: moonshot/kimi-k3 — максимальная репрезентативная ёмкость и vision

Такая конфигурация обеспечивает routing по стоимости по умолчанию с автоматической эскалацией к более мощным (и дорогим) моделям при необходимости.

FAQ

Какая модель лучше для routing через Cursor или Claude Code?

Для общей работы с кодом DeepSeek V4 Pro предлагает лучшее соотношение стоимости и качества. Если IDE-агент часто работает со сложными рефакторингами больших codebase, Qwen3.8-Max сильнее в многошаговом планировании. У Cursor есть известные ограничения при routing через custom API endpoint в sub-агентах — убедитесь, что все запросы идут через TheRouter.

Можно ли использовать эти модели с OpenAI Python SDK?

Да. Все три провайдера предоставляют OpenAI-совместимые endpoint, и TheRouter объединяет их за одним base_url. Установите base_url="https://api.therouter.ai/v1" и используйте model ID из таблицы сравнения.

Как работают off-peak цены DeepSeek?

DeepSeek определяет peak-часы как 01:00–04:00 и 06:00–10:00 UTC с понедельника по пятницу. Все остальные часы — off-peak с половинной ценой. Для команд в US Pacific или европейских часовых поясах большая часть рабочего времени попадает в off-peak.

Qwen3.8-Max действительно open weight?

Да. Alibaba опубликовала веса Qwen3.8-Max, это единственная open-weight модель в данном сравнении. Self-hosting возможен через Together, DeepInfra или SiliconFlow, однако 2.4T параметров требуют серьёзной GPU-инфраструктуры.

Почему Kimi K3 такой дорогой?

Dense-архитектура K3 означает, что каждый token обрабатывается всеми 2.8T параметрами, что требует значительно больше вычислений на token, чем MoE-модели. Высокая цена отражает повышенную стоимость compute. Moonshot позиционирует K3 как потолок качества для задач, где репрезентативная ёмкость важнее пропускной способности.

Поддерживают ли эти модели streaming?

Да. Все три поддерживают SSE-streaming через стандартный OpenAI-совместимый параметр stream: true. TheRouter прозрачно сохраняет streaming при routing к любому из этих провайдеров.

Какая модель обеспечивает наибольший эффективный контекст?

Все три заявляют 1M token. На практике ограничение output в 384K у DeepSeek V4 Pro — binding constraint для задач с очень длинной генерацией. Для input-тяжёлых нагрузок (большой codebase в контексте) все три модели сопоставимы при длинах ниже 500K token. Сверх этого порога независимых оценок мало, результаты зависят от типа задачи.


Все цены и бенчмарки получены 18 сентября 2026 года. Цены и результаты бенчмарков могут измениться после публикации. Перед принятием решений о закупке проверяйте актуальные цены в документации провайдеров.

Модели, упомянутые в статье

Помощь и контакты