← Все статьи

Китайские LLM API провайдеры во 2-м полугодии 2026: DashScope, DeepSeek, Kimi, Zhipu, Volcengine и SiliconFlow

Практическое сравнение шести крупнейших китайских LLM API провайдеров во 2-м полугодии 2026: DashScope (Bailian), DeepSeek, Moonshot (Kimi), Zhipu (Z.ai), Volcengine Ark и SiliconFlow. Разбираем флагманские модели, актуальные цены после волны пересмотра, совместимость с OpenAI SDK, rate limits, риски жизненного цикла моделей и сценарии применения.

· updated 2026-08-24· TheRouter

Коротко: DashScope — если нужен стек Qwen3.8 плюс third-party модели и China-region compliance. DeepSeek — если важна цена на reasoning-задачи после repricing 16 августа. Kimi K3 — если нужен 1M-context coding agent и бюджет позволяет. Zhipu GLM-5.3 — если хотите open-weight модель на 743B для self-hosting. Volcengine Ark — если вы уже в экосистеме ByteDance. SiliconFlow — если нужен free-tier агрегатор open-weight моделей с OpenAI-compatible endpoint. Ландшафт ощутимо сдвинулся во 2-м полугодии 2026, и эта страница фиксирует текущее состояние.

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Сравнивая цены API между провайдерами, всегда нормализуйте кUSD за миллион токенов и разделяйте input и output. Большинство провайдеров берёт за output токены в 2–5 раз дороже, чем за input, поэтому нагрузка с длинными completion'ами при одной и той же номинальной цене обходится дороже.

  • Одна валюта (USD) — конвертация на дату публикации с указанием курса.
  • Разделяйте input/output — никогда не публикуйте смешанную цифру.
  • Цитируйте каждую строку со страницы цен провайдера + дата извлечения.
  • Указывайте тарифы длинного контекста — они часто скачут вверх.

Источники: DashScope Model Pricing, получено 2026-08-24; DeepSeek Models & Pricing, получено 2026-08-24; Kimi K3 Pricing, получено 2026-08-24; SiliconFlow Pricing, получено 2026-08-24; GLM-5.3 Specs, получено 2026-08-24; Volcengine Ark Pricing, получено 2026-08-24.

Зачем новое сравнение для H2 2026

Сравнение провайдеров за первое полугодие было опубликовано в конце июля. С тех пор каждый китайский провайдер сделал шаг, который меняет расклад:

  • DashScope запустил Qwen3.8-Max (¥12/¥36 за 1M tokens), расширил third-party model hosting (DeepSeek, Kimi K3, GLM на одном endpoint) и объявил волну закрытия 10 октября 2026, когда будут удалены 30+ legacy model ID.
  • DeepSeek выпустил V4-Pro GA 13 августа и 16 августа ввёл peak/off-peak billing — впервые среди китайских LLM API провайдеров.
  • Moonshot выпустил Kimi K3 по цене $3/$15 за 1M tokens с 1M-token context window, позиционируя его как premium coding-and-reasoning flagship.
  • Zhipu 14 августа выпустил GLM-5.3 (743B параметров, open-weight) и продолжил стратегию открытых весов, сохранив Z.ai subscription plans.
  • Volcengine Ark выпустил Doubao Seed 2.1 с уровнями Pro и Turbo плюс Seed-Evolving — модель с непрерывной итерацией.
  • SiliconFlow стал основным агрегатором open-weight моделей по community pricing, включая DeepSeek V4-Flash по $0.13/$0.28 за 1M tokens.

Если вы выбираете китайского LLM API провайдера сегодня, эта страница — ваша опорная точка.

Сводная таблица провайдеров

ПровайдерEndpointOpenAI SDKФлагманInput / Output (за 1M tokens)ContextLifecycle Risk
DashScope (Bailian)dashscope.aliyuncs.comДа (compat mode)qwen3.8-max¥12 / ¥361MСредний (закат 10 окт.)
DeepSeekapi.deepseek.comДаdeepseek-v4-pro$0.66 / $1.98 (off-peak)1MНизкий
Moonshot (Kimi)api.moonshot.cnДаkimi-k3$3.00 / $15.001MНизкий
Zhipu (Z.ai)open.bigmodel.cnЧастичноGLM-5.3TBA (5.2: $1.40 / $4.40)1MНизкий
Volcengine Arkark.cn-beijing.volces.comДа (compat mode)doubao-seed-2.1-pro¥6 / ¥30256KНизкий
SiliconFlowapi.siliconflow.cnДаАгрегатор (V4-Flash, K3, GLM-5.2)Зависит от модели (V4-Flash: $0.13 / $0.28)РазличныйНизкий

Все цены получены 2026-08-24. У DeepSeek действует peak/off-peak pricing. Цены DashScope указаны в юанях для региона Пекин. SiliconFlow — в долларах.

DashScope (Bailian): стек Qwen + third-party агрегатор

DashScope — платформа model inference от Alibaba Cloud. Она является основным хостом семейства Qwen и незаметно превратилась в китайский LLM-агрегатор, предлагая third-party модели DeepSeek, Moonshot, Zhipu и MiniMax через один API key.

Флагманские модели (август 2026):

  • qwen3.8-max — ¥12 input / ¥36 output за 1M tokens, 1M context, thinking + non-thinking modes, batch calling со скидкой 50%, context caching с отдельным тарифом
  • qwen3.7-max — такой же тариф, но сейчас со скидкой 50% (эффективно ¥6/¥18)
  • qwen3.7-plus — ¥2 input / ¥8 output (256K context), скидка 20%

Что изменилось в H2:

  1. Запуск Qwen3.8-Max на том же тарифном уровне, что и 3.7-Max, с добавлением multimodal и расширенного контекста
  2. Third-party model hosting расширен: DeepSeek V4-Flash/Pro, Kimi K3 и GLM доступны через тот же DashScope endpoint
  3. Волна закрытия 10 октября 2026 удалит 30+ legacy model ID, включая qwen-turbo, qwen-vl-plus, qwen-audio-turbo и старые Qwen3 snapshots

Совместимость с OpenAI SDK: полная замена base_url + api_key. DashScope использует dashscope.aliyuncs.com/compatible-mode/v1 как OpenAI-compatible endpoint. Rate limits зависят от уровня аккаунта, точные лимиты по моделям не опубликованы.

Подходит для: команд, которым нужен полный набор Qwen плюс third-party модели на одном счёте, China-region compliance (развёртывание в Пекине/Шанхае/Шэньчжэне) и самые щедрые бесплатные trial квоты (1M tokens на модель, 90 дней).

На что обратить внимание: волна закрытия 10 октября требует заблаговременной миграции. Если вы используете qwen-turbo, qwen-vl или qwen-audio model ID, прочитайте наш гайд по миграции DashScope на октябрь 2026 уже сейчас.

Источники: DashScope Model Pricing, получено 2026-08-24; DashScope Model Deprecation, получено 2026-08-24.

DeepSeek: лидер по цене с peak/off-peak billing

DeepSeek остаётся самым дешёвым вариантом для reasoning-задач. Поколение V4 вышло в двух уровнях с уникальной для отрасли моделью peak/off-peak pricing.

Флагманские модели (август 2026):

  • deepseek-v4-pro — $0.66 input / $1.98 output за 1M tokens (off-peak), в пиковые часы цена удваивается. Cache hit: $0.022 (off-peak). 1M context, 384K max output. Поддержка Responses API и Anthropic API.
  • deepseek-v4-flash — $0.22 input / $0.66 output за 1M tokens (off-peak). Лимит concurrency 2,500 (у Pro — 500).

Что изменилось в H2:

  1. V4-Pro вышел в GA 13 августа, заменив V3.2 в качестве рекомендованного флагмана
  2. Repricing 16 августа ввёл peak/off-peak billing. Пиковые часы: 01:00–04:00 и 06:00–10:00 UTC, с понедельника по пятницу. Остальное время — off-peak. Peak rates = 2× off-peak.
  3. Responses API запущен вместе с V4-Pro GA, обеспечив DeepSeek feature parity с post-Assistants API поверхностью OpenAI
  4. Cache hit pricing на V4-Pro снижен до $0.022 за 1M input tokens (off-peak)

Совместимость с OpenAI SDK: полная drop-in замена. DeepSeek также поддерживает Anthropic-format endpoint на api.deepseek.com/anthropic.

Подходит для: высоконагруженных reasoning и coding задач, где важна цена. Off-peak V4-Flash по $0.22/$0.66 сложно превзойти по соотношению качество/доллар. Batch-задачи, которые можно сдвинуть на off-peak, экономят 50%.

На что обратить внимание: peak-hour pricing удваивает счёт, если ваш трафик попадает в UTC 01:00–04:00 и 06:00–10:00 (пересекается с бизнес-часами в Азии). Лимит 500 concurrent requests на V4-Pro может быть узким местом для high-throughput pipeline.

Источники: DeepSeek Models & Pricing, получено 2026-08-24.

Moonshot (Kimi): premium reasoning на 1M context

Kimi K3 от Moonshot — самая дорогая модель в этом обзоре, позиционируемая как premium coding-and-reasoning agent.

Флагманская модель (август 2026):

  • kimi-k3 — $3.00 input / $15.00 output за 1M tokens. Cache hit: $0.30. 1M-token context. Reasoning включён всегда, настраивается effort (low/high/max). Tool calling, JSON mode, structured output.

Что изменилось в H2:

  1. Kimi K3 вышел с лучшими в индустрии бенчмарками на long-horizon coding (SWE-bench Verified, Codeforces) и 1M-context agentic tasks
  2. K3 появился на DashScope и SiliconFlow как third-party hosted модель
  3. Добавлена настройка reasoning effort (low/high/max), позволяющая снижать качество ради экономии на лёгких задачах

Совместимость с OpenAI SDK: полная замена base_url на api.moonshot.cn/v1. Поддержка tool_choice constraints и dynamically loaded tools (специфика K3).

Подходит для: long-context coding agents, сложных multi-step reasoning задач и сценариев, где один вызов модели заменяет несколько дешёвых. При $15/1M output tokens K3 экономически оправдан только при высокой сложности задачи.

На что обратить внимание: output pricing K3 в 7.5 раз выше DeepSeek V4-Pro off-peak и примерно в 2.5 раза выше DashScope Qwen3.8-Max. Для рутинных completions дешёвые модели дадут сопоставимый результат.

Источники: Kimi K3 Pricing, получено 2026-08-24; Kimi K3 Quickstart, получено 2026-08-24.

Zhipu (Z.ai): open-weight GLM и coding-подписки

Zhipu использует двухколейную стратегию: open-weight модели (доступны на HuggingFace, SiliconFlow и DashScope) плюс premium API и coding-подписки через Z.ai.

Флагманские модели (август 2026):

  • GLM-5.3 — 743B параметров, запуск 14 августа 2026. Open-weight на HuggingFace. API pricing на BigModel/Z.ai на момент написания не опубликован. Ориентир — GLM-5.2: $1.40 input / $4.40 output за 1M tokens (Z.ai API), $1.30 / $4.09 на SiliconFlow.
  • GLM-5.2 — $1.40 input / $4.40 output за 1M tokens через Z.ai. 1M context. Cache hit: $0.26. Доступен на SiliconFlow и DashScope.

Что изменилось в H2:

  1. GLM-5.3 вышел как open-weight модель на 743B с улучшенными бенчмарками long-horizon coding
  2. Z.ai coding subscription переоценён: $18/$72/$160 в месяц
  3. Pricing GLM-5.3 на BigModel API пока не опубликован; ожидается появление на SiliconFlow и DashScope

Совместимость с OpenAI SDK: частичная. API Z.ai на open.bigmodel.cn/api/paas/v4 принимает OpenAI-format запросы для chat completions, но часть функций (web search, knowledge retrieval) используют Zhipu-specific параметры.

Подходит для: команд, которым нужен open-weight доступ (self-hosting GLM-5.3) или Z.ai coding subscription для dev-workflow. Открытые веса означают, что GLM-5.3 можно запустить на своём железе без per-token cost.

На что обратить внимание: pricing GLM-5.3 через API ещё не объявлен. Страница цен BigModel рендерится на клиенте и сложно парсится программно. SiliconFlow pricing для GLM-5.2 ($1.30/$4.09) чуть дешевле прямого Z.ai.

Источники: GLM-5.3 Specs, получено 2026-08-24; GLM Pricing, получено 2026-08-24; SiliconFlow Pricing, получено 2026-08-24.

Volcengine Ark: экосистема ByteDance и Doubao Seed 2.1

Volcengine Ark — платформа model inference от ByteDance, домашняя площадка семейства Doubao (Seed) и растущего каталога third-party моделей.

Флагманские модели (август 2026):

  • doubao-seed-2.1-pro — ¥6 input / ¥30 output за 1M tokens. Флагман для reasoning.
  • doubao-seed-2.1-turbo — ¥3 input / ¥15 output за 1M tokens. Ниже latency, ниже стоимость.
  • doubao-seed-evolving — ¥6 input / ¥30 output за 1M tokens. Модель с непрерывной итерацией, фокус на снижение галлюцинаций.

Что изменилось в H2:

  1. Seed 2.1 вышел с уровнями Pro и Turbo, заменив Seed 2.0 в качестве рекомендованного флагмана
  2. Seed-Evolving запущен как continuously updated модель, получающая rolling improvements без смены версии
  3. Third-party model hosting расширен (DeepSeek, Qwen модели доступны на Ark)

Совместимость с OpenAI SDK: да, через ark.cn-beijing.volces.com/api/v3 с OpenAI-format request body. Требуется аккаунт Volcengine и создание endpoint через консоль.

Подходит для: команд, уже использующих инфраструктуру ByteDance (TikTok, Lark, Volcengine cloud). Seed-Evolving интересен для production-задач, где хочется непрерывного улучшения без ручной смены версии модели.

На что обратить внимание: документация Volcengine частично рендерится на клиенте, автоматическое обнаружение затруднено. Pricing привязан к конкретным моделям без единого platform-wide прайс-листа. Региональная доступность — в основном материковый Китай.

Источники: Volcengine Ark Pricing, получено 2026-08-24; Huoshan Token API Pricing, получено 2026-08-24.

SiliconFlow: агрегатор open-weight моделей с free tier

SiliconFlow агрегирует open-weight и third-party модели на едином OpenAI-compatible endpoint. Это не model developer, а inference-платформа, конкурирующая ценой и широтой покрытия.

Ключевые модели и pricing (август 2026):

МодельInput / Output (за 1M tokens)Context
DeepSeek V4-Flash$0.13 / $0.281M
DeepSeek V4-Pro$1.50 / $3.141M
Kimi K3$3.00 / $15.001M
GLM-5.2$1.30 / $4.091M
Kimi K2.5$0.45 / $2.25262K
Qwen3.6-27B$0.30 / $3.20262K

Что изменилось в H2:

  1. Добавлены Kimi K3 и DeepSeek V4-Pro/Flash в каталог
  2. Free tier даёт $1 кредитов при регистрации; часть open-weight моделей (например, Qwen3.5-9B) доступна почти бесплатно
  3. Community pricing часто на 5–15% ниже прямого провайдера

Совместимость с OpenAI SDK: полная drop-in замена на api.siliconflow.cn/v1. Стандартная API key authentication.

Подходит для: бюджетных команд, которые хотят протестировать несколько китайских моделей по одному API key. Free tier и низкий порог входа делают SiliconFlow идеальным для прототипирования и оценки. Также полезен как secondary routing target для fallback-сценариев.

На что обратить внимание: SiliconFlow — reseller, а не model developer. Доступность моделей зависит от upstream-партнёрств. Free tier имеет ограничительные per-model RPM limits. SLA-гарантии не сопоставимы с first-party провайдерами.

Источники: SiliconFlow Pricing, получено 2026-08-24.

Матрица решений: выбор провайдера по задаче

ЗадачаРекомендуемый провайдерПочему
Высоконагруженный reasoning (экономия)DeepSeek V4-Flash (off-peak)$0.22/$0.66 за 1M tokens, сдвиньте batch-задачи на off-peak
Premium coding agentsKimi K3 или DeepSeek V4-ProK3 — максимальное качество, V4-Pro — output в 3 раза дешевле
China compliance + стек QwenDashScopeРазвёртывание в Пекине/Шанхае, самый большой каталог моделей
Open-weight self-hostingZhipu GLM-5.3743B open-weight, запускайте на своих GPU
Экосистема ByteDanceVolcengine ArkSeed 2.1 + путь интеграции с Lark/TikTok
Прототипирование + оценкаSiliconFlowFree tier, один ключ для нескольких моделей
Multi-model fallbackTheRouter + любая комбинацияМаршрутизируйте через model fallbacks

Заметка о маршрутизации TheRouter

TheRouter маршрутизирует OpenAI-compatible запросы через настроенных провайдеров там, где live product paths это поддерживают. Для китайских провайдеров это означает, что вы можете настроить DashScope, DeepSeek, Moonshot или SiliconFlow как routing targets и использовать model fallbacks для переключения трафика между ними по availability, latency или cost. Volcengine Ark и Zhipu BigModel работают через свои OpenAI-compatible endpoints.

Мы не утверждаем, что все перечисленные модели всегда доступны через TheRouter. Проверяйте актуальный статус на странице моделей и странице провайдеров.

FAQ

Какой провайдер самый дешёвый для reasoning-задач?

DeepSeek V4-Flash по off-peak pricing ($0.22/$0.66 за 1M tokens) — самый дешёвый вариант среди reasoning-capable моделей на август 2026. DashScope Qwen3.7-Max со скидкой 50% (¥6/¥18) тоже конкурентоспособен, но срок окончания скидки не опубликован.

Можно ли использовать один API key для нескольких китайских моделей?

DashScope и SiliconFlow предлагают multi-model доступ по одному API key. DashScope хостит Qwen + DeepSeek + Kimi + GLM. SiliconFlow хостит open-weight и отдельные proprietary модели. Volcengine Ark тоже хостит third-party модели, но требует создания endpoint в консоли для каждой модели.

Что произойдёт 10 октября 2026?

DashScope удалит 30+ legacy model ID, включая qwen-turbo, qwen-vl-plus, qwen-audio-turbo и устаревшие snapshots. API-вызовы к удалённым ID вернут ошибку. Полный список и маппинг замен — в нашем гайде по миграции.

Peak pricing DeepSeek действительно удваивает счёт?

Да. Пиковые часы (01:00–04:00 и 06:00–10:00 UTC, будни) удваивают цену всех V4 моделей. Для азиатских команд это пересекается с утренними бизнес-часами (09:00–18:00 CST). Стратегии оптимизации — в нашем гайде по repricing DeepSeek.


Это сравнение отражает цены и доступность моделей на 24 августа 2026. Цены меняются — проверяйте официальные прайс-листы по ссылкам выше перед принятием решений о закупке.

Связанные публикации:

Помощь и контакты