Китайские LLM API провайдеры во 2-м полугодии 2026: DashScope, DeepSeek, Kimi, Zhipu, Volcengine и SiliconFlow
Практическое сравнение шести крупнейших китайских LLM API провайдеров во 2-м полугодии 2026: DashScope (Bailian), DeepSeek, Moonshot (Kimi), Zhipu (Z.ai), Volcengine Ark и SiliconFlow. Разбираем флагманские модели, актуальные цены после волны пересмотра, совместимость с OpenAI SDK, rate limits, риски жизненного цикла моделей и сценарии применения.
Коротко: DashScope — если нужен стек Qwen3.8 плюс third-party модели и China-region compliance. DeepSeek — если важна цена на reasoning-задачи после repricing 16 августа. Kimi K3 — если нужен 1M-context coding agent и бюджет позволяет. Zhipu GLM-5.3 — если хотите open-weight модель на 743B для self-hosting. Volcengine Ark — если вы уже в экосистеме ByteDance. SiliconFlow — если нужен free-tier агрегатор open-weight моделей с OpenAI-compatible endpoint. Ландшафт ощутимо сдвинулся во 2-м полугодии 2026, и эта страница фиксирует текущее состояние.
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
Сравнивая цены API между провайдерами, всегда нормализуйте кUSD за миллион токенов и разделяйте input и output. Большинство провайдеров берёт за output токены в 2–5 раз дороже, чем за input, поэтому нагрузка с длинными completion'ами при одной и той же номинальной цене обходится дороже.
- Одна валюта (USD) — конвертация на дату публикации с указанием курса.
- Разделяйте input/output — никогда не публикуйте смешанную цифру.
- Цитируйте каждую строку со страницы цен провайдера + дата извлечения.
- Указывайте тарифы длинного контекста — они часто скачут вверх.
Источники: DashScope Model Pricing, получено 2026-08-24; DeepSeek Models & Pricing, получено 2026-08-24; Kimi K3 Pricing, получено 2026-08-24; SiliconFlow Pricing, получено 2026-08-24; GLM-5.3 Specs, получено 2026-08-24; Volcengine Ark Pricing, получено 2026-08-24.
Зачем новое сравнение для H2 2026
Сравнение провайдеров за первое полугодие было опубликовано в конце июля. С тех пор каждый китайский провайдер сделал шаг, который меняет расклад:
- DashScope запустил Qwen3.8-Max (¥12/¥36 за 1M tokens), расширил third-party model hosting (DeepSeek, Kimi K3, GLM на одном endpoint) и объявил волну закрытия 10 октября 2026, когда будут удалены 30+ legacy model ID.
- DeepSeek выпустил V4-Pro GA 13 августа и 16 августа ввёл peak/off-peak billing — впервые среди китайских LLM API провайдеров.
- Moonshot выпустил Kimi K3 по цене $3/$15 за 1M tokens с 1M-token context window, позиционируя его как premium coding-and-reasoning flagship.
- Zhipu 14 августа выпустил GLM-5.3 (743B параметров, open-weight) и продолжил стратегию открытых весов, сохранив Z.ai subscription plans.
- Volcengine Ark выпустил Doubao Seed 2.1 с уровнями Pro и Turbo плюс Seed-Evolving — модель с непрерывной итерацией.
- SiliconFlow стал основным агрегатором open-weight моделей по community pricing, включая DeepSeek V4-Flash по $0.13/$0.28 за 1M tokens.
Если вы выбираете китайского LLM API провайдера сегодня, эта страница — ваша опорная точка.
Сводная таблица провайдеров
| Провайдер | Endpoint | OpenAI SDK | Флагман | Input / Output (за 1M tokens) | Context | Lifecycle Risk |
|---|---|---|---|---|---|---|
| DashScope (Bailian) | dashscope.aliyuncs.com | Да (compat mode) | qwen3.8-max | ¥12 / ¥36 | 1M | Средний (закат 10 окт.) |
| DeepSeek | api.deepseek.com | Да | deepseek-v4-pro | $0.66 / $1.98 (off-peak) | 1M | Низкий |
| Moonshot (Kimi) | api.moonshot.cn | Да | kimi-k3 | $3.00 / $15.00 | 1M | Низкий |
| Zhipu (Z.ai) | open.bigmodel.cn | Частично | GLM-5.3 | TBA (5.2: $1.40 / $4.40) | 1M | Низкий |
| Volcengine Ark | ark.cn-beijing.volces.com | Да (compat mode) | doubao-seed-2.1-pro | ¥6 / ¥30 | 256K | Низкий |
| SiliconFlow | api.siliconflow.cn | Да | Агрегатор (V4-Flash, K3, GLM-5.2) | Зависит от модели (V4-Flash: $0.13 / $0.28) | Различный | Низкий |
Все цены получены 2026-08-24. У DeepSeek действует peak/off-peak pricing. Цены DashScope указаны в юанях для региона Пекин. SiliconFlow — в долларах.
DashScope (Bailian): стек Qwen + third-party агрегатор
DashScope — платформа model inference от Alibaba Cloud. Она является основным хостом семейства Qwen и незаметно превратилась в китайский LLM-агрегатор, предлагая third-party модели DeepSeek, Moonshot, Zhipu и MiniMax через один API key.
Флагманские модели (август 2026):
- qwen3.8-max — ¥12 input / ¥36 output за 1M tokens, 1M context, thinking + non-thinking modes, batch calling со скидкой 50%, context caching с отдельным тарифом
- qwen3.7-max — такой же тариф, но сейчас со скидкой 50% (эффективно ¥6/¥18)
- qwen3.7-plus — ¥2 input / ¥8 output (256K context), скидка 20%
Что изменилось в H2:
- Запуск Qwen3.8-Max на том же тарифном уровне, что и 3.7-Max, с добавлением multimodal и расширенного контекста
- Third-party model hosting расширен: DeepSeek V4-Flash/Pro, Kimi K3 и GLM доступны через тот же DashScope endpoint
- Волна закрытия 10 октября 2026 удалит 30+ legacy model ID, включая qwen-turbo, qwen-vl-plus, qwen-audio-turbo и старые Qwen3 snapshots
Совместимость с OpenAI SDK: полная замена base_url + api_key. DashScope использует dashscope.aliyuncs.com/compatible-mode/v1 как OpenAI-compatible endpoint. Rate limits зависят от уровня аккаунта, точные лимиты по моделям не опубликованы.
Подходит для: команд, которым нужен полный набор Qwen плюс third-party модели на одном счёте, China-region compliance (развёртывание в Пекине/Шанхае/Шэньчжэне) и самые щедрые бесплатные trial квоты (1M tokens на модель, 90 дней).
На что обратить внимание: волна закрытия 10 октября требует заблаговременной миграции. Если вы используете qwen-turbo, qwen-vl или qwen-audio model ID, прочитайте наш гайд по миграции DashScope на октябрь 2026 уже сейчас.
Источники: DashScope Model Pricing, получено 2026-08-24; DashScope Model Deprecation, получено 2026-08-24.
DeepSeek: лидер по цене с peak/off-peak billing
DeepSeek остаётся самым дешёвым вариантом для reasoning-задач. Поколение V4 вышло в двух уровнях с уникальной для отрасли моделью peak/off-peak pricing.
Флагманские модели (август 2026):
- deepseek-v4-pro — $0.66 input / $1.98 output за 1M tokens (off-peak), в пиковые часы цена удваивается. Cache hit: $0.022 (off-peak). 1M context, 384K max output. Поддержка Responses API и Anthropic API.
- deepseek-v4-flash — $0.22 input / $0.66 output за 1M tokens (off-peak). Лимит concurrency 2,500 (у Pro — 500).
Что изменилось в H2:
- V4-Pro вышел в GA 13 августа, заменив V3.2 в качестве рекомендованного флагмана
- Repricing 16 августа ввёл peak/off-peak billing. Пиковые часы: 01:00–04:00 и 06:00–10:00 UTC, с понедельника по пятницу. Остальное время — off-peak. Peak rates = 2× off-peak.
- Responses API запущен вместе с V4-Pro GA, обеспечив DeepSeek feature parity с post-Assistants API поверхностью OpenAI
- Cache hit pricing на V4-Pro снижен до $0.022 за 1M input tokens (off-peak)
Совместимость с OpenAI SDK: полная drop-in замена. DeepSeek также поддерживает Anthropic-format endpoint на api.deepseek.com/anthropic.
Подходит для: высоконагруженных reasoning и coding задач, где важна цена. Off-peak V4-Flash по $0.22/$0.66 сложно превзойти по соотношению качество/доллар. Batch-задачи, которые можно сдвинуть на off-peak, экономят 50%.
На что обратить внимание: peak-hour pricing удваивает счёт, если ваш трафик попадает в UTC 01:00–04:00 и 06:00–10:00 (пересекается с бизнес-часами в Азии). Лимит 500 concurrent requests на V4-Pro может быть узким местом для high-throughput pipeline.
Источники: DeepSeek Models & Pricing, получено 2026-08-24.
Moonshot (Kimi): premium reasoning на 1M context
Kimi K3 от Moonshot — самая дорогая модель в этом обзоре, позиционируемая как premium coding-and-reasoning agent.
Флагманская модель (август 2026):
- kimi-k3 — $3.00 input / $15.00 output за 1M tokens. Cache hit: $0.30. 1M-token context. Reasoning включён всегда, настраивается effort (low/high/max). Tool calling, JSON mode, structured output.
Что изменилось в H2:
- Kimi K3 вышел с лучшими в индустрии бенчмарками на long-horizon coding (SWE-bench Verified, Codeforces) и 1M-context agentic tasks
- K3 появился на DashScope и SiliconFlow как third-party hosted модель
- Добавлена настройка reasoning effort (
low/high/max), позволяющая снижать качество ради экономии на лёгких задачах
Совместимость с OpenAI SDK: полная замена base_url на api.moonshot.cn/v1. Поддержка tool_choice constraints и dynamically loaded tools (специфика K3).
Подходит для: long-context coding agents, сложных multi-step reasoning задач и сценариев, где один вызов модели заменяет несколько дешёвых. При $15/1M output tokens K3 экономически оправдан только при высокой сложности задачи.
На что обратить внимание: output pricing K3 в 7.5 раз выше DeepSeek V4-Pro off-peak и примерно в 2.5 раза выше DashScope Qwen3.8-Max. Для рутинных completions дешёвые модели дадут сопоставимый результат.
Источники: Kimi K3 Pricing, получено 2026-08-24; Kimi K3 Quickstart, получено 2026-08-24.
Zhipu (Z.ai): open-weight GLM и coding-подписки
Zhipu использует двухколейную стратегию: open-weight модели (доступны на HuggingFace, SiliconFlow и DashScope) плюс premium API и coding-подписки через Z.ai.
Флагманские модели (август 2026):
- GLM-5.3 — 743B параметров, запуск 14 августа 2026. Open-weight на HuggingFace. API pricing на BigModel/Z.ai на момент написания не опубликован. Ориентир — GLM-5.2: $1.40 input / $4.40 output за 1M tokens (Z.ai API), $1.30 / $4.09 на SiliconFlow.
- GLM-5.2 — $1.40 input / $4.40 output за 1M tokens через Z.ai. 1M context. Cache hit: $0.26. Доступен на SiliconFlow и DashScope.
Что изменилось в H2:
- GLM-5.3 вышел как open-weight модель на 743B с улучшенными бенчмарками long-horizon coding
- Z.ai coding subscription переоценён: $18/$72/$160 в месяц
- Pricing GLM-5.3 на BigModel API пока не опубликован; ожидается появление на SiliconFlow и DashScope
Совместимость с OpenAI SDK: частичная. API Z.ai на open.bigmodel.cn/api/paas/v4 принимает OpenAI-format запросы для chat completions, но часть функций (web search, knowledge retrieval) используют Zhipu-specific параметры.
Подходит для: команд, которым нужен open-weight доступ (self-hosting GLM-5.3) или Z.ai coding subscription для dev-workflow. Открытые веса означают, что GLM-5.3 можно запустить на своём железе без per-token cost.
На что обратить внимание: pricing GLM-5.3 через API ещё не объявлен. Страница цен BigModel рендерится на клиенте и сложно парсится программно. SiliconFlow pricing для GLM-5.2 ($1.30/$4.09) чуть дешевле прямого Z.ai.
Источники: GLM-5.3 Specs, получено 2026-08-24; GLM Pricing, получено 2026-08-24; SiliconFlow Pricing, получено 2026-08-24.
Volcengine Ark: экосистема ByteDance и Doubao Seed 2.1
Volcengine Ark — платформа model inference от ByteDance, домашняя площадка семейства Doubao (Seed) и растущего каталога third-party моделей.
Флагманские модели (август 2026):
- doubao-seed-2.1-pro — ¥6 input / ¥30 output за 1M tokens. Флагман для reasoning.
- doubao-seed-2.1-turbo — ¥3 input / ¥15 output за 1M tokens. Ниже latency, ниже стоимость.
- doubao-seed-evolving — ¥6 input / ¥30 output за 1M tokens. Модель с непрерывной итерацией, фокус на снижение галлюцинаций.
Что изменилось в H2:
- Seed 2.1 вышел с уровнями Pro и Turbo, заменив Seed 2.0 в качестве рекомендованного флагмана
- Seed-Evolving запущен как continuously updated модель, получающая rolling improvements без смены версии
- Third-party model hosting расширен (DeepSeek, Qwen модели доступны на Ark)
Совместимость с OpenAI SDK: да, через ark.cn-beijing.volces.com/api/v3 с OpenAI-format request body. Требуется аккаунт Volcengine и создание endpoint через консоль.
Подходит для: команд, уже использующих инфраструктуру ByteDance (TikTok, Lark, Volcengine cloud). Seed-Evolving интересен для production-задач, где хочется непрерывного улучшения без ручной смены версии модели.
На что обратить внимание: документация Volcengine частично рендерится на клиенте, автоматическое обнаружение затруднено. Pricing привязан к конкретным моделям без единого platform-wide прайс-листа. Региональная доступность — в основном материковый Китай.
Источники: Volcengine Ark Pricing, получено 2026-08-24; Huoshan Token API Pricing, получено 2026-08-24.
SiliconFlow: агрегатор open-weight моделей с free tier
SiliconFlow агрегирует open-weight и third-party модели на едином OpenAI-compatible endpoint. Это не model developer, а inference-платформа, конкурирующая ценой и широтой покрытия.
Ключевые модели и pricing (август 2026):
| Модель | Input / Output (за 1M tokens) | Context |
|---|---|---|
| DeepSeek V4-Flash | $0.13 / $0.28 | 1M |
| DeepSeek V4-Pro | $1.50 / $3.14 | 1M |
| Kimi K3 | $3.00 / $15.00 | 1M |
| GLM-5.2 | $1.30 / $4.09 | 1M |
| Kimi K2.5 | $0.45 / $2.25 | 262K |
| Qwen3.6-27B | $0.30 / $3.20 | 262K |
Что изменилось в H2:
- Добавлены Kimi K3 и DeepSeek V4-Pro/Flash в каталог
- Free tier даёт $1 кредитов при регистрации; часть open-weight моделей (например, Qwen3.5-9B) доступна почти бесплатно
- Community pricing часто на 5–15% ниже прямого провайдера
Совместимость с OpenAI SDK: полная drop-in замена на api.siliconflow.cn/v1. Стандартная API key authentication.
Подходит для: бюджетных команд, которые хотят протестировать несколько китайских моделей по одному API key. Free tier и низкий порог входа делают SiliconFlow идеальным для прототипирования и оценки. Также полезен как secondary routing target для fallback-сценариев.
На что обратить внимание: SiliconFlow — reseller, а не model developer. Доступность моделей зависит от upstream-партнёрств. Free tier имеет ограничительные per-model RPM limits. SLA-гарантии не сопоставимы с first-party провайдерами.
Источники: SiliconFlow Pricing, получено 2026-08-24.
Матрица решений: выбор провайдера по задаче
| Задача | Рекомендуемый провайдер | Почему |
|---|---|---|
| Высоконагруженный reasoning (экономия) | DeepSeek V4-Flash (off-peak) | $0.22/$0.66 за 1M tokens, сдвиньте batch-задачи на off-peak |
| Premium coding agents | Kimi K3 или DeepSeek V4-Pro | K3 — максимальное качество, V4-Pro — output в 3 раза дешевле |
| China compliance + стек Qwen | DashScope | Развёртывание в Пекине/Шанхае, самый большой каталог моделей |
| Open-weight self-hosting | Zhipu GLM-5.3 | 743B open-weight, запускайте на своих GPU |
| Экосистема ByteDance | Volcengine Ark | Seed 2.1 + путь интеграции с Lark/TikTok |
| Прототипирование + оценка | SiliconFlow | Free tier, один ключ для нескольких моделей |
| Multi-model fallback | TheRouter + любая комбинация | Маршрутизируйте через model fallbacks |
Заметка о маршрутизации TheRouter
TheRouter маршрутизирует OpenAI-compatible запросы через настроенных провайдеров там, где live product paths это поддерживают. Для китайских провайдеров это означает, что вы можете настроить DashScope, DeepSeek, Moonshot или SiliconFlow как routing targets и использовать model fallbacks для переключения трафика между ними по availability, latency или cost. Volcengine Ark и Zhipu BigModel работают через свои OpenAI-compatible endpoints.
Мы не утверждаем, что все перечисленные модели всегда доступны через TheRouter. Проверяйте актуальный статус на странице моделей и странице провайдеров.
FAQ
Какой провайдер самый дешёвый для reasoning-задач?
DeepSeek V4-Flash по off-peak pricing ($0.22/$0.66 за 1M tokens) — самый дешёвый вариант среди reasoning-capable моделей на август 2026. DashScope Qwen3.7-Max со скидкой 50% (¥6/¥18) тоже конкурентоспособен, но срок окончания скидки не опубликован.
Можно ли использовать один API key для нескольких китайских моделей?
DashScope и SiliconFlow предлагают multi-model доступ по одному API key. DashScope хостит Qwen + DeepSeek + Kimi + GLM. SiliconFlow хостит open-weight и отдельные proprietary модели. Volcengine Ark тоже хостит third-party модели, но требует создания endpoint в консоли для каждой модели.
Что произойдёт 10 октября 2026?
DashScope удалит 30+ legacy model ID, включая qwen-turbo, qwen-vl-plus, qwen-audio-turbo и устаревшие snapshots. API-вызовы к удалённым ID вернут ошибку. Полный список и маппинг замен — в нашем гайде по миграции.
Peak pricing DeepSeek действительно удваивает счёт?
Да. Пиковые часы (01:00–04:00 и 06:00–10:00 UTC, будни) удваивают цену всех V4 моделей. Для азиатских команд это пересекается с утренними бизнес-часами (09:00–18:00 CST). Стратегии оптимизации — в нашем гайде по repricing DeepSeek.
Это сравнение отражает цены и доступность моделей на 24 августа 2026. Цены меняются — проверяйте официальные прайс-листы по ссылкам выше перед принятием решений о закупке.
Связанные публикации: