Все статьи

Сравнение провайдеров LLM API в 2026 году: OpenAI, Anthropic, Google, DeepSeek, DashScope и SiliconFlow

Практическое сравнение шести ведущих провайдеров LLM API в 2026 году: OpenAI, Anthropic, Google Gemini, DeepSeek, DashScope (Bailian) и SiliconFlow. Сравниваем флагманские модели, цены за токен, rate limits, совместимость с OpenAI SDK и региональное развёртывание.

· updated 2026-07-28· TheRouter

Короткий ответ: выбирайте OpenAI, если нужна самая широкая экосистема и интеграция инструментов; Anthropic — для длинного контекста и extended thinking; Google Gemini — для мультимодальных задач и managed agents; DeepSeek — когда стоимость reasoning-задач критична; DashScope — для развёртывания в Китае и экосистемы Qwen; SiliconFlow — если нужен бесплатный доступ к open-weight моделям через OpenAI-совместимый endpoint. Сложность 2026 года — не в поиске провайдера, а в понимании его rate limits, ценовых ступеней и режимов отказа.

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Источники: OpenAI API Pricing, проверено 2026-07-28; Anthropic Claude Pricing, проверено 2026-07-28; Google Gemini API Pricing, проверено 2026-07-28; DeepSeek Models & Pricing, проверено 2026-07-28; DashScope Model Pricing, проверено 2026-07-28; SiliconFlow Pricing, проверено 2026-07-28.

Сводная таблица провайдеров

ПровайдерФлагманская модельInput / Output (за 1M токенов)Контекстное окноOpenAI SDKRate limitДля кого
OpenAIGPT-5.6 Sol$5.00 / $30.00272K+НативнаяRPM/TPM/RPD по уровнямШирокая экосистема, tool calling, coding agents
AnthropicClaude Opus 4.8$5.00 / $25.00200K–1MЧерез base_urlRPM/ITPM/OTPM по уровнямExtended thinking, длинный контекст, safety
GoogleGemini 3.6 Flash$1.50 / $7.501M+Через base_urlRPM/TPM по проектуМультимодальность, managed agents, Google Cloud
DeepSeekV4-Flash$0.14 / $0.281MНативная (+ Anthropic формат)По concurrency (2 500)Минимальная стоимость reasoning и кода
DashScopeQwen3.7-Max¥6 / ¥18 (промо)1MOpenAI-совместимый endpointRPM/TPM по моделиКитай, Qwen-экосистема, ступенчатые цены
SiliconFlowМультивендор (200+ моделей)$0.00–$15.00Зависит от моделиНативнаяПо тарифному уровнюБесплатные модели, open-weight, pay-as-you-go

Примечание: Цены актуальны на июль 2026 года. Промо-тарифы могут измениться. DashScope указан в юанях, остальные — в долларах. Проверяйте официальные страницы перед принятием решений.

OpenAI — экосистема по умолчанию

OpenAI остаётся выбором по умолчанию для команд, которым нужен самый широкий каталог моделей, глубокая интеграция инструментов и максимальная поддержка SDK.

Модельный ряд (июль 2026):

МодельInputOutputКонтекстПримечания
GPT-5.6 Sol$5.00$30.00272K+Флагман, длинный контекст
GPT-5.6 Terra$2.50$15.00272K+Средний уровень
GPT-5.6 Luna$1.00$6.00272K+Оптимальная цена
GPT-5.4-mini$0.75$4.50СтандартныйБыстрая, доступная
GPT-5.4-nano$0.20$1.25СтандартныйУльтра-дешёвая
o3$2.00$8.00СтандартныйReasoning
o4-mini$1.10$4.40СтандартныйЛёгкий reasoning

Сильные стороны: нативный prompt caching (скидка 90% на cache hit), Batch API (скидка 50%), Responses API со встроенным tool calling, Codex для agentic coding, data residency в 10 регионах.

Ограничения: rate limits зависят от уровня и неочевидны до момента срабатывания. Spend limits (жёсткие 429) — это отдельный механизм. Новейшие модели (GPT-5.6) стоят дорого — Luna ($1/$6) оптимальна для большинства production-нагрузок.

Когда выбирать OpenAI: нужна широчайшая экосистема инструментов, команда уже использует OpenAI SDK, или нужен data residency в конкретном регионе.

Источник: OpenAI API Pricing, проверено 2026-07-28.

Anthropic — Extended Thinking и безопасность

Claude API от Anthropic занимает уникальную нишу: лучший в классе extended thinking, сильные coding-бенчмарки и enterprise-уровень контролей безопасности.

Модельный ряд (июль 2026):

МодельInputOutputКонтекстПримечания
Claude Opus 4.8$5.00$25.00200K (1M с extended thinking)Frontier reasoning
Claude Sonnet 5$2.00$10.00200KПромо до конца августа 2026 (стандартная: $3/$15)
Claude Haiku 4$1.00$5.00200KБыстрая, экономичная

Сильные стороны: extended thinking (бюджетный, до 128K thinking-токенов), prompt caching (скидка 90%), effort control (auto/low/high), Claude Code для agentic coding.

Ограничения: rate limits по уровням (RPM/ITPM/OTPM), повышение требует истории расходов. Нет нативного Batch API. Промо-цена Sonnet 5 ($2/$10) заканчивается 31 августа 2026.

Когда выбирать Anthropic: задачи выигрывают от extended thinking (сложный reasoning, многоэтапный анализ), нужны строгие гарантии безопасности, или coding agents показывают лучшие результаты на бенчмарках Claude.

Источники: Anthropic Claude API Pricing, проверено 2026-07-28; Claude Pricing — cloudzero.com, проверено 2026-07-28.

Google Gemini — мультимодальность и managed agents

Gemini API от Google выделяется мультимодальными возможностями, оркестрацией managed agents и глубокой интеграцией с Google Cloud.

Модельный ряд (июль 2026):

МодельInputOutputКонтекстПримечания
Gemini 3.6 Flash$1.50$7.501M+Новейшая Flash, output на 17% дешевле 3.5 Flash
Gemini 3.1 Pro Preview$1.00$6.00200KPreview-цена
Gemini 2.5 Pro$0.625$5.001M+Зрелая, экономичная

Сильные стороны: нативная мультимодальность (текст, изображения, видео, аудио), managed agent API с фоновым выполнением и поддержкой MCP, computer-use в 3.5 Flash, щедрый бесплатный уровень, Vertex AI для enterprise.

Ограничения: документация и страницы цен исторически сложны в навигации. Managed agent — относительно новая функция. Rate limits — по проекту, а не по модели.

Когда выбирать Google: мультимодальные задачи (vision, audio, video), нужна оркестрация managed agents, инфраструктура уже на Google Cloud.

Источники: Gemini API Pricing, проверено 2026-07-28; felloai.com Gemini Pricing, проверено 2026-07-28.

DeepSeek — ультранизкая стоимость reasoning

DeepSeek сломал ценовой пол в 2025 году и сохраняет эту позицию в середине 2026. Модели V4 предлагают reasoning-уровень производительности за малую долю стоимости.

Модельный ряд (июль 2026):

МодельInput (cache miss)Input (cache hit)OutputКонтекстПримечания
DeepSeek V4-Flash$0.14$0.0028$0.281MThinking mode по умолчанию, 2 500 concurrency
DeepSeek V4-Pro$0.435$0.003625$0.871MБолее мощная, 500 concurrency

Сильные стороны: самый дешёвый reasoning API. Cache hits — на 98% дешевле cache miss. Поддержка форматов OpenAI и Anthropic. Thinking mode включён по умолчанию. FIM-completion для кода. 1M контекст для обеих моделей.

Ограничения: concurrency limits вместо RPM/TPM (2 500 для Flash, 500 для Pro). При пиковых нагрузках ограничения могут быть жёсткими. Минимум enterprise-контролей (нет data residency, ограниченный audit). Периодические проблемы с доступностью.

Когда выбирать DeepSeek: стоимость — главный приоритет, задачи на reasoning или код, допустимо concurrency-based throttling.

Источник: DeepSeek Models & Pricing, проверено 2026-07-28.

DashScope (Bailian) — экосистема Qwen

DashScope (百炼) от Alibaba Cloud — основной API для семейства моделей Qwen. Также хостит сторонние модели: GLM, Kimi, MiniMax. Платформа номер один для развёртывания в Китае.

Ключевые цены (июль 2026, регион Пекин):

МодельInputOutputКонтекстПримечания
Qwen3.7-Max¥6/M (промо, обычно ¥12)¥18/M (промо, обычно ¥36)1MФлагман, thinking + non-thinking
Qwen3-Max¥2.5/M (≤32K)¥10/M (≤32K)256KСтупенчатая цена
Qwen3.7-Flash¥0.6/M¥1.2/M1MЭкономичная

Сильные стороны: полная линейка Qwen (Max, Plus, Turbo, Flash, Coder, VL, Audio), OpenAI-совместимый endpoint (dashscope.aliyuncs.com/compatible-mode/v1), ступенчатые цены (короткий контекст дешевле), context caching (explicit + implicit), Batch API за полцены, multi-region (Пекин, Сингапур, Виргиния, Франкфурт, Токио).

Ограничения: международные цены в 1,4–1,8 раза выше китайских. Ступенчатые цены добавляют сложность. Rate limits по моделям и не всегда документированы. Масштабное retirement моделей сконцентрировано на 10 октября 2026 — проверьте календарь жизненного цикла DashScope перед выбором model ID.

Когда выбирать DashScope: нужно развёртывание в Китае, работа с Qwen, или выгоды от ступенчатых цен на коротком контексте.

Источник: DashScope Model Pricing, проверено 2026-07-28.

SiliconFlow — бесплатный доступ к open-weight моделям

SiliconFlow агрегирует 200+ open-weight и проприетарных моделей за единым OpenAI-совместимым API с бесплатным уровнем для небольших моделей.

Основные цены (июль 2026):

МодельInputOutputКонтекстПримечания
DeepSeek V4-Flash (через SF)$0.13$0.281MInput чуть дешевле прямого подключения
DeepSeek V4-Pro (через SF)$1.50$3.1351MНаценка vs прямое подключение
Kimi K3$3.00$15.001MНовейшая reasoning-модель Moonshot
GLM-5.2$1.30$4.091MФлагман Zhipu
Qwen3.6-27B$0.30$3.20262KOpen-weight Qwen
Малые модели$0.00$0.00РазныеНавсегда бесплатные

Сильные стороны: бесплатные модели для прототипирования, широкий каталог от нескольких вендоров, $1 бесплатных кредитов при регистрации, один API-ключ для разных семейств моделей, OpenAI-совместимый по умолчанию.

Ограничения: наценка на часть моделей по сравнению с прямым подключением. Бесплатные rate limits ограничены для production. SiliconFlow — не вендор модели, а инфраструктура инференса. Провайдер-специфичные функции (extended thinking, prompt caching) могут быть доступны не полностью.

Когда выбирать SiliconFlow: нужен один API-ключ для нескольких open-weight моделей, нужен бесплатный уровень для прототипов, или хотите сравнить модели без регистрации у каждого провайдера.

Источник: SiliconFlow Pricing, проверено 2026-07-28.

Матрица выбора по типу задачи

ЗадачаПриоритет бюджетаРекомендацияПочему
Общий чат/ассистентСреднийOpenAI (GPT-5.6 Luna) или Anthropic (Haiku 4)Широкая экосистема, низкая цена
Сложный reasoningКачествоAnthropic (Opus 4.8 extended thinking) или OpenAI (o3)Лучшие reasoning-бенчмарки
Бюджетный reasoningСтоимостьDeepSeek V4-Flash$0.14/$0.28 — в 10–35 раз дешевле
Развёртывание в КитаеРегуляторикаDashScope (Qwen3.7-Max)Нативный хостинг в Китае, оплата в юанях
МультимодальностьФункционалGoogle Gemini 3.6 FlashНативная мультимодальность, конкурентная цена
ПрототипированиеБесплатноSiliconFlow (бесплатные модели) или DeepSeek V4-Flash$0 для старта
Coding agentsКачество + ценаAnthropic (Sonnet 5) или DeepSeek V4-ProТоп SWE-bench

Rate Limits — скрытое ограничение

Цены привлекают внимание, но rate limits определяют, подойдёт ли провайдер для вашего паттерна трафика.

ПровайдерМодель лимитовБесплатный / низкий уровеньПлатный / высокий уровеньПримечания
OpenAIRPM + TPM + RPD по уровнюЗависит от моделиTier 5: до 10K RPMSpend limits — отдельный 429 от rate limits
AnthropicRPM + ITPM + OTPM по уровнюTier 1: низкийTier 4: вышеПовышение требует истории расходов
GoogleRPM + TPM по проектуЩедрый бесплатныйVertex AI для масштабированияПо проекту, не по модели
DeepSeekПо concurrency2 500 (Flash) / 500 (Pro)Без RPM/TPM — лимит параллельных запросов
DashScopeRPM + TPM по моделиЗависит от моделиВыше на платных уровняхНе всегда задокументировано
SiliconFlowПо тарифному плануБесплатный: ограниченПлатный: вышеЗависит от модели

Подробнее — в нашем сравнении rate limits AI API 2026.

Совместимость с OpenAI SDK

Ключевой практический вопрос: можно ли использовать openai Python/Node SDK с base_url override для каждого провайдера?

ПровайдерРаботает с OpenAI SDK?base_urlAuthНюансы
OpenAIНативноhttps://api.openai.com/v1OPENAI_API_KEY
AnthropicЧерез proxy/gatewayНе напрямую — другой формат APIANTHROPIC_API_KEYНужен адаптер или gateway
GoogleЧерез proxy/gatewayНе напрямую — другой формат APIGoogle OAuth / API keyНужен адаптер или gateway
DeepSeekДаhttps://api.deepseek.comDEEPSEEK_API_KEYПоддерживает и Anthropic формат
DashScopeДаhttps://dashscope.aliyuncs.com/compatible-mode/v1DASHSCOPE_API_KEYЧасть функций требует DashScope-специфичных headers
SiliconFlowДаhttps://api.siliconflow.cn/v1SILICONFLOW_API_KEYПровайдер-специфичные функции могут не экспонироваться

Для команд, уже использующих OpenAI SDK, DeepSeek, DashScope и SiliconFlow предлагают путь миграции с минимальным трением. Anthropic и Google требуют собственный SDK или routing gateway.

Пошаговый гид по миграции — OpenAI to TheRouter Migration Guide.

Как gateway меняет выбор провайдера

Мы создали TheRouter, чтобы решить конкретную проблему: смена провайдера не должна требовать переписывания приложения. TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров и поддерживает routing и fallback, когда product-пути это позволяют.

Что даёт gateway:

  • Единый endpoint: один base_url, один API key, несколько провайдеров за ним
  • Fallback: если провайдер A возвращает 429 или 5xx, маршрут переключается на провайдера B — по настроенным и протестированным fallback-путям
  • Единый биллинг: один счёт вместо шести панелей провайдеров

Что gateway не делает:

  • Не гарантирует доступность каждой модели от каждого провайдера (мы этого не заявляем)
  • Не устраняет rate limits провайдера (они по-прежнему действуют upstream)
  • Не делает провайдер-специфичные функции идентичными (extended thinking, prompt caching, managed agents — это функции конкретных провайдеров)

Сравнение gateway — отдельная тема. Смотрите Unified LLM API Gateway Comparison 2026 для сравнения OpenRouter, LiteLLM, Portkey, Cloudflare AI Gateway и TheRouter.

Сравнивая цены API между провайдерами, всегда нормализуйте кUSD за миллион токенов и разделяйте input и output. Большинство провайдеров берёт за output токены в 2–5 раз дороже, чем за input, поэтому нагрузка с длинными completion'ами при одной и той же номинальной цене обходится дороже.

  • Одна валюта (USD) — конвертация на дату публикации с указанием курса.
  • Разделяйте input/output — никогда не публикуйте смешанную цифру.
  • Цитируйте каждую строку со страницы цен провайдера + дата извлечения.
  • Указывайте тарифы длинного контекста — они часто скачут вверх.

Что не вошло в обзор

Сравнение сфокусировано на шести провайдерах, наиболее релевантных для пользователей TheRouter. Заметные упущения:

  • xAI (Grok): рассмотрен в Grok 4.5 API Integration Guide. Сильный reasoning, премиальные цены ($5/$15 для Grok 4.3).
  • Mistral: конкурентен для европейского развёртывания, менее релевантен для ориентированных на Китай пользователей.
  • Volcengine (Ark): рассмотрен в Volcengine Ark vs DashScope. Платформа ByteDance с моделями Doubao/Seed.
  • Meta (Llama): open-weight модели доступны через SiliconFlow, Fireworks и других inference-провайдеров, а не через собственный API Meta.

FAQ

Вопрос: Какой провайдер дешевле всех? DeepSeek V4-Flash — $0.14/$0.28 за миллион токенов. Input в 7 раз дешевле GPT-5.6 Luna и в 35 раз дешевле GPT-5.6 Sol. Для задач без reasoning бесплатные модели SiliconFlow не стоят ничего.

Вопрос: Можно ли использовать несколько провайдеров одновременно? Да. Большинство production-команд используют 2–3 провайдера. Gateway вроде TheRouter упрощает это, предоставляя единый endpoint с routing и fallback — при условии, что эти пути настроены и протестированы для нужных моделей.

Вопрос: У кого самые щедрые rate limits? Concurrency-модель DeepSeek (2 500 параллельных запросов для V4-Flash) исключительно щедра для высоконагруженных batch-задач. OpenAI и Anthropic ограничивают по RPM/TPM и требуют повышения уровня через историю расходов. Project-based лимиты Google щедры для экспериментов.

Вопрос: Как с data residency и compliance? OpenAI — data residency в 10 регионах. DashScope — единственный с нативным развёртыванием в Китае. Anthropic и Google предлагают enterprise-соглашения с конкретными compliance-обязательствами. У DeepSeek и SiliconFlow compliance-поверхность ограничена.

Вопрос: Как сравнить скидки prompt caching? OpenAI: 90% скидка на cached input. Anthropic: 90%. DeepSeek: 98% (cache hit V4-Flash — $0.0028/M). DashScope: 90% с explicit caching, implicit caching тоже доступен. SiliconFlow: зависит от модели.

Поддержка