Сравнение провайдеров LLM API в 2026 году: OpenAI, Anthropic, Google, DeepSeek, DashScope и SiliconFlow
Практическое сравнение шести ведущих провайдеров LLM API в 2026 году: OpenAI, Anthropic, Google Gemini, DeepSeek, DashScope (Bailian) и SiliconFlow. Сравниваем флагманские модели, цены за токен, rate limits, совместимость с OpenAI SDK и региональное развёртывание.
Короткий ответ: выбирайте OpenAI, если нужна самая широкая экосистема и интеграция инструментов; Anthropic — для длинного контекста и extended thinking; Google Gemini — для мультимодальных задач и managed agents; DeepSeek — когда стоимость reasoning-задач критична; DashScope — для развёртывания в Китае и экосистемы Qwen; SiliconFlow — если нужен бесплатный доступ к open-weight моделям через OpenAI-совместимый endpoint. Сложность 2026 года — не в поиске провайдера, а в понимании его rate limits, ценовых ступеней и режимов отказа.
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
Источники: OpenAI API Pricing, проверено 2026-07-28; Anthropic Claude Pricing, проверено 2026-07-28; Google Gemini API Pricing, проверено 2026-07-28; DeepSeek Models & Pricing, проверено 2026-07-28; DashScope Model Pricing, проверено 2026-07-28; SiliconFlow Pricing, проверено 2026-07-28.
Сводная таблица провайдеров
| Провайдер | Флагманская модель | Input / Output (за 1M токенов) | Контекстное окно | OpenAI SDK | Rate limit | Для кого |
|---|---|---|---|---|---|---|
| OpenAI | GPT-5.6 Sol | $5.00 / $30.00 | 272K+ | Нативная | RPM/TPM/RPD по уровням | Широкая экосистема, tool calling, coding agents |
| Anthropic | Claude Opus 4.8 | $5.00 / $25.00 | 200K–1M | Через base_url | RPM/ITPM/OTPM по уровням | Extended thinking, длинный контекст, safety |
| Gemini 3.6 Flash | $1.50 / $7.50 | 1M+ | Через base_url | RPM/TPM по проекту | Мультимодальность, managed agents, Google Cloud | |
| DeepSeek | V4-Flash | $0.14 / $0.28 | 1M | Нативная (+ Anthropic формат) | По concurrency (2 500) | Минимальная стоимость reasoning и кода |
| DashScope | Qwen3.7-Max | ¥6 / ¥18 (промо) | 1M | OpenAI-совместимый endpoint | RPM/TPM по модели | Китай, Qwen-экосистема, ступенчатые цены |
| SiliconFlow | Мультивендор (200+ моделей) | $0.00–$15.00 | Зависит от модели | Нативная | По тарифному уровню | Бесплатные модели, open-weight, pay-as-you-go |
Примечание: Цены актуальны на июль 2026 года. Промо-тарифы могут измениться. DashScope указан в юанях, остальные — в долларах. Проверяйте официальные страницы перед принятием решений.
OpenAI — экосистема по умолчанию
OpenAI остаётся выбором по умолчанию для команд, которым нужен самый широкий каталог моделей, глубокая интеграция инструментов и максимальная поддержка SDK.
Модельный ряд (июль 2026):
| Модель | Input | Output | Контекст | Примечания |
|---|---|---|---|---|
| GPT-5.6 Sol | $5.00 | $30.00 | 272K+ | Флагман, длинный контекст |
| GPT-5.6 Terra | $2.50 | $15.00 | 272K+ | Средний уровень |
| GPT-5.6 Luna | $1.00 | $6.00 | 272K+ | Оптимальная цена |
| GPT-5.4-mini | $0.75 | $4.50 | Стандартный | Быстрая, доступная |
| GPT-5.4-nano | $0.20 | $1.25 | Стандартный | Ультра-дешёвая |
| o3 | $2.00 | $8.00 | Стандартный | Reasoning |
| o4-mini | $1.10 | $4.40 | Стандартный | Лёгкий reasoning |
Сильные стороны: нативный prompt caching (скидка 90% на cache hit), Batch API (скидка 50%), Responses API со встроенным tool calling, Codex для agentic coding, data residency в 10 регионах.
Ограничения: rate limits зависят от уровня и неочевидны до момента срабатывания. Spend limits (жёсткие 429) — это отдельный механизм. Новейшие модели (GPT-5.6) стоят дорого — Luna ($1/$6) оптимальна для большинства production-нагрузок.
Когда выбирать OpenAI: нужна широчайшая экосистема инструментов, команда уже использует OpenAI SDK, или нужен data residency в конкретном регионе.
Источник: OpenAI API Pricing, проверено 2026-07-28.
Anthropic — Extended Thinking и безопасность
Claude API от Anthropic занимает уникальную нишу: лучший в классе extended thinking, сильные coding-бенчмарки и enterprise-уровень контролей безопасности.
Модельный ряд (июль 2026):
| Модель | Input | Output | Контекст | Примечания |
|---|---|---|---|---|
| Claude Opus 4.8 | $5.00 | $25.00 | 200K (1M с extended thinking) | Frontier reasoning |
| Claude Sonnet 5 | $2.00 | $10.00 | 200K | Промо до конца августа 2026 (стандартная: $3/$15) |
| Claude Haiku 4 | $1.00 | $5.00 | 200K | Быстрая, экономичная |
Сильные стороны: extended thinking (бюджетный, до 128K thinking-токенов), prompt caching (скидка 90%), effort control (auto/low/high), Claude Code для agentic coding.
Ограничения: rate limits по уровням (RPM/ITPM/OTPM), повышение требует истории расходов. Нет нативного Batch API. Промо-цена Sonnet 5 ($2/$10) заканчивается 31 августа 2026.
Когда выбирать Anthropic: задачи выигрывают от extended thinking (сложный reasoning, многоэтапный анализ), нужны строгие гарантии безопасности, или coding agents показывают лучшие результаты на бенчмарках Claude.
Источники: Anthropic Claude API Pricing, проверено 2026-07-28; Claude Pricing — cloudzero.com, проверено 2026-07-28.
Google Gemini — мультимодальность и managed agents
Gemini API от Google выделяется мультимодальными возможностями, оркестрацией managed agents и глубокой интеграцией с Google Cloud.
Модельный ряд (июль 2026):
| Модель | Input | Output | Контекст | Примечания |
|---|---|---|---|---|
| Gemini 3.6 Flash | $1.50 | $7.50 | 1M+ | Новейшая Flash, output на 17% дешевле 3.5 Flash |
| Gemini 3.1 Pro Preview | $1.00 | $6.00 | 200K | Preview-цена |
| Gemini 2.5 Pro | $0.625 | $5.00 | 1M+ | Зрелая, экономичная |
Сильные стороны: нативная мультимодальность (текст, изображения, видео, аудио), managed agent API с фоновым выполнением и поддержкой MCP, computer-use в 3.5 Flash, щедрый бесплатный уровень, Vertex AI для enterprise.
Ограничения: документация и страницы цен исторически сложны в навигации. Managed agent — относительно новая функция. Rate limits — по проекту, а не по модели.
Когда выбирать Google: мультимодальные задачи (vision, audio, video), нужна оркестрация managed agents, инфраструктура уже на Google Cloud.
Источники: Gemini API Pricing, проверено 2026-07-28; felloai.com Gemini Pricing, проверено 2026-07-28.
DeepSeek — ультранизкая стоимость reasoning
DeepSeek сломал ценовой пол в 2025 году и сохраняет эту позицию в середине 2026. Модели V4 предлагают reasoning-уровень производительности за малую долю стоимости.
Модельный ряд (июль 2026):
| Модель | Input (cache miss) | Input (cache hit) | Output | Контекст | Примечания |
|---|---|---|---|---|---|
| DeepSeek V4-Flash | $0.14 | $0.0028 | $0.28 | 1M | Thinking mode по умолчанию, 2 500 concurrency |
| DeepSeek V4-Pro | $0.435 | $0.003625 | $0.87 | 1M | Более мощная, 500 concurrency |
Сильные стороны: самый дешёвый reasoning API. Cache hits — на 98% дешевле cache miss. Поддержка форматов OpenAI и Anthropic. Thinking mode включён по умолчанию. FIM-completion для кода. 1M контекст для обеих моделей.
Ограничения: concurrency limits вместо RPM/TPM (2 500 для Flash, 500 для Pro). При пиковых нагрузках ограничения могут быть жёсткими. Минимум enterprise-контролей (нет data residency, ограниченный audit). Периодические проблемы с доступностью.
Когда выбирать DeepSeek: стоимость — главный приоритет, задачи на reasoning или код, допустимо concurrency-based throttling.
Источник: DeepSeek Models & Pricing, проверено 2026-07-28.
DashScope (Bailian) — экосистема Qwen
DashScope (百炼) от Alibaba Cloud — основной API для семейства моделей Qwen. Также хостит сторонние модели: GLM, Kimi, MiniMax. Платформа номер один для развёртывания в Китае.
Ключевые цены (июль 2026, регион Пекин):
| Модель | Input | Output | Контекст | Примечания |
|---|---|---|---|---|
| Qwen3.7-Max | ¥6/M (промо, обычно ¥12) | ¥18/M (промо, обычно ¥36) | 1M | Флагман, thinking + non-thinking |
| Qwen3-Max | ¥2.5/M (≤32K) | ¥10/M (≤32K) | 256K | Ступенчатая цена |
| Qwen3.7-Flash | ¥0.6/M | ¥1.2/M | 1M | Экономичная |
Сильные стороны: полная линейка Qwen (Max, Plus, Turbo, Flash, Coder, VL, Audio), OpenAI-совместимый endpoint (dashscope.aliyuncs.com/compatible-mode/v1), ступенчатые цены (короткий контекст дешевле), context caching (explicit + implicit), Batch API за полцены, multi-region (Пекин, Сингапур, Виргиния, Франкфурт, Токио).
Ограничения: международные цены в 1,4–1,8 раза выше китайских. Ступенчатые цены добавляют сложность. Rate limits по моделям и не всегда документированы. Масштабное retirement моделей сконцентрировано на 10 октября 2026 — проверьте календарь жизненного цикла DashScope перед выбором model ID.
Когда выбирать DashScope: нужно развёртывание в Китае, работа с Qwen, или выгоды от ступенчатых цен на коротком контексте.
Источник: DashScope Model Pricing, проверено 2026-07-28.
SiliconFlow — бесплатный доступ к open-weight моделям
SiliconFlow агрегирует 200+ open-weight и проприетарных моделей за единым OpenAI-совместимым API с бесплатным уровнем для небольших моделей.
Основные цены (июль 2026):
| Модель | Input | Output | Контекст | Примечания |
|---|---|---|---|---|
| DeepSeek V4-Flash (через SF) | $0.13 | $0.28 | 1M | Input чуть дешевле прямого подключения |
| DeepSeek V4-Pro (через SF) | $1.50 | $3.135 | 1M | Наценка vs прямое подключение |
| Kimi K3 | $3.00 | $15.00 | 1M | Новейшая reasoning-модель Moonshot |
| GLM-5.2 | $1.30 | $4.09 | 1M | Флагман Zhipu |
| Qwen3.6-27B | $0.30 | $3.20 | 262K | Open-weight Qwen |
| Малые модели | $0.00 | $0.00 | Разные | Навсегда бесплатные |
Сильные стороны: бесплатные модели для прототипирования, широкий каталог от нескольких вендоров, $1 бесплатных кредитов при регистрации, один API-ключ для разных семейств моделей, OpenAI-совместимый по умолчанию.
Ограничения: наценка на часть моделей по сравнению с прямым подключением. Бесплатные rate limits ограничены для production. SiliconFlow — не вендор модели, а инфраструктура инференса. Провайдер-специфичные функции (extended thinking, prompt caching) могут быть доступны не полностью.
Когда выбирать SiliconFlow: нужен один API-ключ для нескольких open-weight моделей, нужен бесплатный уровень для прототипов, или хотите сравнить модели без регистрации у каждого провайдера.
Источник: SiliconFlow Pricing, проверено 2026-07-28.
Матрица выбора по типу задачи
| Задача | Приоритет бюджета | Рекомендация | Почему |
|---|---|---|---|
| Общий чат/ассистент | Средний | OpenAI (GPT-5.6 Luna) или Anthropic (Haiku 4) | Широкая экосистема, низкая цена |
| Сложный reasoning | Качество | Anthropic (Opus 4.8 extended thinking) или OpenAI (o3) | Лучшие reasoning-бенчмарки |
| Бюджетный reasoning | Стоимость | DeepSeek V4-Flash | $0.14/$0.28 — в 10–35 раз дешевле |
| Развёртывание в Китае | Регуляторика | DashScope (Qwen3.7-Max) | Нативный хостинг в Китае, оплата в юанях |
| Мультимодальность | Функционал | Google Gemini 3.6 Flash | Нативная мультимодальность, конкурентная цена |
| Прототипирование | Бесплатно | SiliconFlow (бесплатные модели) или DeepSeek V4-Flash | $0 для старта |
| Coding agents | Качество + цена | Anthropic (Sonnet 5) или DeepSeek V4-Pro | Топ SWE-bench |
Rate Limits — скрытое ограничение
Цены привлекают внимание, но rate limits определяют, подойдёт ли провайдер для вашего паттерна трафика.
| Провайдер | Модель лимитов | Бесплатный / низкий уровень | Платный / высокий уровень | Примечания |
|---|---|---|---|---|
| OpenAI | RPM + TPM + RPD по уровню | Зависит от модели | Tier 5: до 10K RPM | Spend limits — отдельный 429 от rate limits |
| Anthropic | RPM + ITPM + OTPM по уровню | Tier 1: низкий | Tier 4: выше | Повышение требует истории расходов |
| RPM + TPM по проекту | Щедрый бесплатный | Vertex AI для масштабирования | По проекту, не по модели | |
| DeepSeek | По concurrency | — | 2 500 (Flash) / 500 (Pro) | Без RPM/TPM — лимит параллельных запросов |
| DashScope | RPM + TPM по модели | Зависит от модели | Выше на платных уровнях | Не всегда задокументировано |
| SiliconFlow | По тарифному плану | Бесплатный: ограничен | Платный: выше | Зависит от модели |
Подробнее — в нашем сравнении rate limits AI API 2026.
Совместимость с OpenAI SDK
Ключевой практический вопрос: можно ли использовать openai Python/Node SDK с base_url override для каждого провайдера?
| Провайдер | Работает с OpenAI SDK? | base_url | Auth | Нюансы |
|---|---|---|---|---|
| OpenAI | Нативно | https://api.openai.com/v1 | OPENAI_API_KEY | — |
| Anthropic | Через proxy/gateway | Не напрямую — другой формат API | ANTHROPIC_API_KEY | Нужен адаптер или gateway |
| Через proxy/gateway | Не напрямую — другой формат API | Google OAuth / API key | Нужен адаптер или gateway | |
| DeepSeek | Да | https://api.deepseek.com | DEEPSEEK_API_KEY | Поддерживает и Anthropic формат |
| DashScope | Да | https://dashscope.aliyuncs.com/compatible-mode/v1 | DASHSCOPE_API_KEY | Часть функций требует DashScope-специфичных headers |
| SiliconFlow | Да | https://api.siliconflow.cn/v1 | SILICONFLOW_API_KEY | Провайдер-специфичные функции могут не экспонироваться |
Для команд, уже использующих OpenAI SDK, DeepSeek, DashScope и SiliconFlow предлагают путь миграции с минимальным трением. Anthropic и Google требуют собственный SDK или routing gateway.
Пошаговый гид по миграции — OpenAI to TheRouter Migration Guide.
Как gateway меняет выбор провайдера
Мы создали TheRouter, чтобы решить конкретную проблему: смена провайдера не должна требовать переписывания приложения. TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров и поддерживает routing и fallback, когда product-пути это позволяют.
Что даёт gateway:
- Единый endpoint: один
base_url, один API key, несколько провайдеров за ним - Fallback: если провайдер A возвращает 429 или 5xx, маршрут переключается на провайдера B — по настроенным и протестированным fallback-путям
- Единый биллинг: один счёт вместо шести панелей провайдеров
Что gateway не делает:
- Не гарантирует доступность каждой модели от каждого провайдера (мы этого не заявляем)
- Не устраняет rate limits провайдера (они по-прежнему действуют upstream)
- Не делает провайдер-специфичные функции идентичными (extended thinking, prompt caching, managed agents — это функции конкретных провайдеров)
Сравнение gateway — отдельная тема. Смотрите Unified LLM API Gateway Comparison 2026 для сравнения OpenRouter, LiteLLM, Portkey, Cloudflare AI Gateway и TheRouter.
Сравнивая цены API между провайдерами, всегда нормализуйте кUSD за миллион токенов и разделяйте input и output. Большинство провайдеров берёт за output токены в 2–5 раз дороже, чем за input, поэтому нагрузка с длинными completion'ами при одной и той же номинальной цене обходится дороже.
- Одна валюта (USD) — конвертация на дату публикации с указанием курса.
- Разделяйте input/output — никогда не публикуйте смешанную цифру.
- Цитируйте каждую строку со страницы цен провайдера + дата извлечения.
- Указывайте тарифы длинного контекста — они часто скачут вверх.
Что не вошло в обзор
Сравнение сфокусировано на шести провайдерах, наиболее релевантных для пользователей TheRouter. Заметные упущения:
- xAI (Grok): рассмотрен в Grok 4.5 API Integration Guide. Сильный reasoning, премиальные цены ($5/$15 для Grok 4.3).
- Mistral: конкурентен для европейского развёртывания, менее релевантен для ориентированных на Китай пользователей.
- Volcengine (Ark): рассмотрен в Volcengine Ark vs DashScope. Платформа ByteDance с моделями Doubao/Seed.
- Meta (Llama): open-weight модели доступны через SiliconFlow, Fireworks и других inference-провайдеров, а не через собственный API Meta.
FAQ
Вопрос: Какой провайдер дешевле всех? DeepSeek V4-Flash — $0.14/$0.28 за миллион токенов. Input в 7 раз дешевле GPT-5.6 Luna и в 35 раз дешевле GPT-5.6 Sol. Для задач без reasoning бесплатные модели SiliconFlow не стоят ничего.
Вопрос: Можно ли использовать несколько провайдеров одновременно? Да. Большинство production-команд используют 2–3 провайдера. Gateway вроде TheRouter упрощает это, предоставляя единый endpoint с routing и fallback — при условии, что эти пути настроены и протестированы для нужных моделей.
Вопрос: У кого самые щедрые rate limits? Concurrency-модель DeepSeek (2 500 параллельных запросов для V4-Flash) исключительно щедра для высоконагруженных batch-задач. OpenAI и Anthropic ограничивают по RPM/TPM и требуют повышения уровня через историю расходов. Project-based лимиты Google щедры для экспериментов.
Вопрос: Как с data residency и compliance? OpenAI — data residency в 10 регионах. DashScope — единственный с нативным развёртыванием в Китае. Anthropic и Google предлагают enterprise-соглашения с конкретными compliance-обязательствами. У DeepSeek и SiliconFlow compliance-поверхность ограничена.
Вопрос: Как сравнить скидки prompt caching? OpenAI: 90% скидка на cached input. Anthropic: 90%. DeepSeek: 98% (cache hit V4-Flash — $0.0028/M). DashScope: 90% с explicit caching, implicit caching тоже доступен. SiliconFlow: зависит от модели.