← Все статьи

Контекстные окна LLM API у разных провайдеров: максимальные токены, уровни цен и реальные ограничения (2026)

Кросс-провайдерный справочник по контекстным окнам LLM API в 2026 году. Сравнение максимального числа входных и выходных токенов, наценок за длинный контекст и практических ограничений у OpenAI, Anthropic, DeepSeek, DashScope, Google Gemini, Kimi и SiliconFlow.

· updated 2026-08-07· TheRouter

Все крупные LLM API теперь заявляют контекстные окна в сотни тысяч, а иногда и в миллионы токенов. Практический вопрос для операторов — не чей показатель больше, а сколько на самом деле стоит это окно, какой лимит выходных токенов к нему прилагается и где провайдер молча увеличивает цену или снижает производительность при превышении порога.

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Источники: OpenAI API Pricing, получено 2026-08-07; Anthropic Models Overview, получено 2026-08-07; DeepSeek Models & Pricing, получено 2026-08-07; DashScope Model Pricing, получено 2026-08-07; Google Gemini 3.5 Flash Model Card, получено 2026-08-07; Kimi K3 Guide, получено 2026-08-07.

Краткая сводка

ПровайдерМодельКонтекстное окноМакс. выходНаценка за длинный контекстOpenAI SDK совместимость
GoogleGemini 3.5 Pro2M64KНаценка свыше 128KЧерез base_url override
OpenAIGPT-5.6 Sol/Terra/Luna1.05M128K2x input, 1.5x output свыше 272KНативная
AnthropicClaude Opus 4.8 / Sonnet 51M128K (batch 300K)Нет наценкиЧерез base_url override
DeepSeekV4 Pro / V4 Flash1M384KНет наценкиНативная
DashScopeQwen3.8-Max / Qwen3.7-Max1M128KФиксированная цена; у старых Qwen3-Max ступенчатаяOpenAI-совместимый endpoint
KimiK31M——Через base_url override
SiliconFlowЗависит от моделиДо 1MЗависит от моделиНет наценкиНативная
GoogleGemini 3.5 Flash1M64KНаценка свыше 128KЧерез base_url override

Данные по состоянию на август 2026 года. «Контекстное окно» означает максимальное количество токенов (вход + выход) в одном запросе, если не указано иное. Всегда сверяйтесь с актуальной документацией провайдера.

OpenAI — Длинный контекст стоит 2x

OpenAI ввела явное разделение на short-context и long-context тарифы в семействе GPT-5.6. Граница проходит на 272K токенов.

Характеристики контекста GPT-5.6

МодельКонтекстное окноМакс. выходShort-context inputLong-context inputShort-context outputLong-context output
GPT-5.6 Sol1.05M128K$5.00$10.00$30.00$45.00
GPT-5.6 Terra1.05M128K$2.00$4.00$12.00$18.00
GPT-5.6 Luna1.05M128K$0.20$0.40$1.20$1.80

Как только суммарное количество токенов в запросе превышает 272K, цена входных токенов удваивается, а выходных — увеличивается в 1.5 раза. Порог применяется ко всему запросу целиком, а не пропорционально.

Кэширование помогает. Кэш-хит для Sol стоит $0.50/M (обычная short-context цена — $5.00/M), в long-context режиме кэш-хит — $1.00/M. Если между запросами повторяется один и тот же system prompt или набор документов, кэширование может снизить эффективную стоимость длинного контекста до уровня короткого.

Старые модели. GPT-5.5 поддерживает 1.05M контекст с 128K максимальным выходом и той же границей 272K. GPT-5.4 ограничен 272K. GPT-5.4-mini и GPT-5.4-nano не имеют long-context тарифа.

Подробнее в Сравнение модельных уровней GPT-5.6 Sol, Terra и Luna.

Anthropic — 1M контекст, без наценки

В марте 2026 года Anthropic сделала 1M контекстное окно общедоступным для Claude Opus 4.8 и Claude Sonnet 5, не добавив отдельного long-context тарифа.

Характеристики контекста Claude

МодельКонтекстное окноМакс. выходЦена входаЦена выхода
Claude Opus 4.81M128K (batch 300K)$5.00$25.00
Claude Sonnet 51M128K (batch 300K)$2.00$10.00
Claude Sonnet 4200K128K$3.00$15.00
Claude Haiku 3.5200K8K$0.80$4.00

Отсутствие наценки за длинный контекст делает Claude одним из самых выгодных вариантов для нагрузок, регулярно использующих 300K–1M токенов. Prompt caching снижает стоимость кэшированных входных токенов до 10% от базовой цены ($0.50/M для Opus 4.8, $0.20/M для Sonnet 5).

Extended thinking потребляет выходные токены из того же бюджета. Запрос, использующий 60K thinking-токенов, оставляет 68K для видимого ответа (128K всего). В batch API лимит 300K даёт больше пространства для задач с интенсивным reasoning.

Подробнее в Полное руководство по Anthropic Claude API.

DeepSeek — 1M контекст, 384K выход, самая низкая цена за токен

DeepSeek V4 предлагает самый большой максимальный выход среди всех API — 384K токенов, в сочетании с 1M контекстным окном и без наценки за длинный контекст.

Характеристики контекста DeepSeek V4

МодельКонтекстное окноМакс. выходВход (без кэша)Вход (кэш-хит)Выход
V4 Flash1M384K$0.14$0.0028$0.28
V4 Pro1M384K$0.435$0.003625$0.87

Скидка на кэш-хиты составляет 98% — самая агрессивная среди всех провайдеров. При высоком перекрытии префиксов между запросами V4 Flash с кэшированием обеспечивает эффективную стоимость входных токенов менее $0.003/M, независимо от длины контекста.

Обе модели нативно поддерживают форматы OpenAI и Anthropic API. Лимит конкурентности — 2 500 для V4 Flash и 500 для V4 Pro.

Важно: DeepSeek объявил о планах существенно повысить цены на API. Текущие цены могут измениться. Подробнее в Полное руководство по DeepSeek API.

DashScope (Alibaba Bailian) — Ступенчатое ценообразование по длине контекста

DashScope отличается ступенчатым ценообразованием, при котором стоимость токена растёт по мере увеличения общего количества токенов в одном запросе.

Характеристики контекста серии Qwen3 Max (регион Пекин, юаней за 1M токенов)

МодельКонтекстное окноМакс. выходВход ≤32KВход 32K–128KВход 128K–1MВыход
Qwen3.8-Max1M128K¥12¥12 (ед. цена)¥12 (ед. цена)¥36
Qwen3.7-Max1M128K¥12 (акция ¥6)¥12 (акция ¥6)¥12 (акция ¥6)¥36 (акция ¥18)
Qwen3-Max256K128K¥2.5¥4¥7¥10–¥28

Qwen3.8-Max и Qwen3.7-Max перешли на единую цену в пределах 1M токенов. По текущим акционным ценам Qwen3.7-Max стоит примерно $0.83/M вход (¥6) и $2.48/M выход (¥18) — конкурентоспособно с DeepSeek V4 Pro на задачах с длинным контекстом, особенно с учётом скидок на кэширование контекста у DashScope.

Подробнее в Полное руководство по DashScope Qwen3.7.

Google Gemini — 2M контекст на Pro, 1M на Flash

Google предлагает самое большое контекстное окно среди продуктовых API — 2M токенов на Gemini 3.5 Pro.

Характеристики контекста Gemini

МодельКонтекстное окноМакс. выходЦена входаЦена выходаНаценка за длинный контекст
Gemini 3.5 Pro2M64KВарьируетсяВарьируетсяСвыше 128K
Gemini 3.5 Flash1M64K$1.50$9.00Свыше 128K
Gemini 3.6 Flash1M64K———

64K максимального выхода — самый низкий показатель среди флагманских моделей в этом сравнении.

Kimi K3 — 1M контекст, открытые веса

Kimi K3 от Moonshot — 1M контекстное окно, 2.8 триллиона параметров. Веса опубликованы 27 июля 2026 года.

Характеристики контекста Kimi K3

МодельКонтекстное окноМакс. выходЦена входаЦена выхода
K31M (1 048 576)—$0.35$2.00
K3 (thinking-токены)1M——$1.40

K3 поддерживает настройку reasoning effort (пока доступен только уровень max). Thinking-токены тарифицируются по сниженной цене выходных токенов. Модель также доступна на DashScope как hosted third-party модель.

Подробнее в Руководство по интеграции Kimi K3 API.

SiliconFlow — Hosted-модели с открытыми весами

SiliconFlow хостит 200+ моделей с открытыми весами и OpenAI-совместимым API. Контекстное окно зависит от конкретной модели.

Hosted-модельКонтекстное окноМакс. выходЦена (вход/выход за 1M)
DeepSeek V4 Flash (hosted)До 1MЗависит от моделиЕсть бесплатный уровень
Qwen3 серия (hosted)32K–128KЗависит от моделиВарьируется
Другие open-weight4K–128KЗависит от моделиНекоторые бесплатно

SiliconFlow не берёт дополнительную наценку за длинный контекст. Подробнее в Руководство по маршрутизации бесплатных моделей SiliconFlow.

Дерево решений: выбор провайдера по требованиям к контексту

  1. Нужно больше 1M контекста? → Google Gemini 3.5 Pro (2M) — единственный вариант.
  2. Нужно больше 128K выходных токенов? → DeepSeek V4 (384K макс. выход) — единственный вариант.
  3. Средний запрос меньше 272K токенов? → OpenAI GPT-5.6 Luna ($0.20/$1.20) или DeepSeek V4 Flash ($0.14/$0.28) обойдутся дешевле всего.
  4. Регулярно отправляете 300K–1M токенов? → Anthropic (без наценки) или DeepSeek (без наценки + самая низкая базовая цена) выгоднее OpenAI (наценка 2x свыше 272K).
  5. Нужен deployment в Китае? → DashScope Qwen3.7-Max или Qwen3.8-Max (1M контекст, оплата в юанях, регионы Пекин/Сингапур).
  6. Нужен бесплатный уровень для прототипирования? → SiliconFlow (бесплатный уровень для ряда моделей) или DashScope (бесплатная квота для новых аккаунтов).

Реальная стоимость длинного контекста: запрос в 500K токенов

Следующая таблица показывает фактическую стоимость одного запроса с 500K входных и 10K выходных токенов, с кэшированием и без:

ПровайдерМодель500K вход + 10K выход (без кэша)С 80% кэш-хитом
OpenAIGPT-5.6 Sol$5.45 (long-context тариф)$1.35
OpenAIGPT-5.6 Luna$0.21$0.05
AnthropicClaude Opus 4.8$2.75$0.50
AnthropicClaude Sonnet 5$1.10$0.22
DeepSeekV4 Flash$0.073$0.004
DeepSeekV4 Pro$0.226$0.012
DashScopeQwen3.7-Max (акция)≈$0.47≈$0.10
GoogleGemini 3.5 Flash≈$0.84—

DeepSeek V4 Flash с кэшированием примерно в 1 300 раз дешевле, чем OpenAI GPT-5.6 Sol при одинаковых long-context нагрузках. Без кэширования разница составляет 75x. Это самая значимая переменная стоимости при маршрутизации между провайдерами.

Практические ограничения за пределами заявленных цифр

Эффективное vs. заявленное окно. Некоторые провайдеры фактически предоставляют окно меньше заявленного. Например, продукт Codex от OpenAI, по отзывам пользователей, открывает только ~258K токенов из 1.05M окна GPT-5.6. API и продуктовый интерфейс могут различаться.

Пропускная способность при длинном контексте. Заполнение 1M-токенного окна требует времени и на передачу, и на обработку. У всех провайдеров время до первого токена (TTFT) и скорость генерации (TPS) снижаются с ростом длины контекста.

Различия в подсчёте токенов. Провайдеры используют разные tokenizer'ы. Один и тот же документ даёт разное количество токенов у OpenAI (tiktoken), Anthropic (Claude tokenizer) и DeepSeek (собственный tokenizer). Окно в 1M токенов у одного провайдера вмещает не ровно тот же объём текста, что 1M у другого.

Поведение при превышении. Провайдеры по-разному обрабатывают запросы, превышающие контекстное окно. Одни молча обрезают вход (удаляя самые старые сообщения), другие возвращают ошибку, третьи обрезают, но предупреждают в метаданных ответа. Перед запуском в продакшен обязательно протестируйте со сверхдлинными входами.

TheRouter и маршрутизация по длине контекста

OpenAI-совместимый router вроде TheRouter может оценивать длину входных данных и принимать решения о маршрутизации:

  • Короткие запросы (до 32K токенов) — направлять к дешёвым моделям (DeepSeek V4 Flash, GPT-5.6 Luna, бесплатные модели SiliconFlow)
  • Средние запросы (32K–272K токенов) — ещё попадают в short-context тариф OpenAI, маршрутизация по предпочтению качество/стоимость
  • Длинные запросы (272K+ токенов) — избегать OpenAI из-за наценки 2x, направлять к DeepSeek V4 или Anthropic Claude с фиксированной ценой
  • Сверхдлинные запросы (1M+ токенов) — только Google Gemini 3.5 Pro поддерживает этот диапазон

Такая маршрутизация с учётом длины контекста — одна из самых рентабельных оптимизаций при работе с несколькими провайдерами. Подробнее в Стратегии оптимизации стоимости LLM API и Маршрутизация с fallback.

FAQ

Какой провайдер лучше всего подходит для длинного контекста по цене?

DeepSeek V4 Flash — с большим отрывом. $0.14/M вход и $0.28/M выход без наценки за длинный контекст, скидка на кэш-хиты 98%. При любой длине контекста до 1M токенов это самый дешёвый вариант. Но DeepSeek предупредил о предстоящем повышении цен.

Можно ли использовать полное контекстное окно с extended thinking / reasoning?

Thinking-токены расходуют бюджет выходных токенов, не контекстного окна. У Claude 60K thinking-токенов оставляют 68K для видимого ответа (128K всего). У DeepSeek V4 максимальный выход 384K даёт достаточно места для thinking + ответ. У OpenAI o3/o4-mini reasoning-токены отделены от контекстного окна, но влияют на стоимость.

Максимальный выход масштабируется пропорционально контекстному окну?

Нет. Google Gemini предлагает самый большой контекст (2M), но самый маленький максимальный выход (64K). DeepSeek предлагает самый большой выход (384K) с 1M контекстом. Между провайдерами нет единого соотношения.

Существуют ли модели с неограниченным контекстом?

По состоянию на август 2026 года ни одно продуктовое API не предлагает неограниченный контекст. 2M токенов (Gemini 3.5 Pro) — текущий максимум.

Как оценить количество токенов до отправки запроса?

Используйте библиотеку tokenizer провайдера. OpenAI публикует tiktoken (open source). Anthropic предоставляет API для подсчёта токенов. Грубое правило: 1 токен ≈ 4 символа в английском или ≈ 1.5 символа в китайском, но реальные значения зависят от tokenizer.

Помощь и контакты