Контекстные окна LLM API у разных провайдеров: максимальные токены, уровни цен и реальные ограничения (2026)
Кросс-провайдерный справочник по контекстным окнам LLM API в 2026 году. Сравнение максимального числа входных и выходных токенов, наценок за длинный контекст и практических ограничений у OpenAI, Anthropic, DeepSeek, DashScope, Google Gemini, Kimi и SiliconFlow.
Все крупные LLM API теперь заявляют контекстные окна в сотни тысяч, а иногда и в миллионы токенов. Практический вопрос для операторов — не чей показатель больше, а сколько на самом деле стоит это окно, какой лимит выходных токенов к нему прилагается и где провайдер молча увеличивает цену или снижает производительность при превышении порога.
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
Источники: OpenAI API Pricing, получено 2026-08-07; Anthropic Models Overview, получено 2026-08-07; DeepSeek Models & Pricing, получено 2026-08-07; DashScope Model Pricing, получено 2026-08-07; Google Gemini 3.5 Flash Model Card, получено 2026-08-07; Kimi K3 Guide, получено 2026-08-07.
Краткая сводка
| Провайдер | Модель | Контекстное окно | Макс. выход | Наценка за длинный контекст | OpenAI SDK совместимость |
|---|---|---|---|---|---|
| Gemini 3.5 Pro | 2M | 64K | Наценка свыше 128K | Через base_url override | |
| OpenAI | GPT-5.6 Sol/Terra/Luna | 1.05M | 128K | 2x input, 1.5x output свыше 272K | Нативная |
| Anthropic | Claude Opus 4.8 / Sonnet 5 | 1M | 128K (batch 300K) | Нет наценки | Через base_url override |
| DeepSeek | V4 Pro / V4 Flash | 1M | 384K | Нет наценки | Нативная |
| DashScope | Qwen3.8-Max / Qwen3.7-Max | 1M | 128K | Фиксированная цена; у старых Qwen3-Max ступенчатая | OpenAI-совместимый endpoint |
| Kimi | K3 | 1M | — | — | Через base_url override |
| SiliconFlow | Зависит от модели | До 1M | Зависит от модели | Нет наценки | Нативная |
| Gemini 3.5 Flash | 1M | 64K | Наценка свыше 128K | Через base_url override |
Данные по состоянию на август 2026 года. «Контекстное окно» означает максимальное количество токенов (вход + выход) в одном запросе, если не указано иное. Всегда сверяйтесь с актуальной документацией провайдера.
OpenAI — Длинный контекст стоит 2x
OpenAI ввела явное разделение на short-context и long-context тарифы в семействе GPT-5.6. Граница проходит на 272K токенов.
Характеристики контекста GPT-5.6
| Модель | Контекстное окно | Макс. выход | Short-context input | Long-context input | Short-context output | Long-context output |
|---|---|---|---|---|---|---|
| GPT-5.6 Sol | 1.05M | 128K | $5.00 | $10.00 | $30.00 | $45.00 |
| GPT-5.6 Terra | 1.05M | 128K | $2.00 | $4.00 | $12.00 | $18.00 |
| GPT-5.6 Luna | 1.05M | 128K | $0.20 | $0.40 | $1.20 | $1.80 |
Как только суммарное количество токенов в запросе превышает 272K, цена входных токенов удваивается, а выходных — увеличивается в 1.5 раза. Порог применяется ко всему запросу целиком, а не пропорционально.
Кэширование помогает. Кэш-хит для Sol стоит $0.50/M (обычная short-context цена — $5.00/M), в long-context режиме кэш-хит — $1.00/M. Если между запросами повторяется один и тот же system prompt или набор документов, кэширование может снизить эффективную стоимость длинного контекста до уровня короткого.
Старые модели. GPT-5.5 поддерживает 1.05M контекст с 128K максимальным выходом и той же границей 272K. GPT-5.4 ограничен 272K. GPT-5.4-mini и GPT-5.4-nano не имеют long-context тарифа.
Подробнее в Сравнение модельных уровней GPT-5.6 Sol, Terra и Luna.
Anthropic — 1M контекст, без наценки
В марте 2026 года Anthropic сделала 1M контекстное окно общедоступным для Claude Opus 4.8 и Claude Sonnet 5, не добавив отдельного long-context тарифа.
Характеристики контекста Claude
| Модель | Контекстное окно | Макс. выход | Цена входа | Цена выхода |
|---|---|---|---|---|
| Claude Opus 4.8 | 1M | 128K (batch 300K) | $5.00 | $25.00 |
| Claude Sonnet 5 | 1M | 128K (batch 300K) | $2.00 | $10.00 |
| Claude Sonnet 4 | 200K | 128K | $3.00 | $15.00 |
| Claude Haiku 3.5 | 200K | 8K | $0.80 | $4.00 |
Отсутствие наценки за длинный контекст делает Claude одним из самых выгодных вариантов для нагрузок, регулярно использующих 300K–1M токенов. Prompt caching снижает стоимость кэшированных входных токенов до 10% от базовой цены ($0.50/M для Opus 4.8, $0.20/M для Sonnet 5).
Extended thinking потребляет выходные токены из того же бюджета. Запрос, использующий 60K thinking-токенов, оставляет 68K для видимого ответа (128K всего). В batch API лимит 300K даёт больше пространства для задач с интенсивным reasoning.
Подробнее в Полное руководство по Anthropic Claude API.
DeepSeek — 1M контекст, 384K выход, самая низкая цена за токен
DeepSeek V4 предлагает самый большой максимальный выход среди всех API — 384K токенов, в сочетании с 1M контекстным окном и без наценки за длинный контекст.
Характеристики контекста DeepSeek V4
| Модель | Контекстное окно | Макс. выход | Вход (без кэша) | Вход (кэш-хит) | Выход |
|---|---|---|---|---|---|
| V4 Flash | 1M | 384K | $0.14 | $0.0028 | $0.28 |
| V4 Pro | 1M | 384K | $0.435 | $0.003625 | $0.87 |
Скидка на кэш-хиты составляет 98% — самая агрессивная среди всех провайдеров. При высоком перекрытии префиксов между запросами V4 Flash с кэшированием обеспечивает эффективную стоимость входных токенов менее $0.003/M, независимо от длины контекста.
Обе модели нативно поддерживают форматы OpenAI и Anthropic API. Лимит конкурентности — 2 500 для V4 Flash и 500 для V4 Pro.
Важно: DeepSeek объявил о планах существенно повысить цены на API. Текущие цены могут измениться. Подробнее в Полное руководство по DeepSeek API.
DashScope (Alibaba Bailian) — Ступенчатое ценообразование по длине контекста
DashScope отличается ступенчатым ценообразованием, при котором стоимость токена растёт по мере увеличения общего количества токенов в одном запросе.
Характеристики контекста серии Qwen3 Max (регион Пекин, юаней за 1M токенов)
| Модель | Контекстное окно | Макс. выход | Вход ≤32K | Вход 32K–128K | Вход 128K–1M | Выход |
|---|---|---|---|---|---|---|
| Qwen3.8-Max | 1M | 128K | ¥12 | ¥12 (ед. цена) | ¥12 (ед. цена) | ¥36 |
| Qwen3.7-Max | 1M | 128K | ¥12 (акция ¥6) | ¥12 (акция ¥6) | ¥12 (акция ¥6) | ¥36 (акция ¥18) |
| Qwen3-Max | 256K | 128K | ¥2.5 | ¥4 | ¥7 | ¥10–¥28 |
Qwen3.8-Max и Qwen3.7-Max перешли на единую цену в пределах 1M токенов. По текущим акционным ценам Qwen3.7-Max стоит примерно $0.83/M вход (¥6) и $2.48/M выход (¥18) — конкурентоспособно с DeepSeek V4 Pro на задачах с длинным контекстом, особенно с учётом скидок на кэширование контекста у DashScope.
Подробнее в Полное руководство по DashScope Qwen3.7.
Google Gemini — 2M контекст на Pro, 1M на Flash
Google предлагает самое большое контекстное окно среди продуктовых API — 2M токенов на Gemini 3.5 Pro.
Характеристики контекста Gemini
| Модель | Контекстное окно | Макс. выход | Цена входа | Цена выхода | Наценка за длинный контекст |
|---|---|---|---|---|---|
| Gemini 3.5 Pro | 2M | 64K | Варьируется | Варьируется | Свыше 128K |
| Gemini 3.5 Flash | 1M | 64K | $1.50 | $9.00 | Свыше 128K |
| Gemini 3.6 Flash | 1M | 64K | — | — | — |
64K максимального выхода — самый низкий показатель среди флагманских моделей в этом сравнении.
Kimi K3 — 1M контекст, открытые веса
Kimi K3 от Moonshot — 1M контекстное окно, 2.8 триллиона параметров. Веса опубликованы 27 июля 2026 года.
Характеристики контекста Kimi K3
| Модель | Контекстное окно | Макс. выход | Цена входа | Цена выхода |
|---|---|---|---|---|
| K3 | 1M (1 048 576) | — | $0.35 | $2.00 |
| K3 (thinking-токены) | 1M | — | — | $1.40 |
K3 поддерживает настройку reasoning effort (пока доступен только уровень max). Thinking-токены тарифицируются по сниженной цене выходных токенов. Модель также доступна на DashScope как hosted third-party модель.
Подробнее в Руководство по интеграции Kimi K3 API.
SiliconFlow — Hosted-модели с открытыми весами
SiliconFlow хостит 200+ моделей с открытыми весами и OpenAI-совместимым API. Контекстное окно зависит от конкретной модели.
| Hosted-модель | Контекстное окно | Макс. выход | Цена (вход/выход за 1M) |
|---|---|---|---|
| DeepSeek V4 Flash (hosted) | До 1M | Зависит от модели | Есть бесплатный уровень |
| Qwen3 серия (hosted) | 32K–128K | Зависит от модели | Варьируется |
| Другие open-weight | 4K–128K | Зависит от модели | Некоторые бесплатно |
SiliconFlow не берёт дополнительную наценку за длинный контекст. Подробнее в Руководство по маршрутизации бесплатных моделей SiliconFlow.
Дерево решений: выбор провайдера по требованиям к контексту
- Нужно больше 1M контекста? → Google Gemini 3.5 Pro (2M) — единственный вариант.
- Нужно больше 128K выходных токенов? → DeepSeek V4 (384K макс. выход) — единственный вариант.
- Средний запрос меньше 272K токенов? → OpenAI GPT-5.6 Luna ($0.20/$1.20) или DeepSeek V4 Flash ($0.14/$0.28) обойдутся дешевле всего.
- Регулярно отправляете 300K–1M токенов? → Anthropic (без наценки) или DeepSeek (без наценки + самая низкая базовая цена) выгоднее OpenAI (наценка 2x свыше 272K).
- Нужен deployment в Китае? → DashScope Qwen3.7-Max или Qwen3.8-Max (1M контекст, оплата в юанях, регионы Пекин/Сингапур).
- Нужен бесплатный уровень для прототипирования? → SiliconFlow (бесплатный уровень для ряда моделей) или DashScope (бесплатная квота для новых аккаунтов).
Реальная стоимость длинного контекста: запрос в 500K токенов
Следующая таблица показывает фактическую стоимость одного запроса с 500K входных и 10K выходных токенов, с кэшированием и без:
| Провайдер | Модель | 500K вход + 10K выход (без кэша) | С 80% кэш-хитом |
|---|---|---|---|
| OpenAI | GPT-5.6 Sol | $5.45 (long-context тариф) | $1.35 |
| OpenAI | GPT-5.6 Luna | $0.21 | $0.05 |
| Anthropic | Claude Opus 4.8 | $2.75 | $0.50 |
| Anthropic | Claude Sonnet 5 | $1.10 | $0.22 |
| DeepSeek | V4 Flash | $0.073 | $0.004 |
| DeepSeek | V4 Pro | $0.226 | $0.012 |
| DashScope | Qwen3.7-Max (акция) | ≈$0.47 | ≈$0.10 |
| Gemini 3.5 Flash | ≈$0.84 | — |
DeepSeek V4 Flash с кэшированием примерно в 1 300 раз дешевле, чем OpenAI GPT-5.6 Sol при одинаковых long-context нагрузках. Без кэширования разница составляет 75x. Это самая значимая переменная стоимости при маршрутизации между провайдерами.
Практические ограничения за пределами заявленных цифр
Эффективное vs. заявленное окно. Некоторые провайдеры фактически предоставляют окно меньше заявленного. Например, продукт Codex от OpenAI, по отзывам пользователей, открывает только ~258K токенов из 1.05M окна GPT-5.6. API и продуктовый интерфейс могут различаться.
Пропускная способность при длинном контексте. Заполнение 1M-токенного окна требует времени и на передачу, и на обработку. У всех провайдеров время до первого токена (TTFT) и скорость генерации (TPS) снижаются с ростом длины контекста.
Различия в подсчёте токенов. Провайдеры используют разные tokenizer'ы. Один и тот же документ даёт разное количество токенов у OpenAI (tiktoken), Anthropic (Claude tokenizer) и DeepSeek (собственный tokenizer). Окно в 1M токенов у одного провайдера вмещает не ровно тот же объём текста, что 1M у другого.
Поведение при превышении. Провайдеры по-разному обрабатывают запросы, превышающие контекстное окно. Одни молча обрезают вход (удаляя самые старые сообщения), другие возвращают ошибку, третьи обрезают, но предупреждают в метаданных ответа. Перед запуском в продакшен обязательно протестируйте со сверхдлинными входами.
TheRouter и маршрутизация по длине контекста
OpenAI-совместимый router вроде TheRouter может оценивать длину входных данных и принимать решения о маршрутизации:
- Короткие запросы (до 32K токенов) — направлять к дешёвым моделям (DeepSeek V4 Flash, GPT-5.6 Luna, бесплатные модели SiliconFlow)
- Средние запросы (32K–272K токенов) — ещё попадают в short-context тариф OpenAI, маршрутизация по предпочтению качество/стоимость
- Длинные запросы (272K+ токенов) — избегать OpenAI из-за наценки 2x, направлять к DeepSeek V4 или Anthropic Claude с фиксированной ценой
- Сверхдлинные запросы (1M+ токенов) — только Google Gemini 3.5 Pro поддерживает этот диапазон
Такая маршрутизация с учётом длины контекста — одна из самых рентабельных оптимизаций при работе с несколькими провайдерами. Подробнее в Стратегии оптимизации стоимости LLM API и Маршрутизация с fallback.
FAQ
Какой провайдер лучше всего подходит для длинного контекста по цене?
DeepSeek V4 Flash — с большим отрывом. $0.14/M вход и $0.28/M выход без наценки за длинный контекст, скидка на кэш-хиты 98%. При любой длине контекста до 1M токенов это самый дешёвый вариант. Но DeepSeek предупредил о предстоящем повышении цен.
Можно ли использовать полное контекстное окно с extended thinking / reasoning?
Thinking-токены расходуют бюджет выходных токенов, не контекстного окна. У Claude 60K thinking-токенов оставляют 68K для видимого ответа (128K всего). У DeepSeek V4 максимальный выход 384K даёт достаточно места для thinking + ответ. У OpenAI o3/o4-mini reasoning-токены отделены от контекстного окна, но влияют на стоимость.
Максимальный выход масштабируется пропорционально контекстному окну?
Нет. Google Gemini предлагает самый большой контекст (2M), но самый маленький максимальный выход (64K). DeepSeek предлагает самый большой выход (384K) с 1M контекстом. Между провайдерами нет единого соотношения.
Существуют ли модели с неограниченным контекстом?
По состоянию на август 2026 года ни одно продуктовое API не предлагает неограниченный контекст. 2M токенов (Gemini 3.5 Pro) — текущий максимум.
Как оценить количество токенов до отправки запроса?
Используйте библиотеку tokenizer провайдера. OpenAI публикует tiktoken (open source). Anthropic предоставляет API для подсчёта токенов. Грубое правило: 1 токен ≈ 4 символа в английском или ≈ 1.5 символа в китайском, но реальные значения зависят от tokenizer.