Экономика цен на контекстное окно AI-моделей: стоимость полезного токена у провайдеров с 1M+ контекстом
Все фронтирные модели заявляют 1M токенов, но заполнение этого окна стоит от $0.15 до $10. Разбираем реальную стоимость на глубинах 128K, 256K, 512K и 1M у OpenAI, Anthropic, Google, DeepSeek и DashScope, и показываем, как context-aware routing держит счёт под контролем.
За 30 секунд: все фронтирные модели сентября 2026 заявляют контекстное окно в 1M токенов, но реальная стоимость заполнения этого окна отличается более чем в 70 раз. 1M входных токенов на DeepSeek V4.1 Flash (непиковое время) стоит $0.15, а на OpenAI GPT-6 Astra (long-context тариф) — $20.00. Кэширование, ступенчатые тарифы и стоимость вывода расширяют этот разрыв ещё больше. На этой справочной странице мы считаем реальные затраты на четырёх глубинах контекста (128K, 256K, 512K, 1M) у основных провайдеров, а затем показываем, как маршрутизация по длине контекста удерживает счёт под контролем.
Эта статья не повторяет наш справочник по лимитам контекстных окон, который описывает размеры окон и бенчмарки effective context. И это не наше сравнение prompt caching, которое разбирает механику кэширования. Здесь мы моделируем долларовую стоимость заполнения контекста в масштабе — вопрос, который большинство команд игнорирует до прихода счёта.
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
Таблица цен на контекст 1M
Все цены за 1M токенов, в долларах США, по состоянию на сентябрь 2026. Где провайдер использует ступенчатое ценообразование (разные ставки выше порога контекста), показаны обе ступени.
| Провайдер | Модель | Контекст | Вход $/M | Вход $/M (длинный) | Cache hit $/M | Выход $/M | Выход $/M (длинный) |
|---|---|---|---|---|---|---|---|
| OpenAI | GPT-6 Astra | 1M | $10.00 | $20.00 (>272K) | $1.00 / $2.00 | $50.00 | $75.00 |
| OpenAI | GPT-5.6 Sol | 1M | $4.00 | $8.00 (>272K) | $0.40 / $0.80 | $20.00 | $30.00 |
| OpenAI | GPT-5.6 Luna | 1M | $0.20 | $0.40 (>272K) | $0.02 / $0.04 | $1.20 | $1.80 |
| Anthropic | Claude Fable 5.1 | 1M | $10.00 | фикс. | $0.25 | $50.00 | фикс. |
| Anthropic | Claude Opus 4.8 | 1M | $5.00 | фикс. | $0.50 | $25.00 | фикс. |
| Anthropic | Claude Sonnet 5 | 1M | $2.00 | фикс. | $0.20 | $10.00 | фикс. |
| Gemini 3.8 Flash | 1M | $0.75 | $1.50 (>200K) | $0.075 | $3.75 | $7.50 | |
| DeepSeek | V4.1 Flash | 1M | $0.15 (внепик) / $0.30 (пик) | фикс. | $0.003 / $0.006 | $0.60 / $1.20 | фикс. |
| DeepSeek | V4 Pro | 1M | $0.66 / $1.32 | фикс. | $0.022 / $0.044 | $1.98 / $3.96 | фикс. |
| DashScope | Qwen3.8-Max | 1M | $2.00 | фикс. | $0.25 | $6.00 | фикс. |
Источники: OpenAI pricing (получено 2026-09-19), Anthropic pricing (получено 2026-09-19), DeepSeek pricing (получено 2026-09-19), DashScope pricing (получено 2026-09-19), Gemini pricing через сторонние агрегаторы (получено 2026-09-19).
Три закономерности:
- OpenAI удваивает цену на длинный контекст. Модели GPT-5.6 и GPT-6 при превышении 272K токенов берут 2x за вход и 1.5x за выход. Промпт в 500K токенов на GPT-5.6 Sol обойдётся в $4.00 за первые 272K и $8.00/M за остальное — средняя ставка около $5.50/M.
- Anthropic и DeepSeek держат фиксированную ставку. Промпт в 1M токенов стоит столько же за токен, как и промпт в 10K. При длинном контексте не бывает сюрпризов.
- Кэширование доминирует в масштабе. Cache hit на DeepSeek V4.1 Flash (внепиковое время) стоит $0.003/M — на 98% ниже и без того дешёвой ставки cache miss. Cache hit на Anthropic Fable 5.1 стоит $0.25/M — снижение на 97.5% от базовых $10.00/M.
Сколько реально стоит заполнить контекстное окно?
Таблица выше показывает ставки за миллион токенов. Ниже — сколько вы заплатите, заполнив окно до конкретной глубины (только вход, без кэширования и вывода).
| Глубина контекста | DeepSeek V4.1 Flash (внепик) | GPT-5.6 Luna | Gemini 3.8 Flash | Qwen3.8-Max | Claude Sonnet 5 | GPT-5.6 Sol | Claude Opus 4.8 | GPT-6 Astra |
|---|---|---|---|---|---|---|---|---|
| 128K токенов | $0.02 | $0.03 | $0.10 | $0.26 | $0.26 | $0.51 | $0.64 | $1.28 |
| 256K токенов | $0.04 | $0.05 | $0.19 | $0.51 | $0.51 | $1.02 | $1.28 | $2.56 |
| 512K токенов | $0.08 | $0.10 | $0.58 | $1.02 | $1.02 | $2.88 | $2.56 | $7.68 |
| 1M токенов | $0.15 | $0.20 | $1.13 | $2.00 | $2.00 | $5.60 | $5.00 | $14.60 |
Примечания: для GPT-5.6 Sol и GPT-6 Astra на 1M используются смешанные ставки (первые 272K по short-context тарифу, оставшиеся 728K по long-context тарифу). Для Gemini 3.8 Flash на 512K и 1M — смешанные ставки (первые 200K по $0.75, остальные по $1.50). DeepSeek — внепиковые ставки.
Разрыв между DeepSeek V4.1 Flash ($0.15) и GPT-6 Astra ($14.60) на 1M токенов составляет примерно 97 раз. Обе модели заявляют 1M-токенное окно. Разница отражает архитектуру, позиционирование и политику ступенчатого ценообразования.
При нагрузке 100 запросов в день по 500K токенов контекста ежемесячный счёт только за вход варьируется от примерно $240 (DeepSeek V4.1 Flash внепик) до примерно $23,000 (GPT-6 Astra). Это разница уровня найма сотрудника.
Кэширование меняет экономику при масштабировании
Входная цена без кэширования — только часть картины. Если ваша нагрузка содержит повторяющиеся префиксы (system prompt, tool schema, общие документные фрагменты), кэширование радикально снижает эффективную входную стоимость.
| Провайдер | Модель | Cache miss $/M | Cache hit $/M | Экономия | Сколько hit-ов окупают один write |
|---|---|---|---|---|---|
| DeepSeek | V4.1 Flash (внепик) | $0.15 | $0.003 | 98% | 1 (нет надбавки за write) |
| Anthropic | Claude Sonnet 5 | $2.00 | $0.20 | 90% | ~1.2 (5-мин. write $2.50) |
| Anthropic | Claude Fable 5.1 | $10.00 | $0.25 | 97.5% | ~1.3 (5-мин. write $12.50) |
| OpenAI | GPT-5.6 Sol | $4.00 | $0.40 | 90% | ~1.4 (write $5.00) |
| Gemini 3.8 Flash | $0.75 | $0.075 | 90% | context caching бесплатно до декабря 2026 | |
| DashScope | Qwen3.8-Max | $2.00 | $0.25 | 87.5% | зависит от режима кэширования |
Если cache hit происходит хотя бы 1-2 раза после write, эффективная входная стоимость у всех провайдеров снижается на 87–98%. Implicit caching у DeepSeek не требует надбавки за write — это самый простой вариант для внедрения.
Пример: рабочий процесс ревью контрактов обрабатывает 50 документов на одном и том же system prompt в 200K токенов. На Claude Opus 4.8 без кэширования — $20.00/день, с кэшированием (1 write + 49 hit) — $2.50/день. На DeepSeek V4.1 Flash та же нагрузка падает с $1.50/день до $0.16/день.
Проблема стоимости полезного токена
Не все токены в контексте работают. Промпт в 1M токенов, где 60% — padding, boilerplate или шум, который модель игнорирует, фактически стоит в 2.5 раза дороже заявленной ставки за полезный токен.
Анализ BenchLM (получено 2026-09-19) говорит прямо: заявленный контекст и effective context — разные числа. Разрыв растёт с увеличением длины. На 128K токенов фронтирные модели сохраняют сильный recall, на 500K+ у части моделей recall заметно падает — токены в дальнем конце окна оплачены, но не используются.
Это создаёт второй ценовой рычаг помимо тарифа за токен: качество утилизации контекста. Модель, стоящая в 3 раза дороже за токен, но поддерживающая 95% recall на 500K, может дать меньшую стоимость полезного токена, чем модель с третью цены и 60% recall.
Стандартизированных кросс-провайдерных бенчмарков effective context на всех глубинах на сентябрь 2026 нет. Известные ориентиры:
- DeepSeek V4 Pro показывает сильные NIAH (needle-in-a-haystack) результаты на 1M
- Claude Opus 4.8 и Fable 5 сохраняют recall по всему окну в опубликованных оценках Anthropic
- Google Gemini 3.1 Pro показал лучшие effective-context результаты на 500K–1M в оценке BenchLM (апрель 2026)
- OpenAI GPT-5.5 получил лучшие результаты по LongBench v2 и MRCRv2 (128–256K) в той же оценке
Практический вывод: перед выбором провайдера для работы с длинным контекстом тестируйте recall на вашей реальной глубине. Модель с $0.15/M и 50% recall на 500K стоит дороже за полезный токен, чем модель с $2.00/M и 95% recall.
Стоимость вывода — упускаемый множитель
Входная цена получает всё внимание. Но для нагрузок с длинным выводом (генерация отчётов, код, перевод документов) стоимость вывода может оказаться важнее.
| Модель | Выход $/M (короткий) | Выход $/M (длинный) | Макс. вывод |
|---|---|---|---|
| DeepSeek V4.1 Flash | $0.60 (внепик) | фикс. | 384K |
| GPT-5.6 Luna | $1.20 | $1.80 (>272K) | 128K |
| Gemini 3.8 Flash | $3.75 | $7.50 (>200K) | 64K |
| Claude Sonnet 5 | $10.00 | фикс. | 64K |
| Qwen3.8-Max | $6.00 | фикс. | 32K |
| GPT-5.6 Sol | $20.00 | $30.00 (>272K) | 128K |
| Claude Opus 4.8 | $25.00 | фикс. | 64K |
| GPT-6 Astra | $50.00 | $75.00 (>272K) | 128K |
Максимальный вывод DeepSeek V4 Pro в 384K — структурное преимущество, в 3–6 раз больше, чем у остальных. Для рабочих процессов, где нужен полный черновик документа за один вызов, это не ценовое, а функциональное преимущество, которое маршрутизация не компенсирует.
При нагрузке 50K токенов вывода на запрос и 100 запросов в день: DeepSeek V4.1 Flash (внепик) — $90/мес., Claude Sonnet 5 — $1,500/мес., GPT-6 Astra — $7,500/мес. Для генерационных нагрузок стоимость вывода может превысить стоимость входа.
Стратегия context-aware routing
При таком разбросе цен самый эффективный способ контроля затрат — маршрутизация по длине контекста: отправка запросов к разным провайдерам в зависимости от глубины входного контекста.
Простой набор правил:
| Глубина контекста | Направить к | Причина |
|---|---|---|
| <32K токенов | Любой провайдер (приоритет качества) | При малом контексте разница в стоимости незначительна |
| 32K–128K токенов | Лучший по качеству/цене для вашего use case | Умеренная стоимость; разница в качестве начинает проявляться |
| 128K–256K токенов | Провайдеры с фиксированной ставкой (Anthropic, DeepSeek) или кэш-интенсивные рабочие процессы | Ступенчатые провайдеры (OpenAI, Google) начинают брать надбавку |
| 256K–1M токенов | DeepSeek или Anthropic + caching | Ступенчатые провайдеры берут 2x; провайдеры с фиксированной ставкой не меняют тариф |
Gateway вроде TheRouter реализует такую маршрутизацию на уровне инфраструктуры. Приложение отправляет все запросы на один OpenAI-compatible endpoint; gateway маршрутизирует по количеству токенов в запросе. В сочетании с fallback routing long-context запросы автоматически попадают к самому дешёвому подходящему провайдеру, а при его недоступности переключаются на резервный.
Подробнее мы описали этот паттерн в руководстве по оптимизации стоимости через routing. Измерение длины контекста добавляет routing-сигнал, который большинство руководств по оптимизации упускает.
Примеры реальных нагрузок
RAG с 200K контекста retrieval
RAG-пайплайн передаёт 200K токенов retrieved chunks и 2K system prompt на каждый запрос. 500 запросов в день.
- DeepSeek V4.1 Flash (внепик, system prompt закэширован): ~$0.03/запрос вход + $0.003 cached prefix. ~$465/мес.
- Claude Sonnet 5 (system prompt закэширован): ~$0.40/запрос вход + $0.004 cached prefix. ~$6,060/мес.
- GPT-5.6 Sol: ~$0.81/запрос вход (весь в short-context тарифе). ~$12,150/мес.
Анализ кодовой базы, 500K токенов
Code-review agent загружает 500K-токенный snapshot репозитория. 20 ревью в день.
- DeepSeek V4.1 Flash (внепик): $0.08/ревью. ~$48/мес.
- Claude Opus 4.8: $2.56/ревью. ~$1,536/мес.
- GPT-6 Astra (смешанная ставка): $7.68/ревью. ~$4,608/мес.
Обработка документов, 1M токенов
Юридическая система обрабатывает полные контракты по 800K–1M токенов. 10 документов в день.
- DeepSeek V4.1 Flash (внепик): $0.15/документ. ~$45/мес.
- Claude Sonnet 5: $2.00/документ. ~$600/мес.
- GPT-5.6 Sol (смешанная ставка): $5.60/документ. ~$1,680/мес.
В каждом сценарии комбинация long-context routing к DeepSeek и short-context reasoning к более качественной модели даёт лучшее соотношение стоимость/качество.
FAQ
Сколько стоит заполнить контекстное окно в 1M токенов?
От $0.15 (DeepSeek V4.1 Flash внепик) до $20.00 (OpenAI GPT-6 Astra long-context тариф). Разброс более 130 раз. Он отражает уровень модели, архитектуру и политику ценообразования.
Все ли провайдеры берут одинаковую плату вне зависимости от длины контекста?
Нет. OpenAI удваивает вход и увеличивает выход на 50% для GPT-5.6 и GPT-6 выше 272K токенов. Google Gemini удваивает ставки выше 200K. Anthropic и DeepSeek используют фиксированные ставки на всё 1M окно. DashScope применяет ступенчатое ценообразование для некоторых моделей Qwen выше 128K.
Что такое стоимость полезного токена?
Стоимость полезного токена учитывает качество утилизации контекста. Если модель игнорирует 40% токенов в длинном окне, эффективная стоимость полезного токена составляет примерно 1.67x от номинальной. Дешёвая модель с плохим recall на длинном контексте может стоить дороже за полезный токен, чем дорогая с высоким recall.
Как prompt caching снижает затраты на длинный контекст?
Кэширование сохраняет повторяющиеся префиксы промптов, последующие вызовы платят по ставке cache hit. Anthropic берёт 10% от базовой входной цены (2.5% для Fable 5.1). OpenAI — 10%. DeepSeek в непиковое время — 2%. Для нагрузок со стабильным system prompt или общими документными префиксами кэширование снижает эффективную входную стоимость на 87–98%.
Может ли маршрутизация снизить затраты на контекстное окно?
Да. Context-aware routing направляет короткие запросы к любому провайдеру, а длинные — к самому дешёвому с приемлемым качеством. TheRouter маршрутизирует по количеству входных токенов без изменений в коде приложения. В сочетании с model fallback это удерживает затраты на длинный контекст и сохраняет доступность.
Всегда ли нужно выбирать самого дешёвого провайдера для длинного контекста?
Не обязательно. Стоимость полезного токена важнее стоимости сырого токена. Если самый дешёвый провайдер плохо восстанавливает информацию на вашей глубине контекста, вам потребуется больше повторных попыток или вы получите менее качественный вывод — и то, и другое увеличивает общую стоимость. Тестируйте recall на вашей реальной глубине контекста перед привязкой к провайдеру.
Данные о ценах получены 19 сентября 2026 года. Цены меняются; проверяйте актуальные тарифы на страницах провайдеров перед принятием решений о закупках.