Обзор цен на LLM API в Q4 2026: GPT-6.1 Sol, Opus 5.5 и ландшафт после отмены Astra
Полный справочник цен на API крупных языковых моделей за Q4 2026. OpenAI отменила GPT-6.1 Astra, и GPT-6.1 Sol по цене $2/$10 стала самой мощной публичной моделью OpenAI. Мы собрали все тарифы, скидки на кэширование и пакетную обработку по каждому провайдеру, чтобы вы могли настроить routing по бюджету.
Короткий ответ: flagship-сегмент API OpenAI больше не существует. 29 сентября 2026 года OpenAI отменила GPT-6.1 Astra из-за проблем с безопасностью. Ценовая планка $10/$50, которую OpenAI удерживала для своей топовой модели начиная с GPT-6 Astra, исчезла. GPT-6.1 Sol заняла верхнюю позицию в публичной линейке OpenAI по цене $2/$10 за миллион токенов — столько же, сколько стоила предыдущая GPT-6 Sol. Параллельно Claude Opus 5.5 вышла по цене $4/$20, Fable 5.1 от Anthropic держит позицию лидера по расширенному reasoning за $10/$50, а DeepSeek V4.1 Flash заменила V4 Pro по значительно более низкой цене. Ценовой пол опустился, потолок обрушился, и разрыв между «frontier» и «mid-tier» никогда не был таким узким.
Эта страница — полная таблица цен по состоянию на 3 октября 2026 года. Сохраните её, поделитесь с командой, используйте для настройки routing-конфигурации.
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
Источники: OpenAI API Pricing, получено 2026-10-03; Anthropic Claude Pricing, получено 2026-10-03; DeepSeek Pricing, получено 2026-10-03; DashScope Model Pricing, получено 2026-10-03; SiliconFlow Pricing, получено 2026-10-03; Gemini API Pricing, получено 2026-10-03.
Ландшафт после Astra
До 29 сентября 2026 года карта API-цен имела чёткую верхнюю границу. OpenAI брала $10/$50 за GPT-6 Astra. Anthropic — $10/$50 за Fable 5.1. Это были модели из категории «нужна максимальная точность — платите здесь».
Затем OpenAI отменила GPT-6.1 Astra на DevDay из-за проблем с безопасностью. В тот же день вышла GPT-6.1 Sol по цене $2/$10, и OpenAI описала её как модель, которая обеспечивает «интеллект близкий к Astra для программирования, компьютерного использования и профессиональных задач по цене в пять раз ниже стандартных API-цен Astra». Этот пятикратный разрыв — относительно модели, которая больше не продаётся.
Практический результат: самая мощная публичная модель OpenAI теперь стоит столько же, сколько Claude Sonnet 5. Ценовая планка «flagship» на стороне OpenAI упала с $10/$50 до $2/$10 за одну ночь. Anthropic по-прежнему держит $10/$50 с Fable 5.1 и $4/$20 с Opus 5.5, но конкурентное давление GPT-6.1 Sol по $2/$10 ощутимо.
Полная таблица цен
Цены указаны за миллион токенов (вход / выход), если не оговорено иное. Столбцы «Кэш» и «Пакет» отражают опубликованную провайдером сниженную ставку. Прочерк означает, что провайдер не публикует этот тариф.
Frontier-сегмент (вход от $4)
| Модель | Провайдер | Вход | Выход | Кэш вход | Пакет | Контекст |
|---|---|---|---|---|---|---|
| Claude Fable 5.1 | Anthropic | $10.00 | $50.00 | $0.25 | $5.00/$25.00 | 1M |
| Claude Fable 5 | Anthropic | $10.00 | $50.00 | $1.00 | $5.00/$25.00 | 1M |
| Claude Opus 5.5 | Anthropic | $4.00 | $20.00 | $0.20 | $2.00/$10.00 | 1M |
Fable 5.1 снизила стоимость чтения из кэша на 75% ($0.25 против $1.00 у Fable 5), что существенно удешевляет длинноконтекстные agentic-нагрузки с высоким cache-hit. После отмены Astra, Fable 5.1 — единственная модель крупного западного провайдера по $10/$50.
Mid-tier ($1 — $4 за вход)
| Модель | Провайдер | Вход | Выход | Кэш вход | Пакет | Контекст |
|---|---|---|---|---|---|---|
| GPT-6.1 Sol | OpenAI | $2.00 | $10.00 | $0.10 | — | 1M |
| GPT-6 Sol | OpenAI | $2.00 | $10.00 | $0.10 | $1.00/$5.00 | 1M |
| Claude Sonnet 5 | Anthropic | $2.00 | $10.00 | $0.20 | $1.00/$5.00 | 200K |
| Qwen3.8-Max | DashScope | ~$2.00 | ~$6.00 | — | — | 1M |
| GPT-6 Luna | OpenAI | $1.00 | $4.00 | $0.10 | $0.50/$2.00 | 1M |
GPT-6.1 Sol и Claude Sonnet 5 стоят одинаково. Ключевое различие: GPT-6.1 Sol предлагает контекстное окно 1M и кэшированный вход по $0.10, тогда как Sonnet 5 ограничен 200K контекста, но предлагает пакетную обработку со скидкой 50%. Qwen3.8-Max находится в той же ценовой полосе с заметно более низкой ставкой за выход (цена конвертирована из юаней по приблизительному курсу; DashScope также предлагает промо-скидки).
Value-сегмент ($0.10 — $1 за вход)
| Модель | Провайдер | Вход | Выход | Кэш вход | Пакет | Контекст |
|---|---|---|---|---|---|---|
| Gemini 3.8 Flash | $0.75 | $3.75 | — | — | 1M | |
| Kimi K3 | Moonshot | ~$0.55 | ~$2.20 | — | — | 256K |
| GPT-6.1 Sol Mini | OpenAI | $0.30 | $1.20 | $0.015 | $0.15/$0.60 | 1M |
| DeepSeek V4.1 Flash | DeepSeek | $0.15 | $0.60 | $0.003 | — | 128K |
| Qwen3.8-Flash | DashScope | ~$0.15 | ~$0.47 | — | — | 256K |
Основная борьба Q4 2026 идёт здесь. DeepSeek V4.1 Flash заменила V4 Pro 14 сентября и снизила стоимость до $0.15/$0.60 в непиковые часы (пиковая ставка — x2). Запросы к V4 Pro теперь автоматически маршрутизируются на V4.1 Flash. Qwen3.8-Flash на DashScope совпадает с DeepSeek по входной цене. Gemini 3.8 Flash работает по вводной ставке $0.75/$3.75, которую Google обещает повысить в 2027 году.
Бесплатный и почти бесплатный сегмент
| Модель | Провайдер | Вход | Выход | Контекст |
|---|---|---|---|---|
| DeepSeek V4 Flash | DeepSeek | $0.07 | $0.28 | 128K |
| Различные open-weight модели | SiliconFlow | $0.00 | $0.00 | варьируется |
SiliconFlow продолжает предоставлять бесплатный доступ к open-weight моделям — Qwen, DeepSeek, GLM и другим (действуют лимиты частоты запросов). DeepSeek V4 Flash остаётся самым дешёвым платным вариантом у крупного провайдера — $0.07/$0.28 в непиковое время.
Ценовые кластеры паритета
Выделяются три естественных кластера, где модели от разных провайдеров попадают в практически одинаковый диапазон цен.
Кластер $2/$10 — самый конкурентный. GPT-6.1 Sol, GPT-6 Sol и Claude Sonnet 5 — все по $2 за вход и $10 за выход. Qwen3.8-Max рядом — ~$2/$6. Для routing-слоя эти модели взаимозаменяемы по стоимости и различаются только по возможностям, окну контекста и региональной доступности.
Кластер $0.15/$0.60 — золотая середина для оптимизации затрат. DeepSeek V4.1 Flash и Qwen3.8-Flash обе попадают сюда. DeepSeek использует пиковые/непиковые тарифы (в таблице — непиковые; пиковые — x2). Цена Qwen3.8-Flash включает промо-скидки DashScope и может измениться.
Кластер $10/$50 теперь принадлежит только Anthropic. Claude Fable 5.1 и Fable 5 — обе по $10/$50. После отмены Astra ни одна модель OpenAI не занимает эту полку. Ключевой вопрос для операторов: стоит ли Fable в пять раз дороже GPT-6.1 Sol? Для задач расширенного reasoning и agentic-нагрузок, требующих максимальных возможностей, ответ может быть «да», особенно с учётом $0.25 за чтение из кэша у Fable 5.1.
Экономика кэширования
Prompt caching стал главным рычагом снижения затрат в Q4 2026. Разброс между кэшированными и некэшированными входными тарифами впечатляет.
| Провайдер | Модель | Без кэша | С кэшем | Экономия |
|---|---|---|---|---|
| OpenAI | GPT-6.1 Sol | $2.00 | $0.10 | 95% |
| Anthropic | Opus 5.5 | $4.00 | $0.20 | 95% |
| Anthropic | Fable 5.1 | $10.00 | $0.25 | 97.5% |
| DeepSeek | V4.1 Flash | $0.15 | $0.003 | 98% |
| OpenAI | GPT-6.1 Sol Mini | $0.30 | $0.015 | 95% |
Кэширование OpenAI работает автоматически (не нужно менять API-вызовы; повторяющиеся префиксы кэшируются сами). Anthropic требует явных cache-control заголовков. DeepSeek кэширует автоматически через KV cache. DashScope предлагает явное контекстное кэширование через отдельный API.
Для нагрузок, где системный промт, few-shot примеры или документный контекст остаются неизменными между запросами, реальная стоимость за токен падает до 2–5% от заявленной входной ставки. Routing-слой, который фиксирует стабильные префиксы и ротирует только пользовательский ввод, может сократить затраты на 90%+ без смены провайдера.
Скидки на пакетную обработку
Не все провайдеры предлагают batch API, и механика у них различается.
| Провайдер | Скидка | Срок обработки | Примечания |
|---|---|---|---|
| OpenAI | 50% на вход и выход | 24 часа | Загрузка JSONL, асинхронные результаты |
| Anthropic | 50% на вход и выход | 24 часа | Аналогичный JSONL-формат |
| DashScope | 50% | 24 часа | OpenAI-совместимый batch endpoint |
| DeepSeek | — | — | Нет batch API |
| — | — | Доступно через Vertex AI |
Если ваша нагрузка допускает 24-часовую задержку, пакетная обработка OpenAI и Anthropic снижает счёт вдвое. DashScope предлагает аналогичную скидку. DeepSeek пока не выпустила batch API.
Дерево решений: routing по бюджету
Бюджет на вход менее $0.50/M → DeepSeek V4.1 Flash ($0.15), Qwen3.8-Flash (~$0.15), DeepSeek V4 Flash ($0.07) или бесплатный уровень SiliconFlow. Подходит для высоконагруженных, не критичных к задержке нагрузок. Непиковые тарифы DeepSeek делают ночные batch-задачи крайне дешёвыми.
$0.50–$2/M → Gemini 3.8 Flash ($0.75), GPT-6.1 Sol Mini ($0.30), Kimi K3 (~$0.55). Баланс стоимости и возможностей. Gemini 3.8 Flash предлагает контекст 1M в этом ценовом диапазоне.
$2–$4/M → GPT-6.1 Sol ($2.00), Claude Sonnet 5 ($2.00), Qwen3.8-Max (~$2.00). «Пост-Astra frontier» для большинства production-нагрузок. Маршрутизируйте по типу задачи: GPT-6.1 Sol для программирования и computer use, Sonnet 5 для тонкой аналитики и текстов, Qwen3.8-Max для задач на китайском языке.
$4–$10/M → Claude Opus 5.5 ($4.00). Frontier-модель reasoning с лучшим соотношением цена/качество. После отмены Astra — единственная модель в этой ценовой полосе.
$10+/M → Claude Fable 5.1 ($10.00). Расширенный reasoning, долгосрочные agentic-задачи и сценарии, где экономика cache-read ($0.25/M) амортизирует высокую базовую ставку.
Конфигурация TheRouter
TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров. Оптимизированная по стоимости конфигурация для Q4 2026 может выглядеть так:
# Routing по сложности задачи и целевому бюджету
routes:
- match: { capability: "frontier-reasoning" }
providers:
- model: claude-fable-5.1
weight: 80
- model: claude-opus-5.5
weight: 20
- match: { capability: "general" }
providers:
- model: gpt-6.1-sol
weight: 50
- model: claude-sonnet-5
weight: 30
- model: qwen3.8-max
weight: 20
- match: { capability: "high-volume" }
providers:
- model: deepseek-v4.1-flash
weight: 60
- model: qwen3.8-flash
weight: 40
TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров и поддерживает routing и fallback между провайдерами/моделями, когда это реализовано в продуктовых путях.
На что обратить внимание в Q4 2026
Следующий ожидаемый релиз OpenAI — около 19 октября. Выпустят ли они новую модель по отменённой цене Astra $10/$50 или продолжат двигать возможности в сегмент Sol по $2/$10 — это определит дальнейшую картину цен.
Планируемое повышение цен DeepSeek упоминается в отчётах, но конкретные ставки и даты не подтверждены. Если DeepSeek поднимет V4.1 Flash выше $0.15/$0.60, ценовое преимущество перед Qwen3.8-Flash сократится.
GPT-3.5-turbo-0125 уходит 23 октября. Если вы всё ещё используете эту модель, путь миграции лежит через GPT-6.1 Sol Mini ($0.30/$1.20), которая и дешевле, и мощнее.
Волна отключений DashScope 10 октября выводит из эксплуатации несколько устаревших моделей Qwen. Полный список и пути замены — в нашем руководстве по миграции DashScope октябрь 2026.
FAQ
Какой самый дешёвый frontier-класс LLM API в Q4 2026?
GPT-6.1 Sol и Claude Sonnet 5 — оба по $2/$10 за миллион токенов. После отмены Astra модель GPT-6.1 Sol фактически стала самой мощной публичной моделью OpenAI по цене, которая раньше считалась «средним сегментом». Подробности настройки — в нашем руководстве по интеграции GPT-6.1 Sol.
Сколько стоит Claude Opus 5.5?
$4 за миллион входных токенов и $20 за миллион выходных. Чтение из кэша — $0.20/M. На 20% дешевле Opus 5 ($5/$25), единственная модель в диапазоне $4. Подробности миграции — в нашем руководстве по routing Claude Opus 5.5.
Почему отменили GPT-6.1 Astra?
OpenAI отменила GPT-6.1 Astra 29 сентября 2026 года на DevDay из-за проблем с безопасностью. Ожидаемая цена составляла около $10/$50, конкурент — Claude Fable 5.1. После отмены Fable 5.1 осталась единственной моделью западного провайдера в диапазоне $10/$50. Сравнение альтернатив среднего сегмента — в нашем GPT-6.1 Sol vs Claude Sonnet 5 обзоре.
Как работает пиковое/непиковое ценообразование DeepSeek?
DeepSeek взимает разные тарифы в зависимости от времени суток (UTC). Непиковые ставки — это базовые ставки, приведённые в этой статье. Пиковые — удвоенные. Для V4.1 Flash это $0.30/$1.20 в пик против $0.15/$0.60 в непик. Если есть возможность планировать batch-работу на непиковые часы — затраты сокращаются вдвое. Подробнее — в нашем руководстве по DeepSeek V4.1 Flash.
Какие провайдеры поддерживают prompt caching?
OpenAI (автоматически), Anthropic (явный cache control), DeepSeek (автоматический KV cache), DashScope (явный context cache API) и Google Gemini (контекстное кэширование с платой за хранение). SiliconFlow пока не предлагает prompt caching. Детали реализации — в нашем кроссплатформенном сравнении prompt caching.
Как выбрать между GPT-6.1 Sol, Claude Sonnet 5 и Qwen3.8-Max при схожих ценах?
Все три — около $2/M за вход. GPT-6.1 Sol сильна в программировании и computer use с контекстным окном 1M. Claude Sonnet 5 хороша для тонких текстов и аналитики с контекстом 200K. Qwen3.8-Max — лучший выбор для задач на китайском языке, предлагает конкурентный reasoning по ~$2/$6 через DashScope. Маршрутизируйте по типу задачи, а не по цене. Бенчмарки — в нашем сравнении моделей среднего сегмента.
SiliconFlow действительно бесплатен?
SiliconFlow предоставляет бесплатный доступ к нескольким open-weight моделям с лимитами частоты запросов. Для production-нагрузок платные тарифы снимают ограничения и добавляют SLA. Бесплатный уровень подходит для разработки, тестирования и приложений с низким трафиком. Актуальный список бесплатных моделей — в нашем руководстве по бесплатным моделям SiliconFlow.
Данные о ценах собраны 3 октября 2026 года. Цены на LLM API меняются часто. Актуальные ставки уточняйте на официальных страницах провайдеров. Цены DashScope конвертированы из юаней по приблизительному курсу. Цены DeepSeek — непиковые; пиковые ставки — x2.