← Все статьи

Обзор цен на LLM API в Q4 2026: GPT-6.1 Sol, Opus 5.5 и ландшафт после отмены Astra

Полный справочник цен на API крупных языковых моделей за Q4 2026. OpenAI отменила GPT-6.1 Astra, и GPT-6.1 Sol по цене $2/$10 стала самой мощной публичной моделью OpenAI. Мы собрали все тарифы, скидки на кэширование и пакетную обработку по каждому провайдеру, чтобы вы могли настроить routing по бюджету.

· updated 2026-10-03· TheRouter

Короткий ответ: flagship-сегмент API OpenAI больше не существует. 29 сентября 2026 года OpenAI отменила GPT-6.1 Astra из-за проблем с безопасностью. Ценовая планка $10/$50, которую OpenAI удерживала для своей топовой модели начиная с GPT-6 Astra, исчезла. GPT-6.1 Sol заняла верхнюю позицию в публичной линейке OpenAI по цене $2/$10 за миллион токенов — столько же, сколько стоила предыдущая GPT-6 Sol. Параллельно Claude Opus 5.5 вышла по цене $4/$20, Fable 5.1 от Anthropic держит позицию лидера по расширенному reasoning за $10/$50, а DeepSeek V4.1 Flash заменила V4 Pro по значительно более низкой цене. Ценовой пол опустился, потолок обрушился, и разрыв между «frontier» и «mid-tier» никогда не был таким узким.

Эта страница — полная таблица цен по состоянию на 3 октября 2026 года. Сохраните её, поделитесь с командой, используйте для настройки routing-конфигурации.

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Источники: OpenAI API Pricing, получено 2026-10-03; Anthropic Claude Pricing, получено 2026-10-03; DeepSeek Pricing, получено 2026-10-03; DashScope Model Pricing, получено 2026-10-03; SiliconFlow Pricing, получено 2026-10-03; Gemini API Pricing, получено 2026-10-03.

Ландшафт после Astra

До 29 сентября 2026 года карта API-цен имела чёткую верхнюю границу. OpenAI брала $10/$50 за GPT-6 Astra. Anthropic — $10/$50 за Fable 5.1. Это были модели из категории «нужна максимальная точность — платите здесь».

Затем OpenAI отменила GPT-6.1 Astra на DevDay из-за проблем с безопасностью. В тот же день вышла GPT-6.1 Sol по цене $2/$10, и OpenAI описала её как модель, которая обеспечивает «интеллект близкий к Astra для программирования, компьютерного использования и профессиональных задач по цене в пять раз ниже стандартных API-цен Astra». Этот пятикратный разрыв — относительно модели, которая больше не продаётся.

Практический результат: самая мощная публичная модель OpenAI теперь стоит столько же, сколько Claude Sonnet 5. Ценовая планка «flagship» на стороне OpenAI упала с $10/$50 до $2/$10 за одну ночь. Anthropic по-прежнему держит $10/$50 с Fable 5.1 и $4/$20 с Opus 5.5, но конкурентное давление GPT-6.1 Sol по $2/$10 ощутимо.

Полная таблица цен

Цены указаны за миллион токенов (вход / выход), если не оговорено иное. Столбцы «Кэш» и «Пакет» отражают опубликованную провайдером сниженную ставку. Прочерк означает, что провайдер не публикует этот тариф.

Frontier-сегмент (вход от $4)

МодельПровайдерВходВыходКэш входПакетКонтекст
Claude Fable 5.1Anthropic$10.00$50.00$0.25$5.00/$25.001M
Claude Fable 5Anthropic$10.00$50.00$1.00$5.00/$25.001M
Claude Opus 5.5Anthropic$4.00$20.00$0.20$2.00/$10.001M

Fable 5.1 снизила стоимость чтения из кэша на 75% ($0.25 против $1.00 у Fable 5), что существенно удешевляет длинноконтекстные agentic-нагрузки с высоким cache-hit. После отмены Astra, Fable 5.1 — единственная модель крупного западного провайдера по $10/$50.

Mid-tier ($1 — $4 за вход)

МодельПровайдерВходВыходКэш входПакетКонтекст
GPT-6.1 SolOpenAI$2.00$10.00$0.10—1M
GPT-6 SolOpenAI$2.00$10.00$0.10$1.00/$5.001M
Claude Sonnet 5Anthropic$2.00$10.00$0.20$1.00/$5.00200K
Qwen3.8-MaxDashScope~$2.00~$6.00——1M
GPT-6 LunaOpenAI$1.00$4.00$0.10$0.50/$2.001M

GPT-6.1 Sol и Claude Sonnet 5 стоят одинаково. Ключевое различие: GPT-6.1 Sol предлагает контекстное окно 1M и кэшированный вход по $0.10, тогда как Sonnet 5 ограничен 200K контекста, но предлагает пакетную обработку со скидкой 50%. Qwen3.8-Max находится в той же ценовой полосе с заметно более низкой ставкой за выход (цена конвертирована из юаней по приблизительному курсу; DashScope также предлагает промо-скидки).

Value-сегмент ($0.10 — $1 за вход)

МодельПровайдерВходВыходКэш входПакетКонтекст
Gemini 3.8 FlashGoogle$0.75$3.75——1M
Kimi K3Moonshot~$0.55~$2.20——256K
GPT-6.1 Sol MiniOpenAI$0.30$1.20$0.015$0.15/$0.601M
DeepSeek V4.1 FlashDeepSeek$0.15$0.60$0.003—128K
Qwen3.8-FlashDashScope~$0.15~$0.47——256K

Основная борьба Q4 2026 идёт здесь. DeepSeek V4.1 Flash заменила V4 Pro 14 сентября и снизила стоимость до $0.15/$0.60 в непиковые часы (пиковая ставка — x2). Запросы к V4 Pro теперь автоматически маршрутизируются на V4.1 Flash. Qwen3.8-Flash на DashScope совпадает с DeepSeek по входной цене. Gemini 3.8 Flash работает по вводной ставке $0.75/$3.75, которую Google обещает повысить в 2027 году.

Бесплатный и почти бесплатный сегмент

МодельПровайдерВходВыходКонтекст
DeepSeek V4 FlashDeepSeek$0.07$0.28128K
Различные open-weight моделиSiliconFlow$0.00$0.00варьируется

SiliconFlow продолжает предоставлять бесплатный доступ к open-weight моделям — Qwen, DeepSeek, GLM и другим (действуют лимиты частоты запросов). DeepSeek V4 Flash остаётся самым дешёвым платным вариантом у крупного провайдера — $0.07/$0.28 в непиковое время.

Ценовые кластеры паритета

Выделяются три естественных кластера, где модели от разных провайдеров попадают в практически одинаковый диапазон цен.

Кластер $2/$10 — самый конкурентный. GPT-6.1 Sol, GPT-6 Sol и Claude Sonnet 5 — все по $2 за вход и $10 за выход. Qwen3.8-Max рядом — ~$2/$6. Для routing-слоя эти модели взаимозаменяемы по стоимости и различаются только по возможностям, окну контекста и региональной доступности.

Кластер $0.15/$0.60 — золотая середина для оптимизации затрат. DeepSeek V4.1 Flash и Qwen3.8-Flash обе попадают сюда. DeepSeek использует пиковые/непиковые тарифы (в таблице — непиковые; пиковые — x2). Цена Qwen3.8-Flash включает промо-скидки DashScope и может измениться.

Кластер $10/$50 теперь принадлежит только Anthropic. Claude Fable 5.1 и Fable 5 — обе по $10/$50. После отмены Astra ни одна модель OpenAI не занимает эту полку. Ключевой вопрос для операторов: стоит ли Fable в пять раз дороже GPT-6.1 Sol? Для задач расширенного reasoning и agentic-нагрузок, требующих максимальных возможностей, ответ может быть «да», особенно с учётом $0.25 за чтение из кэша у Fable 5.1.

Экономика кэширования

Prompt caching стал главным рычагом снижения затрат в Q4 2026. Разброс между кэшированными и некэшированными входными тарифами впечатляет.

ПровайдерМодельБез кэшаС кэшемЭкономия
OpenAIGPT-6.1 Sol$2.00$0.1095%
AnthropicOpus 5.5$4.00$0.2095%
AnthropicFable 5.1$10.00$0.2597.5%
DeepSeekV4.1 Flash$0.15$0.00398%
OpenAIGPT-6.1 Sol Mini$0.30$0.01595%

Кэширование OpenAI работает автоматически (не нужно менять API-вызовы; повторяющиеся префиксы кэшируются сами). Anthropic требует явных cache-control заголовков. DeepSeek кэширует автоматически через KV cache. DashScope предлагает явное контекстное кэширование через отдельный API.

Для нагрузок, где системный промт, few-shot примеры или документный контекст остаются неизменными между запросами, реальная стоимость за токен падает до 2–5% от заявленной входной ставки. Routing-слой, который фиксирует стабильные префиксы и ротирует только пользовательский ввод, может сократить затраты на 90%+ без смены провайдера.

Скидки на пакетную обработку

Не все провайдеры предлагают batch API, и механика у них различается.

ПровайдерСкидкаСрок обработкиПримечания
OpenAI50% на вход и выход24 часаЗагрузка JSONL, асинхронные результаты
Anthropic50% на вход и выход24 часаАналогичный JSONL-формат
DashScope50%24 часаOpenAI-совместимый batch endpoint
DeepSeek——Нет batch API
Google——Доступно через Vertex AI

Если ваша нагрузка допускает 24-часовую задержку, пакетная обработка OpenAI и Anthropic снижает счёт вдвое. DashScope предлагает аналогичную скидку. DeepSeek пока не выпустила batch API.

Дерево решений: routing по бюджету

Бюджет на вход менее $0.50/M → DeepSeek V4.1 Flash ($0.15), Qwen3.8-Flash (~$0.15), DeepSeek V4 Flash ($0.07) или бесплатный уровень SiliconFlow. Подходит для высоконагруженных, не критичных к задержке нагрузок. Непиковые тарифы DeepSeek делают ночные batch-задачи крайне дешёвыми.

$0.50–$2/M → Gemini 3.8 Flash ($0.75), GPT-6.1 Sol Mini ($0.30), Kimi K3 (~$0.55). Баланс стоимости и возможностей. Gemini 3.8 Flash предлагает контекст 1M в этом ценовом диапазоне.

$2–$4/M → GPT-6.1 Sol ($2.00), Claude Sonnet 5 ($2.00), Qwen3.8-Max (~$2.00). «Пост-Astra frontier» для большинства production-нагрузок. Маршрутизируйте по типу задачи: GPT-6.1 Sol для программирования и computer use, Sonnet 5 для тонкой аналитики и текстов, Qwen3.8-Max для задач на китайском языке.

$4–$10/M → Claude Opus 5.5 ($4.00). Frontier-модель reasoning с лучшим соотношением цена/качество. После отмены Astra — единственная модель в этой ценовой полосе.

$10+/M → Claude Fable 5.1 ($10.00). Расширенный reasoning, долгосрочные agentic-задачи и сценарии, где экономика cache-read ($0.25/M) амортизирует высокую базовую ставку.

Конфигурация TheRouter

TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров. Оптимизированная по стоимости конфигурация для Q4 2026 может выглядеть так:

# Routing по сложности задачи и целевому бюджету
routes:
  - match: { capability: "frontier-reasoning" }
    providers:
      - model: claude-fable-5.1
        weight: 80
      - model: claude-opus-5.5
        weight: 20
        
  - match: { capability: "general" }
    providers:
      - model: gpt-6.1-sol
        weight: 50
      - model: claude-sonnet-5
        weight: 30
      - model: qwen3.8-max
        weight: 20
        
  - match: { capability: "high-volume" }
    providers:
      - model: deepseek-v4.1-flash
        weight: 60
      - model: qwen3.8-flash
        weight: 40

TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров и поддерживает routing и fallback между провайдерами/моделями, когда это реализовано в продуктовых путях.

На что обратить внимание в Q4 2026

Следующий ожидаемый релиз OpenAI — около 19 октября. Выпустят ли они новую модель по отменённой цене Astra $10/$50 или продолжат двигать возможности в сегмент Sol по $2/$10 — это определит дальнейшую картину цен.

Планируемое повышение цен DeepSeek упоминается в отчётах, но конкретные ставки и даты не подтверждены. Если DeepSeek поднимет V4.1 Flash выше $0.15/$0.60, ценовое преимущество перед Qwen3.8-Flash сократится.

GPT-3.5-turbo-0125 уходит 23 октября. Если вы всё ещё используете эту модель, путь миграции лежит через GPT-6.1 Sol Mini ($0.30/$1.20), которая и дешевле, и мощнее.

Волна отключений DashScope 10 октября выводит из эксплуатации несколько устаревших моделей Qwen. Полный список и пути замены — в нашем руководстве по миграции DashScope октябрь 2026.

FAQ

Какой самый дешёвый frontier-класс LLM API в Q4 2026?

GPT-6.1 Sol и Claude Sonnet 5 — оба по $2/$10 за миллион токенов. После отмены Astra модель GPT-6.1 Sol фактически стала самой мощной публичной моделью OpenAI по цене, которая раньше считалась «средним сегментом». Подробности настройки — в нашем руководстве по интеграции GPT-6.1 Sol.

Сколько стоит Claude Opus 5.5?

$4 за миллион входных токенов и $20 за миллион выходных. Чтение из кэша — $0.20/M. На 20% дешевле Opus 5 ($5/$25), единственная модель в диапазоне $4. Подробности миграции — в нашем руководстве по routing Claude Opus 5.5.

Почему отменили GPT-6.1 Astra?

OpenAI отменила GPT-6.1 Astra 29 сентября 2026 года на DevDay из-за проблем с безопасностью. Ожидаемая цена составляла около $10/$50, конкурент — Claude Fable 5.1. После отмены Fable 5.1 осталась единственной моделью западного провайдера в диапазоне $10/$50. Сравнение альтернатив среднего сегмента — в нашем GPT-6.1 Sol vs Claude Sonnet 5 обзоре.

Как работает пиковое/непиковое ценообразование DeepSeek?

DeepSeek взимает разные тарифы в зависимости от времени суток (UTC). Непиковые ставки — это базовые ставки, приведённые в этой статье. Пиковые — удвоенные. Для V4.1 Flash это $0.30/$1.20 в пик против $0.15/$0.60 в непик. Если есть возможность планировать batch-работу на непиковые часы — затраты сокращаются вдвое. Подробнее — в нашем руководстве по DeepSeek V4.1 Flash.

Какие провайдеры поддерживают prompt caching?

OpenAI (автоматически), Anthropic (явный cache control), DeepSeek (автоматический KV cache), DashScope (явный context cache API) и Google Gemini (контекстное кэширование с платой за хранение). SiliconFlow пока не предлагает prompt caching. Детали реализации — в нашем кроссплатформенном сравнении prompt caching.

Как выбрать между GPT-6.1 Sol, Claude Sonnet 5 и Qwen3.8-Max при схожих ценах?

Все три — около $2/M за вход. GPT-6.1 Sol сильна в программировании и computer use с контекстным окном 1M. Claude Sonnet 5 хороша для тонких текстов и аналитики с контекстом 200K. Qwen3.8-Max — лучший выбор для задач на китайском языке, предлагает конкурентный reasoning по ~$2/$6 через DashScope. Маршрутизируйте по типу задачи, а не по цене. Бенчмарки — в нашем сравнении моделей среднего сегмента.

SiliconFlow действительно бесплатен?

SiliconFlow предоставляет бесплатный доступ к нескольким open-weight моделям с лимитами частоты запросов. Для production-нагрузок платные тарифы снимают ограничения и добавляют SLA. Бесплатный уровень подходит для разработки, тестирования и приложений с низким трафиком. Актуальный список бесплатных моделей — в нашем руководстве по бесплатным моделям SiliconFlow.


Данные о ценах собраны 3 октября 2026 года. Цены на LLM API меняются часто. Актуальные ставки уточняйте на официальных страницах провайдеров. Цены DashScope конвертированы из юаней по приблизительному курсу. Цены DeepSeek — непиковые; пиковые ставки — x2.

Помощь и контакты