Anthropic pricing changes, OpenAI API price increase 2026: рост стоимости AI
Anthropic pricing changes и OpenAI API price increase в мае 2026: реальный рост AI расходов до 92%. FairMind/OpenRouter данные по продакшен-трафику. Четыре рычага контроля: cache-aware контекст, model routing, дисциплина промпта, completion control.
Архивный материал, подготовленный с помощью ИИ по указанному источнику и опубликованный без индивидуальной проверки. Ответственный редактор: Joe Werner.

Прайс-лист перестал быть надёжным ориентиром для расходов на AI. В первую неделю мая 2026 года сразу три поставщика поменяли экономические условия — каждый по-своему, — и на одних и тех же запросах разрыв между публичной ставкой и реальным счётом доходит до 92%.
| Провайдер | Что изменилось | Реальный рост расходов |
|---|---|---|
| OpenAI | GPT-5.5: входные $2.50 → $5.00/M, выходные $15 → $30/M | +49–92% (зависит от длины промпта) |
| Anthropic | Opus 4.7: тот же прайс, tokenizer выдаёт +32–45% токенов | +12–27% на промптах > 2 000 токенов |
| GitHub Copilot | Token-based billing с 1 июня, множитель Opus 4.7: ×7.5 → ×27 | +260% для agentic-сценариев |
Для команд, которые ориентируются на страницу с тарифами одного провайдера, это означает, что бюджетный прогноз может ошибаться вдвое или больше за 48 часов. Эпоха предсказуемого, «коммодитизированного» прайсинга AI-инференса закончилась. Стоимость теперь ведёт себя как структурированный финансовый продукт: цена зависит от поведения tokenizer, паттернов использования, prompt caching и биллинговых моделей, взаимодействующих в реальном времени.
Что изменилось в мае 2026
OpenAI удвоила прайс GPT-5.5 (с $2.50 до $5.00 за миллион входных токенов, с $15 до $30 — за выходные). Anthropic выпустила Opus 4.7 по той же цене, но поменяла tokenizer так, что на одном и том же тексте он выдаёт на 32–45% больше токенов. GitHub объявила о переходе Copilot на token-based billing с 1 июня, где множители для agentic-сценариев выросли до 260%.
Механизмы разные, итог одинаковый: волатильность прайса 50–90% за двое суток. Данные OpenRouter по десяткам миллионов проксированных вызовов подтверждают: это не прогнозы — это замеры по продакшен-трафику.
Почему смена tokenizer имеет значение
Tokenizer превращает текст в токены — минимальную тарифицируемую единицу. Разные tokenizer на одном и том же тексте дают разное число токенов. Когда Anthropic выпустила Opus 4.7 с более «быстрым» счётчиком, прайс-лист остался прежним — но реальная стоимость для промптов длиннее 2000 токенов выросла на 12–27%.
Обратное тоже бывает. На коротких промптах Opus 4.7 выдаёт на 62% меньше completion-токенов и в итоге оказывается на 1.6% дешевле предшественника. Одна и та же модель может различаться по стоимости на 30% в зависимости от длины промпта.
Prompt caching смягчает эффект. Anthropic тарифицирует кэшированные токены со скидкой 90%. На промптах длиннее 128 000 токенов кэш поглощает 93% инфляции от tokenizer — то есть рост нейтрализуется. На промптах средней длины (10 000–25 000 токенов) поглощение падает до 9%, и рост практически целиком пробивается в счёт.
Один и тот же workload может стоить на 5–33% дороже в зависимости от того, учитывает архитектура кэш или нет.
GPT-5.5: явное удорожание, компенсируемое эффективностью
Подход OpenAI прямолинеен: цена за токен удвоилась. Сюрприз в том, что реальные расходы выросли только на 49–92% — в зависимости от длины промпта. Компенсация идёт за счёт эффективности: GPT-5.5 на длинных промптах выдаёт на 19–34% меньше completion-токенов, чем предшественник.
Следствие: две компании, гоняющие GPT-5.5 на одинаковом месячном объёме, могут получить радикально разные счета — всё определяется распределением длины их промптов.
Copilot: структурный сдвиг биллинговой модели
Переход GitHub Copilot на token-based billing с 1 июня — пожалуй, самое разрушительное изменение. Множитель для Claude Opus 4.7 прыгает с 7.5x до 27x — это +260%. Для autocomplete это незаметно. Для agentic-сценариев (Chat, agent-сессии, code review, многошаговые задачи) реальные расходы вырастают в 3–4 раза.
Сигнал понятен: flat-rate тарификация больше не выдерживает agentic-нагрузку. У организаций, использующих Copilot в agent-сценариях, остаётся выбор — принять рост стоимости, перейти на прямой API через routing или перепроектировать workflow, чтобы тратить меньше токенов.
Угол зрения router/operator
Это не просто история про прайс. Это история о том, почему routing-архитектуры больше не опциональны.
Четыре рычага контроля затрат:
-
Cache-aware structuring контекста: проектируйте промпты со стабильными префиксами (системные инструкции, RAG-контекст), которые поглощают инфляцию tokenizer. 90%-я скидка Anthropic на кэш превращает +45% от tokenizer в реальное удорожание 0–5% на длинных промптах.
-
Model routing: держите routing-слой между приложениями и провайдерами. Команды с router перебалансировали трафик между OpenAI, Anthropic и альтернативами в ту же неделю майских изменений. Команды без router открыли change requests, которые двигаются неделями.
-
Дисциплина длины промпта: диапазон 2000–10 000 токенов сильнее всего пострадал от майских изменений. Сжимайте нерелевантный контекст, дробите вызовы там, где работает кэш, выкидывайте мёртвый контекст.
-
Контроль completion: жёсткие выходные схемы, точные stop-условия и лаконичная постановка задачи защищают от пассивного впитывания «многословия» провайдера.
Выбор модели объясняет лишь 30–40% дисперсии стоимости. Harness — система вокруг модели — отвечает за 60–70%.
Что делать AI-инженерным командам
Во-первых, перестать воспринимать прайс-страницу провайдера как оценку расходов. Достоверная оценка требует трёх входных параметров: ставка прайс-листа, поведение tokenizer и фактический паттерн использования.
Во-вторых, тестировать альтернативы. Данные OpenRouter показывают существенный разброс стоимости между провайдерами на одинаковых workload. Соберите тестовый harness, который замеряет число токенов, latency и качество по моделям до того, как фиксировать продакшен-объёмы.
В-третьих, внедрить routing с fallback. Когда один провайдер меняет прайс или поведение tokenizer, трафик переезжает code change-ом, а не closed-procurement-циклом. Эта изоляция и есть ценность routing — за пределами простой экономии.
В-четвёртых, аудит использования prompt caching. Если вы платите полную цену за токены, которые могли бы кэшироваться на 93% дешевле — архитектура протекает деньгами.
Почему пользователям TheRouter стоит следить
TheRouter — это routing-слой, который позволяет реагировать на изменения прайса быстрее, чем команда могла бы менять провайдеров напрямую. Гарантировать минимальную цену он не может — это в принципе невозможно, когда условия меняются за дни. Что он даёт — это возможность мерить реальную стоимость на задачу, сравнивать провайдеров и перенаправлять трафик кодом.
События мая 2026 показывают, что multi-provider routing теперь операционное требование, а не проект по «оптимизации затрат». Волатильность 50–90% за 48 часов не управляется квартальными бюджетными циклами. Нужны runtime-наблюдаемость и способность действовать по данным за часы, а не за месяцы.
Похожие материалы
Новости AI-роутинга и провайдеров →
OpenAI Fast Mode и снижение цен на GPT-5.6: что должны изменить команды маршрутизации
Priority Processing переименован в Fast mode, GPT-5.6 Luna подешевел на 80%, Terra на 20% — и лимит скорости роста трафика означает, что batch-задачи могут незаметно деградировать до стандартной скорости.

Claude Sonnet 5: самая агентивная модель Sonnet от Anthropic — что вводное окно ценообразования означает для команд по маршрутизации
Claude Sonnet 5 запускается по $2/$10 за миллион токенов до 31 августа — затем цена возвращается к $3/$15. Модель заменяет Sonnet 4.6 в качестве дефолтной у Anthropic и приносит агентивные возможности уровня Opus по ценам Sonnet. Вот как реагировать командам по маршрутизации.

Claude Fable 5 вернулся — с национальными ограничениями, усиленными классификаторами и кредитным ценовым порогом с завтрашнего дня
Fable 5 восстановлен 18 июня с национальными ограничениями доступа, более строгими классификаторами безопасности и обязательным хранением данных. Сегодня последний день бесплатного включения в подписки — с 23 июня требуются usage credits по $10/M входных и $50/M выходных токенов.