Anthropic pricing changes, OpenAI API price increase 2026: рост стоимости AI

Anthropic pricing changes и OpenAI API price increase в мае 2026: реальный рост AI расходов до 92%. FairMind/OpenRouter данные по продакшен-трафику. Четыре рычага контроля: cache-aware контекст, model routing, дисциплина промпта, completion control.

Опубликовано Обновлено источник FairMind / OpenRouter data

Архивный материал, подготовленный с помощью ИИ по указанному источнику и опубликованный без индивидуальной проверки. Ответственный редактор: Joe Werner.

График, показывающий разрыв между объявленными ставками AI-моделей и реальными счетами при разных tokenizer и паттернах использования
Машинный перевод с английского оригинала — читать оригинал

Прайс-лист перестал быть надёжным ориентиром для расходов на AI. В первую неделю мая 2026 года сразу три поставщика поменяли экономические условия — каждый по-своему, — и на одних и тех же запросах разрыв между публичной ставкой и реальным счётом доходит до 92%.

ПровайдерЧто изменилосьРеальный рост расходов
OpenAIGPT-5.5: входные $2.50 → $5.00/M, выходные $15 → $30/M+49–92% (зависит от длины промпта)
AnthropicOpus 4.7: тот же прайс, tokenizer выдаёт +32–45% токенов+12–27% на промптах > 2 000 токенов
GitHub CopilotToken-based billing с 1 июня, множитель Opus 4.7: ×7.5 → ×27+260% для agentic-сценариев

Для команд, которые ориентируются на страницу с тарифами одного провайдера, это означает, что бюджетный прогноз может ошибаться вдвое или больше за 48 часов. Эпоха предсказуемого, «коммодитизированного» прайсинга AI-инференса закончилась. Стоимость теперь ведёт себя как структурированный финансовый продукт: цена зависит от поведения tokenizer, паттернов использования, prompt caching и биллинговых моделей, взаимодействующих в реальном времени.

Что изменилось в мае 2026

OpenAI удвоила прайс GPT-5.5 (с $2.50 до $5.00 за миллион входных токенов, с $15 до $30 — за выходные). Anthropic выпустила Opus 4.7 по той же цене, но поменяла tokenizer так, что на одном и том же тексте он выдаёт на 32–45% больше токенов. GitHub объявила о переходе Copilot на token-based billing с 1 июня, где множители для agentic-сценариев выросли до 260%.

Механизмы разные, итог одинаковый: волатильность прайса 50–90% за двое суток. Данные OpenRouter по десяткам миллионов проксированных вызовов подтверждают: это не прогнозы — это замеры по продакшен-трафику.

Почему смена tokenizer имеет значение

Tokenizer превращает текст в токены — минимальную тарифицируемую единицу. Разные tokenizer на одном и том же тексте дают разное число токенов. Когда Anthropic выпустила Opus 4.7 с более «быстрым» счётчиком, прайс-лист остался прежним — но реальная стоимость для промптов длиннее 2000 токенов выросла на 12–27%.

Обратное тоже бывает. На коротких промптах Opus 4.7 выдаёт на 62% меньше completion-токенов и в итоге оказывается на 1.6% дешевле предшественника. Одна и та же модель может различаться по стоимости на 30% в зависимости от длины промпта.

Prompt caching смягчает эффект. Anthropic тарифицирует кэшированные токены со скидкой 90%. На промптах длиннее 128 000 токенов кэш поглощает 93% инфляции от tokenizer — то есть рост нейтрализуется. На промптах средней длины (10 000–25 000 токенов) поглощение падает до 9%, и рост практически целиком пробивается в счёт.

Один и тот же workload может стоить на 5–33% дороже в зависимости от того, учитывает архитектура кэш или нет.

GPT-5.5: явное удорожание, компенсируемое эффективностью

Подход OpenAI прямолинеен: цена за токен удвоилась. Сюрприз в том, что реальные расходы выросли только на 49–92% — в зависимости от длины промпта. Компенсация идёт за счёт эффективности: GPT-5.5 на длинных промптах выдаёт на 19–34% меньше completion-токенов, чем предшественник.

Следствие: две компании, гоняющие GPT-5.5 на одинаковом месячном объёме, могут получить радикально разные счета — всё определяется распределением длины их промптов.

Copilot: структурный сдвиг биллинговой модели

Переход GitHub Copilot на token-based billing с 1 июня — пожалуй, самое разрушительное изменение. Множитель для Claude Opus 4.7 прыгает с 7.5x до 27x — это +260%. Для autocomplete это незаметно. Для agentic-сценариев (Chat, agent-сессии, code review, многошаговые задачи) реальные расходы вырастают в 3–4 раза.

Сигнал понятен: flat-rate тарификация больше не выдерживает agentic-нагрузку. У организаций, использующих Copilot в agent-сценариях, остаётся выбор — принять рост стоимости, перейти на прямой API через routing или перепроектировать workflow, чтобы тратить меньше токенов.

Угол зрения router/operator

Это не просто история про прайс. Это история о том, почему routing-архитектуры больше не опциональны.

Четыре рычага контроля затрат:

  • Cache-aware structuring контекста: проектируйте промпты со стабильными префиксами (системные инструкции, RAG-контекст), которые поглощают инфляцию tokenizer. 90%-я скидка Anthropic на кэш превращает +45% от tokenizer в реальное удорожание 0–5% на длинных промптах.

  • Model routing: держите routing-слой между приложениями и провайдерами. Команды с router перебалансировали трафик между OpenAI, Anthropic и альтернативами в ту же неделю майских изменений. Команды без router открыли change requests, которые двигаются неделями.

  • Дисциплина длины промпта: диапазон 2000–10 000 токенов сильнее всего пострадал от майских изменений. Сжимайте нерелевантный контекст, дробите вызовы там, где работает кэш, выкидывайте мёртвый контекст.

  • Контроль completion: жёсткие выходные схемы, точные stop-условия и лаконичная постановка задачи защищают от пассивного впитывания «многословия» провайдера.

Выбор модели объясняет лишь 30–40% дисперсии стоимости. Harness — система вокруг модели — отвечает за 60–70%.

Что делать AI-инженерным командам

Во-первых, перестать воспринимать прайс-страницу провайдера как оценку расходов. Достоверная оценка требует трёх входных параметров: ставка прайс-листа, поведение tokenizer и фактический паттерн использования.

Во-вторых, тестировать альтернативы. Данные OpenRouter показывают существенный разброс стоимости между провайдерами на одинаковых workload. Соберите тестовый harness, который замеряет число токенов, latency и качество по моделям до того, как фиксировать продакшен-объёмы.

В-третьих, внедрить routing с fallback. Когда один провайдер меняет прайс или поведение tokenizer, трафик переезжает code change-ом, а не closed-procurement-циклом. Эта изоляция и есть ценность routing — за пределами простой экономии.

В-четвёртых, аудит использования prompt caching. Если вы платите полную цену за токены, которые могли бы кэшироваться на 93% дешевле — архитектура протекает деньгами.

Почему пользователям TheRouter стоит следить

TheRouter — это routing-слой, который позволяет реагировать на изменения прайса быстрее, чем команда могла бы менять провайдеров напрямую. Гарантировать минимальную цену он не может — это в принципе невозможно, когда условия меняются за дни. Что он даёт — это возможность мерить реальную стоимость на задачу, сравнивать провайдеров и перенаправлять трафик кодом.

События мая 2026 показывают, что multi-provider routing теперь операционное требование, а не проект по «оптимизации затрат». Волатильность 50–90% за 48 часов не управляется квартальными бюджетными циклами. Нужны runtime-наблюдаемость и способность действовать по данным за часы, а не за месяцы.

Абстрактная схема маршрутизации, показывающая компромиссы между стоимостью и скоростью при выборе API service tier

OpenAI Fast Mode и снижение цен на GPT-5.6: что должны изменить команды маршрутизации

Priority Processing переименован в Fast mode, GPT-5.6 Luna подешевел на 80%, Terra на 20% — и лимит скорости роста трафика означает, что batch-задачи могут незаметно деградировать до стандартной скорости.

источник OpenAI API Changelog
Абстрактная схема маршрутизации, показывающая выбор между Sonnet 5 и Opus 4.8 по кривым стоимости в зависимости от уровня усилий

Claude Sonnet 5: самая агентивная модель Sonnet от Anthropic — что вводное окно ценообразования означает для команд по маршрутизации

Claude Sonnet 5 запускается по $2/$10 за миллион токенов до 31 августа — затем цена возвращается к $3/$15. Модель заменяет Sonnet 4.6 в качестве дефолтной у Anthropic и приносит агентивные возможности уровня Opus по ценам Sonnet. Вот как реагировать командам по маршрутизации.

источник Anthropic
Abstract editorial illustration of a restored but gated AI endpoint with security controls and a pricing clock showing the June 23 deadline

Claude Fable 5 вернулся — с национальными ограничениями, усиленными классификаторами и кредитным ценовым порогом с завтрашнего дня

Fable 5 восстановлен 18 июня с национальными ограничениями доступа, более строгими классификаторами безопасности и обязательным хранением данных. Сегодня последний день бесплатного включения в подписки — с 23 июня требуются usage credits по $10/M входных и $50/M выходных токенов.

источник Anthropic
Помощь и контакты