Anthropic удваивает лимиты Claude Code и добавляет GPU от SpaceX: влияние на routing

Anthropic удвоила лимиты Claude Code и подняла потолки Opus API благодаря 220K GPU в SpaceX Colossus 1. Как изменились fallback-триггеры, расписание и стратегия multi-provider routing.

Опубликовано источник Anthropic

Архивный материал, подготовленный с помощью ИИ по указанному источнику и опубликованный без индивидуальной проверки. Ответственный редактор: Joe Werner.

Абстрактная схема расширения compute-инфраструктуры AI с уровнями принятия решений в routing policy
Машинный перевод с английского оригинала — читать оригинал

Rate limits — это не просто ценовое трение. Это архитектурная граница, которая определяет, сможет ли ваш основной провайдер впитать всплеск трафика или передаст запрос на fallback. Когда 6 мая 2026 года Anthropic удвоила лимиты Claude Code и одновременно раскрыла подключение 220 000+ новых NVIDIA GPU в дата-центре SpaceX Colossus 1, операционный вопрос для инженерных команд звучал не «о, интересно, появилось больше capacity». Он звучал так: меняет ли это конфигурацию моей routing policy?

Короткий ответ — да, в трёх конкретных аспектах.

Что изменилось

Anthropic объявила три конкретных изменения, действующих с 6 мая 2026 года:

1. Пятичасовые rate limits Claude Code удвоены. Для тарифов Pro, Max, Team и Enterprise с поседельным биллингом скользящий пятичасовой лимит использования Claude Code теперь в 2 раза больше прежнего. Это не временная акция — это отражение поступающей онлайн compute-мощности.

2. Throttling в часы пик убран для Pro и Max. Раньше пользователи Claude Code на Pro и Max получали сниженные лимиты в часы пиковой нагрузки. Эти сокращения больше нет. Лимиты теперь плоские в любое время — это важно для команд, чьи workload пересекаются с рабочими часами США.

3. Rate limits Claude Opus API существенно повышены. В анонсе обновили таблицу rate limits для моделей Claude Opus. Opus — это, как правило, самый дорогой и самый способный уровень, который команды используют для сложных рассуждений, длинного контекста и оркестрации агентов. Повышение API rate limits напрямую влияет на то, насколько надёжно команды могут гонять Opus в масштабе, не сваливаясь в fallback на Sonnet или модели flash-уровня.

Compute-фон: Anthropic подписала соглашение об использовании всех compute-мощностей в дата-центре SpaceX Colossus 1 в Мемфисе — это более 300 МВт и свыше 220 000 NVIDIA GPU, выходящих в строй в течение месяца после анонса. Это пополняет стек, в котором уже есть AWS Trainium, Google TPUs, стратегическое партнёрство с Azure/NVIDIA на $30 млрд и запланированная сделка на 5 ГВт с Amazon и Google. Compute-стек Anthropic больше не однопровайдерский — он диверсифицирован между пятью крупными источниками.

Почему это важно для AI-инженерных команд

Burst ceiling сдвинулся. Самый прямой операционный эффект — эффективный burst ceiling для Claude Code и Opus API стал выше. Команды, которые раньше упирались в лимиты во время долгих agent-прогонов, batch-окон или ночных пайплайнов автоматизации, должны увидеть, что ограничения ослабли. Это не значит, что лимиты исчезли — это значит, что headroom до них больше.

Частота срабатывания fallback сдвигается. Если вы настроили fallback routing на срабатывание по 429 (rate limit exceeded) от Anthropic — срабатываний будет меньше. Команды, выстроившие fallback-цепочки специально под capacity-ограничения Anthropic (например, fallback на Gemini или DeepSeek по 429 от Anthropic), увидят снижение реальной частоты срабатывания. Это стоит замерить в стеке observability — если вы использовали частоту fallback как прокси здоровья провайдера, теперь сниженная частота — это новая базовая норма, а не признак аномально низкого спроса.

Удаление peak-hour throttling меняет ваши предположения по расписанию. Команды, которые специально сдвигали несрочные AI-нагрузки на ночь и выходные, чтобы избежать throttling на Pro/Max, могут больше этого не делать. Если у вас есть cron-задания, batch-прогоны или CI-пайплайны, привязанные к непиковому времени именно из-за rate limits Anthropic — это ограничение можно пересмотреть.

Multi-compute стек — это сигнал надёжности. Диверсификация compute Anthropic между AWS, Google, SpaceX и в перспективе Azure/NVIDIA означает, что сбой одного дата-центра с меньшей вероятностью повалит Anthropic целиком. Для команд, у которых Anthropic стоит в multi-provider routing ради надёжности (а не только цены), это структурное улучшение устойчивости провайдера.

Угол зрения router/operator

Расширение compute создаёт три routing policy-решения:

1. Пересчитайте порог fallback с Opus. Если у вас жёсткий fallback с Claude Opus на более дешёвую модель по конкретному порогу токенов в час — этот порог, скорее всего, выставлялся под старые rate limits. Проверьте, имеет ли он смысл сейчас или его можно безопасно поднять, чтобы воспользоваться выросшим headroom. Слишком агрессивный fallback с Opus на Sonnet режет качество; слишком вялый — тратит деньги. Перебалансируйте на актуальных данных.

2. Аудитируйте, нужно ли по-прежнему расписание под непиковые часы. Любой пайплайн, искусственно избегающий часов пик Anthropic ради обхода throttling, стоит проверить. Если можно упростить логику расписания (убрав off-peak-ограничения) — это минус одна подвижная деталь в инфраструктуре.

3. Учитывайте multi-provider compute-диверсификацию при оценке надёжности Anthropic. Если в логике выбора провайдера у вас есть score надёжности или весовой коэффициент здоровья провайдера, compute-диверсификация по пяти крупным источникам — это фактор, который стоит учесть. Устойчивость Anthropic улучшилась структурно, а не только в плане «сырой» capacity.

Routing-фреймворк по уровням — после 6 мая:

СценарийРекомендуемый подход
Opus упирается в rate limits в agentic-пайплайнеПоднять порог fallback; до конфиг-изменения замерить фактическую частоту 429
CI/cron сдвинуты на off-peak ради обхода throttleОслабить ограничение расписания; упростить пайплайн
Fallback-цепочка: Opus → Sonnet → DeepSeekПересмотреть частоту срабатывания fallback; подтвердить новые лимиты в observability
Оценка надёжности Anthropic как провайдераУчесть multi-compute-source архитектуру (SpaceX + AWS + Google + Azure)

Одна заметка по latency: больше compute-мощности само по себе не улучшает inference latency на отдельных запросах. Time-to-first-token и throughput на запрос зависят от инфраструктуры за пределами «сырого» количества GPU. Если в routing policy у вас есть выбор провайдера по latency — изменения 6 мая затрагивают capacity и rate limits, но не обязательно характеристики latency на запрос.

За чем стоит следить пользователям TheRouter

Если вы маршрутизируете Claude Opus через TheRouter, повышение rate limits 6 мая означает, что конфигурация лимитов на уровне провайдера может быть теперь консервативнее, чем нужно. Если потолок «запросов в минуту» или «токенов в минуту» выставлялся под старые лимиты Anthropic — стоит проверить, отражает ли он по-прежнему ваш реальный headroom.

Чек по observability: вытащите частоту ошибок 429 от Anthropic за последние 30 дней и сравните с базой до 6 мая. Если частота срабатывания fallback упала — новые лимиты работают. Если нет — возможны несостыковки по тарифу или плану аккаунта, которые стоит разобрать с поддержкой Anthropic.

Более широкая закономерность здесь важна для стратегии multi-provider routing: расширения compute у крупных провайдеров создают асимметрии в надёжности, которые не видны на benchmark-сравнениях и в прайс-листах. Они видны в продакшен-частоте 429, в burst-доступности и в точности ваших предположений о частоте fallback. Это ровно тот провайдерский операционный сигнал, который routing-инфраструктура должна отслеживать — и действовать по нему, когда он меняется.

Anthropic Claude API унификация лимитов уровней маршрутизация — консолидация Start Build Scale editorial

Anthropic унифицирует лимиты API Claude: что означает паритет Sonnet/Haiku/Opus для команд маршрутизации

26 июня Anthropic выровняла RPM, ITPM и OTPM для Sonnet и Haiku до уровня Opus и консолидировала пять уровней использования в три. Что новая структура Start/Build/Scale означает для политики fallback-маршрутизации и управления лимитами расходов.

источник Anthropic Platform Docs
Помощь и контакты