Claude Code 2.1.181: Prompt Caching восстановлен для кастомных gateway и Foundry — что нужно знать операторам
Claude Code 2.1.181 исправляет скрытую регрессию prompt caching, из-за которой все команды, работающие через кастомный ANTHROPIC_BASE_URL или Microsoft Foundry, несли завышенные расходы. Также принудительно введён лимит в пять уровней глубины для foreground subagent.

Если ваша команда запускает Claude Code через кастомный ANTHROPIC_BASE_URL, собственный AI gateway или Microsoft Azure Foundry, вы теряли cache-попадания при каждом обращении к API — и, скорее всего, даже не подозревали об этом. Claude Code 2.1.181, выпущенный 17 июня 2026 года, устраняет эту дорогостоящую скрытую регрессию и закрывает пробел в управлении foreground subagent, который у background subagent был исправлен раньше.
Что произошло
Релиз 2.1.181 включает одно критическое исправление и несколько изменений, важных для операторов:
Prompt caching не работал на кастомных base URL и в Foundry. Кастомные endpoint и Foundry используют «токен аттестации на запрос» (per-request attestation token), который меняется при каждом вызове. Это приводило к тому, что Claude Code видел разный fingerprint запроса и полностью обходил кэш. Операторы, работающие через ANTHROPIC_BASE_URL или Foundry, фактически имели нулевой cache hit rate. При типичном объёме system prompt (~2 000–8 000 токенов) каждый пропущенный cache read означал повторное выставление счёта за полный контекст по стандартной цене входных токенов. Для команд с десятками параллельных сессий это увеличивало эффективную стоимость сессии на 40–60%.
Foreground subagent теперь принудительно соблюдает лимит в пять уровней глубины. Background subagent ограничен по глубине с версии 2.1.175; foreground (интерактивный) — нет. Это позволяло неограниченному foreground agent выходить за пределы запланированного governance-контура и порождать рекурсивные цепочки. В 2.1.181 пятиуровневый лимит применяется к обоим типам агентов, устраняя несоответствие.
Синтаксис /config key=value в промпте. Теперь любой конфигурационный ключ можно задать прямо в промпте — в том числе в headless-режиме -p и в сессиях Remote Control. Это важно для операторов, запускающих Claude Code программно: интерактивные меню настройки там недоступны.
Исправлена петля обновления AWS-credentials. Учётные данные awsCredentialExport с коротким оставшимся сроком жизни вызывали обновление каждую минуту — приводя к лавине AssumeRole-вызовов к Bedrock и периодическим ошибкам из-за rate limit в высоконагруженных пайплайнах.
Дополнительно: стабильность истории длинных сессий (чистка другого процесса больше не удаляет транскрипт активной сессии), сокращение задержки запуска (~120 мс на свежем окружении) и macOS-специфические патчи надёжности.
Почему это важно для инженерных команд
Исправление регрессии prompt caching — наиболее значимое изменение для команд, использующих кастомную инфраструктуру маршрутизации. Prompt caching является несущей конструкцией в модели стоимости Claude Code: согласно официальной документации Anthropic, hit rate выше 80% норма для установившейся кодирующей сессии. Полный cache miss означает, что при каждом обращении system prompt, контекст проекта и накопленная история разговора биллингуются по стандартной цене входных токенов.
Ирония для команд, которые специально подключили Claude Code через managed AI gateway или Microsoft Foundry ради централизованного биллинга, управления rate limit и переключения провайдеров: именно та инфраструктура, которую они добавили для снижения стоимости, и обходила кэш, который мог бы её снизить.
Принудительный лимит глубины subagent важен для операторского governance. До 2.1.181 foreground agent мог обойти ограничение глубины, которое -p/headless-пайплайн уже применял к background агентам. В многоуровневых архитектурах — оркестратор → планировщик → executor subagent — это несоответствие делало равномерное применение fleet-wide политик труднодостижимым.
Угол зрения router и оператора
Несколько изменений в 2.1.181 напрямую касаются routing-уровня:
Валидация prompt cache. Команды, использующие reverse-proxy или gateway перед Anthropic API, должны проверить поведение своих токенов аттестации. Если ваш gateway добавляет per-request подпись или tracking-заголовок, который меняется при каждом вызове — даже если сам промпт не изменился — вы можете воспроизводить тот же паттерн cache miss, что и в Foundry. Исправление в Claude Code меняет способ чтения cache headers, но поведение промежуточных прокси, модифицирующих fingerprint запроса, остаётся на вашей стороне.
Глубина subagent как политика маршрутизации. Пятиуровневый лимит теперь принудительно применяется независимо от того, запущен subagent интерактивно или программно. Операторы, желающие установить более жёсткие ограничения, должны использовать правила разрешений Tool(param:value) (появившиеся в 2.1.178) для ограничения доступа subagent по tier модели — ещё до того, как в дело вступит лимит глубины.
Headless /config для fleet-автоматизации. Новый синтаксис /config key=value позволяет скриптовать изменения конфигурации в -p-режиме. Операторы могут теперь задавать модель, уровень effort или sandbox-политику для каждого вызова в скриптах автоматизации — без необходимости хранить конфигурацию в переменных окружения образа контейнера.
Защита от rate limit на Bedrock. Исправление обновления AWS-credentials снижает число лишних AssumeRole-вызовов, которые попадали в rate limit Bedrock в высоконагруженных окружениях. Команды с несколькими параллельными Claude Code-сессиями против Bedrock должны заметить уменьшение числа прерывистых 429-ошибок, связанных с credential churn.
Что отслеживать пользователям TheRouter
Если вы запускаете Claude Code через TheRouter или любой OpenAI-compatible gateway, проверьте, не добавляет ли ваш прокси-слой per-request токены, меняющиеся при каждом вызове. Стабильный fingerprint запроса — необходимое условие работы prompt caching. Апстримное исправление в Claude Code не поможет, если промежуточный gateway трансформирует запрос способом, нарушающим cache key.
Операторы, управляющие fleet-ами Claude Code с несколькими backend-провайдерами, могут использовать новый синтаксис /config в промпте для внедрения провайдер-специфичных настроек (имя модели, base URL, уровень effort) в per-session-скрипты автоматизации без зависимости от переменных окружения.
На уровне governance единый пятиуровневый лимит глубины subagent убирает одну переменную из рассуждений о fleet-политике: интерактивные и headless агенты теперь ведут себя идентично под давлением глубины. Если ваша модель стоимости или политика безопасности требует более жёстких ограничений, настройте ограничения по tier модели через правила Tool(model:tier), а не полагайтесь только на лимит глубины.
Актуальное руководство по подключению Claude Code к кастомному API endpoint доступно в документации TheRouter.
Похожие материалы
Новости AI-роутинга и провайдеров →
Исследование Anthropic: 400 тыс. сессий Claude Code, экспертиза и AI routing
Данные Anthropic по 400 тыс. сессий Claude Code: эксперты удваивают verified success (15%→28–33%) и дают 5× вывода. Это меняет model tiers, token budgets и prompt caching.

Claude Code 2.1.181: модель доверия агентов переписана — что операторы мультиагентных пайплайнов должны проверить
Claude Code 2.1.181 переписывает модель доверия к peer-сообщениям между агентами: с «относиться с подозрением» на «запрос коллеги, скорее всего действующего от имени пользователя». Пути эскалации и permission laundering по-прежнему заблокированы жёстко.

Claude Code 2.1.178: правила Tool(param:value) позволяют операторам блокировать субагентов по модельному уровню
Claude Code 2.1.178 вводит синтаксис разрешений Tool(param:value) — операторы теперь могут писать правила вида Agent(model:opus), блокируя субагентов на Opus-уровне. Также добавлены вложенные области видимости .claude/ и предварительная проверка субагентов в auto-режиме.