Исследование Anthropic: 400 тыс. сессий Claude Code, экспертиза и AI routing

Данные Anthropic по 400 тыс. сессий Claude Code: эксперты удваивают verified success (15%→28–33%) и дают 5× вывода. Это меняет model tiers, token budgets и prompt caching.

TheRouter Newsroomисточник Anthropic
Редакционная схема routing с ветвящимися путями, маркированными по сложности задачи и уровню доменной экспертизы, приглушённая нейтральная палитра

16 июня Anthropic опубликовала исследовательскую статью, основанную на анализе примерно 400 000 сессий Claude Code от 235 000 пользователей за период с октября 2025 по апрель 2026 года. Поверхностно это выглядит как исследование рынка труда, однако данные напрямую полезны для операторов, запускающих Claude Code через gateway, систему биллинга или routing-слой.

Что произошло

В статье представлена девятикатегорийная таксономия сессий (построение, отладка, тестирование/оркестрация, эксплуатация ПО, планирование, исследование, анализ данных, документы/нетехнический вывод) и три измерения для каждой сессии: режим задачи, уровень экспертизы пользователя и процент успешных завершений.

Ключевые выводы для операторов:

  • Состав сессий: 56% сессий связаны с написанием или отладкой кода (25% — написание, 26% — отладка, 5% — тестирование/оркестрация); 17% — эксплуатация ПО; 13% — аналитика и документы. Доля «отладочных» сессий упала с 33% в октябре до 19% в апреле; их место заняли «эксплуатационные» (14% → 21%) и аналитические сессии.
  • Усилитель экспертизы: эксперты в среднем генерируют около 12 действий Claude на один запрос и ~3200 слов вывода, новички — 5 действий и ~600 слов. Этот множитель 2,4× по действиям и 5× по объёму вывода стабилен для всех режимов работы и диапазонов ценности задач. В регрессии с контролем на режим, месяц и модель каждый уровень экспертизы добавляет примерно 9% действий и 13% вывода.
  • Рост ценности задач: средняя экономическая ценность сессии (оценённая через эквивалент фриланс-маркетплейса) выросла на 27% с октября 2025 по апрель 2026; задачи типа «построение», «эксплуатация» и «отладка» каждая выросла примерно на треть.
  • Процент успеха: представители всех крупных профессий справляются с задачами примерно так же, как инженеры-программисты. Доменные эксперты успевают чаще и быстрее восстанавливаются после ошибок, хотя разрыв между средним и экспертным уровнями невелик.
  • Разделение труда: пользователи принимают около 70% плановых решений; Claude принимает около 80% исполнительных решений. Когда Claude контролирует планирование, среднее число действий за ход — около 16; когда пользователь сохраняет контроль над исполнением — около 8.

Почему это важно для AI-инженерных команд

Таксономия сессий и данные об экспертизе меняют подход к планированию ресурсов и прогнозированию затрат в масштабных развёртываниях Claude Code.

Бюджет токенов зависит от уровня экспертизы. Команды, моделирующие потребление токенов как равномерное по всем сессиям, систематически занижают стоимость рабочих нагрузок, где преобладают эксперты. Команды доменных экспертов (юристы с инструментами для контрактов, учёные с аналитическими pipeline, старшие инженеры, оркестрирующие агентов) генерируют сессии с объёмом вывода в 5 раз больше среднего. Если система биллинга амортизирует затраты на контекст по единому сессионному бюджету, эксперты либо субсидируются новичками, либо наоборот.

Изменение состава задач влияет на логику выбора модельного уровня. Отладочные сессии (снижающиеся) как правило ограничены — задача завершается, когда тест проходит. Эксплуатационные и оркестрационные сессии (растущие) как правило открытые — они запускают pipeline, разворачивают инфраструктуру или координируют sub-agent в нескольких ходах. Именно здесь prompt caching приносит наибольший выигрыш, размер контекстного окна наиболее критичен, а задержка на ход напрямую влияет на производительность. Аргументы в пользу routing оркестрационных нагрузок на наиболее мощный доступный уровень существенно сильнее, чем для очереди отладочных задач.

Рост ценности задач на 27% означает, что политика routing годовой давности устарела. Если средняя сессия теперь стоит на 27% дороже (в эквиваленте фриланса), то уровень модели, откалиброванный полгода назад под более дешёвый профиль нагрузки, применяется к задачам, которые стали заметно сложнее.

Routing и операторский угол

Ряд выводов статьи прямо транслируется в решения по routing-политике.

Режим сессии как сигнал для routing. Девять режимов статьи неплохо соотносятся с уровнями routing: отладочные/тестовые сессии с быстрой итерацией выигрывают от экономичных моделей с низкой задержкой; сессии построения с накоплением большого контекста (средний вывод 2400 слов на ход у экспертов) выигрывают от более широкого контекстного окна и сильного рассуждения; оркестрационные/эксплуатационные сессии — это сценарии с наибольшей отдачей от топового модельного уровня, и множитель вывода сам по себе оправдывает разницу в стоимости при соответствующей ценности задачи.

Вывод об экспертизе как динамический input для routing. Классификатор экспертизы в статье использует формулировку запросов, паттерны исправлений и доменную специфику — сигналы, доступные на уровне gateway. Прокси, наблюдающий первые 2–3 хода сессии, может оценить, движется ли она в сторону экспертного сценария, и соответственно скорректировать выбор модели. Динамический routing по сложности сессии согласуется с данными: экспертные сессии приносят больше на каждый потраченный токен мощной модели.

ROI prompt caching растёт с уровнем экспертизы. Экспертные сессии накапливают больше контекста за ход и делают это на протяжении большего числа ходов. Выигрыш от prompt caching — пропорциональный объёму повторяющегося контекста, поглощаемого кешем — выше для экспертных оркестрационных и конструктивных сессий, чем для коротких отладочных обменов. Команды, недавно починившие prompt caching (см. Claude Code 2.1.181), должны учитывать долю экспертных сессий при оценке реального экономического эффекта.

Ограничение глубины sub-agent взаимодействует с цепочками действий. Статья показывает, что в высокоэкспертных, высокоавтономных сессиях Claude может выполнять более 100 действий за ход. Команды, установившие ограничения глубины sub-agent (governance-контроль из последних релизов Claude Code), должны моделировать это взаимодействие: ограничение глубиной 5 уровней при 12 действиях на ход у экспертного пользователя означает потенциальный fan-out в десятки параллельных действий на листовом уровне. Управление задержкой и затратами на уровне routing должно учитывать этот fan-out, а не рассматривать каждую пользовательскую сессию как однопоточную.

Что стоит проверить и попробовать пользователям TheRouter

Если вы маршрутизируете Claude Code через TheRouter или кастомный AI gateway, данные о режимах сессий и уровнях экспертизы применимы к конфигурации routing:

  • Проверьте текущее распределение токенов по сессиям, чтобы выяснить, не генерируют ли эксперты непропорционально высокие затраты на контекст. Если да — рассмотрите отдельные routing-политики или токен-бюджеты для сессий с ранними признаками высокой экспертизы.
  • Оцените назначение модельных уровней для эксплуатационных/оркестрационных нагрузок отдельно от отладочных/тестовых. Эти режимы теперь представляют существенно иной профиль использования, чем полгода назад.
  • Изучите /docs/ для актуальных рекомендаций по конфигурации routing, политике fallback и учёту токенов в многосессионных развёртываниях Claude Code.

Статья и приложение с методологией доступны на странице исследований Anthropic и содержат статистику на уровне сессий, полезную для сравнения вашего развёртывания со средними показателями по всей аудитории.

Абстрактная схема маршрутизации, демонстрирующая корректную работу слоя кэша при перехвате повторяющихся API-вызовов через кастомный gateway endpoint

Claude Code 2.1.181: Prompt Caching восстановлен для кастомных gateway и Foundry — что нужно знать операторам

Claude Code 2.1.181 исправляет скрытую регрессию prompt caching, из-за которой все команды, работающие через кастомный ANTHROPIC_BASE_URL или Microsoft Foundry, несли завышенные расходы. Также принудительно введён лимит в пять уровней глубины для foreground subagent.

источник Anthropic
Редакционная схема: два соединённых узла агентов с слоем доверительной границы и барьером разрешений, сдержанная нейтральная палитра

Claude Code 2.1.181: модель доверия агентов переписана — что операторы мультиагентных пайплайнов должны проверить

Claude Code 2.1.181 переписывает модель доверия к peer-сообщениям между агентами: с «относиться с подозрением» на «запрос коллеги, скорее всего действующего от имени пользователя». Пути эскалации и permission laundering по-прежнему заблокированы жёстко.

источник Anthropic
Абстрактная схема сетевой маршрутизации с правилами разрешений и ветвящимися путями на тёмном редакционном фоне

Claude Code 2.1.178: правила Tool(param:value) позволяют операторам блокировать субагентов по модельному уровню

Claude Code 2.1.178 вводит синтаксис разрешений Tool(param:value) — операторы теперь могут писать правила вида Agent(model:opus), блокируя субагентов на Opus-уровне. Также добавлены вложенные области видимости .claude/ и предварительная проверка субагентов в auto-режиме.

источник Anthropic Claude Code
Поддержка