← Все статьи

Экономика кэширования промптов Claude Fable 5.1: расчёт окупаемости, паттерны запросов и стратегии маршрутизации

Кэш-чтение Fable 5.1 подешевело на 75% до $0.25/MTok — но изменилась только эта строка. Разбираем математику окупаемости, показываем, какие паттерны запросов действительно экономят, и объясняем, как решения о маршрутизации с учётом кэша влияют на fallback к более дешёвым моделям.

· TheRouter

Экономика кэширования промптов Claude Fable 5.1: расчёт окупаемости, паттерны запросов и стратегии маршрутизации

Кэш-чтение Fable 5.1 стоит $0.25 за миллион токенов — на 75% дешевле, чем $1.00 у Fable 5. Это делает кэш-тяжёлые нагрузки примерно на 25% дешевле в среднем и до 45% дешевле для длительных агентных задач. Но базовая цена не изменилась: ввод по-прежнему $10/MTok, вывод — $50/MTok. Если ваше приложение не использует кэширование, счёт за Fable 5.1 идентичен Fable 5 — до цента.

Мы написали это руководство, потому что экономика кэширования теперь напрямую определяет, когда Fable 5.1 выгоднее более дешёвой модели. Ответ зависит от вашего cache-hit ratio, длины контекста и количества шагов агента — не от числа 75% самого по себе.

Источники: страница цен Anthropic, получено 2026-09-14; документация Anthropic по кэшированию промптов, получено 2026-09-14; анонс Fable 5.1, получено 2026-09-14; репортаж VentureBeat, получено 2026-09-14.


Что изменилось, а что нет

Статья расходовFable 5Fable 5.1Изменение
Базовый ввод$10 / MTok$10 / MTokНет
5-мин запись в кэш$12.50 / MTok$12.50 / MTokНет
1-час запись в кэш$20 / MTok$20 / MTokНет
Кэш-чтение$1.00 / MTok$0.25 / MTok−75%
Вывод$50 / MTok$50 / MTokНет

Множитель 0.025x для кэш-чтения действует только для Fable 5.1 и Mythos 5.1. Все остальные модели Claude используют 0.1x. Эта асимметрия — вся экономика.

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.


Как работает кэширование промптов у Anthropic

Anthropic кэширует KV-тензоры слоёв внимания для непрерывного префикса промпта. При последующих запросах с тем же префиксом модель пропускает повторное вычисление и тарифицирует токены по ставке кэш-чтения вместо базовой.

Доступны два режима:

  • Автоматическое кэширование — добавьте cache_control: {"type": "ephemeral"} на уровне запроса. Система ставит точку кэширования в конце последнего кэшируемого блока и двигает её вперёд по мере роста диалога.
  • Явные точки кэширования — разместите cache_control на отдельных блоках контента для точного контроля.

Ключевые ограничения:

  • Минимальный кэшируемый префикс: 1024 токена для моделей Haiku, 2048 для всех остальных (включая Fable 5.1).
  • Варианты TTL: 5-минутный ephemeral (запись стоит 1.25x от цены ввода) или 1-часовой extended (запись стоит 2x от цены ввода). Кэш-чтение автоматически обновляет TTL.
  • Только префикс: кэширование строго префиксное. Если переменное содержимое стоит до статического контекста, кэш не сработает.

В ответе usage есть поля cache_creation_input_tokens и cache_read_input_tokens, позволяющие точно отслеживать, сколько токенов попало в кэш и сколько было записано заново.


Пять категорий тарификации токенов в кэше

Каждый запрос Fable 5.1 порождает до пяти типов тарифицируемых токенов. Без их понимания расчёт окупаемости невозможен.

  1. Некэшированные входные токены — тарифицируются по $10/MTok. Это токены после кэшированного префикса или весь ввод первого запроса до создания кэша.
  2. Токены записи в 5-мин кэш — $12.50/MTok (1.25x ввода). Оплачиваются при создании кэшированного префикса или при пересоздании после истечения кэша.
  3. Токены записи в 1-час кэш — $20/MTok (2x ввода). То же, но с более длинным окном хранения.
  4. Токены кэш-чтения — $0.25/MTok (0.025x ввода). Оплачиваются при попадании последующих запросов в кэшированный префикс.
  5. Выходные токены — $50/MTok вне зависимости от кэширования.

Вся экономика сводится к простому вопросу: перекрывает ли экономия на кэш-чтении (по $0.25 вместо $10 за MTok) одноразовую стоимость записи ($12.50 или $20 за MTok)?


Анализ окупаемости: когда запись в кэш себя оправдывает

5-минутный TTL (ephemeral)

Запись P токенов в 5-минутный кэш стоит P × $12.50/MTok. Каждое последующее кэш-чтение экономит P × ($10 − $0.25)/MTok = P × $9.75/MTok.

Точка окупаемости = $12.50 / $9.75 ≈ 1.28 чтений

Достаточно 2 кэш-чтений, чтобы запись окупилась. На старом тарифе Fable 5 (кэш-чтение $1.00) окупаемость наступала при $12.50 / $9.00 ≈ 1.39 — тоже 2 чтения, но с меньшим запасом. Скидка Fable 5.1 не меняет количество чтений для окупаемости, но значительно увеличивает экономию на каждом чтении после неё.

Экономия на каждом дополнительном чтении после окупаемости:

  • Fable 5: $9.00/MTok за чтение
  • Fable 5.1: $9.75/MTok за чтение (+8.3%)

1-часовой TTL (extended)

Запись P токенов в 1-часовой кэш стоит P × $20/MTok. Каждое чтение экономит P × $9.75/MTok.

Точка окупаемости = $20 / $9.75 ≈ 2.05 чтений

Нужно 3 кэш-чтения в течение часа. На Fable 5 это было $20 / $9.00 ≈ 2.22 — тоже 3 чтения. Количество совпадает, но после окупаемости каждое чтение экономит больше.

Настоящий вопрос — cache-hit ratio

На практике окупаемость зависит от cache-hit ratio — доли входных токенов, приходящих из кэш-чтения, а не из свежего ввода. По данным Anthropic, типичные нагрузки получают снижение эффективной стоимости на 25%, агентные — до 45%.

Обратный расчёт:

СценарийCache-hit ratioЭффективная стоимость вводаЭкономия vs без кэша
Без кэша0%$10.00/MTok0%
Лёгкое кэширование (короткие диалоги)30–40%~$7.00/MTok~30%
Среднее кэширование (RAG со стабильным контекстом)50–60%~$5.25/MTok~48%
Тяжёлое кэширование (длительные агентные задачи)80–90%~$2.25/MTok~78%

При cache-hit ratio 80% стоимость ввода Fable 5.1 падает ниже некэшированной ставки Opus 5 ($5/MTok). Это порог, на котором скидка на кэш делает фронтирную модель дешевле по вводу, чем модель рангом ниже.


Паттерны запросов с наибольшей выгодой

Агентные циклы (максимальная экономия)

Агент отправляет растущий контекст на каждом шаге: системный промпт, определения инструментов, описание задачи и полную запись всех предыдущих шагов. Префикс стабилен и объёмен. После первого шага почти все входные токены — кэш-чтения.

50-шаговый агентный запуск с 50K-токенным системным промптом и растущим контекстом может достигать cache-hit ratio 85–95%. На Fable 5.1 эффективная стоимость ввода составляет $1.50–$2.50 за MTok вместо $10.

RAG со стабильной преамбулой (средняя экономия)

Если ваш RAG-пайплайн предваряет извлечённые фрагменты большим стабильным системным промптом или справочным документом, стабильный префикс хорошо кэшируется. Извлечённые фрагменты и запрос пользователя меняются при каждом обращении и не кэшируются.

Типичный cache-hit ratio: 40–60%, в зависимости от соотношения стабильной преамбулы и динамического контента.

Многошаговые диалоги (переменная экономия)

Каждый шаг добавляет предыдущий обмен в контекст. Растущий префикс естественно кэшируется при автоматическом кэшировании. Ранние шаги имеют низкий cache-hit ratio; поздние шаги приближаются к паттерну агентного цикла.

Для диалогов в среднем из 8–12 шагов ожидаемый cache-hit ratio по всей сессии составляет 50–70%.

Одноразовые запросы (без экономии)

Запрос, выполняемый один раз с уникальным содержимым — разовое резюмирование, одиночная классификация — не имеет содержимого для кэширования. Если вы записали в кэш, но ни разу не прочитали, вы заплатили надбавку за запись (25% или 100%) впустую.


Стратегии структурирования промптов для кэширования

Для попадания в кэш требуется точное совпадение префикса. Структурирование запросов для максимизации стабильного префикса — это инженерная работа, которая напрямую превращается в экономию.

Паттерн 1: статический системный промпт + инструменты первыми, пользовательский контент последним

{
  "model": "claude-fable-5.1",
  "cache_control": {"type": "ephemeral"},
  "system": "Ваш системный промпт на 5000 токенов...",
  "tools": [...],
  "messages": [
    {"role": "user", "content": "Переменный пользовательский ввод"}
  ]
}

Системный промпт и определения инструментов формируют кэшированный префикс. Пользовательский контент меняется, но не ломает кэш для префикса выше.

Паттерн 2: справочные документы как ранние сообщения

Для RAG-сценариев вставьте справочные документы как ранние обмены до фактического запроса:

{
  "model": "claude-fable-5.1",
  "cache_control": {"type": "ephemeral"},
  "system": "Вы — исследовательский ассистент...",
  "messages": [
    {"role": "user", "content": "[Справочный документ A — 20K токенов]"},
    {"role": "assistant", "content": "Я изучил справочный материал."},
    {"role": "user", "content": "На основании вышеизложенного ответьте: [переменный запрос]"}
  ]
}

Системный промпт + справочный документ формируют кэшированный префикс на ~20K токенов. Переменный запрос — единственный некэшированный ввод.

Паттерн 3: явные точки кэширования для многосекционного кэша

Для тонкого контроля разместите cache_control на отдельных блоках:

response = client.messages.create(
    model="claude-fable-5.1",
    max_tokens=4096,
    system=[
        {
            "type": "text",
            "text": "Ваш стабильный системный промпт...",
            "cache_control": {"type": "ephemeral"}
        }
    ],
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": large_reference_document,
                    "cache_control": {"type": "ephemeral"}
                },
                {
                    "type": "text",
                    "text": "Ответьте на мой конкретный вопрос..."
                }
            ]
        }
    ]
)

Системный промпт и справочный документ кэшируются отдельно, создавая две точки кэширования.


Решения о маршрутизации: когда Fable 5.1 выгоднее дешёвой модели

Скидка на кэш создаёт неочевидный вопрос маршрутизации: когда кэшированный Fable 5.1 обходится дешевле за запрос, чем некэшированная более дешёвая модель?

Fable 5.1 с кэшем vs Opus 5 без кэша

МетрикаFable 5.1 (80% кэш)Opus 5 (без кэша)
Эффективная стоимость ввода~$2.20/MTok$5.00/MTok
Стоимость вывода$50/MTok$25/MTok

При высоком cache-hit ratio Fable 5.1 выигрывает на вводе, но его вывод в 2 раза дороже Opus 5. Для задач с большим вводом (большой контекст, короткие ответы) кэшированный Fable 5.1 может быть дешевле некэшированного Opus 5. Для задач с большим выводом (генерация кода, длинные тексты) премия за вывод доминирует.

Fable 5.1 с кэшем vs Sonnet 5 без кэша

МетрикаFable 5.1 (80% кэш)Sonnet 5 (без кэша)
Эффективная стоимость ввода~$2.20/MTok$2.00/MTok
Стоимость вывода$50/MTok$10/MTok

Даже при 80% cache-hit ratio стоимость ввода Fable 5.1 лишь приближается к некэшированной цене Sonnet 5, а вывод стоит в 5 раз дороже. Sonnet 5 выигрывает по чистой стоимости, если только вам не нужны возможности Fable-уровня, а экономия на вводе компенсирует премию за вывод для вашей нагрузки.

Эвристика маршрутизации

Маршрутизация с учётом кэша имеет смысл, когда выполняются все три условия:

  1. Нагрузка имеет высокий cache-hit ratio (60%+ входных токенов — кэш-чтения)
  2. Задача требует больше ввода, чем вывода (большое контекстное окно, относительно короткие ответы)
  3. Вам нужны возможности уровня Fable (задача проваливается или деградирует на более дешёвых моделях)

Когда все три условия выполняются, Fable 5.1 с кэшированием может быть самым выгодным фронтирным вариантом. Если хотя бы одно не выполняется, рассмотрите маршрутизацию на Opus 5 или Sonnet 5 с их кэшированием (оба используют стандартный множитель 0.1x для кэш-чтения).

При маршрутизации запросов через TheRouter цепочки fallback могут включать решения с учётом кэша: направлять высокосложные задачи с преимущественно кэшированным контекстом на Fable 5.1, а задачи без кэширования или с доминирующей стоимостью вывода — на Opus 5 или Sonnet 5.


Сравнение: кэширование Fable 5.1 vs другие провайдеры

Кэширование промптов — не эксклюзив Anthropic. Сравнение скидки Fable 5.1 на кэш-чтение с конкурирующими провайдерами:

ПровайдерМодельМножитель кэш-чтенияЦена кэш-чтения (за MTok)Механизм
AnthropicFable 5.10.025x$0.25Явный или автоматический, 5 мин / 1 час TTL
AnthropicOpus 50.1x$0.50Аналогичный
OpenAIGPT-5.5 Pro0.5x$1.25Автоматический, без изменений в коде
OpenAIGPT-5.5 Pro (extended 24h)0.25x$0.625Автоматический, 24 часа хранения
DashScopeQwen3.7-Max0.1x (через context cache)¥0.1/тыс. токеновЯвный context cache API

Среди фронтирных моделей множитель 0.025x у Fable 5.1 — самая агрессивная скидка на кэш-чтение среди всех крупных провайдеров. Extended 24h от OpenAI с 0.25x конкурентоспособен в абсолютных цифрах, но базовая цена другая.

Подробное кросс-провайдерное сравнение кэширования — в нашем руководстве по кэшированию промптов: OpenAI, Anthropic и DashScope.


Типичные ошибки

Писать, но не читать. Если вы включили кэширование для запросов, которые редко повторяются, вы платите 25% надбавку за запись (или 100% для 1-часового TTL) и никогда её не отбиваете. Проверьте соотношение кэш-чтений и записей в ответе usage до предположения об экономии.

Переменное содержимое ломает префикс. Метка времени, ID запроса или любое динамическое значение в начале промпта инвалидирует кэш для всего, что идёт после. Переместите все переменные данные в конец массива сообщений.

Несоответствие TTL. 5-минутный TTL дешевле для записи, но быстро истекает. Если между запросами проходит больше 5 минут, кэш истечёт до второго чтения. Используйте 1-часовой TTL для пакетных нагрузок с паузами и 5-минутный для агентов реального времени.

Игнорирование смены токенизатора. Модели Claude 4.7 и новее (включая Fable 5.1) используют токенизатор, порождающий примерно на 30% больше токенов для того же текста. Учитывайте это при прогнозировании стоимости миграции со старых моделей.


Чек-лист перед продакшеном

Перед развёртыванием Fable 5.1 с кэшированием:

  • Измерьте cache-hit ratio. Логируйте cache_read_input_tokens и cache_creation_input_tokens из ответа usage минимум 24 часа на продакшен-трафике.
  • Рассчитайте эффективную стоимость ввода. Формула: (некэшированные × $10 + записи × $12.50 + чтения × $0.25) / всего входных.
  • Сравните с альтернативами. Если эффективная стоимость ввода выше $5/MTok, оцените, даёт ли Opus 5 ($5/MTok без кэша) приемлемое качество при меньшей стоимости.
  • Структурируйте промпты для максимального перекрытия префиксов. Статический контент — первым, динамический — последним. Если автоматическое кэширование ставит точку кэширования не там, используйте явные точки.
  • Выберите правильный TTL. 5 минут для высокочастотных агентных циклов. 1 час для пакетных или низкочастотных нагрузок.
  • Мониторьте соотношение записей и чтений. Здоровое кэширование показывает соотношение записей к чтениям значительно ниже 1:2. Если записи доминируют, кэш постоянно сбрасывается.
  • Не забудьте о стоимости вывода. Вывод Fable 5.1 по $50/MTok — крупнейшая статья расходов для большинства нагрузок. Экономия на кэшировании ввода не уменьшает стоимость вывода.

FAQ

Скидка 75% на кэш-чтение действует для всех моделей Claude?

Нет. Множитель 0.025x ($0.25/MTok) действует только для Fable 5.1 и Mythos 5.1. Все остальные модели Claude используют множитель 0.1x. Кэш-чтение Opus 5 стоит $0.50/MTok, Sonnet 5 — $0.20/MTok.

Кэширование промптов на Fable 5.1 включается автоматически?

Кэширование не включено по умолчанию. Необходимо добавить cache_control в запрос — либо на уровне запроса для автоматического кэширования, либо на отдельных блоках для явных точек. Без этого каждый токен тарифицируется по полной ставке ввода.

Влияет ли кэширование на качество вывода?

Нет. Кэширование сохраняет промежуточные вычисления (KV-тензоры внимания) для входного префикса. Поведение генерации модели идентично независимо от того, был ввод кэширован или обработан заново.

Можно ли использовать кэширование промптов через TheRouter?

TheRouter маршрутизирует OpenAI-совместимые запросы к настроенным провайдерам. Когда upstream-провайдер — Anthropic и запрос содержит cache_control, поведение кэширования проходит к Anthropic API. TheRouter поддерживает маршрутизацию и fallback между провайдерами.

Как новый токенизатор влияет на стоимость кэширования?

Fable 5.1 использует токенизатор, порождающий примерно на 30% больше токенов для того же текста по сравнению с Claude 4.6 и более ранними моделями. Один и тот же системный промпт стоит на ~30% больше в токенах, но 75% скидка на кэш-чтение с лихвой компенсирует расширение токенизатора на кэшированном контенте.

Модели, упомянутые в статье

Помощь и контакты