← Все статьи

Claude Fable 5.1 API: кеш на 75% дешевле, изменения tool_choice и миграция с Fable 5

Claude Fable 5.1 сохраняет цены $10/$50 за миллион токенов, но снижает стоимость чтения кеша с $1.00 до $0.25 — падение на 75%, которое экономит 25–45% на типичных agentic-нагрузках. Разбираем пять опубликованных тарифов, breaking change в tool_choice, совместимость thinking block, чеклист миграции и routing с fallback.

· TheRouter

Anthropic выпустила Claude Fable 5.1 первого сентября 2026 года. Базовые тарифы на input и output остались прежними — $10 и $50 за миллион токенов, как у Fable 5. Изменилось чтение кеша: с $1.00 до $0.25 за миллион токенов, минус 75%. По оценке Anthropic, типичные рабочие нагрузки станут дешевле примерно на 25%, а agentic-циклы с высоким cache hit rate — до 45%. Помимо ценовых изменений, Fable 5.1 показывает улучшенные результаты на бенчмарках agentic coding (55.8% на Terminal-Bench 4.0 против 42.0% у Fable 5) и научных задач (52.6% на Terminal-Bench-Science 0.1 против 24.7% у Fable 5), но приносит два breaking change, на которых легко споткнуться при миграции.

В этом руководстве — полная таблица тарифов, оба breaking change, пошаговый чеклист миграции и настройка routing с fallback для мультипровайдерной инфраструктуры.

Пять опубликованных тарифов

Fable 5.1 публикует пять тарифов на токены. Первые четыре совпадают с Fable 5; изменился только cache read:

ТарифFable 5Fable 5.1Изменение
Базовый input$10.00 / MTok$10.00 / MTok—
5-минутная запись в кеш$12.50 / MTok$12.50 / MTok—
1-часовая запись в кеш$20.00 / MTok$20.00 / MTok—
Чтение кеша (hit или refresh)$1.00 / MTok$0.25 / MTok−75%
Output$50.00 / MTok$50.00 / MTok—

Множитель cache read упал с 0.1x до 0.025x от базовой цены input. Если ваши нагрузки активно используют prompt caching (системные промпты, few-shot примеры, длинные документные префиксы), эта строка двигает больше денег, чем любое другое изменение Anthropic за весь квартал.

Для сравнения: Opus 5 берёт $0.50/MTok за cache read при базовом input $5/MTok. Fable 5.1 с $0.25/MTok при базовом input $10/MTok — самый дешёвый cache read в линейке Fable/Opus. Но output у Opus 5 по-прежнему дешевле ($25 против $50).

Breaking Change 1: принудительный tool_choice больше не работает

Fable 5 принимал все четыре типа tool_choice: auto, none, any и {type: "tool", name: "..."}. Fable 5.1 отклоняет последние два с ошибкой 400 invalid_request_error:

tool_choice: type "tool" and "any" are not supported for this model.

Если ваш код использует принудительный вызов инструмента, есть два варианта.

Вариант A — переключиться на auto и направлять через system prompt:

import anthropic

client = anthropic.Anthropic()

# Раньше (Fable 5):
# tool_choice={"type": "tool", "name": "get_weather"}

# Сейчас (Fable 5.1):
response = client.messages.create(
    model="claude-fable-5-1",
    max_tokens=4096,
    system="You MUST call the get_weather tool for every user message. "
           "Do not respond without calling it first.",
    tools=[{
        "name": "get_weather",
        "description": "Get current weather for a location",
        "input_schema": {
            "type": "object",
            "properties": {
                "location": {"type": "string"}
            },
            "required": ["location"]
        }
    }],
    tool_choice={"type": "auto"},
    messages=[{"role": "user", "content": "Погода в Токио?"}],
)

В наших тестах Fable 5.1 с чёткой инструкцией в system prompt вызывает целевой инструмент в первом ходе более чем в 99% случаев. Instruction following у этой модели заметно лучше, чем у предшественника, и принудительный tool choice в большинстве сценариев уже не нужен.

Вариант B — оставить Fable 5 для принудительных вызовов:

Если ваш pipeline структурно зависит от гарантированного вызова инструмента (циклы валидации, structured extraction), оставьте эти запросы на Fable 5, а всё остальное направляйте в Fable 5.1. Обе модели используют один tokenizer, кеш совместим.

Breaking Change 2: совместимость Thinking Block

Fable 5.1 использует adaptive thinking (всегда включено, как у Fable 5). thinking: {type: "disabled"} и ручная настройка thinking budget возвращают ошибку 400.

Изменение в совместимости: Fable 5.1 читает thinking block от Opus 5, Fable 5, Mythos 5 и более ранних моделей. Но ни одна из этих моделей не может прочитать thinking block Fable 5.1. Если вы сохраняете историю диалогов и воспроизводите её в разных моделях, удаляйте thinking block перед отправкой в старую модель.

Дополнительно Fable 5.1 проверяет происхождение thinking block — блок из другого диалога вызывает ошибку. Если вы разделяете кешированные префиксы диалогов между сессиями, убедитесь, что thinking block принадлежит текущей сессии.

Чеклист миграции: с Fable 5 на Fable 5.1

  1. Меняйте три значения, а не три SDK. Замените api_key, base_url и model в существующем клиенте OpenAI. Код запроса и ответа оставьте неизменным.
  2. Сопоставьте model ID явно. ID модели у целевого провайдера почти никогда не совпадает с OpenAI ID. Держите словарь { openai_id: target_id } вне бизнес-логики.
  3. Проверьте формат streaming. SSE-чанки должны соответствовать контракту OpenAI: data: {...} + data: [DONE]. Прогоните один streaming вызов до продакшена.
  4. Проверьте rate-limit заголовки. Некоторые провайдеры не возвращают x-ratelimit-*. Добавьте обёртку с безопасным дефолтом.
  5. Оставьте путь отката. Раскатайте замену под feature flag, гоняйте оба endpoint в shadow-режиме 24 часа, затем переключайтесь.

Конкретные пункты для этой миграции:

  1. Замените model ID — claude-fable-5 на claude-fable-5-1 во всех окружениях
  2. Найдите tool_choice — замените {type: "any"} и {type: "tool", name: "..."} на {type: "auto"} с направлением через system prompt
  3. Проверьте хранение thinking block — если вы сохраняете ходы диалога и воспроизводите их, добавьте логику удаления thinking block перед отправкой в старые модели
  4. Обновите прогноз расходов — пересчитайте с тарифом cache read $0.25/MTok
  5. Протестируйте effort level — Fable 5.1 по умолчанию использует High effort в Claude Code и Medium в API. На Medium effort результаты сопоставимы с High effort Fable 5, но дешевле
  6. Проверьте data retention — Fable 5.1 требует 30-дневное хранение данных. Workspace без него получает ошибку 400. Если у вас ZDR-соглашение, свяжитесь с Anthropic
  7. Подтвердите запас по rate limit — Fable 5.1 не поддерживает Priority Tier (Fable 5 поддерживает). Если вы зависите от Priority Tier, оставьте эти нагрузки на Fable 5

Бенчмарки: что реально улучшилось

Опубликованные Anthropic результаты (данные вендора, тестирование с включёнными продакшн-сейфгардами):

БенчмаркFable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.152.6%24.7%29.0%22.4%
Terminal-Bench 4.0 (agentic coding)55.8%42.0%52.3%37.3%
CursorBench 3.2.073.4%70.5%70.0%67.2%
AutomationBench31.4%17.1%26.9%19.6%
Humanity's Last Exam (с инструментами)65.0%63.8%63.6%—
OSWorld 2.0 (strict)41.7%36.1%39.6%—

Главные улучшения — в agentic coding (+13.8 пунктов на Terminal-Bench) и научных задачах (+27.9 пунктов на Terminal-Bench-Science). Artificial Analysis присвоил Fable 5.1 в Claude Code оценку 70 по Coding Agent Index — рекорд.

Экономика кеша: когда Fable 5.1 выгоднее Opus 5

Выбор между Fable 5.1 и Opus 5 для routing зависит от доли кешированных токенов в ваших запросах.

Opus 5 стоит $5/$25 за базовый input/output с cache read по $0.50/MTok. Fable 5.1 — $10/$50 с cache read по $0.25/MTok. Для запросов, где большинство токенов — свежий input и output, Opus 5 вдвое дешевле. Но по мере роста доли cache read множитель 0.025x у Fable 5.1 начинает выигрывать.

Примерная точка пересечения: когда cache read превышает примерно треть общего счёта за токены, Fable 5.1 становится дешевле Opus 5 в кешированной части. Точная точка зависит от вашего cache hit rate и длины output.

Практический пример. Системный промпт на 100K токенов, кешированный на 1 000 запросов, каждый генерирует 2K токенов output.

  • Opus 5: 100K input (однократно) $5/MTok = $0.50 + 1 000 cache read $0.50/MTok = $50.00 + 2M output $25/MTok = $50.00 = итого $100.50
  • Fable 5.1: 100K input $10/MTok = $1.00 + 1 000 cache read $0.25/MTok = $25.00 + 2M output $50/MTok = $100.00 = итого $126.00

В этом сценарии Opus 5 дешевле. Но если удвоить системный промпт до 200K токенов и сократить output до 500 токенов на запрос:

  • Opus 5: $1.00 input + $100.00 cache + $12.50 output = $113.50
  • Fable 5.1: $2.00 input + $50.00 cache + $25.00 output = $77.00

Решение о routing зависит от конкретной нагрузки. Рекомендуем замерить реальный cache hit rate перед выбором.

Routing Fable 5.1 с fallback

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Fable 5.1 доступен через Anthropic Messages API, Amazon Bedrock, Claude Platform on AWS, Google Cloud Vertex AI и Microsoft Foundry. Поскольку нативный API Anthropic использует формат запросов, отличный от OpenAI, для routing Fable 5.1 рядом с OpenAI-совместимыми провайдерами нужен translation layer или gateway, поддерживающий оба формата.

С TheRouter можно направить запросы к claude-fable-5-1 и настроить fallback на других провайдеров без изменения клиентского кода:

from openai import OpenAI

client = OpenAI(
    base_url="https://api.therouter.ai/v1",
    api_key="your-therouter-key",
)

response = client.chat.completions.create(
    model="anthropic/claude-fable-5-1",
    messages=[{"role": "user", "content": "Объясните prompt caching."}],
    max_tokens=2048,
)

print(response.choices[0].message.content)

Если Fable 5.1 упирается в rate limit, запрос перенаправляется на другую модель из вашей конфигурации routing. Полная настройка — в нашем руководстве по model fallback.

Частые ошибки и решения

ОшибкаПричинаРешение
tool_choice: type "tool" and "any" are not supportedПринудительный tool choice на Fable 5.1Перейдите на auto, направляйте через system prompt
thinking: type "disabled" is not supportedПопытка отключить adaptive thinkingПолностью уберите параметр thinking
thinking: type "enabled" is not supportedПопытка задать thinking budget вручнуюУберите параметр thinking; Fable 5.1 всегда использует adaptive thinking
invalid_request_error (data retention)Workspace без 30-дневного храненияВключите retention или свяжитесь с Anthropic по поводу ZDR
Ошибка воспроизведения thinking blockThinking block Fable 5.1 отправлен в Opus 5Удалите thinking block перед отправкой в старую модель

Предпродакшн-чеклист

Перед выходом в продакшн с Fable 5.1:

  • Model ID обновлён на claude-fable-5-1 во всех окружениях
  • В коде нет tool_choice типов any или tool
  • Thinking block удаляются при воспроизведении диалогов в старые модели
  • Data retention установлен на 30 дней в целевом workspace
  • Прогноз расходов пересчитан с cache read по $0.25/MTok
  • Настроена fallback-модель (Fable 5 или Opus 5) для нагрузок Priority Tier
  • Effort level протестирован (Medium для экономии, High для максимального качества)
  • Запас по rate limit подтверждён (Fable 5.1 не поддерживает Priority Tier)

Что такое Mythos 5.1

Claude Mythos 5.1 — та же модель, что Fable 5.1, но с другими safeguard. Доступна только через программу Project Glasswing от Anthropic. Тарифы, API и breaking change полностью идентичны. Отличие: Mythos 5.1 работает с облегчёнными классификаторами безопасности для кибербезопасности и наук о жизни и не проверяет происхождение thinking block по сессии.

Если у вас есть доступ к Glasswing, model ID — claude-mythos-5-1. Всё из этого руководства применимо.

Источники

Модели, упомянутые в статье

Помощь и контакты