← Все статьи

Gemini 3.8 Flash vs Claude Fable 5.1: бюджетная flat-rate модель против frontier-модели с экономией на кэше

Сравнение Gemini 3.8 Flash и Claude Fable 5.1 для API routing: фиксированная цена $0.75/$3.75 против $10/$50 с 75%-й скидкой на cache reads. Разбор цен, примеры кода и фреймворк для выбора модели под конкретную нагрузку.

· TheRouter

Gemini 3.8 Flash и Claude Fable 5.1 вышли в первую неделю сентября 2026 года и представляют два принципиально разных подхода к управлению затратами на API в production.

Gemini 3.8 Flash — модель flash-уровня с ценой $0.75 за миллион входных токенов и $3.75 за миллион выходных. Она ставит на плоскую, предсказуемую стоимость и при этом приближается к frontier-моделям по качеству reasoning и кода.

Claude Fable 5.1 — модель frontier-уровня по $10 за миллион входных токенов и $50 за выходные. Основное ценовое преимущество перед предшественником — cache reads, которые подешевели на 75% до $0.25/MTok. Для нагрузок с высоким повторным использованием prompt Anthropic оценивает снижение затрат в 25% для типичных задач и до 45% для agent-нагрузок.

Вопрос routing не в том, какая модель «лучше». Вопрос в том, какая ценовая структура подходит для каждого типа нагрузки, и при каком уровне cache-попаданий эффективная цена Fable 5.1 действительно опускается в конкурентный диапазон.

Быстрое сравнение

ПараметрGemini 3.8 FlashClaude Fable 5.1
Цена input$0.75 / MTok$10 / MTok
Цена output$3.75 / MTok$50 / MTok
Cache read~$0.075 / MTok (implicit caching, скидка 90%)$0.25 / MTok (скидка 75% от Fable 5)
Cache writeБез доплаты (implicit caching)$12.50 / MTok (5-мин TTL) или $20 / MTok (1-час TTL)
Контекстное окно1M токенов1M токенов
Дата выхода2 сентября 20261 сентября 2026
УровеньFlash (cost-optimized)Frontier (capability-optimized)
Лучше всего дляВысокопропускные задачи, cost-sensitive pipelineСложный reasoning, длительное программирование, agent-циклы с кэшем

Ценообразование на практике: когда cache-экономика меняет картину

Без кэша Gemini 3.8 Flash дешевле Claude Fable 5.1 примерно в 13 раз по input и output. Для одноразовых запросов без повторного использования prompt разница однозначна.

С кэшем ситуация меняется. Предположим, 80% входных токенов в каждом запросе попадают в кэш:

Gemini 3.8 Flash (implicit caching, 90% скидка на cached tokens):

  • 200K cached tokens × $0.075/MTok = $0.015
  • 50K новых tokens × $0.75/MTok = $0.0375
  • Эффективная стоимость input за запрос: $0.0525

Claude Fable 5.1 (explicit caching, $0.25/MTok cache reads):

  • 200K cached tokens × $0.25/MTok = $0.05
  • 50K новых tokens × $10/MTok = $0.50
  • Эффективная стоимость input за запрос: $0.55

Даже при агрессивном кэшировании эффективная стоимость input у Fable 5.1 остаётся примерно в 10 раз выше. Cache-скидка сжимает разрыв с 13x до ~10x, но не устраняет его. Экономия на кэше у Fable 5.1 значима при сравнении с другими frontier-моделями того же ценового уровня (Fable 5), а не при сравнении с flash-моделями, которые стартуют с кратно меньшей базовой цены.

Вопрос routing, таким образом, не «у кого дешевле кэш», а «нужен ли для этой задачи frontier-уровень интеллекта».

Примеры кода: routing через OpenAI-compatible API

Обе модели поддерживают OpenAI-compatible chat-completions endpoint — один и тот же клиентский код работает с заменой base URL и model name.

Gemini 3.8 Flash через Google AI Studio

from openai import OpenAI

client = OpenAI(
    api_key="GEMINI_API_KEY",
    base_url="https://generativelanguage.googleapis.com/v1beta/openai/",
)

response = client.chat.completions.create(
    model="gemini-3.8-flash",
    messages=[
        {"role": "system", "content": "Ты — code reviewer."},
        {"role": "user", "content": "Проверь этот PR diff на проблемы безопасности."},
    ],
)

Claude Fable 5.1 через Anthropic API

from openai import OpenAI

client = OpenAI(
    api_key="ANTHROPIC_API_KEY",
    base_url="https://api.anthropic.com/v1/",
)

response = client.chat.completions.create(
    model="claude-fable-5-1",
    messages=[
        {"role": "system", "content": "Ты — code reviewer."},
        {"role": "user", "content": "Проверь этот PR diff на проблемы безопасности."},
    ],
)

TheRouter: routing на обе модели с fallback

TheRouter направляет OpenAI-compatible запросы через настроенных провайдеров и поддерживает provider/model routing и fallback, когда продуктовые пути это позволяют. Один запрос может направляться на ту модель, которая лучше подходит для нагрузки, с автоматическим fallback при недоступности основного провайдера.

from openai import OpenAI

client = OpenAI(
    api_key="THEROUTER_API_KEY",
    base_url="https://api.therouter.ai/v1",
)

# Cost-sensitive задачи — на Gemini 3.8 Flash
response = client.chat.completions.create(
    model="google/gemini-3.8-flash",
    messages=[{"role": "user", "content": "Классифицируй этот тикет поддержки."}],
)

# Сложный reasoning — на Claude Fable 5.1
response = client.chat.completions.create(
    model="anthropic/claude-fable-5-1",
    messages=[{"role": "user", "content": "Найди причину deadlock в этой распределённой системе."}],
)

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Benchmark-производительность: flash-уровень сокращает разрыв

Сам факт, что Gemini 3.8 Flash можно обсуждать рядом с frontier-моделями, показывает масштаб прогресса flash-уровня. Google утверждает, что 3.8 Flash на DeepSWE v1.1 (длительная программная инженерия) превосходит большинство более крупных frontier-моделей при кратно меньшей стоимости.

Claude Fable 5.1 занимает первое место в независимых агрегированных benchmark. BenchLM ставит ему 84.36/100, первое из 231 моделей. SWE-bench Pro — 92.6%, Terminal-Bench-Science 0.1 — 52.6%. По тестам самой Anthropic, Fable 5.1 решает больше задач по коду, чем Fable 5 и Opus 5.

Разрыв по качеству существует, но он значительно меньше 13-кратной разницы в цене. Когда flash-качества достаточно, routing на Gemini 3.8 Flash экономит более 90% затрат на токены. Когда последние 10–15% capabilities критичны — многодневные coding-сессии, отладка редких crash, frontier reasoning — наценка Fable 5.1 оправдана.

BenchmarkGemini 3.8 FlashClaude Fable 5.1
BenchLM aggregate77.81/100 (#6 / 231)84.36/100 (#1 / 231)
HLE-Verified54.9%—
SWE-bench Pro—92.6%
Terminal-Bench-Science 0.1—52.6%

Модели не тестировались на идентичных наборах benchmark — прямые сравнения приблизительны. Все данные из отчётов вендоров или ранних независимых оценок.

Rate limits: пропускная способность в production

Rate limits определяют, выдержит ли модель production-трафик без throttling.

Gemini 3.8 Flash опирается на инфраструктуру Google. Free tier даёт щедрые лимиты для экспериментов, paid-уровни масштабируются с потреблением. На момент написания Google не опубликовал model-specific RPM/TPM лимиты для 3.8 Flash, но flash-модели в Gemini API исторически обеспечивают высокую пропускную способность.

Claude Fable 5.1 следует tier-системе Anthropic, конкретные rate limits зависят от уровня аккаунта. У Fable 5.1 есть встроенная safety-маршрутизация: запросы, помеченные cybersecurity- или biology-safeguard, автоматически перенаправляются на менее мощные модели, и эти перенаправленные запросы не тарифицируются по ценам Fable.

Для высокопропускных pipeline с тысячами запросов в минуту Gemini 3.8 Flash обычно обеспечивает более высокую concurrency при меньшей стоимости. Для нагрузок с небольшим объёмом, но высокой сложностью каждого запроса, rate limits Fable 5.1 достаточны, и решающим фактором становится capability каждого запроса.

Фреймворк выбора: какую модель для какой нагрузки

Граница routing между этими моделями определяется сложностью нагрузки и паттернами prompt-повторного использования.

Routing на Gemini 3.8 Flash:

  • Высокопропускные, cost-sensitive задачи (классификация, extraction, summarization)
  • Prompt-повторное использование низкое или отсутствует — flat rate на каждый запрос
  • Flash-качество reasoning соответствует вашему порогу точности
  • Нужен недорогой multimodal input (Gemini 3.8 Flash поддерживает текст, изображения и видео)
  • Латентность важна — flash-модели оптимизированы под скорость

Routing на Claude Fable 5.1:

  • Задача требует frontier reasoning (multi-step debugging, научный анализ, long-horizon coding)
  • Высокое повторное использование prompt, выгода от $0.25/MTok cache reads
  • Нужен extended thinking для сложных задач
  • Длинный context с повторными обращениями к одним и тем же данным, где 1M-токеновое окно Fable 5.1 плюс cache-экономика делают его cost-effective
  • Последние 10% capability важнее стоимости токенов

Обе модели с routing fallback:

  • Разные нагрузки в одном приложении с разной сложностью
  • По умолчанию Gemini 3.8 Flash для экономии, escalation на Fable 5.1 только когда flash-модель недостаточно уверена или задача требует глубокого reasoning
  • Двойной provider повышает availability

Что не охвачено этой статьёй

Статья фокусируется на cost-routing между flash-моделью и frontier-моделью. Не рассматриваются:

Gemini 3.8 Flash и Claude Fable 5.1 на момент написания не включены в models-data.ts TheRouter. Доступность через TheRouter следует проверить на странице моделей.

Источники

Помощь и контакты