← Все статьи

Gemini 3.8 Flash API: полное руководство по маршрутизации — Flash-цена, frontier-бенчмарки

Gemini 3.8 Flash вышла 2 сентября 2026 года — самая интеллектуальная Flash-модель Google для долгосрочного программирования и автономных агентов. Та же стоимость $0.75/$3.75, что и у 3.7 Flash, но существенный рост в agentic-рассуждениях. Руководство покрывает подключение к API, тарификацию (включая скрытые thinking-токены), бенчмарки, multi-provider routing и продакшен-деплой.

· TheRouter

Google выпустила Gemini 3.8 Flash 2 сентября 2026 года — третью Flash-модель за шесть недель, самую интеллектуальную в линейке Flash. Промо-цена совпадает с 3.7 Flash: $0.75 / 1M input-токенов и $3.75 / 1M output-токенов до 31 декабря 2026 года. Главный прирост — agentic reasoning (индекс Artificial Analysis вырос почти на 5 пунктов по сравнению с 3.7 Flash), а чистые coding-бенчмарки почти не изменились. Для операторов это бесплатный апгрейд: та же цена, то же окно контекста в 1M токенов, тот же API. Но тарификация thinking-токенов означает, что фактическая стоимость зависит от настройки уровня рассуждений.

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Источники: Google Blog — Introducing Gemini 3.8 Flash and 3.8 Flash Cyber, получено 2026-09-09; Codersera — Gemini 3.8 Flash Complete Guide, получено 2026-09-09; OpenRouter — Gemini 3.8 Flash, получено 2026-09-09; Artificial Analysis — Gemini 3.8 Flash, получено 2026-09-09.

Начало работы за 3 минуты

1. Получите API-ключ

Создайте или получите ключ Gemini API на ai.google.dev. Для Enterprise Agent Platform активируйте Gemini API в вашем проекте Google Cloud.

2. Установите SDK

Python (Google GenAI SDK):

pip install google-genai

Python (OpenAI SDK — для OpenAI-совместимых endpoint):

pip install openai

3. Первый запрос

Через Google GenAI SDK:

from google import genai

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.8-flash",
    contents="Write a Python function that retries HTTP requests with exponential backoff.",
)
print(response.text)

Через OpenAI SDK (OpenAI-совместимый endpoint):

from openai import OpenAI

client = OpenAI(
    api_key="your-api-key",
    base_url="https://generativelanguage.googleapis.com/v1beta/openai/",
)

response = client.chat.completions.create(
    model="gemini-3.8-flash",
    messages=[
        {"role": "user", "content": "Write a Python function that retries HTTP requests with exponential backoff."}
    ],
)
print(response.choices[0].message.content)

Оба способа возвращают один и тот же результат. OpenAI-совместимый endpoint позволяет менять провайдера без переписывания кода приложения.

Что изменилось по сравнению с Gemini 3.7 Flash

Gemini 3.8 Flash вышла через три недели после 3.7 Flash. Цена, окно контекста, потолок output-токенов, модальности ввода и матрица возможностей полностью совпадают. Разница — только в качестве модели, и она реальная, но неравномерная.

Метрика3.7 Flash3.8 FlashИзменениеИсточник
Artificial Analysis Intelligence Index5659+3Независимая оценка
Artificial Analysis Agentic Index45.150.0+4.9Независимая оценка
Artificial Analysis Coding Index76.176.3+0.2Независимая оценка
HLE-Verified53.6%54.9%+1.3 п.п.Google
Vals Finance Agent v259.0%61.4%+2.4 п.п.Google
Harvey Legal Agent8.8%10.0%+1.2 п.п.Google
LMArena text (High)1491 ± 81494 ± 9В пределах погрешностиНезависимая оценка
Скорость output279 tok/s299 tok/s+20 tok/sНезависимая оценка
Time to first token12.01 s13.21 s+1.20 s (хуже)Независимая оценка

Закономерность: agentic многошаговое рассуждение существенно улучшилось. Чистый coding почти не изменился — +0.2 на индексе coding это шум. Человеческие предпочтения (LMArena) статистически неотличимы при данных доверительных интервалах.

Есть реальный регресс: time to first token вырос с 12.01 до 13.21 секунды — примерно на 10% медленнее начало ответа. Google об этом не упоминает. На Design Arena оценки OpenRouter ставят 3.8 Flash чуть ниже 3.7 Flash (1311 vs 1318 Elo).

Объяснение самой Google: 3.8 Flash «работает усерднее» — выполняет больше шагов рассуждения и итеративно вызывает инструменты. Это обеспечивает прирост agentic-возможностей, но одновременно увеличивает TTFT и расход токенов.

Источники: Codersera — Gemini 3.8 Flash Complete Guide, получено 2026-09-09; Google Blog — Introducing Gemini 3.8 Flash, получено 2026-09-09; Artificial Analysis, получено 2026-09-09.

Тарификация, уровни и ловушка thinking-токенов

УровеньInput / 1M токеновOutput / 1M токенов
Standard (промо, до 31.12.2026)$0.75$3.75
Standard (с 01.01.2027)$1.50$7.50
Batch API$0.375$1.875
Flex inference$0.375$1.875
Priority inference$1.35$6.75
Cached input (чтение)$0.075—
Cache storage$0.50 / 1M токенов / час—

Два момента легко упустить.

Thinking-токены тарифицируются как output. Gemini 3.8 Flash по умолчанию рассуждает на уровне medium, и каждый внутренний thinking-токен оплачивается по output-тарифу ($3.75 / 1M). Эти токены не появляются в теле ответа, но попадают в счёт. Документация Google раскрывает их количество через поле total_thought_tokens.

Промо-тарифы заканчиваются. С 1 января 2027 года стандартные цены удваиваются: $1.50 input, $7.50 output. При годовом планировании считайте два полугодия раздельно.

Пример расчёта с thinking-токенами

Типичный agentic-вызов: 30 000 input-токенов, 800 видимых output-токенов, 6 000 thinking-токенов при уровне medium.

  • Input: 30 000 × $0.75 / 1M = $0.0225
  • Output + thinking: (800 + 6 000) × $3.75 / 1M = $0.0255
  • Итого: $0.048 за вызов

Наивная оценка (только видимые output-токены) даёт $0.026 — реальный счёт в 1.9 раза больше. При 1 000 вызовов в день разница составит около $22/день, или примерно $660/месяц.

Три рычага для управления стоимостью:

  1. Снизьте thinking_level до low. Для задач, не требующих глубокого рассуждения, это напрямую сокращает самый дорогой класс токенов.
  2. Используйте Batch API. Для задач вне реального времени — половинная цена и на input, и на output.
  3. Кэшируйте стабильный prefix. Чтение из кэша стоит $0.075 / 1M — скидка в 10 раз на input. Следите за платой за хранение $0.50/час: кэширование окупается только при частом повторном чтении.

Источники: Codersera — Gemini 3.8 Flash Complete Guide, получено 2026-09-09; Google Blog, получено 2026-09-09.

Спецификации модели и возможности

СвойствоGemini 3.8 Flash
Model IDgemini-3.8-flash
Дата GA2 сентября 2026
Модальности inputТекст, изображения, видео, аудио, PDF
Модальности outputТолько текст
Лимит input-токенов1 048 576
Лимит output-токенов65 536
ThinkingПоддерживается — low, medium, high (по умолчанию medium)
Function calling / structured outputПоддерживается
Кэширование контекстаПоддерживается
Batch API / Flex / PriorityВсе поддерживаются
Search groundingПоддерживается
Code executionПоддерживается
Computer useПоддерживается (Preview)
Live APIНе поддерживается
Генерация изображений / аудиоНе поддерживается

Два отсутствия: Live API (нет двусторонних голосовых сессий в реальном времени) и генерация изображений/аудио (это отдельные модели Google — Omni и Image). Google также не публикует дату knowledge cutoff — если ваша задача зависит от актуальной информации, используйте search grounding или URL context.

Настройка Thinking Mode

Gemini 3.8 Flash рассуждает по умолчанию. Thinking нельзя отключить полностью; можно выбрать low, medium или high. Это самый важный рычаг управления стоимостью для данной модели.

from google import genai
from google.genai import types

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.8-flash",
    contents="Debug this Python traceback and suggest a fix: ...",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(
            thinking_budget=2048,  # Меньший бюджет = меньше thinking-токенов = ниже стоимость
        )
    ),
)

# Проверка фактического расхода thinking-токенов
print(f"Thinking tokens: {response.usage_metadata.thoughts_token_count}")
print(f"Output tokens: {response.usage_metadata.candidates_token_count}")
print(response.text)

В agent-циклах часть шагов требует глубокого рассуждения (ревью кода, отладка), а часть — быстрого ответа (проверка статуса, форматирование). Настройка thinking level на уровне отдельного вызова эффективнее глобального значения по умолчанию.

Сравнение цен с конкурентами

МодельInput / 1M токеновOutput / 1M токеновОкно контекстаПримечание
Gemini 3.8 Flash$0.75$3.751MПромо до дек. 2026
Gemini 3.7 Flash$0.75$3.751MПромо до дек. 2026
Claude Fable 5.1$3.00$15.00200KCache reads $0.75/MTok
GPT-6 Astra$10.00$50.00256KFrontier-уровень
Claude Sonnet 5$2.00$10.00200KСредний уровень
DeepSeek V4 Flash$0.14$0.28128KБюджетный, контекст меньше

По промо-ценам Gemini 3.8 Flash в 4 раза дешевле Claude Fable 5.1 по листовым ценам input и output. Контекстное окно самое большое в Flash/среднем сегменте (1M токенов). Однако thinking-токены увеличивают фактическую стоимость output, а кэш-чтение Claude Fable 5.1 на 75% дешевле, что может сократить разрыв при высоком коэффициенте повторного использования prompt.

Подробное сравнение с Fable 5.1 по кэш-экономике — в сравнении frontier-моделей сентября 2026.

Multi-provider routing через TheRouter

В продакшене зависимость от одного провайдера — это единая точка отказа. TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров с поддержкой fallback.

from openai import OpenAI

client = OpenAI(
    api_key="your-therouter-api-key",
    base_url="https://api.therouter.ai/v1",
)

# TheRouter разрешает 'google/gemini-3.8-flash' в провайдера Google
response = client.chat.completions.create(
    model="google/gemini-3.8-flash",
    messages=[
        {"role": "user", "content": "Write a Python function to parse ISO 8601 dates."}
    ],
)
print(response.choices[0].message.content)

При настроенном fallback, если endpoint Google недоступен, TheRouter прозрачно перенаправит запрос к альтернативному провайдеру. Для coding-агентов, работающих ночными batch-задачами, это предотвращает остановку pipeline из-за временного сбоя провайдера.

Подробнее о настройке fallback — в руководстве по model fallback routing.

Примечание: На момент публикации google/gemini-3.8-flash ещё не добавлена в каталог моделей TheRouter. Текущую доступность смотрите на странице провайдера Google.

Частые ошибки и их решение

429 Too Many Requests — превышен rate limit. Google применяет лимиты RPM и TPM, зависящие от уровня аккаунта. Внедрите exponential backoff, повысьте уровень аккаунта или распределите нагрузку через TheRouter с fallback.

400 Invalid value at 'contents' — некорректное тело запроса. Частая причина: пустой массив contents или неподдерживаемый параметр. Проверьте API-справку для generateContent.

503 Service Unavailable — временный сбой. Повторите с backoff. В продакшене настройте model fallback для автоматической переадресации.

gemini-3.8-flash not found — убедитесь в правильности Model ID. Для Google AI Studio используйте gemini-3.8-flash, для Vertex AI / Enterprise Agent Platform — полное квалифицированное имя. Модель стала GA 2 сентября 2026 года.

Неожиданно высокие счета — проверьте total_thought_tokens в метаданных ответа. При уровне medium thinking-токены могут превышать видимые output-токены в 5-10 раз. Для рутинных задач переключайтесь на low.

Чеклист для продакшена

Перед деплоем Gemini 3.8 Flash в продакшен проверьте:

  1. Область действия API-ключа. Используйте project-specific ключи с минимальными правами. Ротируйте по расписанию.
  2. Запас по rate limit. Проверьте выделенные RPM/TPM в Google Cloud Console. Запрашивайте увеличение до запуска, а не во время сбоя.
  3. Тюнинг thinking budget. Профилируйте нагрузку. Уровень medium по умолчанию дорог в agent-циклах с множеством шагов. Начинайте с low, повышайте только там, где прирост точности оправдывает стоимость.
  4. Fallback routing. Настройте хотя бы одну альтернативу (например, google/gemini-3.7-flash или deepseek/deepseek-chat), чтобы временные сбои не останавливали pipeline.
  5. Мониторинг контекстного окна. 1M токенов — это максимум, отслеживайте фактическое использование. Большие запросы стоят дороже и работают медленнее.
  6. Окончание промо-тарифов. Текущие цены действуют до 31 декабря 2026 года. Закладывайте двукратные тарифы на 2027 год.
  7. Учёт стоимости thinking-токенов. Логируйте thoughts_token_count по каждому запросу. Стройте дашборды, отслеживающие фактическую стоимость (output + thinking), а не только видимый output.

Интеграция с TheRouter

TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров, поддерживает provider/model routing и fallback, и предоставляет единый интерфейс биллинга и учёта.

Для моделей Gemini это означает: вы пишете код с OpenAI SDK один раз, указываете base_url на TheRouter и получаете отказоустойчивость на уровне провайдера без интеграции с provider-specific SDK. Когда google/gemini-3.8-flash появится в каталоге моделей, переход с прямых вызовов Google API на маршрутизированные потребует только смены base URL и API-ключа.

Текущую доступность моделей Google на TheRouter смотрите на странице провайдера Google.

Дополнительное чтение

Помощь и контакты