Gemini 3.8 Flash API: полное руководство по маршрутизации — Flash-цена, frontier-бенчмарки
Gemini 3.8 Flash вышла 2 сентября 2026 года — самая интеллектуальная Flash-модель Google для долгосрочного программирования и автономных агентов. Та же стоимость $0.75/$3.75, что и у 3.7 Flash, но существенный рост в agentic-рассуждениях. Руководство покрывает подключение к API, тарификацию (включая скрытые thinking-токены), бенчмарки, multi-provider routing и продакшен-деплой.
Google выпустила Gemini 3.8 Flash 2 сентября 2026 года — третью Flash-модель за шесть недель, самую интеллектуальную в линейке Flash. Промо-цена совпадает с 3.7 Flash: $0.75 / 1M input-токенов и $3.75 / 1M output-токенов до 31 декабря 2026 года. Главный прирост — agentic reasoning (индекс Artificial Analysis вырос почти на 5 пунктов по сравнению с 3.7 Flash), а чистые coding-бенчмарки почти не изменились. Для операторов это бесплатный апгрейд: та же цена, то же окно контекста в 1M токенов, тот же API. Но тарификация thinking-токенов означает, что фактическая стоимость зависит от настройки уровня рассуждений.
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
Источники: Google Blog — Introducing Gemini 3.8 Flash and 3.8 Flash Cyber, получено 2026-09-09; Codersera — Gemini 3.8 Flash Complete Guide, получено 2026-09-09; OpenRouter — Gemini 3.8 Flash, получено 2026-09-09; Artificial Analysis — Gemini 3.8 Flash, получено 2026-09-09.
Начало работы за 3 минуты
1. Получите API-ключ
Создайте или получите ключ Gemini API на ai.google.dev. Для Enterprise Agent Platform активируйте Gemini API в вашем проекте Google Cloud.
2. Установите SDK
Python (Google GenAI SDK):
pip install google-genai
Python (OpenAI SDK — для OpenAI-совместимых endpoint):
pip install openai
3. Первый запрос
Через Google GenAI SDK:
from google import genai
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.8-flash",
contents="Write a Python function that retries HTTP requests with exponential backoff.",
)
print(response.text)
Через OpenAI SDK (OpenAI-совместимый endpoint):
from openai import OpenAI
client = OpenAI(
api_key="your-api-key",
base_url="https://generativelanguage.googleapis.com/v1beta/openai/",
)
response = client.chat.completions.create(
model="gemini-3.8-flash",
messages=[
{"role": "user", "content": "Write a Python function that retries HTTP requests with exponential backoff."}
],
)
print(response.choices[0].message.content)
Оба способа возвращают один и тот же результат. OpenAI-совместимый endpoint позволяет менять провайдера без переписывания кода приложения.
Что изменилось по сравнению с Gemini 3.7 Flash
Gemini 3.8 Flash вышла через три недели после 3.7 Flash. Цена, окно контекста, потолок output-токенов, модальности ввода и матрица возможностей полностью совпадают. Разница — только в качестве модели, и она реальная, но неравномерная.
| Метрика | 3.7 Flash | 3.8 Flash | Изменение | Источник |
|---|---|---|---|---|
| Artificial Analysis Intelligence Index | 56 | 59 | +3 | Независимая оценка |
| Artificial Analysis Agentic Index | 45.1 | 50.0 | +4.9 | Независимая оценка |
| Artificial Analysis Coding Index | 76.1 | 76.3 | +0.2 | Независимая оценка |
| HLE-Verified | 53.6% | 54.9% | +1.3 п.п. | |
| Vals Finance Agent v2 | 59.0% | 61.4% | +2.4 п.п. | |
| Harvey Legal Agent | 8.8% | 10.0% | +1.2 п.п. | |
| LMArena text (High) | 1491 ± 8 | 1494 ± 9 | В пределах погрешности | Независимая оценка |
| Скорость output | 279 tok/s | 299 tok/s | +20 tok/s | Независимая оценка |
| Time to first token | 12.01 s | 13.21 s | +1.20 s (хуже) | Независимая оценка |
Закономерность: agentic многошаговое рассуждение существенно улучшилось. Чистый coding почти не изменился — +0.2 на индексе coding это шум. Человеческие предпочтения (LMArena) статистически неотличимы при данных доверительных интервалах.
Есть реальный регресс: time to first token вырос с 12.01 до 13.21 секунды — примерно на 10% медленнее начало ответа. Google об этом не упоминает. На Design Arena оценки OpenRouter ставят 3.8 Flash чуть ниже 3.7 Flash (1311 vs 1318 Elo).
Объяснение самой Google: 3.8 Flash «работает усерднее» — выполняет больше шагов рассуждения и итеративно вызывает инструменты. Это обеспечивает прирост agentic-возможностей, но одновременно увеличивает TTFT и расход токенов.
Источники: Codersera — Gemini 3.8 Flash Complete Guide, получено 2026-09-09; Google Blog — Introducing Gemini 3.8 Flash, получено 2026-09-09; Artificial Analysis, получено 2026-09-09.
Тарификация, уровни и ловушка thinking-токенов
| Уровень | Input / 1M токенов | Output / 1M токенов |
|---|---|---|
| Standard (промо, до 31.12.2026) | $0.75 | $3.75 |
| Standard (с 01.01.2027) | $1.50 | $7.50 |
| Batch API | $0.375 | $1.875 |
| Flex inference | $0.375 | $1.875 |
| Priority inference | $1.35 | $6.75 |
| Cached input (чтение) | $0.075 | — |
| Cache storage | $0.50 / 1M токенов / час | — |
Два момента легко упустить.
Thinking-токены тарифицируются как output. Gemini 3.8 Flash по умолчанию рассуждает на уровне medium, и каждый внутренний thinking-токен оплачивается по output-тарифу ($3.75 / 1M). Эти токены не появляются в теле ответа, но попадают в счёт. Документация Google раскрывает их количество через поле total_thought_tokens.
Промо-тарифы заканчиваются. С 1 января 2027 года стандартные цены удваиваются: $1.50 input, $7.50 output. При годовом планировании считайте два полугодия раздельно.
Пример расчёта с thinking-токенами
Типичный agentic-вызов: 30 000 input-токенов, 800 видимых output-токенов, 6 000 thinking-токенов при уровне medium.
- Input: 30 000 × $0.75 / 1M = $0.0225
- Output + thinking: (800 + 6 000) × $3.75 / 1M = $0.0255
- Итого: $0.048 за вызов
Наивная оценка (только видимые output-токены) даёт $0.026 — реальный счёт в 1.9 раза больше. При 1 000 вызовов в день разница составит около $22/день, или примерно $660/месяц.
Три рычага для управления стоимостью:
- Снизьте
thinking_levelдоlow. Для задач, не требующих глубокого рассуждения, это напрямую сокращает самый дорогой класс токенов. - Используйте Batch API. Для задач вне реального времени — половинная цена и на input, и на output.
- Кэшируйте стабильный prefix. Чтение из кэша стоит $0.075 / 1M — скидка в 10 раз на input. Следите за платой за хранение $0.50/час: кэширование окупается только при частом повторном чтении.
Источники: Codersera — Gemini 3.8 Flash Complete Guide, получено 2026-09-09; Google Blog, получено 2026-09-09.
Спецификации модели и возможности
| Свойство | Gemini 3.8 Flash |
|---|---|
| Model ID | gemini-3.8-flash |
| Дата GA | 2 сентября 2026 |
| Модальности input | Текст, изображения, видео, аудио, PDF |
| Модальности output | Только текст |
| Лимит input-токенов | 1 048 576 |
| Лимит output-токенов | 65 536 |
| Thinking | Поддерживается — low, medium, high (по умолчанию medium) |
| Function calling / structured output | Поддерживается |
| Кэширование контекста | Поддерживается |
| Batch API / Flex / Priority | Все поддерживаются |
| Search grounding | Поддерживается |
| Code execution | Поддерживается |
| Computer use | Поддерживается (Preview) |
| Live API | Не поддерживается |
| Генерация изображений / аудио | Не поддерживается |
Два отсутствия: Live API (нет двусторонних голосовых сессий в реальном времени) и генерация изображений/аудио (это отдельные модели Google — Omni и Image). Google также не публикует дату knowledge cutoff — если ваша задача зависит от актуальной информации, используйте search grounding или URL context.
Настройка Thinking Mode
Gemini 3.8 Flash рассуждает по умолчанию. Thinking нельзя отключить полностью; можно выбрать low, medium или high. Это самый важный рычаг управления стоимостью для данной модели.
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.8-flash",
contents="Debug this Python traceback and suggest a fix: ...",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(
thinking_budget=2048, # Меньший бюджет = меньше thinking-токенов = ниже стоимость
)
),
)
# Проверка фактического расхода thinking-токенов
print(f"Thinking tokens: {response.usage_metadata.thoughts_token_count}")
print(f"Output tokens: {response.usage_metadata.candidates_token_count}")
print(response.text)
В agent-циклах часть шагов требует глубокого рассуждения (ревью кода, отладка), а часть — быстрого ответа (проверка статуса, форматирование). Настройка thinking level на уровне отдельного вызова эффективнее глобального значения по умолчанию.
Сравнение цен с конкурентами
| Модель | Input / 1M токенов | Output / 1M токенов | Окно контекста | Примечание |
|---|---|---|---|---|
| Gemini 3.8 Flash | $0.75 | $3.75 | 1M | Промо до дек. 2026 |
| Gemini 3.7 Flash | $0.75 | $3.75 | 1M | Промо до дек. 2026 |
| Claude Fable 5.1 | $3.00 | $15.00 | 200K | Cache reads $0.75/MTok |
| GPT-6 Astra | $10.00 | $50.00 | 256K | Frontier-уровень |
| Claude Sonnet 5 | $2.00 | $10.00 | 200K | Средний уровень |
| DeepSeek V4 Flash | $0.14 | $0.28 | 128K | Бюджетный, контекст меньше |
По промо-ценам Gemini 3.8 Flash в 4 раза дешевле Claude Fable 5.1 по листовым ценам input и output. Контекстное окно самое большое в Flash/среднем сегменте (1M токенов). Однако thinking-токены увеличивают фактическую стоимость output, а кэш-чтение Claude Fable 5.1 на 75% дешевле, что может сократить разрыв при высоком коэффициенте повторного использования prompt.
Подробное сравнение с Fable 5.1 по кэш-экономике — в сравнении frontier-моделей сентября 2026.
Multi-provider routing через TheRouter
В продакшене зависимость от одного провайдера — это единая точка отказа. TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров с поддержкой fallback.
from openai import OpenAI
client = OpenAI(
api_key="your-therouter-api-key",
base_url="https://api.therouter.ai/v1",
)
# TheRouter разрешает 'google/gemini-3.8-flash' в провайдера Google
response = client.chat.completions.create(
model="google/gemini-3.8-flash",
messages=[
{"role": "user", "content": "Write a Python function to parse ISO 8601 dates."}
],
)
print(response.choices[0].message.content)
При настроенном fallback, если endpoint Google недоступен, TheRouter прозрачно перенаправит запрос к альтернативному провайдеру. Для coding-агентов, работающих ночными batch-задачами, это предотвращает остановку pipeline из-за временного сбоя провайдера.
Подробнее о настройке fallback — в руководстве по model fallback routing.
Примечание: На момент публикации
google/gemini-3.8-flashещё не добавлена в каталог моделей TheRouter. Текущую доступность смотрите на странице провайдера Google.
Частые ошибки и их решение
429 Too Many Requests — превышен rate limit. Google применяет лимиты RPM и TPM, зависящие от уровня аккаунта. Внедрите exponential backoff, повысьте уровень аккаунта или распределите нагрузку через TheRouter с fallback.
400 Invalid value at 'contents' — некорректное тело запроса. Частая причина: пустой массив contents или неподдерживаемый параметр. Проверьте API-справку для generateContent.
503 Service Unavailable — временный сбой. Повторите с backoff. В продакшене настройте model fallback для автоматической переадресации.
gemini-3.8-flash not found — убедитесь в правильности Model ID. Для Google AI Studio используйте gemini-3.8-flash, для Vertex AI / Enterprise Agent Platform — полное квалифицированное имя. Модель стала GA 2 сентября 2026 года.
Неожиданно высокие счета — проверьте total_thought_tokens в метаданных ответа. При уровне medium thinking-токены могут превышать видимые output-токены в 5-10 раз. Для рутинных задач переключайтесь на low.
Чеклист для продакшена
Перед деплоем Gemini 3.8 Flash в продакшен проверьте:
- Область действия API-ключа. Используйте project-specific ключи с минимальными правами. Ротируйте по расписанию.
- Запас по rate limit. Проверьте выделенные RPM/TPM в Google Cloud Console. Запрашивайте увеличение до запуска, а не во время сбоя.
- Тюнинг thinking budget. Профилируйте нагрузку. Уровень medium по умолчанию дорог в agent-циклах с множеством шагов. Начинайте с low, повышайте только там, где прирост точности оправдывает стоимость.
- Fallback routing. Настройте хотя бы одну альтернативу (например,
google/gemini-3.7-flashилиdeepseek/deepseek-chat), чтобы временные сбои не останавливали pipeline. - Мониторинг контекстного окна. 1M токенов — это максимум, отслеживайте фактическое использование. Большие запросы стоят дороже и работают медленнее.
- Окончание промо-тарифов. Текущие цены действуют до 31 декабря 2026 года. Закладывайте двукратные тарифы на 2027 год.
- Учёт стоимости thinking-токенов. Логируйте
thoughts_token_countпо каждому запросу. Стройте дашборды, отслеживающие фактическую стоимость (output + thinking), а не только видимый output.
Интеграция с TheRouter
TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров, поддерживает provider/model routing и fallback, и предоставляет единый интерфейс биллинга и учёта.
Для моделей Gemini это означает: вы пишете код с OpenAI SDK один раз, указываете base_url на TheRouter и получаете отказоустойчивость на уровне провайдера без интеграции с provider-specific SDK. Когда google/gemini-3.8-flash появится в каталоге моделей, переход с прямых вызовов Google API на маршрутизированные потребует только смены base URL и API-ключа.
Текущую доступность моделей Google на TheRouter смотрите на странице провайдера Google.
Дополнительное чтение
- Gemini 3.7 Flash GA API Routing Guide — руководство по предыдущей модели, сравнение 3.6 и 3.7
- Сравнение frontier-моделей сентября 2026: GPT-6 Astra, Claude Fable 5.1, Gemini 3.8 Flash — тройное сравнение по цене и бенчмаркам
- Gemini 3.5 Flash Agentic Computer Use Guide — встроенный инструмент computer use
- LLM API Cost Optimization Routing Strategies 2026 — кэширование prompt, batch-обработка и fallback routing
- Coding Agent Model Routing Comparison 2026 — Flash-модели в workflow coding-агентов
- Model Fallback Routing Guide — настройка multi-provider отказоустойчивости