← Все статьи

Gemini 3.7 Flash GA: руководство по интеграции API и маршрутизации между провайдерами

Gemini 3.7 Flash стал общедоступным 13 августа 2026 года — самая мощная рабочая модель Google для кодинга и агентов. В руководстве рассматриваются настройка API, ценообразование, результаты бенчмарков, маршрутизация между провайдерами и сравнение с предшественником.

· TheRouter

Google выпустил Gemini 3.7 Flash 13 августа 2026 года — новейшую рабочую модель линейки Flash с существенными улучшениями в написании кода, агентном инструментарии и интеллектуальной работе по сравнению с Gemini 3.6 Flash. Вводная цена составляет $0.75 за 1M входных токенов и $3.75 за 1M выходных токенов до 31 декабря 2026 года (после этого стандартные тарифы удваиваются). Модель принимает текст, изображения, аудио и видео с контекстным окном в 1M токенов и максимальным выводом в 64K токенов, что делает её сильным вариантом для продакшн-пайплайнов агентов.

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Источники: Google Blog — Introducing Gemini 3.7 Flash, дата обращения 2026-08-20; Gemini 3.7 Flash Model Card — Google DeepMind, дата обращения 2026-08-20; Gemini API Pricing — Google Cloud, дата обращения 2026-08-20; OpenRouter — Gemini 3.7 Flash, дата обращения 2026-08-20; Artificial Analysis — Gemini 3.7 Flash, дата обращения 2026-08-20.

Начало работы за 3 минуты

1. Получите API-ключ

Создайте или получите API-ключ Gemini на ai.google.dev. Если планируете использовать Enterprise Agent Platform, включите Gemini API в проекте Google Cloud.

2. Установите SDK

Python (Google GenAI SDK):

pip install google-genai

Python (OpenAI SDK — для OpenAI-совместимых эндпоинтов):

pip install openai

3. Первый запрос

Через Google GenAI SDK:

from google import genai

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="Объясни разницу между gRPC и REST в трёх предложениях.",
)
print(response.text)

Через OpenAI SDK (OpenAI-совместимый эндпоинт):

from openai import OpenAI

client = OpenAI(
    api_key="your-api-key",
    base_url="https://generativelanguage.googleapis.com/v1beta/openai/",
)

response = client.chat.completions.create(
    model="gemini-3.7-flash",
    messages=[
        {"role": "user", "content": "Объясни разницу между gRPC и REST в трёх предложениях."}
    ],
)
print(response.choices[0].message.content)

Оба варианта возвращают одинаковый результат. OpenAI-совместимый эндпоинт позволяет менять провайдеров без переписывания кода приложения.

Что изменилось в 3.7 Flash по сравнению с 3.6 Flash

Gemini 3.7 Flash вышел через три недели после 3.6 Flash. Google описывает его как прямой результат обратной связи от разработчиков и алгоритмических улучшений базовой архитектуры рассуждений. Практические различия проявляются в трёх областях.

Точность кода. На FrontierCode 1.1 Main (качество продакшн-кода) результат вырос с 34.4% до 43.6%. На DeepSWE v1.1 (long-horizon software engineering) — с 49.0% до 65.3%. Для модели того же поколения это заметный скачок.

Агентные workflow. Terminal-bench 2.1 (агентное терминальное кодирование) поднялся с 78.0% до 85.8%. AutomationBench (автоматизация корпоративных workflow) почти удвоился — с 17.0% до 30.4%. OSWorld-2.0 (агентное управление компьютером) вырос с 33.8% до 47.9%.

Интеллектуальная работа. GDP.pdf (экспертное понимание PDF) увеличился с 22.0% до 34.0%. Harvey LAB-AA (сложные юридические workflow) — с 85.1% до 90.7%.

Модель лучше справляется с препятствиями, при необходимости уточняет намерение пользователя и точнее следует многошаговым инструкциям, сокращая необходимость ручного вмешательства и повторных запросов.

Источник: Gemini 3.7 Flash Model Card — Google DeepMind, дата обращения 2026-08-20.

Цены и контекстное окно

ПараметрGemini 3.7 Flash
Цена входных токенов$0.75 / 1M токенов (вводная, до 31 декабря 2026)
Цена выходных токенов$3.75 / 1M токенов (вводная, до 31 декабря 2026)
Стандартная цена входных токенов (с января 2027)$1.50 / 1M токенов
Стандартная цена выходных токенов (с января 2027)$7.50 / 1M токенов
Контекстное окно1 000 000 токенов
Максимальный вывод64 000 токенов
Входные модальностиТекст, изображения, аудио, видео, PDF
Выходные модальностиТекст
Дата отсечки знанийМарт 2026

По вводным тарифам 3.7 Flash стоит вдвое дешевле, чем 3.6 Flash на момент его первоначального запуска. Для команд с большим объёмом агентных циклов или batch-обработки Gemini 3.7 Flash — один из самых экономичных вариантов среди GA-моделей рабочего класса.

Источники: Google Cloud Pricing — Gemini Enterprise Agent Platform, дата обращения 2026-08-20; Google DeepMind Model Card, дата обращения 2026-08-20.

Сравнение бенчмарков

БенчмаркGemini 3.7 FlashGemini 3.6 FlashClaude Sonnet 5GPT-5.6 Terra
FrontierCode 1.1 Main43.6%34.4%42.7%41.3%
DeepSWE v1.165.3%49.0%53.8%69.6%
WebDev Arena Elo1588153815411523
Terminal-bench 2.185.8%78.0%80.4%87.4%
AutomationBench30.4%17.0%10.7%23.6%
GDP.pdf34.0%22.0%28.0%24.7%
LVBench (длинное видео)85.4%84.2%68.5%78.9%
128k MRCR v2 (8-needle)97.0%91.8%81.5%93.5%
OSWorld-2.047.9%33.8%—50.2%
HLE-Verified53.6%51.2%31.0%51.1%

Gemini 3.7 Flash лидирует в web-разработке, автоматизации, работе с длинным контекстом и видео. GPT-5.6 Terra незначительно превосходит его на Terminal-bench 2.1 и DeepSWE. Claude Sonnet 5 отстаёт по большинству бенчмарков в этой таблице, но обладает собственными сильными сторонами в extended thinking и структурированном выводе.

Все данные бенчмарков взяты из Gemini 3.7 Flash Model Card (Google DeepMind, август 2026). Это данные от производителя — независимые оценки ещё только появляются.

Маршрутизация через TheRouter

Зависимость от одного провайдера — это единая точка отказа. TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров с поддержкой fallback для отказоустойчивости.

Типичная конфигурация маршрутизации для Gemini 3.7 Flash:

from openai import OpenAI

client = OpenAI(
    api_key="your-therouter-api-key",
    base_url="https://api.therouter.ai/v1",
)

# TheRouter направляет 'google/gemini-3.7-flash' к провайдеру Google
response = client.chat.completions.create(
    model="google/gemini-3.7-flash",
    messages=[
        {"role": "user", "content": "Напиши функцию на Python для парсинга дат в формате ISO 8601."}
    ],
)
print(response.choices[0].message.content)

При настроенном fallback, если эндпоинт Google недоступен, TheRouter прозрачно перенаправит запрос к альтернативному провайдеру. Для coding-агентов, выполняющих ночные batch-задачи, это критично — кратковременный сбой провайдера не должен останавливать весь пайплайн.

Подробнее о настройке fallback в нашем руководстве по маршрутизации с fallback.

Примечание: На момент публикации google/gemini-3.7-flash ещё не добавлен в models-data.ts TheRouter. Текущую доступность моделей Google смотрите на странице провайдера Google.

Режим thinking и настройка

Gemini 3.7 Flash поддерживает настраиваемые конфигурации thinking. Вы можете управлять балансом качества, стоимости и задержки через параметр thinking budget.

from google import genai
from google.genai import types

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="Отладь этот Python-трейсбек и предложи исправление: ...",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(
            thinking_budget=4096,
        )
    ),
)
print(response.text)

Более высокий thinking budget повышает точность на сложных многошаговых задачах ценой увеличения задержки и потребления токенов. Для простых запросов достаточно низкого бюджета — ответы быстрее и дешевле. В агентных циклах эта гибкость полезна: одни шаги требуют глубокого рассуждения (code review, отладка), другие — быстрого ответа (проверка статуса, форматирование).

Поддерживаемые возможности

ВозможностьПоддержка
Генерация текстаДа
Мультимодальный ввод (изображения, аудио, видео, PDF)Да
Function calling / tool useДа
Режим thinkingДа (настраиваемый budget)
Search groundingДа
Computer useДа (встроенный инструмент, унаследован от 3.5 Flash)
Managed AgentsДа
Interactions APIДа
Выполнение кодаДа
Context cachingДа
Batch APIСм. документацию Google

Gemini 3.7 Flash наследует весь набор возможностей линейки Flash, включая встроенный инструмент computer use из 3.5 Flash. Подробнее об интеграции computer use — в нашем руководстве по Gemini 3.5 Flash computer use.

Сравнение цен с конкурентами

МодельВход / 1M токеновВыход / 1M токеновКонтекстное окно
Gemini 3.7 Flash$0.75$3.751M
Gemini 3.6 Flash$0.75$3.751M
Claude Sonnet 5$2.00$10.00200K
GPT-5.6 Terra$2.00$12.00256K
DeepSeek V4 Flash$0.14$0.28128K
Qwen3.7-Max¥2.00¥8.001M

Среди моделей фронтир-класса Gemini 3.7 Flash предлагает самое большое контекстное окно по самой низкой цене. DeepSeek V4 Flash дешевле, но имеет меньшее контекстное окно и меньше встроенных возможностей. Qwen3.7-Max сопоставим по размеру контекста, но тарифицируется в юанях и доступен через DashScope.

Источники: цены по состоянию на август 2026 из официальной документации провайдеров и агрегаторов. Тарифы могут измениться.

Распространённые ошибки и решения

429 Too Many Requests — превышен лимит запросов. Google устанавливает лимиты RPM и TPM в зависимости от уровня аккаунта. Решения: экспоненциальный backoff, переход на платный уровень или маршрутизация через TheRouter с fallback для распределения нагрузки.

400 Invalid value at 'contents' — некорректное тело запроса. Обычно причина в пустом массиве contents или неподдерживаемом параметре. Проверьте API-документацию generateContent.

503 Service Unavailable — временный сбой. Повторите запрос с backoff. В продакшне настройте model fallback для автоматического перенаправления.

gemini-3.7-flash not found — убедитесь в правильности model ID. В Google AI Studio используйте gemini-3.7-flash, на Vertex AI / Enterprise Agent Platform — полное квалифицированное имя. Модель стала GA 13 августа 2026 года.

Чек-лист для продакшна

Перед развёртыванием Gemini 3.7 Flash в продакшне проверьте следующие пункты:

  1. Области действия API-ключей. Используйте ключ, привязанный к проекту, с минимальными правами. Ротируйте ключи по расписанию.
  2. Запас по лимитам. Проверьте выделенные RPM/TPM в Google Cloud Console. Запрашивайте увеличение до запуска, а не в момент инцидента.
  3. Настройка thinking budget. Профилируйте рабочую нагрузку. В агентных циклах с большим числом шагов высокий thinking budget обходится дорого. Начинайте с низких значений и повышайте только там, где точность критична.
  4. Fallback-маршрутизация. Настройте хотя бы одну альтернативную модель (например, google/gemini-3.6-flash или deepseek/deepseek-chat), чтобы кратковременные сбои не останавливали пайплайн.
  5. Использование контекстного окна. 1M токенов — это максимум. Мониторьте фактическое потребление. Запросы с большим контекстом дороже и медленнее.
  6. Срок вводных тарифов. Текущие цены действуют до 31 декабря 2026. В бюджете на 2027 год закладывайте удвоение тарифов на вход и выход.
  7. Безопасность контента. Gemini 3.7 Flash включает обновлённые меры безопасности Frontier Safety для CBRN и кибер-доменов. Ознакомьтесь с model card на предмет ограничений контентной политики.

Интеграция с TheRouter

TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров, поддерживает provider/model routing и fallback в рамках существующих продуктовых путей, а также предоставляет унифицированные поверхности для биллинга и учёта.

Для моделей Gemini это значит: вы один раз пишете код на OpenAI SDK, направляете base_url на TheRouter и получаете отказоустойчивость на уровне провайдера без интеграции провайдер-специфичных SDK. Когда google/gemini-3.7-flash появится в каталоге моделей, переход с прямых вызовов Google API на маршрутизированные вызовы потребует только смены base URL и API-ключа.

Текущую доступность моделей Google на TheRouter смотрите на странице провайдера Google.

Дополнительные материалы

Модели, упомянутые в статье

Помощь и контакты