Gemini 3.7 Flash GA: руководство по интеграции API и маршрутизации между провайдерами
Gemini 3.7 Flash стал общедоступным 13 августа 2026 года — самая мощная рабочая модель Google для кодинга и агентов. В руководстве рассматриваются настройка API, ценообразование, результаты бенчмарков, маршрутизация между провайдерами и сравнение с предшественником.
Google выпустил Gemini 3.7 Flash 13 августа 2026 года — новейшую рабочую модель линейки Flash с существенными улучшениями в написании кода, агентном инструментарии и интеллектуальной работе по сравнению с Gemini 3.6 Flash. Вводная цена составляет $0.75 за 1M входных токенов и $3.75 за 1M выходных токенов до 31 декабря 2026 года (после этого стандартные тарифы удваиваются). Модель принимает текст, изображения, аудио и видео с контекстным окном в 1M токенов и максимальным выводом в 64K токенов, что делает её сильным вариантом для продакшн-пайплайнов агентов.
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
Источники: Google Blog — Introducing Gemini 3.7 Flash, дата обращения 2026-08-20; Gemini 3.7 Flash Model Card — Google DeepMind, дата обращения 2026-08-20; Gemini API Pricing — Google Cloud, дата обращения 2026-08-20; OpenRouter — Gemini 3.7 Flash, дата обращения 2026-08-20; Artificial Analysis — Gemini 3.7 Flash, дата обращения 2026-08-20.
Начало работы за 3 минуты
1. Получите API-ключ
Создайте или получите API-ключ Gemini на ai.google.dev. Если планируете использовать Enterprise Agent Platform, включите Gemini API в проекте Google Cloud.
2. Установите SDK
Python (Google GenAI SDK):
pip install google-genai
Python (OpenAI SDK — для OpenAI-совместимых эндпоинтов):
pip install openai
3. Первый запрос
Через Google GenAI SDK:
from google import genai
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="Объясни разницу между gRPC и REST в трёх предложениях.",
)
print(response.text)
Через OpenAI SDK (OpenAI-совместимый эндпоинт):
from openai import OpenAI
client = OpenAI(
api_key="your-api-key",
base_url="https://generativelanguage.googleapis.com/v1beta/openai/",
)
response = client.chat.completions.create(
model="gemini-3.7-flash",
messages=[
{"role": "user", "content": "Объясни разницу между gRPC и REST в трёх предложениях."}
],
)
print(response.choices[0].message.content)
Оба варианта возвращают одинаковый результат. OpenAI-совместимый эндпоинт позволяет менять провайдеров без переписывания кода приложения.
Что изменилось в 3.7 Flash по сравнению с 3.6 Flash
Gemini 3.7 Flash вышел через три недели после 3.6 Flash. Google описывает его как прямой результат обратной связи от разработчиков и алгоритмических улучшений базовой архитектуры рассуждений. Практические различия проявляются в трёх областях.
Точность кода. На FrontierCode 1.1 Main (качество продакшн-кода) результат вырос с 34.4% до 43.6%. На DeepSWE v1.1 (long-horizon software engineering) — с 49.0% до 65.3%. Для модели того же поколения это заметный скачок.
Агентные workflow. Terminal-bench 2.1 (агентное терминальное кодирование) поднялся с 78.0% до 85.8%. AutomationBench (автоматизация корпоративных workflow) почти удвоился — с 17.0% до 30.4%. OSWorld-2.0 (агентное управление компьютером) вырос с 33.8% до 47.9%.
Интеллектуальная работа. GDP.pdf (экспертное понимание PDF) увеличился с 22.0% до 34.0%. Harvey LAB-AA (сложные юридические workflow) — с 85.1% до 90.7%.
Модель лучше справляется с препятствиями, при необходимости уточняет намерение пользователя и точнее следует многошаговым инструкциям, сокращая необходимость ручного вмешательства и повторных запросов.
Источник: Gemini 3.7 Flash Model Card — Google DeepMind, дата обращения 2026-08-20.
Цены и контекстное окно
| Параметр | Gemini 3.7 Flash |
|---|---|
| Цена входных токенов | $0.75 / 1M токенов (вводная, до 31 декабря 2026) |
| Цена выходных токенов | $3.75 / 1M токенов (вводная, до 31 декабря 2026) |
| Стандартная цена входных токенов (с января 2027) | $1.50 / 1M токенов |
| Стандартная цена выходных токенов (с января 2027) | $7.50 / 1M токенов |
| Контекстное окно | 1 000 000 токенов |
| Максимальный вывод | 64 000 токенов |
| Входные модальности | Текст, изображения, аудио, видео, PDF |
| Выходные модальности | Текст |
| Дата отсечки знаний | Март 2026 |
По вводным тарифам 3.7 Flash стоит вдвое дешевле, чем 3.6 Flash на момент его первоначального запуска. Для команд с большим объёмом агентных циклов или batch-обработки Gemini 3.7 Flash — один из самых экономичных вариантов среди GA-моделей рабочего класса.
Источники: Google Cloud Pricing — Gemini Enterprise Agent Platform, дата обращения 2026-08-20; Google DeepMind Model Card, дата обращения 2026-08-20.
Сравнение бенчмарков
| Бенчмарк | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| FrontierCode 1.1 Main | 43.6% | 34.4% | 42.7% | 41.3% |
| DeepSWE v1.1 | 65.3% | 49.0% | 53.8% | 69.6% |
| WebDev Arena Elo | 1588 | 1538 | 1541 | 1523 |
| Terminal-bench 2.1 | 85.8% | 78.0% | 80.4% | 87.4% |
| AutomationBench | 30.4% | 17.0% | 10.7% | 23.6% |
| GDP.pdf | 34.0% | 22.0% | 28.0% | 24.7% |
| LVBench (длинное видео) | 85.4% | 84.2% | 68.5% | 78.9% |
| 128k MRCR v2 (8-needle) | 97.0% | 91.8% | 81.5% | 93.5% |
| OSWorld-2.0 | 47.9% | 33.8% | — | 50.2% |
| HLE-Verified | 53.6% | 51.2% | 31.0% | 51.1% |
Gemini 3.7 Flash лидирует в web-разработке, автоматизации, работе с длинным контекстом и видео. GPT-5.6 Terra незначительно превосходит его на Terminal-bench 2.1 и DeepSWE. Claude Sonnet 5 отстаёт по большинству бенчмарков в этой таблице, но обладает собственными сильными сторонами в extended thinking и структурированном выводе.
Все данные бенчмарков взяты из Gemini 3.7 Flash Model Card (Google DeepMind, август 2026). Это данные от производителя — независимые оценки ещё только появляются.
Маршрутизация через TheRouter
Зависимость от одного провайдера — это единая точка отказа. TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров с поддержкой fallback для отказоустойчивости.
Типичная конфигурация маршрутизации для Gemini 3.7 Flash:
from openai import OpenAI
client = OpenAI(
api_key="your-therouter-api-key",
base_url="https://api.therouter.ai/v1",
)
# TheRouter направляет 'google/gemini-3.7-flash' к провайдеру Google
response = client.chat.completions.create(
model="google/gemini-3.7-flash",
messages=[
{"role": "user", "content": "Напиши функцию на Python для парсинга дат в формате ISO 8601."}
],
)
print(response.choices[0].message.content)
При настроенном fallback, если эндпоинт Google недоступен, TheRouter прозрачно перенаправит запрос к альтернативному провайдеру. Для coding-агентов, выполняющих ночные batch-задачи, это критично — кратковременный сбой провайдера не должен останавливать весь пайплайн.
Подробнее о настройке fallback в нашем руководстве по маршрутизации с fallback.
Примечание: На момент публикации
google/gemini-3.7-flashещё не добавлен вmodels-data.tsTheRouter. Текущую доступность моделей Google смотрите на странице провайдера Google.
Режим thinking и настройка
Gemini 3.7 Flash поддерживает настраиваемые конфигурации thinking. Вы можете управлять балансом качества, стоимости и задержки через параметр thinking budget.
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="Отладь этот Python-трейсбек и предложи исправление: ...",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(
thinking_budget=4096,
)
),
)
print(response.text)
Более высокий thinking budget повышает точность на сложных многошаговых задачах ценой увеличения задержки и потребления токенов. Для простых запросов достаточно низкого бюджета — ответы быстрее и дешевле. В агентных циклах эта гибкость полезна: одни шаги требуют глубокого рассуждения (code review, отладка), другие — быстрого ответа (проверка статуса, форматирование).
Поддерживаемые возможности
| Возможность | Поддержка |
|---|---|
| Генерация текста | Да |
| Мультимодальный ввод (изображения, аудио, видео, PDF) | Да |
| Function calling / tool use | Да |
| Режим thinking | Да (настраиваемый budget) |
| Search grounding | Да |
| Computer use | Да (встроенный инструмент, унаследован от 3.5 Flash) |
| Managed Agents | Да |
| Interactions API | Да |
| Выполнение кода | Да |
| Context caching | Да |
| Batch API | См. документацию Google |
Gemini 3.7 Flash наследует весь набор возможностей линейки Flash, включая встроенный инструмент computer use из 3.5 Flash. Подробнее об интеграции computer use — в нашем руководстве по Gemini 3.5 Flash computer use.
Сравнение цен с конкурентами
| Модель | Вход / 1M токенов | Выход / 1M токенов | Контекстное окно |
|---|---|---|---|
| Gemini 3.7 Flash | $0.75 | $3.75 | 1M |
| Gemini 3.6 Flash | $0.75 | $3.75 | 1M |
| Claude Sonnet 5 | $2.00 | $10.00 | 200K |
| GPT-5.6 Terra | $2.00 | $12.00 | 256K |
| DeepSeek V4 Flash | $0.14 | $0.28 | 128K |
| Qwen3.7-Max | ¥2.00 | ¥8.00 | 1M |
Среди моделей фронтир-класса Gemini 3.7 Flash предлагает самое большое контекстное окно по самой низкой цене. DeepSeek V4 Flash дешевле, но имеет меньшее контекстное окно и меньше встроенных возможностей. Qwen3.7-Max сопоставим по размеру контекста, но тарифицируется в юанях и доступен через DashScope.
Источники: цены по состоянию на август 2026 из официальной документации провайдеров и агрегаторов. Тарифы могут измениться.
Распространённые ошибки и решения
429 Too Many Requests — превышен лимит запросов. Google устанавливает лимиты RPM и TPM в зависимости от уровня аккаунта. Решения: экспоненциальный backoff, переход на платный уровень или маршрутизация через TheRouter с fallback для распределения нагрузки.
400 Invalid value at 'contents' — некорректное тело запроса. Обычно причина в пустом массиве contents или неподдерживаемом параметре. Проверьте API-документацию generateContent.
503 Service Unavailable — временный сбой. Повторите запрос с backoff. В продакшне настройте model fallback для автоматического перенаправления.
gemini-3.7-flash not found — убедитесь в правильности model ID. В Google AI Studio используйте gemini-3.7-flash, на Vertex AI / Enterprise Agent Platform — полное квалифицированное имя. Модель стала GA 13 августа 2026 года.
Чек-лист для продакшна
Перед развёртыванием Gemini 3.7 Flash в продакшне проверьте следующие пункты:
- Области действия API-ключей. Используйте ключ, привязанный к проекту, с минимальными правами. Ротируйте ключи по расписанию.
- Запас по лимитам. Проверьте выделенные RPM/TPM в Google Cloud Console. Запрашивайте увеличение до запуска, а не в момент инцидента.
- Настройка thinking budget. Профилируйте рабочую нагрузку. В агентных циклах с большим числом шагов высокий thinking budget обходится дорого. Начинайте с низких значений и повышайте только там, где точность критична.
- Fallback-маршрутизация. Настройте хотя бы одну альтернативную модель (например,
google/gemini-3.6-flashилиdeepseek/deepseek-chat), чтобы кратковременные сбои не останавливали пайплайн. - Использование контекстного окна. 1M токенов — это максимум. Мониторьте фактическое потребление. Запросы с большим контекстом дороже и медленнее.
- Срок вводных тарифов. Текущие цены действуют до 31 декабря 2026. В бюджете на 2027 год закладывайте удвоение тарифов на вход и выход.
- Безопасность контента. Gemini 3.7 Flash включает обновлённые меры безопасности Frontier Safety для CBRN и кибер-доменов. Ознакомьтесь с model card на предмет ограничений контентной политики.
Интеграция с TheRouter
TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров, поддерживает provider/model routing и fallback в рамках существующих продуктовых путей, а также предоставляет унифицированные поверхности для биллинга и учёта.
Для моделей Gemini это значит: вы один раз пишете код на OpenAI SDK, направляете base_url на TheRouter и получаете отказоустойчивость на уровне провайдера без интеграции провайдер-специфичных SDK. Когда google/gemini-3.7-flash появится в каталоге моделей, переход с прямых вызовов Google API на маршрутизированные вызовы потребует только смены base URL и API-ключа.
Текущую доступность моделей Google на TheRouter смотрите на странице провайдера Google.
Дополнительные материалы
- Руководство по Gemini 3.5 Flash Agentic Computer Use — computer use как встроенный инструмент, Managed Agents, Interactions API
- Сравнение Managed Agents API: DashScope, Gemini, OpenAI — кросс-провайдерное сравнение агентных API
- Сравнение моделей для coding-агентов 2026 — место Gemini 3.7 Flash в workflow coding-агентов
- Лимиты контекстного окна LLM API: справочник по провайдерам — сравнение контекстных окон всех основных провайдеров
- Стратегии оптимизации стоимости LLM API 2026 — prompt caching, batch-обработка и fallback routing для контроля расходов