Gemini 3.5 Flash — это уже не Flash-модель: что ценовая перестройка Google значит для вашей routing-политики

Google запустила Gemini 3.5 Flash по «$1,50»/«$9» за миллион токенов — в 3–6 раз дороже предыдущих Flash-уровней. В связке с новым серверным Interactions API это переписывает то, что routing-команды должны считать про Gemini Flash.

Опубликовано источник Google AI Blog

Архивный материал, подготовленный с помощью ИИ по указанному источнику и опубликованный без индивидуальной проверки. Ответственный редактор: Joe Werner.

Абстрактная редакционная иллюстрация: многоуровневые routing-решения и cost-aware политика AI-provider-ов
Машинный перевод с английского оригинала — читать оригинал

Для команд, у которых routing-политика построена вокруг тезиса «Gemini Flash = дешёвый fallback», Google I/O 2026 только что обнулил это допущение.

19 мая Google запустила Gemini 3.5 Flash — свою новую флагманскую fast-модель — сразу в general availability под model ID gemini-3.5-flash. Без preview-периода. Но главное для routing-команд — цена: «$1,50» за миллион input-токенов и «$9,00» за миллион output-токенов. Это в 3 раза дороже предыдущей Gemini 3 Flash Preview («$0,50»/«$3») и в 6 раз дороже Gemini 3.1 Flash-Lite («$0,25»/«$1,50»).

Параллельно Google представила Interactions API в public beta — новый серверный слой управления сессиями, повторяющий stateful-паттерны OpenAI Responses API. Способен ли ваш текущий proxy маршрутизировать эти вызовы прозрачно — вопрос важнее, чем цифры в бенчмарках.

Что произошло

Google I/O 2026 (19–20 мая) стал крупнейшим релиз-циклом Gemini по числу изменений, обращённых к разработчикам. Центральный релиз для API-команд:

  • Gemini 3.5 Flash (gemini-3.5-flash): generally available с первого дня. Контекст 1 048 576 токенов, до 65 536 output-токенов. Поддерживает thinking-режим. Google использует её внутри Gemini Search, агентной платформы Antigravity, Google AI Studio и Gemini Enterprise.
  • Gemini Interactions API (public beta): новая поверхность API со встроенной поддержкой многошагового tool use, серверной истории диалога и оркестрационных примитивов. По дизайну явно сравнивается с OpenAI Responses.
  • Gemini 3.5 Pro: обещан «в следующем месяце» (июнь 2026). Цены пока не объявлены, но паттерн указывает, что она встанет выше текущих «$2»/«$12» Gemini 3.1 Pro.
  • Context caching и batch-скидки: доступны на 3.5 Flash. 50% batch-скидка подтверждена. Тарифы context caching на момент публикации опубликованы не полностью.

Для сравнения, нынешняя Flash-линейка Google растянулась по цене в 6 раз:

МодельInput («$/1M»)Output («$/1M»)
Gemini 3.1 Flash-Lite«$0,25»«$1,50»
Gemini 3 Flash Preview«$0,50»«$3,00»
Gemini 3.5 Flash«$1,50»«$9,00»
Gemini 3.1 Pro Preview«$2,00»«$12,00»

По стоимости Gemini 3.5 Flash теперь ближе к Pro-уровню, чем к своим Flash-предшественникам.

Почему это важно для AI-инженерных команд

Название «Flash» приучило routing-политики во многих командах воспринимать Gemini Flash как «дешёвый, но мощный» уровень, а Pro — как дорогой reasoning-уровень. С 3.5 Flash эта ментальная модель ломается.

Cost-моделирование требует обновления. Команды, маршрутизирующие high-volume задачи средней сложности на любую модель с именем gemini-*-flash, должны проверить, какой именно model ID реально стоит у них в конфиге. Жёстко прописанная ссылка gemini-flash или gemini-3-flash при aliasing-е теперь может вести на принципиально другой ценовой пункт, а прямого routing на gemini-3.5-flash две недели назад просто не существовало.

Interactions API добавляет риск passthrough через proxy. Новая beta-поверхность API ведёт историю сессии на сервере (как OpenAI Responses). Если ваш routing-слой пробрасывает сырое тело запроса к Gemini-эндпоинту, не понимая схемы Interactions API, вы можете молча падать или терять непрерывность сессии. Стандартные вызовы /v1/chat/completions продолжают работать — Interactions API дополнителен, а не заменяет их, — но любой команде, планирующей его внедрение, нужно проверить, поддерживает ли роутер новые паттерны эндпоинтов.

Gemini 3.5 Pro выйдет в течение недель. Новая верхушка Gemini над Gemini 3.1 Pro означает третий ценово-возможностный якорь, с которым придётся калибровать политику внутри одного Google-provider-а. Команды, строящие в июне 2026 multi-model routing-стратегии, работают с неполной картиной, если не закладывают приход 3.5 Pro.

Context caching меняет эффективную стоимость. Для long-context сценариев (agent memory, большие кодовые базы, длинные документы) context caching и batch-скидки на 3.5 Flash способны существенно снизить «$9/M» output. Реальная цена для команды, маршрутизирующей задачи code review с большим префиксом кода, может быть значительно ниже headline-ставки — но только если роутер или приложение явно включают caching.

Взгляд router/operator

Практическое изменение для routing-команд: уровневая лестница Google Gemini теперь требует трёх уровней политики, а не двух:

  1. Ultra-cheap tier: gemini-3.1-flash-lite для high-volume классификации, простой суммаризации, pre-checks при routing-е.
  2. Mid tier (старый «Flash»): gemini-3-flash-preview остаётся как cost-effective среднее звено.
  3. Premium Flash: gemini-3.5-flash — новый дефолт во всех продуктах Google. Резервируйте под кодинг, агентные задачи, long-horizon reasoning и multimodal-работу, где разрыв в качестве с 3-Flash-Preview оправдывает рост цены в 3 раза.

Следствие для fallback-цепочек: если у вас падает основной provider и происходит fallback на Gemini Flash, стоимость fallback по сравнению с политикой, написанной в начале 2026-го, скорее всего, утроилась. Cost-aware конфигурация fallback теперь должна явно различать gemini-3-flash-preview и gemini-3.5-flash.

Interactions API также поднимает вопрос архитектуры proxy. Новый API управляет историей на сервере, то есть непрерывность сессии привязана к Google-эндпоинту, а не к клиенту. Routing-слой, который перебрасывает запросы посреди сессии другому provider-у (например, как failover), сломает сессии Interactions API. Команд, использующих stateless /generateContent или /chat/completions, это не касается, но за развитием стоит следить по мере приближения GA Interactions API.

Атрибуция стоимости: запуск Gemini 3.5 Flash на масштабе с включённым thinking даёт значительно больше токенов на запрос, чем у non-thinking Flash-моделей. Данные Artificial Analysis показывают, что прогон их стандартного набора против 3.5 Flash (high/thinking режим) стоил «$1 551» — дороже, чем Gemini 3.1 Pro Preview по «$892». Usage-based billing-атрибуция в дашбордах должна учитывать инфляцию reasoning-токенов.

На что обратить внимание пользователям TheRouter

  • Проверьте свои Gemini model ID прямо сейчас. Если какое-то routing-правило или конфиг модели ссылается на gemini-flash без явной фиксации версии, убедитесь в том, как именно резолвится этот alias, до того как Google потенциально изменит дефолт. Явные model ID (gemini-3-flash-preview, gemini-3.5-flash) безопаснее с точки зрения предсказуемости стоимости.
  • Обновите cost-пороги fallback-а. Если Gemini Flash был настроен как low-cost fallback, новый прайс означает, что потолок стоимости fallback изменился. Пересмотрите routing-политики, использующие Gemini Flash как «дешёвый вторичный» вариант.
  • Следите за таймлайном GA Interactions API. Новый beta-API не обязателен для существующих интеграций на базе /chat/completions, но если вы строите долгоживущие agent-воркфлоу на Gemini, спланируйте миграционный путь сейчас, а не после GA.
  • Оцените Gemini 3.1 Flash-Lite для простых routing-задач. По «$0,25»/«$1,50» Flash-Lite остаётся убедительным вариантом для pre-routing классификации, intent detection и дешёвых шагов суммаризации в agent-пайплайнах. Добавление её как явной цели routing для простых нагрузок сохраняет тот ценовой профиль, который раньше подразумевал «Flash».
  • Готовьтесь к Gemini 3.5 Pro. В пределах нескольких недель приземлится новая флагманская Pro-модель Google. Держите один routing-слот открытым и запланируйте оценочный прогон, когда она выйдет.

Главный урок Google I/O 2026 — не в том, что Gemini поумнела (это так), а в том, что Google переоценила свою инференс-экономику, и routing-политики, написанные до мая 2026-го, нужно обновлять с учётом этого.

Модели, упомянутые в статье

Редакционная иллюстрация глобуса с разделёнными региональными и глобальными маршрутами передачи данных и индикаторами стоимости

Ценообразование Gemini для не-глобальных эндпоинтов вступает в силу 1 июля: 10% региональная надбавка, которую каждая команда должна учесть в роутинге

С 1 июля 2026 года Gemini 3 и последующие модели получают 10% надбавку для не-глобальных (региональных) эндпоинтов. Командам, направляющим трафик в eu-west1, asia-northeast1 и аналогичные регионы, необходимо немедленно пересмотреть модели расходов.

источник Google Cloud
Абстрактная редакционная иллюстрация обратного отсчёта таймлайна с переходом жизненного цикла моделей и решениями по routing-путям

Gemini 2.0 Flash отключена (EOL, июнь 2026): что заменило и что делать сейчас

Gemini 2.0 Flash и Flash-Lite достигли конца жизненного цикла 1 июня 2026 года — отключение завершено. Здесь: какие model ID удалены, какие замены (gemini-2.5-flash-lite, gemini-3.1-flash-lite) реально работают как альтернатива, реальная разница в стоимости и быстрый…

источник Google AI for Developers
Абстрактная редакционная схема: три пути маршрутизации генерации изображений — скорость, баланс, качество — сходятся в единой точке AI gateway

Nano Banana 2 Lite — новый дефолтный эндпоинт Gemini для изображений: фреймворк принятия решений по маршрутизации

Nano Banana 2 Lite (gemini-3.1-flash-lite-image) вышел 30 июня по $0,034/тыс. изображений при задержке 4 секунды. Если вы ещё маршрутизируете на gemini-2.5-flash-image — вы на устаревшей модели. Трёхуровневый routing-фреймворк для operator teams.

источник Google DeepMind
Помощь и контакты