Nano Banana 2 Lite — новый дефолтный эндпоинт Gemini для изображений: фреймворк принятия решений по маршрутизации

Nano Banana 2 Lite (gemini-3.1-flash-lite-image) вышел 30 июня по $0,034/тыс. изображений при задержке 4 секунды. Если вы ещё маршрутизируете на gemini-2.5-flash-image — вы на устаревшей модели. Трёхуровневый routing-фреймворк для operator teams.

Опубликовано источник Google DeepMind

Архивный материал, подготовленный с помощью ИИ по указанному источнику и опубликованный без индивидуальной проверки. Ответственный редактор: Joe Werner.

Абстрактная редакционная схема: три пути маршрутизации генерации изображений — скорость, баланс, качество — сходятся в единой точке AI gateway
Машинный перевод с английского оригинала — читать оригинал

Релиз Nano Banana 2 Lite (gemini-3.1-flash-lite-image) 30 июня — это не просто очередная модель. Это сигнал того, что семейство Nano Banana достаточно зрелое, чтобы рассматривать его как структурированный routing tier, а не как единственный дефолтный эндпоинт. В паре с одновременным релизом Gemini Omni Flash для видео Google фактически опубликовал референсную архитектуру мультимедийных pipeline. Если ваш image routing до сих пор ссылается на gemini-2.5-flash-image (оригинальный Nano Banana), вы работаете с устаревшей моделью, от которой сам Google официально рекомендует уходить.

Что произошло

30 июня 2026 года Google DeepMind выпустил для разработчиков через Gemini API и Google AI Studio два новых инструмента:

  • Nano Banana 2 Lite (gemini-3.1-flash-lite-image): самый быстрый и дешёвый вариант в семействе Nano Banana. $0,034 за 1 000 изображений при задержке text-to-image около 4 секунд. Официальная замена от Google для gemini-2.5-flash-image (оригинального Nano Banana).
  • Gemini Omni Flash (gemini-omni-flash-preview): модель для генерации видео и диалогового редактирования по $0,10 за секунду выходного видео — отдельно разобрана в предыдущей статье.

Семейство Nano Banana теперь насчитывает три tier:

МодельAPI IDЗадержкаСтоимость/тыс. изобр.Оптимально для
Nano Banana 2 Litegemini-3.1-flash-lite-image~4 с$0,034Скоростные задачи, высокий throughput, черновики
Nano Banana 2gemini-3.1-flash-imageбыстрее Proниже ProБаланс качества и стоимости
Nano Banana Progemini-3.0-pro-imageмедленнеевышеСложные профессиональные задачи, приоритет точности

Устаревшая модель — оригинальный Nano Banana (gemini-2.5-flash-image) — больше не рекомендуется Google. В официальном блоге прямо написано: «Мы рекомендуем перейти на Nano Banana 2 Lite — она обеспечивает лучшее качество, более высокую скорость и меньшую стоимость».

Почему это важно для AI engineering команд

Для любой команды, работающей с Gemini image API, изменились три routing-решения.

1. Дисциплина версионирования model ID. Если вы захардкодили gemini-2.5-flash-image в качестве дефолтного image эндпоинта, вы отстаёте на два поколения. В отличие от текстовых моделей, где иногда есть alias latest, Google image model ID явно кодирует поколение и tier: gemini-3.1-flash-lite-image, gemini-3.1-flash-image, gemini-3.0-pro-image несут смысл в самом названии. Нужен routing config layer, а не захардкоженная строка — иначе переход на новый tier будет болезненным.

2. Выбор tier теперь — это решение в области routing policy. До Nano Banana 2 Lite большинство команд использовали ту единственную Gemini image model, с которой начинали работу. Теперь один и тот же тип запроса — генерация изображения из текста — имеет три точки cost/latency/quality, и выбор должен зависеть от контекста задачи:

  • Черновые или итеративные workflow, где важна скорость обратной связи: Nano Banana 2 Lite, $0,034/тыс., 4 с задержки.
  • Продакшн-контент с требованиями к консистентности персонажей или читаемости текста на изображении: Nano Banana 2 (средний tier).
  • Профессиональные задачи, где точность важнее стоимости: Nano Banana Pro.

Маршрутизация по параметру quality_tier в запросе — а не по статичному эндпоинту — позволяет выдерживать SLO под каждый сценарий использования без пересмотра контрактов с провайдером.

3. Cost accounting теперь требует отслеживания tier. При $0,034/тыс. для Lite против более высоких ставок для Pro разница в стоимости на умеренных продакшн-нагрузках может быть существенной. Billing reconciliation должен фиксировать, какой tier использовался для каждого задания, а не просто факт обращения к «Gemini image API».

Угол зрения router/operator

Наиболее значимый для операторов аспект этого релиза — явно рекомендованный Google паттерн image-to-video pipeline: быстрая генерация изображений через Nano Banana 2 Lite, затем передача результата как reference frame в Gemini Omni Flash для создания или редактирования видео.

Этот паттерн — дешёвая быстрая image модель, обслуживающая stateful видео-сессию — вводит асинхронную координацию заданий, которую большинство команд, привыкших к синхронным text API, ещё не решали. Генерация изображения сама по себе быстрая (4 с), но последующее видеоредактирование использует Interactions API — session-based, multi-turn протокол. Соединить их корректно можно только при наличии:

  • Отслеживания жизненного цикла заданий: какой image output соответствует какому video session ID.
  • Fallback routing: если Omni Flash упёрся в rate limit или preview деградирует, нужна независимая fallback политика для видеоветки, без повторной генерации изображения.
  • Разнесения стоимости: две ветки тарифицируются по-разному ($0,034/тыс. изобр. против $0,10/сек видео) и должны правильно атрибутироваться в billing ledger команды/проекта.

Для команд, использующих поддержку асинхронных медиа pipeline в TheRouter, image generation задания можно подавать через стандартный жизненный цикл /v1/jobs/:id с параметром model google/gemini-3.1-flash-lite-image. Tier routing — выбор Lite, mid-tier или Pro на основе метаданных запроса — выражается как routing rule без изменения кода приложения.

Пример набора routing правил:

{
  "routes": [
    { "condition": "req.quality == 'draft'", "model": "google/gemini-3.1-flash-lite-image" },
    { "condition": "req.quality == 'balanced'", "model": "google/gemini-3.1-flash-image" },
    { "condition": "req.quality == 'pro'",     "model": "google/gemini-3.0-pro-image" }
  ]
}

Это также готовит вашу инфраструктуру к моменту, когда тег preview у Nano Banana 2 Lite снимут и выйдет стабильный versioned ID — обновляете один routing config, а не десятки call site в приложении.

Что стоит отслеживать и попробовать пользователям TheRouter

  • Мигрируйте с gemini-2.5-flash-image, если ещё не сделали этого. Google считает Nano Banana 2 Lite официальной заменой. Убедитесь, что routing config указывает на gemini-3.1-flash-lite-image, до того как legacy model выйдет из changelog Gemini API.
  • Настройте tier-based routing rules для image generation, если нагрузки охватывают черновики, баланс и высокое качество. Это предотвращает как переплату (весь трафик в Pro), так и деградацию продакшн-контента (весь трафик в Lite).
  • Изучите паттерн image-to-video при оценке Gemini Omni Flash. Апстрим-ветка генерации изображений (Nano Banana 2 Lite) достаточно быстрая и дешёвая, чтобы запускаться заранее перед каждым стартом видеосессии, — но это требует координации заданий, которая работает чисто только если ваш gateway поддерживает связанное async job tracking.
  • Активно следите за preview model ID. gemini-omni-flash-preview и gemini-3.1-flash-lite-image сейчас в API preview. Ранее Google переводил Gemini image preview модели в deprecated через 30-60 дней после релиза GA-версий. Заведите цикл ревью routing config, а не ручное напоминание.
  • Сверяйтесь с документацией по генерации изображений Gemini API для актуальной сравнительной таблицы моделей и обновлённых цен после смены preview статуса.
Техническая схема, показывающая два временных горизонта устаревания endpoint'ов Gemini Image API с датами отключения 25 июня и 17 августа как контрольными точками миграции для инженерных команд

Gemini API Image Generation 2026: как исправить failed to fetch после отключения preview-моделей

В 2026 году Gemini API проходит две миграции: после cutoff 25 июня preview-модели вызывают сбои failed to fetch, а GA-endpoint’ы Imagen 4 отключаются 17 августа. Проверьте model ID, перейдите на gemini-3.1-flash-image или gemini-3-pro-image и протестируйте generateContent.

источник Google AI for Developers
Редакционная иллюстрация глобуса с разделёнными региональными и глобальными маршрутами передачи данных и индикаторами стоимости

Ценообразование Gemini для не-глобальных эндпоинтов вступает в силу 1 июля: 10% региональная надбавка, которую каждая команда должна учесть в роутинге

С 1 июля 2026 года Gemini 3 и последующие модели получают 10% надбавку для не-глобальных (региональных) эндпоинтов. Командам, направляющим трафик в eu-west1, asia-northeast1 и аналогичные регионы, необходимо немедленно пересмотреть модели расходов.

источник Google Cloud
Семь путей маршрутизации сходятся в единый узел пропускной способности, иллюстрируя новую поддержку очереди заказов Gemini

Gemini Provisioned Throughput теперь поддерживает очередь из 7 заказов: что GA-релиз мультизаказов меняет для команд маршрутизации

1 июля Google перевёл поддержку нескольких ожидающих заказов Provisioned Throughput в статус GA — теперь можно одновременно ставить в очередь до 7 заказов на одну модель и регион, устраняя последовательный 10-дневный цикл активации.

источник Google
Помощь и контакты