Gemini 2.0 Flash отключена (EOL, июнь 2026): что заменило и что делать сейчас
Gemini 2.0 Flash и Flash-Lite достигли конца жизненного цикла 1 июня 2026 года — отключение завершено. Здесь: какие model ID удалены, какие замены (gemini-2.5-flash-lite, gemini-3.1-flash-lite) реально работают как альтернатива, реальная разница в стоимости и быстрый…
Архивный материал, подготовленный с помощью ИИ по указанному источнику и опубликованный без индивидуальной проверки. Ответственный редактор: Joe Werner.

Если ваша routing-политика использует gemini-2.0-flash или gemini-2.0-flash-lite как cost-optimized цель — основной маршрут или fallback — у вас жёсткий дедлайн: 1 июня 2026 года. Официальная страница цен Gemini API сейчас отображает заметное предупреждение: обе модели объявлены устаревшими и будут отключены через 7 дней. Любой вызов этих эндпоинтов после 1 июня завершится ошибкой.
Это не мягкое deprecation. Модели с 6 марта 2026 года находятся в режиме ограниченного доступа (новым клиентам их добавить уже нельзя). 1 июня — полное отключение. Затронутым командам нужно проверить ID моделей в конфигурации прямо сейчас, а не в следующем спринте.
Что именно отключается
С 1 июня 2026 года перестанут работать следующие model ID:
gemini-2.0-flash— GA-версия Flash-модели. Цена была «$0,10»/«$0,40» за миллион input/output токенов.gemini-2.0-flash-lite— облегчённый вариант. Цена была «$0,08»/«$0,30» за миллион токенов.gemini-2.0-flash-001иgemini-2.0-flash-lite-001— pinned-версии. С 6 марта уже ограничены только существующими клиентами.
Отдельно: gemini-3.1-flash-lite-preview была отключена сегодня, 25 мая. Если вы использовали эту preview-модель, она уже недоступна.
Реальная стоимость миграции
Слово «миграция» намекает на простую подмену model ID. На деле всё сложнее. Gemini 2.0 Flash была одной из самых дешёвых точек в линейке Gemini. Любая доступная замена стоит дороже:
| Модель-замена | Input | Output | vs Gemini 2.0 Flash |
|---|---|---|---|
gemini-2.5-flash-lite | «$0,10/M» | «$0,40/M» | Та же цена, но прошлое поколение (не Gemini 3) |
gemini-3.1-flash-lite | «$0,25/M» | «$1,50/M» | в ~2,5–3,75 раза дороже |
gemini-3-flash-preview | «$0,50/M» | «$3,00/M» | в 5 раз дороже |
gemini-3.5-flash | «$1,50/M» | «$9,00/M» | в 15 раз дороже |
gemini-3.1-pro-preview | «$2,00/M» | «$12,00/M» | в 20–30 раз дороже |
Ближайший по цене вариант — gemini-2.5-flash-lite за «$0,10»/«$0,40» — это модель предыдущего поколения, которую Google в итоге тоже выведет из эксплуатации. Самая дешёвая замена текущего поколения (Gemini 3) — это gemini-3.1-flash-lite по «$0,25»/«$1,50». Для high-volume нагрузок, где Gemini 2.0 Flash несла основной cost-load, скачок в 2,5–3,75 раза — это много.
Насколько эту разницу удастся сгладить, во многом зависит от того, можете ли вы включить context caching. Gemini Enterprise Agent Platform в Google Cloud теперь включает implicit caching по умолчанию, давая 90% скидку на cached input-токены. Для нагрузок, где большие системные промпты или документы повторяются между запросами — code review, document QA, классификация с общими инструкциями — context caching способен с лихвой компенсировать рост per-token цены базовой модели.
Почему это важно для AI-инженерных команд
Этот model ID наверняка размазан по куче конфигов. Gemini 2.0 Flash доступна с начала 2025-го и больше года была дефолтным дешёвым вариантом Gemini. Она почти наверняка фигурирует в routing-конфигах, fallback-цепочках, привязках к cost-tier, правилах обхода rate limit и прямых SDK-вызовах в нескольких сервисах. Аудита одного главного конфига недостаточно — нужно искать gemini-2.0-flash и gemini-2.0-flash-lite по всем репозиториям, переменным окружения и infrastructure-as-code файлам.
Скрытый риск — в fallback-цепочках. Основные конфиги моделей обычно хорошо задокументированы. Fallback-цепочки — нет. Если ваш routing-слой откатывается на gemini-2.0-flash при недоступности или перегрузке основной модели, то 1 июня превращает ваш fallback из механизма надёжности в путь к outage. Deprecation касается не только основного трафика — он убирает целый уровень из каждой fallback-цепочки, где упоминается эта модель.
Скачок цены на Gemini 3 меняет экономику нагрузки. Командам, которые строили production-нагрузки именно под прайс «$0,10»/«$0,40» Gemini 2.0 Flash, переход на `gemini-3.1-flash-lite» по «$0,25»/«$1,50» меняет unit-экономику. Workload в 1 млрд токенов в месяц с примерно «$300» (input-heavy на 2.0 Flash) уходит к примерно «$750» («$0,25/M» input). Это уже строка бюджета, которую должны видеть финансы, а не просто инженерное изменение конфига.
Deprecation Gemini CLI накладывается на тот же дедлайн. Google также объявила, что нынешняя Gemini CLI устаревает с жёстким отключением 18 июня 2026 года, рекомендуя миграцию на новую Antigravity CLI. Команды, использующие Gemini CLI для скриптов, локальной разработки или CI-пайплайнов, получают два последовательных дедлайна (1 июня для model ID, 18 июня для CLI) в пределах трёх недель.
Плейбук миграции для router/operator
Делите это на две фазы:
Фаза 1: Аудит (сделать сегодня)
- Проищите по всем конфигам, переменным окружения, инициализациям SDK и routing-правилам строки
gemini-2.0-flashиgemini-2.0-flash-lite. Включая pinned-версии (-001,-exp, любые датированные снапшоты). - Определите, где эти модели используются как primary, а где как fallback. Зафиксируйте оба случая.
- Для каждого использования определите тип нагрузки: latency-sensitive real-time, cost-sensitive batch, генерация кода, классификация, long-context документы или multimodal.
Фаза 2: замена на правильную модель, а не на «любую»
Выбор замены — не one-size-fits-all:
- Cost-sensitive, простые задачи, batch-нагрузки: начните с
gemini-2.5-flash-lite(та же цена, прошлое поколение) и протестируйте, прежде чем соглашаться наgemini-3.1-flash-lite. Если качество устраивает — это миграция с минимальным трением. - Cost-sensitive, нужно качество уровня Gemini 3:
gemini-3.1-flash-lite(«$0,25»/«$1,50»). Включите context caching, если у вас повторяются крупные входы — 90% скидка на cached токены заметно сужает реальный gap по стоимости. - High-volume классификация или извлечение с общими промптами:
gemini-3.1-flash-liteс implicit caching. Эффективная cached-input ставка — «$0,025/M», что на масштабе дешевле Gemini 2.0 Flash, если у вас разумный cache hit rate. - Генерация кода или сложный reasoning использовали 2.0 Flash как дешёвый путь: мигрируйте на
gemini-3-flash-preview(«$0,50»/«$3») или `gemini-3.5-flash» («$1,50»/«$9») в зависимости от требуемого качества. Это не эквивалентные замены для всех промптов — тестируйте, прежде чем заворачивать туда production-трафик.
Context caching как рычаг управления стоимостью:
Если вы перешли с Gemini 2.0 Flash на gemini-3.1-flash-lite и в нагрузке есть большой системный промпт (>10K токенов), повторяющийся между запросами, то кеширование этого сегмента способно опустить эффективную input-стоимость до «$0,025/M» — далеко ниже «$0,10/M» Gemini 2.0 Flash на этих cached-токенах. Миграция на 3.1-flash-lite может в итоге оказаться дешевле, чем сегодня, если архитектура поддерживает caching.
Обновление fallback-цепочки:
После замены primary model ID явно обновите fallback-цепочки. Не оставляйте gemini-2.0-flash или gemini-2.0-flash-lite ни в одной fallback-позиции. Списанная модель в fallback будет молча падать, пока fallback не сработает под нагрузкой — и тогда ошибка вылезет как outage, а не как warning в конфиге.
На что обратить внимание пользователям TheRouter
- Сделайте аудит provider-конфигов на упоминания Gemini 2.0 Flash прямо сейчас. Если вы маршрутизируете в Gemini API через TheRouter, поищите по конфигам provider-ов и routing-правилам строку
gemini-2.0-flash. Замените её на явный текущий model ID, не полагаясь на автоматический aliasing — дедлайн 1 июня жёсткий. - Протестируйте влияние стоимости до переключения fallback-ов. Диапазон 2,5–15 раз по стоимости между вариантами миграции означает, что слепая подмена на «ближайший эквивалент» способна заметно изменить ваш месячный счёт. Прогоните целевую модель против реального распределения промптов, прежде чем переключать production routing.
- Включите context caching, если ещё не включили. Если ваши Gemini-нагрузки используют большие повторяющиеся системные промпты или документы, implicit caching (90% скидка на cached токены) способен погасить большую часть удорожания Gemini 3.x. Доступно через Gemini Enterprise Agent Platform в Google Cloud.
- Поставьте календарный алерт и на дедлайн Gemini CLI. 18 июня — отключение Gemini CLI. Если у вас есть скрипты, CI-пайплайны или локальный тулинг, использующий старый CLI, это второй дедлайн, требующий внимания в пределах трёх недель.
Похожие материалы
Новости AI-роутинга и провайдеров →
Ценообразование Gemini для не-глобальных эндпоинтов вступает в силу 1 июля: 10% региональная надбавка, которую каждая команда должна учесть в роутинге
С 1 июля 2026 года Gemini 3 и последующие модели получают 10% надбавку для не-глобальных (региональных) эндпоинтов. Командам, направляющим трафик в eu-west1, asia-northeast1 и аналогичные регионы, необходимо немедленно пересмотреть модели расходов.

Gemini 3.5 Flash — это уже не Flash-модель: что ценовая перестройка Google значит для вашей routing-политики
Google запустила Gemini 3.5 Flash по «$1,50»/«$9» за миллион токенов — в 3–6 раз дороже предыдущих Flash-уровней. В связке с новым серверным Interactions API это переписывает то, что routing-команды должны считать про Gemini Flash.

Nano Banana 2 Lite — новый дефолтный эндпоинт Gemini для изображений: фреймворк принятия решений по маршрутизации
Nano Banana 2 Lite (gemini-3.1-flash-lite-image) вышел 30 июня по $0,034/тыс. изображений при задержке 4 секунды. Если вы ещё маршрутизируете на gemini-2.5-flash-image — вы на устаревшей модели. Трёхуровневый routing-фреймворк для operator teams.