Gemini Omni Flash API Routing: разговорная видеомодель Google теперь — операторское решение
Gemini Omni Flash в публичном API preview: model ID gemini-omni-flash-preview, ~$0.10/сек, Interactions API делает многоходовое видеоредактирование задачей routing-политики.

Когда в этом квартале Google выпустила Gemini 3.5 Flash и Gemini Enterprise Agent Platform, в мультимодальном routing оставался явный пробел: генерация видео по-прежнему требовала специализированного инструментария без нативного API-пути Google, сопоставимого по удобству с text routing. Gemini Omni Flash, вышедший в публичный API preview 30 июня 2026 года, закрывает этот пробел.
Для AI-инженерных команд принципиальный сдвиг состоит не в том, что у Google наконец есть модель генерации видео, а в том, что она работает через Interactions API — сессионный, многоходовый протокол, где каждое редактирование строится на результате предыдущего хода. Эта архитектура принципиально отличается от stateless request/response-шаблона текстовых и image API и порождает routing-решения, к которым большинство команд ещё не готовы.
Что произошло
Google DeepMind выпустила Gemini Omni Flash в Google AI Studio и Gemini API 30 июня 2026 года. Это первая модель семейства Gemini Omni, предназначенная для разговорной генерации и редактирования видео из комбинаций текста, изображений, видео и (в ближайшее время) аудио.
Ключевые технические параметры:
- API model ID:
gemini-omni-flash-preview - API: Gemini Interactions API (сессионный, многоходовый; отличается от стандартного endpoint Responses/Chat)
- Цена: около $0.10 за секунду видеовывода; $1.50 / 1M input tokens, $17.50 / 1M video output tokens; 5 792 токена на секунду видео 720p
- Текущее ограничение preview: генерация видео до 10 секунд за ход
- Входные модальности: текст, изображение, видеореференс; аудиореференсы анонсированы, но ещё не полностью доступны
- Безопасность: вывод содержит водяной знак SynthID и C2PA Content Credentials
- Доступность: Google AI Studio, Gemini API, Gemini Enterprise Agent Platform, Gemini App, Google Flow
Ключевое отличие Interactions API от stateless-генерации: контекст каждого хода (предыдущее состояние видео, правки, сцена) хранится на стороне сервера внутри сессии. Клиент отправляет новую инструкцию — «приглуши свет и добавь падающий снег» — и модель применяет её к текущему состоянию видео, а не начинает с нуля.
Почему это важно для AI-инженерных команд
Это не drop-in замена text-to-video. Команды, интегрировавшие wan2.7 через DashScope или Vertex AI Veo для асинхронных задач видеогенерации, обнаружат, что Gemini Omni Flash следует совершенно иному session lifecycle:
-
Session stickiness: в отличие от stateless-запроса, который можно направить на любую реплику provider, сессия Omni Flash хранит изменяемое состояние. Routing должен закреплять сессию за конкретным endpoint на всё время цикла редактирования — или повторно загружать полное состояние видео при каждом ходе.
-
Гранулярность биллинга: видеовывод тарифицируется ~$0.10/сек, то есть сессия из 5 ходов по 10 секунд обойдётся ~$0.50 только в output tokens, не считая input. Для сравнения: в асинхронных API (например, wan2.7 в DashScope) задача stateless, а стоимость фиксирована по разрешению/длительности.
-
Бюджетирование в режиме preview: в публичном preview Google, вероятно, устанавливает более низкие rate limits, чем в GA. Команды, строящие на
gemini-omni-flash-preview, должны заранее планировать переименование model ID при выходе в GA — по тому же сценарию, который болезненно затронул команды, использовавшиеgemini-3.1-flash-image-previewв июне. Preview ID следует использовать только в некритичных путях и отслеживать GA-переименование. -
Провенанс SynthID + C2PA: водяной знак встраивается в момент генерации, а не на этапе доставки. Для корпоративного governance это плюс (AI-контент поддаётся аудиту), но также сигнал, что Google считает вывод Omni Flash декларируемым AI-генерированным контентом даже на сторонних платформах. Операторы в регулируемых медиа или ad-tech должны проверить, что встроенные credentials сохраняются в их publishing pipeline.
Router/operator-угол
Gemini Omni Flash вводит новую категориальную развилку при routing медиагенерационных нагрузок:
Stateless async vs. stateful session-based видеогенерация. Большинство существующих video API (wan2.7 DashScope, Veo, Kling, Seedance) принимают один prompt/референс и возвращают job ID для поллинга. Interactions API Omni Flash изначально stateful — правки накапливаются на сервере между ходами. Это означает, что fallback-стратегия должна учитывать потерю сессии: при ошибке provider в середине многоходового цикла нельзя просто повторить запрос на другом endpoint — придётся начинать редактирование заново.
Дисциплина версионирования model ID. gemini-omni-flash-preview рано или поздно будет переименован или заменён. Routing-конфигурация, жёстко привязанная к preview ID без alias-слоя, молча сломается при депрекации. Используйте паттерн депрекации Gemini Image API от июня 2026 как шаблон: preview ID может устареть уже через несколько недель после GA-релиза.
Сравнение cost-модели. При ~$0.10/сек ($6.00/мин) видеовывода Gemini Omni Flash дороже большинства DashScope async video задач за аналогичную длительность, но дешевле premium-сервисов real-time видеосинтеза. Команды, маршрутизирующие creative или generative media нагрузки, могут теперь рассматривать Google как основной provider для разговорного видеоредактирования, используя DashScope/Wan2.7 как fallback для stateless пакетной генерации. Эти два API не являются drop-in заменами — их нужно направлять в разные обработчики в зависимости от типа нагрузки: stateful (цикл редактирования) или stateless (пакетная генерация).
Governance-поверхность. SynthID + C2PA встраиваются в момент генерации. Если routing-слой снимает или инспектирует HTTP-заголовки, убедитесь, что C2PA content credentials (которые могут быть встроены в manifest) сохраняются в pipeline в неизменном виде.
На что обратить внимание пользователям TheRouter
Async Media endpoint TheRouter сейчас обрабатывает stateless запросы на генерацию. Interactions API Gemini Omni Flash сессионный — это принципиально иной job lifecycle. До появления нативной поддержки session routing для Interactions API рекомендуется следующий подход:
- Для многоходовых сессий редактирования, требующих session continuity, используйте Gemini Omni Flash напрямую через Gemini API.
- Для stateless задач видеогенерации (wan2.7, Veo, Kling и др.) продолжайте маршрутизацию через Async Media endpoint.
- Реализуйте routing discriminator на уровне приложения: stateful многоходовые циклы редактирования — в Gemini Omni Flash напрямую; one-shot генерация — через стандартный async media путь.
Следите за GA-релизом Gemini Omni Flash: именно тогда model ID стабилизируется, цена может измениться, а ограничение на 10 секунд за генерацию, скорее всего, будет снято.
Похожие материалы
Новости AI-роутинга и провайдеров →
Gemini 3.5 Live Translate API: голосовой перевод в реальном времени выходит на уровень маршрутизации
Google Gemini 3.5 Live Translate стал доступен в публичном предварительном выпуске через Gemini API — непрерывный перевод речи в 70+ языках. Что новый model ID значит для команд маршрутизации voice-agent.

Google Cloud API Gateway model routing: spec-first routing и важное ограничение по host
Google Cloud API Gateway model routing вышел в Public Preview: serverless-слой на OpenAPI для маршрутизации Gemini, Claude и OpenAI requests, но только когда все backends находятся в Vertex AI.

Nano Banana 2 Lite — новый дефолтный эндпоинт Gemini для изображений: фреймворк принятия решений по маршрутизации
Nano Banana 2 Lite (gemini-3.1-flash-lite-image) вышел 30 июня по $0,034/тыс. изображений при задержке 4 секунды. Если вы ещё маршрутизируете на gemini-2.5-flash-image — вы на устаревшей модели. Трёхуровневый routing-фреймворк для operator teams.