Gemini Omni Flash API Routing: разговорная видеомодель Google теперь — операторское решение

Gemini Omni Flash в публичном API preview: model ID gemini-omni-flash-preview, ~$0.10/сек, Interactions API делает многоходовое видеоредактирование задачей routing-политики.

TheRouter Newsroomисточник Google DeepMind
Абстрактная диаграмма маршрутизации данных с защитным шлюзом, представляющая маршрутизацию видеогенерации через Gemini Omni Flash API

Когда в этом квартале Google выпустила Gemini 3.5 Flash и Gemini Enterprise Agent Platform, в мультимодальном routing оставался явный пробел: генерация видео по-прежнему требовала специализированного инструментария без нативного API-пути Google, сопоставимого по удобству с text routing. Gemini Omni Flash, вышедший в публичный API preview 30 июня 2026 года, закрывает этот пробел.

Для AI-инженерных команд принципиальный сдвиг состоит не в том, что у Google наконец есть модель генерации видео, а в том, что она работает через Interactions API — сессионный, многоходовый протокол, где каждое редактирование строится на результате предыдущего хода. Эта архитектура принципиально отличается от stateless request/response-шаблона текстовых и image API и порождает routing-решения, к которым большинство команд ещё не готовы.

Что произошло

Google DeepMind выпустила Gemini Omni Flash в Google AI Studio и Gemini API 30 июня 2026 года. Это первая модель семейства Gemini Omni, предназначенная для разговорной генерации и редактирования видео из комбинаций текста, изображений, видео и (в ближайшее время) аудио.

Ключевые технические параметры:

  • API model ID: gemini-omni-flash-preview
  • API: Gemini Interactions API (сессионный, многоходовый; отличается от стандартного endpoint Responses/Chat)
  • Цена: около $0.10 за секунду видеовывода; $1.50 / 1M input tokens, $17.50 / 1M video output tokens; 5 792 токена на секунду видео 720p
  • Текущее ограничение preview: генерация видео до 10 секунд за ход
  • Входные модальности: текст, изображение, видеореференс; аудиореференсы анонсированы, но ещё не полностью доступны
  • Безопасность: вывод содержит водяной знак SynthID и C2PA Content Credentials
  • Доступность: Google AI Studio, Gemini API, Gemini Enterprise Agent Platform, Gemini App, Google Flow

Ключевое отличие Interactions API от stateless-генерации: контекст каждого хода (предыдущее состояние видео, правки, сцена) хранится на стороне сервера внутри сессии. Клиент отправляет новую инструкцию — «приглуши свет и добавь падающий снег» — и модель применяет её к текущему состоянию видео, а не начинает с нуля.

Почему это важно для AI-инженерных команд

Это не drop-in замена text-to-video. Команды, интегрировавшие wan2.7 через DashScope или Vertex AI Veo для асинхронных задач видеогенерации, обнаружат, что Gemini Omni Flash следует совершенно иному session lifecycle:

  1. Session stickiness: в отличие от stateless-запроса, который можно направить на любую реплику provider, сессия Omni Flash хранит изменяемое состояние. Routing должен закреплять сессию за конкретным endpoint на всё время цикла редактирования — или повторно загружать полное состояние видео при каждом ходе.

  2. Гранулярность биллинга: видеовывод тарифицируется ~$0.10/сек, то есть сессия из 5 ходов по 10 секунд обойдётся ~$0.50 только в output tokens, не считая input. Для сравнения: в асинхронных API (например, wan2.7 в DashScope) задача stateless, а стоимость фиксирована по разрешению/длительности.

  3. Бюджетирование в режиме preview: в публичном preview Google, вероятно, устанавливает более низкие rate limits, чем в GA. Команды, строящие на gemini-omni-flash-preview, должны заранее планировать переименование model ID при выходе в GA — по тому же сценарию, который болезненно затронул команды, использовавшие gemini-3.1-flash-image-preview в июне. Preview ID следует использовать только в некритичных путях и отслеживать GA-переименование.

  4. Провенанс SynthID + C2PA: водяной знак встраивается в момент генерации, а не на этапе доставки. Для корпоративного governance это плюс (AI-контент поддаётся аудиту), но также сигнал, что Google считает вывод Omni Flash декларируемым AI-генерированным контентом даже на сторонних платформах. Операторы в регулируемых медиа или ad-tech должны проверить, что встроенные credentials сохраняются в их publishing pipeline.

Router/operator-угол

Gemini Omni Flash вводит новую категориальную развилку при routing медиагенерационных нагрузок:

Stateless async vs. stateful session-based видеогенерация. Большинство существующих video API (wan2.7 DashScope, Veo, Kling, Seedance) принимают один prompt/референс и возвращают job ID для поллинга. Interactions API Omni Flash изначально stateful — правки накапливаются на сервере между ходами. Это означает, что fallback-стратегия должна учитывать потерю сессии: при ошибке provider в середине многоходового цикла нельзя просто повторить запрос на другом endpoint — придётся начинать редактирование заново.

Дисциплина версионирования model ID. gemini-omni-flash-preview рано или поздно будет переименован или заменён. Routing-конфигурация, жёстко привязанная к preview ID без alias-слоя, молча сломается при депрекации. Используйте паттерн депрекации Gemini Image API от июня 2026 как шаблон: preview ID может устареть уже через несколько недель после GA-релиза.

Сравнение cost-модели. При ~$0.10/сек ($6.00/мин) видеовывода Gemini Omni Flash дороже большинства DashScope async video задач за аналогичную длительность, но дешевле premium-сервисов real-time видеосинтеза. Команды, маршрутизирующие creative или generative media нагрузки, могут теперь рассматривать Google как основной provider для разговорного видеоредактирования, используя DashScope/Wan2.7 как fallback для stateless пакетной генерации. Эти два API не являются drop-in заменами — их нужно направлять в разные обработчики в зависимости от типа нагрузки: stateful (цикл редактирования) или stateless (пакетная генерация).

Governance-поверхность. SynthID + C2PA встраиваются в момент генерации. Если routing-слой снимает или инспектирует HTTP-заголовки, убедитесь, что C2PA content credentials (которые могут быть встроены в manifest) сохраняются в pipeline в неизменном виде.

На что обратить внимание пользователям TheRouter

Async Media endpoint TheRouter сейчас обрабатывает stateless запросы на генерацию. Interactions API Gemini Omni Flash сессионный — это принципиально иной job lifecycle. До появления нативной поддержки session routing для Interactions API рекомендуется следующий подход:

  • Для многоходовых сессий редактирования, требующих session continuity, используйте Gemini Omni Flash напрямую через Gemini API.
  • Для stateless задач видеогенерации (wan2.7, Veo, Kling и др.) продолжайте маршрутизацию через Async Media endpoint.
  • Реализуйте routing discriminator на уровне приложения: stateful многоходовые циклы редактирования — в Gemini Omni Flash напрямую; one-shot генерация — через стандартный async media путь.

Следите за GA-релизом Gemini Omni Flash: именно тогда model ID стабилизируется, цена может измениться, а ограничение на 10 секунд за генерацию, скорее всего, будет снято.

Абстрактная схема уровня маршрутизации для перевода голоса в реальном времени: волновая форма и языковые узлы

Gemini 3.5 Live Translate API: голосовой перевод в реальном времени выходит на уровень маршрутизации

Google Gemini 3.5 Live Translate стал доступен в публичном предварительном выпуске через Gemini API — непрерывный перевод речи в 70+ языках. Что новый model ID значит для команд маршрутизации voice-agent.

источник Google DeepMind
Абстрактная редакционная схема: три пути маршрутизации генерации изображений — скорость, баланс, качество — сходятся в единой точке AI gateway

Nano Banana 2 Lite — новый дефолтный эндпоинт Gemini для изображений: фреймворк принятия решений по маршрутизации

Nano Banana 2 Lite (gemini-3.1-flash-lite-image) вышел 30 июня по $0,034/тыс. изображений при задержке 4 секунды. Если вы ещё маршрутизируете на gemini-2.5-flash-image — вы на устаревшей модели. Трёхуровневый routing-фреймворк для operator teams.

источник Google DeepMind
Помощь и контакты