Gemini 3.5 Live Translate API: голосовой перевод в реальном времени выходит на уровень маршрутизации
Google Gemini 3.5 Live Translate стал доступен в публичном предварительном выпуске через Gemini API — непрерывный перевод речи в 70+ языках. Что новый model ID значит для команд маршрутизации voice-agent.

Gemini 3.5 Live Translate API: голосовой перевод в реальном времени выходит на уровень маршрутизации
Google выпустил gemini-3.5-live-translate-preview в публичное предварительное издание 9 июня, открыв новый endpoint модели в Gemini Live API. Для команд, работающих с голосовыми agent-системами или мультиязычными разговорными конвейерами, появление меняет одно конкретное решение по маршрутизации: куда отправлять непрерывный аудиопоток, которому нужно преодолеть языковую границу.
Что произошло
Gemini 3.5 Live Translate — это специализированная аудио-модель для перевода речи в речь. В отличие от конвейерного подхода, где ASR → NMT → TTS вызываются как отдельные запросы, эта модель непрерывно обрабатывает входящий аудиопоток и выдаёт переведённый аудиосигнал, отставая от говорящего на несколько секунд в течение всей сессии.
Ключевые факты публичного предварительного выпуска:
- Model ID:
gemini-3.5-live-translate-preview - Доступ: Gemini Live API (WebSocket-поток) и Google AI Studio
- Языки: автоматическое определение 70+ входных языков, перевод между 2 000+ языковых пар
- Подход к задержке: непрерывный вывод, не по очередям — модель не ждёт паузу говорящего перед генерацией перевода
- Устойчивость к шуму: задокументировано; работает в громких и непредсказуемых акустических условиях
- Синтетический водяной знак SynthID: весь сгенерированный аудионосит водяной знак для идентификации AI-генерированного контента
- Корпоративный предварительный выпуск: интеграция с Google Meet открыта в private preview для клиентов Workspace с июня 2026
Партнёры по платформам для разработчиков, уже включающие модель в свои SDK: Agora, LiveKit, Pipecat и Fishjam. Каждый берёт на себя инфраструктуру WebSocket-стриминга, так что код приложения работает с их абстракцией, а не с низкоуровневым протоколом Gemini Live API.
Почему это важно для AI-инженерных команд
До сих пор перевод голоса в реальном времени в продакшене означал одну из двух стратегий: проприетарный вендор перевода (SYSTRAN, ModernMT и аналоги) или конвейер, собранный из отдельных вызовов ASR, NMT и TTS. Оба варианта несут сложность интеграции и кумулятивную задержку — каждый хоп добавляет round-trip время.
gemini-3.5-live-translate-preview схлопывает этот стек в один streaming-эндпоинт. Решение по маршрутизации упрощается: команды, уже использующие Gemini API для текстовых или мультимодальных workload-ов, могут добавить перевод речи без нового вендорского контракта.
Автоопределение 70+ языков убирает этап конфигурации исходного языка, который требуется большинству конвейерных подходов. Это значимо для сценариев, где язык говорящего неизвестен на старте сессии: очередь поддержки, мультиязычные совещания, государственные сервисные стойки.
Пилот Grab — операционный сигнал, за которым стоит следить: компания проводит более 10 млн голосовых звонков ежемесячно для связи водителей и пассажиров в мультиязычной Юго-Восточной Азии. Задержка и акустический шум для этого workload-а — ограничения первого класса, а не вторичные соображения.
Угол зрения маршрутизатора и оператора
Для команд, использующих AI-шлюз для управления несколькими endpoint-ами Gemini, gemini-3.5-live-translate-preview вводит решение по маршрутизации модели, которого ранее не существовало:
Когда направлять трафик на gemini-3.5-live-translate-preview вместо gemini-2.0-flash-live-001:
- Сессии с известным намерением перевода →
gemini-3.5-live-translate-previewсоздан для этой задачи и исключает накладные расходы на prompting общей модели для перевода - Обычные голосовые беседы без потребности в переводе →
gemini-2.0-flash-live-001или эквивалент остаётся правильным маршрутом - Смешанные сессии, где необходимость в переводе условна → маршрутизировать по метаданным сессии или по результату определения языка первого высказывания, а не на уровне модели
Архитектурный аспект стриминга: модель работает через WebSocket-канал Gemini Live API. В отличие от стандартного REST-endpoint /v1/models/{model}:generateContent, сессии Live API stateful и имеют продолжительность. Уровни маршрутизации, проксирующие только REST, не смогут перенаправлять эти сессии без поддержки WebSocket pass-through.
Стратегия fallback: gemini-3.5-live-translate-preview — preview-модель без задокументированного SLA. Продакшен-конвейеры голосового перевода должны иметь fallback: либо связка (Gemini Flash для ASR + вызов перевода + вызов TTS), либо альтернативный провайдер. Fallback добавляет задержку, но сохраняет доступность при деградации preview-эндпоинта.
Учёт затрат: Gemini Live API считает billing по аудио-токенам input/output, а не по количеству запросов. Непрерывные сессии перевода длительностью в минуты накапливают стоимость по ставке аудио-токенов. Уровни маршрутизации должны предоставлять метрики длительности сессии наряду со стоимостью отдельного запроса, чтобы у операторов была точная картина расходов.
Пробел в покрытии языковых пар: утверждение о 2 000+ языковых парах покрывает комбинации из 70 обнаруживаемых языков, но не все пары имеют одинаковое качество. Команды, создающие продукты с SLA-поддержкой нескольких языков, должны валидировать качество на конкретных языковых парах в период preview, а не полагаться на равномерное покрытие.
Что отслеживать
- Время до GA: статус «public preview» означает отсутствие продакшен-SLA. Google не объявил дату GA. Следите за Gemini API changelog.
- Релиз в Google Meet: private preview для корпоративных клиентов Workspace стартует в июне 2026 и может ускорить спрос на API-endpoint по мере того, как команды создают прототипы интеграций до расширения корпоративного доступа.
- Ценообразование на GA: pricing аудио-токенов Live API в preview может измениться на GA. Закладывайте бюджет по ставкам preview, но закладывайте возможность корректировки.
- Паритет сторонних SDK: LiveKit, Pipecat, Agora и Fishjam имеют нативную интеграцию. Если ваша голосовая инфраструктура работает на другом WebRTC или медиа-стеке, проверьте документацию интеграции прежде чем считать модель доступной.
For teams evaluating which Gemini model to route voice-translation sessions through, the models catalog on TheRouter shows the currently routable Gemini endpoints. WebSocket-канал Live API требует прямого подключения к Google или к платформе-партнёру, которая его оборачивает.
Похожие материалы
Новости AI-роутинга и провайдеров →
Nano Banana 2 Lite — новый дефолтный эндпоинт Gemini для изображений: фреймворк принятия решений по маршрутизации
Nano Banana 2 Lite (gemini-3.1-flash-lite-image) вышел 30 июня по $0,034/тыс. изображений при задержке 4 секунды. Если вы ещё маршрутизируете на gemini-2.5-flash-image — вы на устаревшей модели. Трёхуровневый routing-фреймворк для operator teams.

Gemini Provisioned Throughput теперь поддерживает очередь из 7 заказов: что GA-релиз мультизаказов меняет для команд маршрутизации
1 июля Google перевёл поддержку нескольких ожидающих заказов Provisioned Throughput в статус GA — теперь можно одновременно ставить в очередь до 7 заказов на одну модель и регион, устраняя последовательный 10-дневный цикл активации.

Gemini API Image Generation 2026: как исправить failed to fetch после отключения preview-моделей
В 2026 году Gemini API проходит две миграции: после cutoff 25 июня preview-модели вызывают сбои failed to fetch, а GA-endpoint’ы Imagen 4 отключаются 17 августа. Проверьте model ID, перейдите на gemini-3.1-flash-image или gemini-3-pro-image и протестируйте generateContent.