GPT-Live voice API routing: full-duplex voice превращает delegation policy в точку контроля

GPT-Live voice API routing становится новым operator решением: OpenAI ведет full-duplex voice, background delegation и realtime safeguards к developer API.

Опубликовано источник OpenAI

Архивный материал, подготовленный с помощью ИИ по указанному источнику и опубликованный без индивидуальной проверки. Ответственный редактор: Joe Werner.

GPT-Live voice API routing как full-duplex audio lane, который делегирует сложную работу в управляемый model route
Машинный перевод с английского оригинала — читать оригинал

GPT-Live voice API routing — следующая вещь, к которой командам voice-agent стоит готовиться заранее. 8 июля OpenAI представила GPT-Live как семейство full-duplex voice моделей для ChatGPT Voice: GPT-Live-1 и GPT-Live-1 mini уже выходят для пользователей, а API доступ запланирован следующим шагом. Для operator важен не только тезис «голос стал естественнее». Важна архитектура: одна модель управляет непрерывным слушанием и речью, а более глубокая работа может делегироваться frontier model вроде GPT-5.5 в фоне. Voice превращается из выбора одного realtime model в routing policy для interaction, reasoning, tools, safety и cost.

Что изменилось

OpenAI описывает GPT-Live как систему для continuous interaction, а не для turn-by-turn voice. Модель может слушать и говорить одновременно, подтверждать, что она следит за разговором, делать паузу, перебивать, молчать по просьбе пользователя и сохранять поток диалога, пока другая модель выполняет сложную задачу. На старте GPT-Live использует GPT-5.5 в фоне для задач, где нужны search, deeper reasoning или более agentic execution; OpenAI также говорит, что delegated model будет обновляться по мере выхода новых frontier models.

Rollout начинается в ChatGPT Voice с GPT-Live-1 и GPT-Live-1 mini. OpenAI отдельно пишет, что developers и enterprises смогут зарегистрироваться для будущего API доступа. В анонсе GPT-Live сравнивается с cascaded voice системами, где speech-to-text, language model и text-to-speech идут цепочкой, и с turn-based audio models, которые все еще ждут тишины, чтобы понять конец реплики.

OpenAI также описала safety детали для real-time voice. Safeguards могут срабатывать прямо во время речи модели: направлять ответ в более безопасную сторону, показывать ресурсы поддержки или завершать high-risk conversation. Тестирование включало audio-native evaluations для self-harm, psychosis and mania, emotional reliance, violence и sexual content. Для engineering teams это важно, потому что voice agents ломаются не так, как chatbots: interruption timing, background noise, user distress и tool handoff могут стать production incidents.

Почему это важно для AI-инженерных команд

GPT-Live voice API routing меняет единицу контроля. Классический voice pipeline часто routes один request за раз: transcribe, reason, synthesize. Full-duplex model больше похожа на live session с continuous state. Operators должны определить policy: когда voice lane продолжает говорить, когда останавливается, когда делегирует работу и какой deeper model или tool lane имеет право принять задачу.

Отсюда появляются новые вопросы для API gateways и agent platforms. Все ли пользователи получают один voice tier? Может ли support call начинаться на mini tier и escalates только при необходимости? Какие intents могут вызывать web search или file tools? Как атрибутировать background reasoning cost, если пользователь слышит только короткий spoken answer? Что происходит, если delegated model недоступна, слишком медленная или заблокирована safety policy?

Ответы не стоит hard-code внутри одного voice app. Voice workloads требуют observable routing. Командам нужны метрики session duration, interruptions, silence handling, delegated tasks, tool calls, safety interventions, fallback decisions и cost split между realtime audio и background reasoning. Без такого ledger GPT-Live-style systems будут казаться пользователям магическими, но станут непрозрачными для finance, security и operations.

Взгляд со стороны роутинга и эксплуатации

The router/operator angle for GPT-Live voice API routing — разделить interaction routing и reasoning routing. Interaction route отвечает за latency, turn-taking, voice quality и safety timing. Reasoning route отвечает за search, tool use, long-context work и более дорогие model calls. Если смешать оба слоя в одном provider setting, контролировать spend и расследовать failure modes будет трудно.

Практичная policy matrix включает как минимум четыре lanes:

  • Conversation lane: default full-duplex voice, оптимизированная под быстрое подтверждение и низкую interruption error.
  • Reasoning lane: delegated model calls для search, analysis или complex tasks, с явными effort и timeout budgets.
  • Tool lane: вызовы web, files, CRM, calendar или internal systems, ограниченные user consent и session context.
  • Safety lane: real-time classifiers и stop conditions, которые могут переопределять остальные lanes.

Fallback тоже должен быть lane-specific. Если reasoning lane не может достучаться до preferred frontier model, безопасный fallback может быть очередью или честным сообщением, что задача еще выполняется, а не попыткой voice model притвориться, что работа завершена. Если сработала safety lane, fallback должен снижать риск, а не просто менять model. Если деградирует conversation lane, продукту может понадобиться switch to push-to-talk или text, вместо продолжения сломанной full-duplex session.

Пользователи TheRouter могут воспринимать это как предварительный шаблон voice-agent gateway policy. Документация TheRouter по AI routing — стабильная отправная точка для provider routing и request policy. Недавний разбор GPT-Realtime-2.1 routing покрывает API model-tier сторону; GPT-Live добавляет поверх нее session-level delegation layer.

Что стоит проверить или попробовать пользователям TheRouter

Сначала инвентаризируйте каждый voice workload по session risk. Language-practice bot, sales assistant, healthcare triage flow и internal operations agent не должны делить одну routing policy только потому, что используют одно семейство audio models.

Затем задайте delegation budgets до появления API. Решите, какие intents могут запускать search, high-effort reasoning или tool execution; установите timeout и cost ceilings; логируйте delegated model отдельно от voice model. Так будущий API rollout будет проще принять без потери cost control.

Наконец, тестируйте fallback как user experience, а не только как HTTP retry. В full-duplex voice отказ background task является частью live conversation. GPT-Live voice API routing вознаградит команды, которые сохраняют flow, safety и auditability, когда route меняется прямо в середине session.

Абстрактная диаграмма маршрутизации: аудиопотоки голоса разделяются между полной и mini версиями модели

GPT-Realtime-2.1 и 2.1-Mini: Решение по маршрутизации голосового трафика, которое операторам нужно принять прямо сейчас

OpenAI выпустил GPT-Realtime-2.1 и GPT-Realtime-2.1-mini 6 июля. Двухуровневая структура, настраиваемые уровни reasoning effort и новый базис ценообразования на аудио меняют подход операторов к маршрутизации трафика голосовых агентов.

источник OpenAI API Changelog
Абстрактная схема роутинга с уровнями выбора модели по соотношению стоимости и результата, проходящими через AI-шлюз

Скорбалл OpenAI «Полезный интеллект на доллар»: чек-лист роутинговой политики для каждого оператора AI-шлюза

OpenAI опубликовала четырёхмерный фреймворк — «Useful Intelligence per Dollar» — который переосмысляет оценку моделей: вместо стоимости токена — стоимость успешно выполненной задачи. Вот что должен изменить каждый оператор роутинга уже сегодня.

источник OpenAI
Диаграмма маршрутизации с переходами между версиями моделей и таймлайнами устаревания

OpenAI выводит снапшоты gpt-5 и o3 из эксплуатации 11 декабря: что должна проверить каждая команда

OpenAI объявила об устаревании шести первых снапшотов gpt-5 и o3 — все они отключаются 11 декабря 2026 года. Командам, которые ещё использует date-stamped идентификаторы в routing-конфигурациях, дано шесть месяцев на миграцию.

источник OpenAI
Помощь и контакты