Назад к моделям

gpt-realtime-whisper

openaiopenai/gpt-realtime-whisper

Whisper-class automatic speech recognition over the realtime channel. Audio in, transcribed text out.

GPT-Realtime-Whisper — это модель потокового распознавания речи от OpenAI, выпущенная 7 мая 2026 года одновременно с GPT-Realtime-2 и GPT-Realtime-Translate. Она преобразует живое аудио в текст в реальном времени, выдавая инкрементальные дельты транскрипта по мере речи — не дожидаясь завершения высказывания. Разработана для сценариев с низкой задержкой; предлагает настраиваемые уровни задержки от 'minimal' до 'xhigh', позволяя разработчикам балансировать между скоростью и точностью.

На TheRouter модель обслуживается одним обычным HTTP-запросом — POST /v1/audio/transcriptions, multipart, тот же контракт, что у Whisper — а потоковый realtime-канал не открыт вовсе. Вы загружаете аудио и получаете один JSON. Нет инкрементальных дельт, нет сессии, не нужен WebSocket- или WebRTC-клиент, нет настроек delay и определения реплик. Любой путь /v1/realtime возвращает 501 realtime_websocket_not_supported до аутентификации и для любой модели — поэтому API-ключ не является причиной этой ошибки.

Когда выбирать
  • • Живые субтитры для конференций, вебинаров, трансляций — потоковая передача аудио докладчика с отображением субтитров в реальном времени
  • • Мониторинг соответствия и качества — запись разговоров в текст для регуляторного архивирования, контроля качества или аналитики
  • • Многоязычные конвейеры транскрипции — объединение с GPT-Realtime-Translate для получения транскрипта на исходном языке вместе с переведённым аудио
  • • Голосовые интерфейсы с видимостью текста — показ пользователю того, что система услышала, одновременно с ответом голосового агента
Когда не выбирать
  • • Разговорные голосовые агенты — для ассистентов с рассуждениями, вызовами инструментов и голосовыми ответами используйте GPT-Realtime-2
  • • Транскрипция заранее записанного аудио — для файлов или ограниченных аудиозапросов используйте gpt-4o-transcribe ($0,006/мин, выше точность) или gpt-4o-mini-transcribe ($0,003/мин)
  • • Живой перевод — GPT-Realtime-Whisper только транскрибирует, не переводит. Используйте GPT-Realtime-Translate для перевода речи в речь

Чем обслуживание в TheRouter отличается от вендорского

Как её эксплуатирует вендор

Потоковый realtime-канал: WebSocket-сессия выдаёт инкрементальные дельты транскрипта, пока говорящий ещё говорит, с настраиваемой задержкой от 'minimal' до 'xhigh' и определением реплик.

На TheRouter

Один обычный HTTP-запрос: POST /v1/audio/transcriptions, multipart, в ответ один JSON. Нет инкрементальных дельт, нет сессии, не нужен WebSocket- или WebRTC-клиент, нет настроек delay и определения реплик. Любой путь /v1/realtime возвращает 501 realtime_websocket_not_supported до аутентификации и для любой модели.

Размер контекста
--
Максимальный вывод
--
Цена Аудиоза минуту аудио
$0.0184за минуту аудио

Модальности

Аудио→Текст

Возможности

Распознавание речи

Разбивка цен

ТипСтавка
Аудио$0.0184 за минуту аудио

request is price per minute of audio, the only unit OpenAI publishes for this model.

Поддерживаемые параметры

filelanguagepromptresponse_formattemperature

Характеристики

Дата релиза7 мая 2026developers.openai.com ↗проверено
Дата отсечения30 сентября 2024developers.openai.com ↗проверено
Окно контекста16 000 токеновdevelopers.openai.com ↗проверено
Макс. выходных токенов2 000 токеновdevelopers.openai.com ↗проверено
Единица тарификацииЗа минуту обработанного аудио, по полю duration каждого ответа — не за токен и не за запрос. Десять 6-секундных запросов стоят столько же, сколько один 60-секундный. Прейскурантная цена OpenAI — $0,017/минуту.developers.openai.com ↗проверено
API эндпоинтАпстрим (только прямой OpenAI, НЕ доступен через TheRouter): /v1/realtime/transcription_sessions, тип сессии 'transcription', через WebRTC или WebSocket. На TheRouter вход — POST /v1/audio/transcriptions; любой путь /v1/realtime возвращает 501 realtime_websocket_not_supported до аутентификации, поэтому API-ключ никогда не является причиной. См. гид по транскрипции в реальном времени.developers.openai.com ↗проверено
Настройка задержкиНЕДОСТУПНО НА THEROUTER. audio.input.transcription.delay (minimal / low / medium / high / xhigh) — параметр realtime-сессии, а сессии здесь нет: отправка не даёт эффекта. Принимаются ровно: file, language, prompt, response_format, temperature. Задержка определяется длиной вашего сегмента плюс один HTTP-запрос на сегмент (измерено 1,7–6,9 с), а не настройкой delay.developers.openai.com ↗проверено
Поддерживаемые функцииНа TheRouter — Потоковая передача: НЕТ. Ответ — один JSON после транскрипции всего отправленного аудио, без инкрементальных дельт: транспорт, который модель использует в апстриме, здесь не открыт. Near-realtime достигается нарезкой на стороне клиента — по одному запросу на сегмент. Управление через промпт: ДА, параметр prompt принимается (в GA realtime-сессии OpenAI он недоступен). Вызов функций: нет. Структурированные выводы: нет. Тонкая настройка: нет.developers.openai.com ↗проверено
Формат аудиовходаНа TheRouter: файл-контейнер, загружаемый как multipart-часть file — WAV, MP3, FLAC, M4A, MPEG, MPGA, OGG или WebM, до 25 МБ. СЫРОЙ PCM НЕ ПРИНИМАЕТСЯ: апстрим-сессия принимает 24 кГц моно PCM16 по своему потоку, но этот канал здесь не открыт, поэтому PCM нужно обернуть в контейнер (например, WAV-заголовок). Каждый сегмент должен декодироваться самостоятельно. Часть file обязана нести имя файла с настоящим расширением — по нему определяется формат.developers.openai.com ↗проверено

Бенчмарки

BenchmarkDistributionScoreSource
Azure WER improvement
Документация Azure Foundry утверждает, что GPT-Realtime-Whisper достигает примерно на 50% меньшего Word Error Rate по сравнению с предыдущей транскрипцией gpt-4o в реальном времени. Это относительное заявление провайдера, а не независимо проверенный абсолютный показатель WER.
~50% lower WER than gpt-4o realtime% reductionlearn.microsoft.com ↗

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/audio/transcriptions   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -F "model=openai/gpt-realtime-whisper"   -F "file=@speech.mp3"

Транскрипция (TheRouter)

На TheRouter GPT-Realtime-Whisper обслуживается через POST /v1/audio/transcriptions — тот же REST-эндпоинт, что и Whisper — а не через chat completions или WebSocket. TheRouter связывает канал реального времени провайдера с этим неизменным публичным контрактом; поведение на уровне запроса идентично любой другой модели транскрипции. Поддерживаемые параметры: file, language, prompt, response_format, temperature. Оплата за минуту аудио, не за токен и не за запрос. У этой модели нет маршрута chat/completions на TheRouter — вызов таким образом вернёт 503. Полный контракт на уровне протокола, схема нарезки для near-realtime и примеры на Java/Go/Python — в гиде: https://therouter.ai/guides/multimodal/realtime-transcription/ru

cURL
curl https://api.therouter.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -F file="@speech.wav" \
  -F model="openai/gpt-realtime-whisper" \
  -F language="en" \
  -F prompt="Technical terms: TheRouter, API" \
  -F response_format="json" \
  -F temperature="0"

Ещё от openai

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2026-05-07

OpenAI запускает GPT-Realtime-Whisper одновременно с GPT-Realtime-2 и GPT-Realtime-Translate

7 мая 2026 года OpenAI выпустила три новые модели аудио в реальном времени: GPT-Realtime-2 (голосовой агент с контекстом 128K), GPT-Realtime-Translate (потоковый перевод за $0,034/мин) и GPT-Realtime-Whisper (потоковая речь-в-текст за $0,017/мин). GPT-Realtime-Whisper разработана для живой транскрипции с настраиваемой задержкой — режим 'minimal' даёт почти мгновенные дельты, а 'xhigh' предпочитает точность скорости. Модель подключается через выделенный эндпоинт транскрипционных сессий с WebRTC (браузеры) или WebSocket (серверные медиа-конвейеры). Также доступна через Azure Foundry с WER примерно на 50% ниже, чем у предыдущих моделей транскрипции в реальном времени.

переработано TheRouterdevelopers.openai.com ↗

Частые вопросы

Модель документирована как работающая только по WebSocket. Есть ли wss://-эндпоинт на TheRouter?

Да, и он частично работает — измерено на проде 29.07.2026. POST /v1/realtime/sessions с этой моделью и валидным ключом возвращает 200 с session_token и expires_at (без ключа — 401, не 501). Но подключение к wss://api.therouter.ai/v1/realtime с этим токеном сейчас отвечает 503 upstream_unavailable — 'This model is not configured for realtime billing' — то есть токен получить можно, а использовать пока нельзя. Разговорное realtime-семейство (openai/gpt-realtime, openai/gpt-realtime-2) по-прежнему заблокировано и отвечает 404 model_not_found. Нереализованные подпути (/v1/realtime/transcription_sessions, /calls, /client_secrets) отвечают 501, а не голым 404. На чём строить сегодня: POST /v1/audio/transcriptions — он работает end-to-end. Потоковая передача на TheRouter есть и в обратную сторону: /v1/audio/speech (TTS) стримит через SSE или chunked HTTP, никогда через WebSocket.

Чем GPT-Realtime-Whisper отличается от gpt-4o-transcribe?

В апстриме разница — потоковый режим против пакетного. На TheRouter этой разницы нет: обе модели обслуживаются одним и тем же POST /v1/audio/transcriptions, обе возвращают полный транскрипт, ни одна не стримит. Реально различаются только цена и точность — и компромисс направлен противоположно тому, что подсказывают названия. Прейскурант GPT-Realtime-Whisper — $0,017/мин против $0,006/мин у gpt-4o-transcribe, то есть примерно в 2,8 раза ДОРОЖЕ, при этом gpt-4o-transcribe обычно точнее на записанном аудио. Если эта модель не нужна вам специально, gpt-4o-transcribe — лучший выбор по умолчанию по обоим параметрам. (Приведён прейскурант OpenAI; фактические тарифы — на карточках цен.)

Могу ли я использовать GPT-Realtime-Whisper через стандартный OpenAI chat completions SDK?

Нативно — нет, и на TheRouter тоже нет. Нативно GPT-Realtime-Whisper от OpenAI использует выделенный эндпоинт /v1/realtime/transcription_sessions (WebRTC или WebSocket) — вы управляете постоянным соединением, передаёте аудио через события input_audio_buffer.append и обрабатываете дельты транскрипта по мере поступления. На TheRouter эта модель обслуживается только через POST /v1/audio/transcriptions — стандартный REST-контракт транскрипции: запрос на входе, полный транскрипт на выходе. У этой модели нет маршрута chat/completions на TheRouter — вызов таким образом вернёт 503.

Что делает настройка 'delay' и какую выбрать?

Настройка задержки управляет компромиссом между задержкой и точностью при потоковой транскрипции. Низкие значения (minimal, low) быстрее выдают дельты, но могут иметь более высокий WER из-за меньшего аудиоконтекста. Высокие значения (high, xhigh) ждут больше контекста перед выдачей текста, улучшая точность ценой задержки отображения. OpenAI рекомендует начинать с 'low' для живых субтитров и 'medium' для сбалансированных сценариев. Тестируйте с вашим реальным аудио — микрофоны, фоновый шум, акценты и доменная лексика влияют на оптимальную настройку.

Могу ли я управлять транскрипцией модели с помощью пользовательской лексики или промптов?

Управление через промпт НЕ поддерживается для GPT-Realtime-Whisper в GA-сессиях реального времени. Вместо этого используйте языковую подсказку (параметр 'language'). Если в будущих версиях появится поддержка промптов, OpenAI рекомендует использовать короткие списки ключевых слов (например, 'Keywords: метопролол, аторвастатин, A1C') вместо полноценных инструкций на естественном языке. В продакшене рассматривайте ключевые слова как помощь, а не гарантию — продолжайте вручную оценивать имена, числа, даты и доменные термины.

Как GPT-Realtime-Whisper сравнивается с традиционным Whisper по задержке?

Традиционный Whisper (whisper-1) обрабатывает аудио блоками и должен ждать завершения высказывания перед транскрипцией — он не является нативно потоковым. GPT-Realtime-Whisper непрерывно выдаёт инкрементальные дельты транскрипта по мере поступления аудио, с настраиваемой задержкой от 'minimal' (почти мгновенный частичный текст) до 'xhigh' (больше контекста, лучше точность). Для живых субтитров и потоковых приложений улучшение задержки драматично: пользователи видят текст, появляющийся в середине предложения, а не ждут несколько секунд. Для записанных файлов, где задержка не важна, gpt-4o-transcribe или gpt-4o-mini-transcribe предлагают более высокую точность при меньшей цене.

Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Дата релизаdevelopers.openai.com ↗2026-05-30проверено
Дата отсеченияdevelopers.openai.com ↗2026-05-30проверено
Окно контекстаdevelopers.openai.com ↗2026-05-30проверено
Макс. выходных токеновdevelopers.openai.com ↗2026-05-30проверено
Единица тарификацииdevelopers.openai.com ↗2026-05-30проверено
API эндпоинтdevelopers.openai.com ↗2026-05-30проверено
Настройка задержкиdevelopers.openai.com ↗2026-05-30проверено
Поддерживаемые функцииdevelopers.openai.com ↗2026-05-30проверено
Формат аудиовходаdevelopers.openai.com ↗2026-05-30проверено
Azure WER improvementlearn.microsoft.com ↗2026-05-30один источник
OpenAI запускает GPT-Realtime-Whisper одновременно с GPT-Realtime-2 и GPT-Realtime-Translatedevelopers.openai.com ↗2026-05-30проверено
Модель документирована как работающая только по WebSocket. Есть ли wss://-эндпоинт на TheRouter?therouter.ai ↗2026-07-29к проверке
Чем GPT-Realtime-Whisper отличается от gpt-4o-transcribe?developers.openai.com ↗2026-05-30к проверке
Могу ли я использовать GPT-Realtime-Whisper через стандартный OpenAI chat completions SDK?developers.openai.com ↗2026-05-30к проверке
Что делает настройка 'delay' и какую выбрать?developers.openai.com ↗2026-05-30к проверке
Могу ли я управлять транскрипцией модели с помощью пользовательской лексики или промптов?developers.openai.com ↗2026-05-30к проверке
Как GPT-Realtime-Whisper сравнивается с традиционным Whisper по задержке?developers.openai.com ↗2026-05-30к проверке
Помощь и контакты