Назад к моделям

gpt-realtime-whisper

openaiopenai/gpt-realtime-whisper

Чем обслуживание в TheRouter отличается от вендорского

Как её эксплуатирует вендор

Потоковый realtime-канал: WebSocket-сессия выдаёт инкрементальные дельты транскрипта, пока говорящий ещё говорит, с настраиваемой задержкой от 'minimal' до 'xhigh' и определением реплик.

На TheRouter

Один обычный HTTP-запрос: POST /v1/audio/transcriptions, multipart, в ответ один JSON. Нет инкрементальных дельт, нет сессии, не нужен WebSocket- или WebRTC-клиент, нет настроек delay и определения реплик. Любой путь /v1/realtime возвращает 501 realtime_websocket_not_supported до аутентификации и для любой модели.

Гид по API

Транскрипция (TheRouter)

На TheRouter GPT-Realtime-Whisper обслуживается через POST /v1/audio/transcriptions — тот же REST-эндпоинт, что и Whisper — а не через chat completions или WebSocket. TheRouter связывает канал реального времени провайдера с этим неизменным публичным контрактом; поведение на уровне запроса идентично любой другой модели транскрипции. Поддерживаемые параметры: file, language, prompt, response_format, temperature. Оплата за минуту аудио, не за токен и не за запрос. У этой модели нет маршрута chat/completions на TheRouter — вызов таким образом вернёт 503. Полный контракт на уровне протокола, схема нарезки для near-realtime и примеры на Java/Go/Python — в гиде: https://therouter.ai/guides/multimodal/realtime-transcription/ru

cURL
curl https://api.therouter.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -F file="@speech.wav" \
  -F model="openai/gpt-realtime-whisper" \
  -F language="en" \
  -F prompt="Technical terms: TheRouter, API" \
  -F response_format="json" \
  -F temperature="0"

Near-realtime транскрипция нарезкой на стороне клиента

Потокового эндпоинта транскрипции на TheRouter нет, поэтому near-realtime достигается нарезкой на клиенте: по одному обычному запросу на сегмент. Оба примера ниже выполнены на проде 29.07.2026 и дали вывод, приведённый в гиде. Они демонстрируют две вещи, на которых чаще всего ошибаются: каждый сегмент должен быть самостоятельным декодируемым контейнером (сырой срез байтов отклоняется с 400), и заголовок WAV НЕ равен фиксированным 44 байтам — в реальных записях перед data встречаются чанки LIST/FLLR, поэтому RIFF-чанки нужно действительно обходить. Ожидайте потерю или дублирование слов на границах и 1,7–6,9 с на сегмент.

cURL
# Segment locally, then post each segment to the same endpoint.
# Each piece must decode on its own — split with a tool that writes a real
# container per piece (ffmpeg here), never with `split`/`dd` on the bytes.
ffmpeg -i speech.wav -f segment -segment_time 3 -c copy chunk-%03d.wav

for f in chunk-*.wav; do
  curl -sS https://api.therouter.ai/v1/audio/transcriptions \
    -H "Authorization: Bearer $THEROUTER_API_KEY" \
    -F file="@$f" \
    -F model="openai/gpt-realtime-whisper" \
    -F language="en" | python3 -c 'import json,sys; print(json.load(sys.stdin)["text"])'
done
Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Дата релизаdevelopers.openai.com ↗2026-05-30проверено
Дата отсеченияdevelopers.openai.com ↗2026-05-30проверено
Окно контекстаdevelopers.openai.com ↗2026-05-30проверено
Макс. выходных токеновdevelopers.openai.com ↗2026-05-30проверено
Единица тарификацииdevelopers.openai.com ↗2026-05-30проверено
API эндпоинтdevelopers.openai.com ↗2026-05-30проверено
Настройка задержкиdevelopers.openai.com ↗2026-05-30проверено
Поддерживаемые функцииdevelopers.openai.com ↗2026-05-30проверено
Формат аудиовходаdevelopers.openai.com ↗2026-05-30проверено
Azure WER improvementlearn.microsoft.com ↗2026-05-30один источник
OpenAI запускает GPT-Realtime-Whisper одновременно с GPT-Realtime-2 и GPT-Realtime-Translatedevelopers.openai.com ↗2026-05-30проверено
Модель документирована как работающая только по WebSocket. Есть ли wss://-эндпоинт на TheRouter?therouter.ai ↗2026-07-29к проверке
Чем GPT-Realtime-Whisper отличается от gpt-4o-transcribe?developers.openai.com ↗2026-05-30к проверке
Могу ли я использовать GPT-Realtime-Whisper через стандартный OpenAI chat completions SDK?developers.openai.com ↗2026-05-30к проверке
Что делает настройка 'delay' и какую выбрать?developers.openai.com ↗2026-05-30к проверке
Могу ли я управлять транскрипцией модели с помощью пользовательской лексики или промптов?developers.openai.com ↗2026-05-30к проверке
Как GPT-Realtime-Whisper сравнивается с традиционным Whisper по задержке?developers.openai.com ↗2026-05-30к проверке
Помощь и контакты