gpt-realtime-whisper
Чем обслуживание в TheRouter отличается от вендорского
Потоковый realtime-канал: WebSocket-сессия выдаёт инкрементальные дельты транскрипта, пока говорящий ещё говорит, с настраиваемой задержкой от 'minimal' до 'xhigh' и определением реплик.
Один обычный HTTP-запрос: POST /v1/audio/transcriptions, multipart, в ответ один JSON. Нет инкрементальных дельт, нет сессии, не нужен WebSocket- или WebRTC-клиент, нет настроек delay и определения реплик. Любой путь /v1/realtime возвращает 501 realtime_websocket_not_supported до аутентификации и для любой модели.
Гид по API
Транскрипция (TheRouter)
На TheRouter GPT-Realtime-Whisper обслуживается через POST /v1/audio/transcriptions — тот же REST-эндпоинт, что и Whisper — а не через chat completions или WebSocket. TheRouter связывает канал реального времени провайдера с этим неизменным публичным контрактом; поведение на уровне запроса идентично любой другой модели транскрипции. Поддерживаемые параметры: file, language, prompt, response_format, temperature. Оплата за минуту аудио, не за токен и не за запрос. У этой модели нет маршрута chat/completions на TheRouter — вызов таким образом вернёт 503. Полный контракт на уровне протокола, схема нарезки для near-realtime и примеры на Java/Go/Python — в гиде: https://therouter.ai/guides/multimodal/realtime-transcription/ru
curl https://api.therouter.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-F file="@speech.wav" \
-F model="openai/gpt-realtime-whisper" \
-F language="en" \
-F prompt="Technical terms: TheRouter, API" \
-F response_format="json" \
-F temperature="0"Near-realtime транскрипция нарезкой на стороне клиента
Потокового эндпоинта транскрипции на TheRouter нет, поэтому near-realtime достигается нарезкой на клиенте: по одному обычному запросу на сегмент. Оба примера ниже выполнены на проде 29.07.2026 и дали вывод, приведённый в гиде. Они демонстрируют две вещи, на которых чаще всего ошибаются: каждый сегмент должен быть самостоятельным декодируемым контейнером (сырой срез байтов отклоняется с 400), и заголовок WAV НЕ равен фиксированным 44 байтам — в реальных записях перед data встречаются чанки LIST/FLLR, поэтому RIFF-чанки нужно действительно обходить. Ожидайте потерю или дублирование слов на границах и 1,7–6,9 с на сегмент.
# Segment locally, then post each segment to the same endpoint.
# Each piece must decode on its own — split with a tool that writes a real
# container per piece (ffmpeg here), never with `split`/`dd` on the bytes.
ffmpeg -i speech.wav -f segment -segment_time 3 -c copy chunk-%03d.wav
for f in chunk-*.wav; do
curl -sS https://api.therouter.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-F file="@$f" \
-F model="openai/gpt-realtime-whisper" \
-F language="en" | python3 -c 'import json,sys; print(json.load(sys.stdin)["text"])'
doneРеестр фактов — каждая утверждаемая величина имеет источник
| источник | URL | получено | |
|---|---|---|---|
| Дата релиза | developers.openai.com ↗ | 2026-05-30 | проверено |
| Дата отсечения | developers.openai.com ↗ | 2026-05-30 | проверено |
| Окно контекста | developers.openai.com ↗ | 2026-05-30 | проверено |
| Макс. выходных токенов | developers.openai.com ↗ | 2026-05-30 | проверено |
| Единица тарификации | developers.openai.com ↗ | 2026-05-30 | проверено |
| API эндпоинт | developers.openai.com ↗ | 2026-05-30 | проверено |
| Настройка задержки | developers.openai.com ↗ | 2026-05-30 | проверено |
| Поддерживаемые функции | developers.openai.com ↗ | 2026-05-30 | проверено |
| Формат аудиовхода | developers.openai.com ↗ | 2026-05-30 | проверено |
| Azure WER improvement | learn.microsoft.com ↗ | 2026-05-30 | один источник |
| OpenAI запускает GPT-Realtime-Whisper одновременно с GPT-Realtime-2 и GPT-Realtime-Translate | developers.openai.com ↗ | 2026-05-30 | проверено |
| Модель документирована как работающая только по WebSocket. Есть ли wss://-эндпоинт на TheRouter? | therouter.ai ↗ | 2026-07-29 | к проверке |
| Чем GPT-Realtime-Whisper отличается от gpt-4o-transcribe? | developers.openai.com ↗ | 2026-05-30 | к проверке |
| Могу ли я использовать GPT-Realtime-Whisper через стандартный OpenAI chat completions SDK? | developers.openai.com ↗ | 2026-05-30 | к проверке |
| Что делает настройка 'delay' и какую выбрать? | developers.openai.com ↗ | 2026-05-30 | к проверке |
| Могу ли я управлять транскрипцией модели с помощью пользовательской лексики или промптов? | developers.openai.com ↗ | 2026-05-30 | к проверке |
| Как GPT-Realtime-Whisper сравнивается с традиционным Whisper по задержке? | developers.openai.com ↗ | 2026-05-30 | к проверке |