Назад к моделям

GPT-4o Transcribe Diarize — это модель распознавания речи от OpenAI со встроенной диаризацией говорящих, впервые анонсированная около октября 2025 года. Построенная на той же мультимодальной архитектуре GPT-4o, что и базовая gpt-4o-transcribe, модель добавляет нативную возможность определять «кто когда говорил» — возвращая метки говорящих ("A:", "B:" и т.д.) с посегментными временными метками. Это делает её прямой альтернативой выделенным пайплайнам диаризации, которые ранее требовали передачи отдельной STT-модели через кластеризационный бэкенд.

Модель использует тот же эндпоинт /v1/audio/transcriptions и имеет ту же цену, что и базовая модель транскрипции (~$0.0066/мин). Ключевое отличие — формат ответа diarized_json, возвращающий структурированные сегменты вместо плоского текста. В отличие от базовой модели, gpt-4o-transcribe-diarize не поддерживает промптинг (prompting) или Realtime API, и имеет лимит аудиочанка в 1 400 секунд. Метки говорящих назначаются автоматически как A/B/C, если не указаны явные ссылки на говорящих. По словам Пита Баккума из OpenAI, WER «примерно сопоставим» с базовой gpt-4o-transcribe — используйте базовую модель, если вам не нужна диаризация.

Когда выбирать
  • • Транскрипция звонков поддержки — разделение реплик оператора и клиента с нативными метками говорящих, без отдельного пайплайна диаризации. Используйте diarized_json для структурированного анализа после звонка.
  • • Транскрипция встреч и протоколов — автоматическое приписывание высказываний участникам в многосторонних разговорах. Комбинируйте с эндпоинтом транскрипции TheRouter для простой SDK-интеграции.
  • • Транскрипция интервью и допросов — надёжное разделение говорящих без постобработки. Лимит чанка в 1 400 секунд покрывает большинство одиночных интервью.
  • • Многоязычная транскрипция с диаризацией на 100+ языках — единая основа GPT-4o обрабатывает определение языка и атрибуцию говорящих за один проход, упрощая международные голосовые рабочие процессы.
Когда не выбирать
  • • Простая транскрипция без разделения говорящих — используйте gpt-4o-transcribe (тот же эндпоинт, та же цена, немного ниже задержка без накладных расходов на диаризацию).
  • • Потоковая транскрипция с метками говорящих в реальном времени — gpt-4o-transcribe-diarize недоступна через Realtime API. Для живых субтитров с диаризацией рассмотрите Deepgram или AssemblyAI.
  • • Транскрипция, зависящая от промпта — модель не поддерживает параметр prompt (в отличие от gpt-4o-transcribe). Для транскрипции технических/медицинских терминов с контекстным смещением используйте базовую модель.
  • • Локальное развертывание / air-gapped — GPT-4o Transcribe Diarize является закрытой моделью, доступной только через API. Для самодеплойной диаризации используйте открытый WhisperX или NVIDIA Parakeet с кластеризационным бэкендом.
Размер контекста
--
Максимальный вывод
--
Цена Аудиоза минуту аудио
$0.0071за минуту аудио
Цена Входза минуту аудио
$2.70за 1 млн токенов

Модальности

Аудио→Текст

Возможности

Распознавание речи

Разбивка цен

ТипСтавка
Аудио$0.0071 за минуту аудио
Вход$2.70 за 1 млн токенов
Выход$10.80 за 1 млн токенов
Audio input$6.48 за 1 млн токенов
Estimated$0.0065 за минуту

request is price per minute (official: same $0.006/min as gpt-4o-transcribe; the earlier +10% diarization surcharge does not exist on OpenAI's rate card)

Поддерживаемые параметры

filelanguagepromptresponse_formattemperature

Характеристики

Дата релизаOpenAI публично не раскрывает дату; Azure Foundry указывает модель как общедоступнуюai.azure.com ↗неизвестно
АрхитектураМодель speech-to-text на базе GPT-4o с поддержкой диаризации для распознавания говорящихai.azure.com ↗проверено
Эндпоинт/v1/audio/transcriptions (SDK, совместимый с OpenAI)developers.openai.com ↗проверено
Распознавание языковУлучшенное распознавание языков для speech-to-text; точное число поддерживаемых языков для diarize-варианта публично не раскрытоai.azure.com ↗неизвестно
Макс. размер файлаЛимит загрузки файла для Transcriptions API — 25 МБdevelopers.openai.com ↗проверено
Формат ответаdiarized_json возвращает сегменты с метками говорящих и временными метками start/end, а также полный текст транскриптаdevelopers.openai.com ↗проверено
Метки говорящихПри наличии эталонных записей используются известные имена говорящих; иначе говорящие помечаются последовательно как A, B, ...developers.openai.com ↗проверено
Поддерживаемые форматыmp3, mp4, mpeg, mpga, m4a, wav, webmdevelopers.openai.com ↗проверено
ЛицензияЗакрытая / проприетарная (доступ только через API; открытых весов нет)openai.com ↗проверено

Бенчмарки

BenchmarkDistributionScoreSource
AA-WER (base gpt-4o-transcribe, combined rank)
Независимый бенчмарк STT от Artificial Analysis для базовой gpt-4o-transcribe. По данным OpenAI, вариант с диаризацией должен иметь сопоставимый WER. Отдельный AA-WER для gpt-4o-transcribe-diarize по состоянию на май 2026 г. отсутствует.
—Не раскрыто—
FLEURS (multilingual WER — base gpt-4o-transcribe)
OpenAI сообщает о последовательном улучшении WER по сравнению с Whisper на эталоне FLEURS (100+ языков) для базовой архитектуры gpt-4o-transcribe. Вариант с диаризацией использует тот же мультиязычный фундамент. Конкретные агрегированные показатели не опубликованы.
Improved WER over Whisper v2/v3 across all language groupsopenai.com ↗

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/audio/transcriptions   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -F "model=openai/gpt-4o-transcribe-diarize"   -F "file=@speech.mp3"

Транскрипция аудио с диаризацией

Транскрибируйте аудиофайл с несколькими говорящими и получите сегменты с метками говорящих в формате diarized_json.

cURL
curl https://api.therouter.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -F "file=@meeting.mp3" \
  -F "model=openai/gpt-4o-transcribe-diarize" \
  -F "response_format=diarized_json"

Ещё от openai

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2025-12-15

OpenAI выпускает декабрьский снэпшот 2025 г. для gpt-4o-transcribe со снижением WER

OpenAI выпустила обновлённые снэпшоты gpt-4o-transcribe (2025-12-15) с улучшенной точностью на бенчмарках Common Voice и FLEURS. Тот же фундамент работает и в варианте с диаризацией. Устаревшие whisper-1 и начальные снэпшоты gpt-4o-transcribe 2025-03-20 ожидаются к выводу из эксплуатации к июню 2026 г., что делает модель с диаризацией одним из оставшихся вариантов транскрипции.

переработано TheRouterdevelopers.openai.com ↗
2025-10-24

GPT-4o Transcribe Diarize становится доступной в OpenAI API

OpenAI незаметно добавила модель gpt-4o-transcribe-diarize в эндпоинт /v1/audio/transcriptions, предлагая нативную диаризацию говорящих поверх основы GPT-4o Transcribe. Модель использует формат ответа diarized_json, возвращающий сегменты с метками говорящих и временными метками. Ранние отчёты указывают лимит чанка в 1 400 секунд и отсутствие поддержки Realtime API как ключевые ограничения.

переработано TheRouterndurner.github.io ↗

Частые вопросы

Чем gpt-4o-transcribe-diarize отличается от базовой gpt-4o-transcribe?

Вариант с диаризацией добавляет нативную идентификацию говорящих — возвращает структурированные сегменты с метками (A:, B: и т.д.) и временными метками через формат ответа diarized_json. Базовая gpt-4o-transcribe возвращает обычный текст без атрибуции говорящих. Ограничения: модель с диаризацией не поддерживает параметр prompt, недоступна через Realtime API и имеет лимит чанка в 1 400 секунд. WER «примерно сопоставим» по данным OpenAI, поэтому используйте базовую модель, если вам не нужна диаризация.

переработано TheRouterndurner.github.io ↗
Можно ли получить пользовательские имена говорящих вместо A/B/C?

Метки говорящих по умолчанию A:, B:, C: и т.д. Вы можете предоставить аудиоссылки для атрибуции говорящих (связывая сегменты с известными голосами), но модель не запоминает имена постоянно — это атрибуция на каждый запрос, а не постоянное распознавание говорящих.

переработано TheRouterlearn.microsoft.com ↗
Доступна ли gpt-4o-transcribe-diarize через Realtime API?

Нет. gpt-4o-transcribe-diarize доступна только через эндпоинт /v1/audio/transcriptions для пакетной транскрипции на основе файлов. Она не поддерживает Realtime API или потоковый ввод аудио. Для транскрипции в реальном времени используйте gpt-4o-mini-transcribe (без диаризации) через Realtime API или рассмотрите Deepgram и AssemblyAI для потоковой диаризации.

переработано TheRoutercommunity.openai.com ↗
Поддерживает ли gpt-4o-transcribe-diarize параметр prompt для контекстного смещения?

Нет. Это ключевое отличие от базовой модели gpt-4o-transcribe. Согласно руководству OpenAI по распознаванию речи, промптинг в настоящее время недоступен для gpt-4o-transcribe-diarize. Если вам нужно контекстное смещение для доменной терминологии, используйте базовую модель gpt-4o-transcribe.

переработано TheRouterplatform.openai.com ↗
Каков лимит аудиочанка для gpt-4o-transcribe-diarize?

Каждый запрос ограничен ~1 400 секундами (~23 минутами) аудио. Это короче, чем лимит базовой gpt-4o-transcribe (25 МБ / ~25 минут). Для более длинных записей разбивайте на части и опционально собирайте сегменты с диаризацией на стороне клиента.

переработано TheRouterndurner.github.io ↗
Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Дата релизаai.azure.com ↗2026-08-10неизвестно
Архитектураai.azure.com ↗2026-08-10проверено
Эндпоинтdevelopers.openai.com ↗2026-05-28проверено
Распознавание языковai.azure.com ↗2026-08-10неизвестно
Макс. размер файлаdevelopers.openai.com ↗2026-08-10проверено
Формат ответаdevelopers.openai.com ↗2026-08-10проверено
Метки говорящихdevelopers.openai.com ↗2026-08-10проверено
Поддерживаемые форматыdevelopers.openai.com ↗2026-08-10проверено
Лицензияopenai.com ↗2026-08-10проверено
AA-WER (base gpt-4o-transcribe, combined rank)openai.com ↗2026-08-10неизвестно
FLEURS (multilingual WER — base gpt-4o-transcribe)openai.com ↗2026-08-10проверено
OpenAI выпускает декабрьский снэпшот 2025 г. для gpt-4o-transcribe со снижением WERdevelopers.openai.com ↗2026-05-28проверено
GPT-4o Transcribe Diarize становится доступной в OpenAI APIndurner.github.io ↗2026-05-28проверено
Чем gpt-4o-transcribe-diarize отличается от базовой gpt-4o-transcribe?ndurner.github.io ↗2026-05-28к проверке
Можно ли получить пользовательские имена говорящих вместо A/B/C?learn.microsoft.com ↗2026-05-28к проверке
Доступна ли gpt-4o-transcribe-diarize через Realtime API?community.openai.com ↗2026-05-28к проверке
Поддерживает ли gpt-4o-transcribe-diarize параметр prompt для контекстного смещения?platform.openai.com ↗2026-05-28к проверке
Каков лимит аудиочанка для gpt-4o-transcribe-diarize?ndurner.github.io ↗2026-05-28к проверке
Помощь и контакты