Назад к моделям

GPT-4o Transcribe — это новейшая модель распознавания речи от OpenAI, выпущенная 20 марта 2025 года. Построенная на мультимодальной архитектуре GPT-4o, она заменяет устаревший API whisper-1 со значительным улучшением показателя WER (word error rate) на 99+ языках. Модель использует общее понимание языка GPT-4o для более точной транскрипции технической терминологии, имён собственных, смешанного языкового контента и речи с акцентом — областей, где Whisper исторически страдал от галлюцинаций.

Модель доступна через существующий эндпоинт /v1/audio/transcriptions с поминутной тарификацией ($0.006/мин), что делает её экономически эффективной для высоконагруженных сценариев. GPT-4o Transcribe занимает конкурентоспособную позицию среди лидеров индустрии — Artificial Analysis оценивает её как кандидата высшего уровня наравне со Speechmatics и AssemblyAI, отставая от ElevenLabs Scribe всего на один процентный пункт в совокупной точности. OpenAI выпустила декабрьский снэпшот 2025 года (gpt-4o-transcribe-2025-12-15) с дальнейшим снижением WER на бенчмарках Common Voice и FLEURS. Модель является закрытой и доступна только через API; в отличие от Whisper, версия с открытыми весами не предоставляется.

Когда выбирать
  • • Высокообъёмная общая транскрипция (встречи, подкасты, звонки поддержки) по конкурентной цене — $0.006/мин с улучшенным WER по сравнению с Whisper на большинстве языков.
  • • Приложения, требующие точной транскрипции технической/медицинской/юридической терминологии — понимание языка GPT-4o снижает количество ошибок в специфических доменах по сравнению с чисто акустическими моделями.
  • • Интеграция с экосистемой OpenAI — простая замена whisper-1: тот же эндпоинт, тот же SDK, более высокая точность по конкурентной цене.
  • • Многоязычная транскрипция на 99+ языках с улучшенной обработкой акцентов, переключения кодов и различной скорости речи благодаря методологии обучения с подкреплением.
Когда не выбирать
  • • Полная диаризация (распознавание говорящих) — GPT-4o Transcribe не определяет, кто говорит. Для этого используйте gpt-4o-transcribe-diarize (отдельная модель с метками говорящих) или AssemblyAI.
  • • Потоковая транскрипция реального времени с посекундными метками — модель работает чанками, а не в реальном потоке. Для живых субтитров Deepgram обеспечивает лучшую задержку.
  • • Локальное развертывание / air-gapped — GPT-4o Transcribe является закрытой моделью, доступной только через API. Для самодеплоя используйте открытый Whisper или NVIDIA Parakeet с полным суверенитетом данных.
  • • Языки с низкими ресурсами, где Whisper уже плохо справлялся — улучшения WER сосредоточены на языках со средними и высокими ресурсами. Для таких языков рассмотрите специализированных провайдеров распознавания речи.
Размер контекста
--
Максимальный вывод
--
Цена Аудиоза минуту аудио
$0.0065за минуту аудио
Цена Входза минуту аудио
$2.70за 1 млн токенов

Модальности

Аудио→Текст

Возможности

Распознавание речи

Разбивка цен

ТипСтавка
Аудио$0.0065 за минуту аудио
Вход$2.70 за 1 млн токенов
Выход$10.80 за 1 млн токенов
Audio input$6.48 за 1 млн токенов
Estimated$0.0065 за минуту

request is estimated price per minute

Поддерживаемые параметры

filelanguagepromptresponse_formattemperature

Характеристики

Дата релиза20 марта 2025 г. (начальный снэпшот); обновление 15 декабря 2025 г.openai.com ↗проверено
АрхитектураМультимодальная основа GPT-4o со специализированным аудио-центричным предобучениемopenai.com ↗проверено
Эндпоинт/v1/audio/transcriptions (SDK, совместимый с OpenAI)developers.openai.com ↗проверено
Количество языковТочное число поддерживаемых языков OpenAI публично не раскрывает; OpenAI документирует улучшенное распознавание языков и оценку FLEURS, охватывающую более 100 языков.openai.com ↗неизвестно
Методология обученияОбширное предобучение на аудиоцентричных датасетах + парадигма RL для снижения WERopenai.com ↗проверено
Макс. размер файла25 МБ на запрос (рекомендуется разбивать аудио длиннее 25 мин на части)tokenmix.ai ↗проверено
Поддерживаемые форматыmp3, mp4, mpeg, mpga, m4a, wav, webmdevelopers.openai.com ↗проверено
ЛицензияЗакрытая / проприетарная (доступ только через API; открытых весов нет)techcrunch.com ↗проверено

Бенчмарки

BenchmarkDistributionScoreSource
FLEURS (multilingual WER — all languages)
OpenAI сообщает, что GPT-4o Transcribe показывает более низкий WER, чем Whisper v2 и Whisper v3, во всех языковых оценках FLEURS. FLEURS охватывает более 100 языков; единую агрегированную оценку OpenAI в анонсе не публикует.
Outperforms Whisper v2/v3 across all language evaluations per OpenAIopenai.com ↗
Artificial Analysis AA-WER (combined rank)
Вторичные материалы ссылаются на рейтинг Artificial Analysis для GPT-4o Transcribe, но OpenAI не публикует официальный ранг AA-WER или совокупный балл для этой модели. Поэтому эта страница не считает вторичный рейтинг подтверждённым вендорским бенчмарком.
—Не раскрыто—
Common Voice & FLEURS (Dec 2025 snapshot)
OpenAI сообщает, что декабрьский снэпшот 2025 года даёт более низкий WER, чем предыдущие модели, на Common Voice и FLEURS без языковых подсказок, а во внутренней noise evaluation — примерно на 90% меньше галлюцинаций, чем Whisper v2, и примерно на 70% меньше, чем предыдущие модели GPT-4o-transcribe. Полную числовую таблицу Common Voice/FLEURS для этой модели OpenAI не публикует.
Lower WER than prior models; exact numeric deltas not publicly discloseddevelopers.openai.com ↗

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/audio/transcriptions   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -F "model=openai/gpt-4o-transcribe"   -F "file=@speech.mp3"

Транскрипция аудио

Транскрибируйте аудиофайлы с GPT-4o Transcribe через совместимый с OpenAI эндпоинт /v1/audio/transcriptions через TheRouter.

cURL
curl https://api.therouter.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -F "file=@recording.mp3" \
  -F "model=openai/gpt-4o-transcribe" \
  -F "response_format=json"

Ещё от openai

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2025-12-15

OpenAI выпускает декабрьский снэпшот 2025 г. с дальнейшим снижением WER

OpenAI выпустила обновлённые снэпшоты gpt-4o-transcribe (2025-12-15) с улучшенной точностью на бенчмарках Common Voice и FLEURS. Обновление снижает WER, особенно в сценариях zero-shot определения языка. Устаревшие whisper-1 и начальный снэпшот 2025-03-20 ожидаются к выводу из эксплуатации к июню 2026 г.

переработано TheRouterdevelopers.openai.com ↗
2025-03-20

OpenAI запускает gpt-4o-transcribe и gpt-4o-mini-transcribe

OpenAI представила новейшие модели распознавания речи на базе архитектуры GPT-4o, заменяющие устаревший эндпоинт whisper-1. Модели обеспечивают значительное снижение WER на 99+ языках, с обучением на основе RL для уменьшения галлюцинаций и повышения точности на акцентированной речи, технической терминологии и в шумной среде. Примечание: не открытый исходный код в отличие от Whisper.

переработано TheRouteropenai.com ↗

Частые вопросы

Чем gpt-4o-transcribe отличается от whisper-1?

GPT-4o Transcribe использует мультимодальную архитектуру GPT-4o вместо специализированного кодировщика-декодировщика Whisper. Он достигает более низкого WER на 99+ языках (особенно на акцентированной речи и технической терминологии), менее склонен к галлюцинациям и использует поминутную тарификацию ($0.006/мин против токеновой тарификации Whisper). Однако он закрыт и доступен только через API — в отличие от Whisper (лицензия MIT, возможность самостоятельного хостинга). Через TheRouter вы можете получить к нему доступ по конкурентным маршрутным ценам.

переработано TheRouteropenai.com ↗
Поддерживает ли gpt-4o-transcribe диаризацию говорящих?

Нет, базовая модель gpt-4o-transcribe не определяет разных говорящих. Она возвращает единую транскрипцию без меток говорящих. Для диаризации используйте модель gpt-4o-transcribe-diarize (доступна через TheRouter как openai/gpt-4o-transcribe-diarize) или сторонний сервис, например AssemblyAI.

переработано TheRoutertokenmix.ai ↗
Можно ли получить посекундные метки?

Не нативно. Режим response_format=verbose_json возвращает только посегментные метки. Для посекундной точности рассмотрите Deepgram или AssemblyAI, которые предлагают покадровую разметку как встроенную функцию.

переработано TheRoutertokenmix.ai ↗
Каков максимальный размер аудиофайла?

25 МБ на запрос. Для более длинного аудио разбивайте на части до 25 МБ или ~25 минут каждая. У модели нет формального пакетного эндпоинта для транскрипции, поэтому для больших медиатеки потребуется собственная очередь.

переработано TheRouterdevelopers.openai.com ↗
С какими языками gpt-4o-transcribe работает лучше всего?

Модель поддерживает 99+ языков, с наилучшими результатами на английском, испанском, французском, немецком, итальянском, португальском, китайском (мандарин), японском, корейском, арабском и русском. Улучшения WER по сравнению с Whisper наиболее заметны на языках, где Whisper ранее плохо справлялся (например, индийские и дравидийские языки). Для плохо поддерживаемых языков рассмотрите специализированных STT-провайдеров или самодеплой Whisper.

переработано TheRoutertechcrunch.com ↗
Доступен ли gpt-4o-transcribe через TheRouter?

Да. Используйте model=openai/gpt-4o-transcribe с baseURL=https://api.therouter.ai/v1 и стандартным SDK OpenAI. TheRouter маршрутизирует ваш запрос на лучший доступный эндпоинт API транскрипции OpenAI по конкурентным ценам.

Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Дата релизаopenai.com ↗2026-05-28проверено
Архитектураopenai.com ↗2026-08-25проверено
Эндпоинтdevelopers.openai.com ↗2026-05-28проверено
Количество языковopenai.com ↗2026-08-25неизвестно
Методология обученияopenai.com ↗2026-05-28проверено
Макс. размер файлаtokenmix.ai ↗2026-05-28проверено
Поддерживаемые форматыdevelopers.openai.com ↗2026-08-25проверено
Лицензияtechcrunch.com ↗2026-05-28проверено
FLEURS (multilingual WER — all languages)openai.com ↗2026-08-25проверено
Artificial Analysis AA-WER (combined rank)openai.com ↗2026-08-25неизвестно
Common Voice & FLEURS (Dec 2025 snapshot)developers.openai.com ↗2026-08-25проверено
OpenAI выпускает декабрьский снэпшот 2025 г. с дальнейшим снижением WERdevelopers.openai.com ↗2026-05-28проверено
OpenAI запускает gpt-4o-transcribe и gpt-4o-mini-transcribeopenai.com ↗2026-05-28проверено
Чем gpt-4o-transcribe отличается от whisper-1?openai.com ↗2026-05-28к проверке
Поддерживает ли gpt-4o-transcribe диаризацию говорящих?tokenmix.ai ↗2026-05-28к проверке
Можно ли получить посекундные метки?tokenmix.ai ↗2026-05-28к проверке
Каков максимальный размер аудиофайла?developers.openai.com ↗2026-05-28к проверке
С какими языками gpt-4o-transcribe работает лучше всего?techcrunch.com ↗2026-05-28к проверке
Доступен ли gpt-4o-transcribe через TheRouter?api.therouter.ai ↗2026-05-28к проверке
Помощь и контакты