Назад к моделям

GPT-4o Mini Transcribe

openaiopenai/gpt-4o-mini-transcribe

Speech-to-text model powered by GPT-4o mini.

GPT-4o Mini Transcribe — это экономичная модель распознавания речи от OpenAI, построенная на архитектуре GPT-4o Mini. Она транскрибирует аудиовход в текст и обеспечивает улучшенный коэффициент ошибок, распознавание языков и общую точность по сравнению с оригинальными моделями Whisper. Модель предназначена для разработчиков, которым требуется надёжная транскрипция по более низкой цене, чем полноразмерная GPT-4o Transcribe, при сохранении точности, усиленной за счёт обучения с подкреплением.

OpenAI применяет парадигму обучения с подкреплением, выводя точность транскрипции на передовой уровень и одновременно уменьшая галлюцинации. Модель поддерживает 99+ языков и лучше справляется с акцентами, шумной средой и различной скоростью речи по сравнению с предшественниками Whisper. На многозвычном бенчмарке FLEURS полноразмерная GPT-4o Transcribe достигает однозначного WER по основным языкам; GPT-4o Mini Transcribe следует за ней как экономичная альтернатива.

Когда выбирать
  • • Транскрипция и аналитика колл-центров — высокая точность в условиях акцентов и шума по конкурентной цене.
  • • Автоматизация заметок на совещаниях — транскрипция записанного или живого аудио встреч в доступный для поиска текст.
  • • Субтитры и титры — генерация субтитров для видеоконтента на 99+ языках.
  • • Конвейеры голосовых агентов — транскрипция речи пользователя для последующей обработки LLM в голосовых приложениях.
Когда не выбирать
  • • Сценарии «речь-в-речь» в реальном времени — используйте модели Realtime API от OpenAI (gpt-realtime-*) для минимальной сквозной задержки.
  • • Транскрипция максимальной точности без ограничения бюджета — GPT-4o Transcribe (полноразмерная) или ElevenLabs Scribe могут превзойти её по независимым тестам.
  • • Диаризация дикторов — используйте openai/gpt-4o-transcribe-diarize для транскрипции с идентификацией говорящих.
Размер контекста
--
Максимальный вывод
--
Цена Аудиоза минуту аудио
$0.0032за минуту аудио
Цена Входза минуту аудио
$1.35за 1 млн токенов

Модальности

Аудио→Текст

Возможности

Распознавание речи

Разбивка цен

ТипСтавка
Аудио$0.0032 за минуту аудио
Вход$1.35 за 1 млн токенов
Выход$5.40 за 1 млн токенов
Audio input$3.24 за 1 млн токенов
Estimated$0.0032 за минуту

request is estimated price per minute

Поддерживаемые параметры

filelanguagepromptresponse_formattemperature

Характеристики

Дата релиза20 марта 2025openai.com ↗проверено
Поддерживаемые языки99+ языков через коды ISO-639-1openai.com ↗проверено
АрхитектураGPT-4o Mini с усиленным RL предобучением для речиopenai.com ↗проверено
Форматы входного аудиоmp3, mp4, mpeg, mpga, m4a, wav, webm, flac, ogg, ogaplatform.openai.com ↗проверено
Макс. размер файла25 МБplatform.openai.com ↗проверено
Дата отсечения данныхНе раскрытонеизвестно

Бенчмарки

BenchmarkDistributionScoreSource
FLEURS English WER
WER на английском подмножестве FLEURS для gpt-4o-transcribe (полноразмерная) указан в блоге OpenAI как 2.46%. Ожидается, что у мини-версии WER выше, но точные показатели пока не опубликованы независимо.
~2.46% (gpt-4o-transcribe reference)%openai.com ↗
FLEURS Multilingual
OpenAI сообщает об однозначном WER по основным языкам на FLEURS. Семейство gpt-4o-transcribe соответствует Whisper v2/v3 или превосходит их по всем языковым оценкам.
Single-digit WER across major languagesopenai.com ↗

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/audio/transcriptions   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -F "model=openai/gpt-4o-mini-transcribe"   -F "file=@speech.mp3"

Гид по API

Транскрипция

Транскрибируйте аудиофайлы через стандартный эндпоинт OpenAI /v1/audio/transcriptions через TheRouter. Поддерживаются различные аудиоформаты и опциональные языковые подсказки для повышения точности.

cURL
curl https://api.therouter.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -F "file=@recording.mp3" \
  -F "model=openai/gpt-4o-mini-transcribe" \
  -F "response_format=json" \
  -F "language=en"

Ещё от openai

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2025-03-20

OpenAI запускает аудиомодели нового поколения, включая GPT-4o Mini Transcribe

OpenAI анонсировала gpt-4o-transcribe, gpt-4o-mini-transcribe и gpt-4o-mini-tts — новое семейство моделей распознавания и синтеза речи. Модели транскрипции используют RL-обучение для достижения передового WER, превосходя Whisper v2/v3 на многозвычном бенчмарке FLEURS.

переработано TheRouteropenai.com ↗

Частые вопросы

В чём разница между GPT-4o Mini Transcribe и Whisper-1?

GPT-4o Mini Transcribe использует GPT-4o Mini в качестве основы с усиленным RL-предобучением, обеспечивая значительно более низкий WER по всем оцениваемым языкам. Она лучше справляется с акцентами, шумной средой и разной скоростью речи, чем Whisper. Whisper-1 остаётся доступной для устаревших интеграций, но для новых проектов рекомендуется новая модель.

Можно ли использовать GPT-4o Mini Transcribe для живой/потоковой транскрипции?

Нет — эта модель поддерживает только стандартный эндпоинт /v1/audio/transcriptions, обрабатывающий загруженные аудиофайлы. Для потоковой транскрипции в реальном времени используйте модели Realtime API от OpenAI (gpt-realtime-*), поддерживающие аудиопотоки на основе WebSocket с меньшей задержкой.

переработано TheRouter
В каком формате выводится транскрипция?

Поддерживаемые форматы ответа: json (по умолчанию), text, srt (формат субтитров SubRip), verbose_json (с временными метками и сегментами) и vtt (WebVTT). Форматы json и verbose_json предоставляют структурированные данные для использования в конвейерах.

Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Дата релизаopenai.com ↗2026-05-28проверено
Поддерживаемые языкиopenai.com ↗2026-05-28проверено
Архитектураopenai.com ↗2026-05-28проверено
Форматы входного аудиоplatform.openai.com ↗2026-05-28проверено
Макс. размер файлаplatform.openai.com ↗2026-05-28проверено
Дата отсечения данных——неизвестно
FLEURS English WERopenai.com ↗2026-05-28к проверке
FLEURS Multilingualopenai.com ↗2026-05-28к проверке
OpenAI запускает аудиомодели нового поколения, включая GPT-4o Mini Transcribeopenai.com ↗2026-05-28проверено
В чём разница между GPT-4o Mini Transcribe и Whisper-1?openai.com ↗2026-05-28к проверке
В каком формате выводится транскрипция?platform.openai.com ↗2026-05-28к проверке
Помощь и контакты