Назад к моделям

GPT-4o Mini TTS — это экономичная модель синтеза речи от OpenAI, выпущенная 20 марта 2025 года в составе нового поколения аудиомоделей вместе с gpt-4o-transcribe и gpt-4o-mini-transcribe. Построенная на мультимодальной основе GPT-4o, она преобразует текст в естественно звучащую речь стоимостью примерно $0,015 за минуту сгенерированного аудио — что делает её одним из самых доступных качественных TTS-решений на рынке. Модель поддерживает 11 встроенных голосов (Alloy, Ash, Ballad, Coral, Echo, Fable, Nova, Onyx, Sage, Shimmer, Verse), охватывающих широкий диапазон тональностей — от глубокой авторитетной дикции до яркого энергичного маркетинга, с последующим добавлением голосов Marin и Cedar.

Ключевая особенность GPT-4o Mini TTS — управляемость: уникальный параметр instructions позволяет разработчикам контролировать не только что говорит модель, но и как она это говорит — используя подсказки на естественном языке для указания эмоции (взволнованно, спокойно, срочно), темпа (быстрее, медленнее), акцента или направления персонажа. Это значительное отличие от традиционных TTS-систем (tts-1, tts-1-hd, ElevenLabs), где голосовые характеристики более фиксированы. Модель поддерживает 50+ языков, синхронный и потоковый режимы и бесшовно интегрируется с OpenAI SDK как замена через эндпоинт /v1/audio/speech — полностью доступна через единый API TheRouter по адресу api.therouter.ai/v1.

Когда выбирать
  • • Бюджетные голосовые приложения — озвучивание подкастов, аудиокниг, IVR-систем и голосовой почты по цене ~$0,015/мин с качеством, сравнимым с более дорогими TTS-провайдерами.
  • • Голосовые агенты, требующие контроля тональности — боты поддержки, которые могут говорить с эмпатией, срочностью или профессионализмом в зависимости от контекста через параметр instructions.
  • • Многоязычная генерация контента — поддержка 50+ языков для глобальных голосовых приложений от e-learning до видеодубляжа.
  • • Прототипирование и быстрая итерация — самая дешёвая OpenAI TTS для экспериментов с интерактивной площадкой openai.fm для мгновенного предпросмотра голоса и генерации кода.
Когда не выбирать
  • • Сценарии, где критична точность воспроизведения текста — как и в любой LLM-основанной TTS, функция управляемости несёт риск, что текстовое содержимое может быть ложно интерпретировано как инструкции (например, ремарки в скобках могут быть исполнены, а не прочитаны вслух). Для приложений, требующих идеального дословного воспроизведения, традиционные TTS-модели (tts-1, tts-1-hd) или специализированный синтез речи могут быть безопаснее.
  • • Клонирование или создание пользовательских голосов — GPT-4o Mini TTS ограничена предустановленными синтетическими голосами. Для zero-shot клонирования голоса по эталонному аудио рассмотрите Mistral Voxtral TTS или Fish Speech 1.5. Для тонкой настройки голоса у ElevenLabs более широкие инструменты дизайна голосов.
  • • Разговорный AI реального времени с задержкой <500 мс — для полностью интерактивных голосовых диалогов Realtime API OpenAI (gpt-4o-realtime-preview) с нативным speech-in-speech-out подходит больше, чем конвейер текст-в-речь.
Размер контекста
--
Максимальный вывод
--
Цена Текстза 1 млн символов
$16.20за 1 млн символов
Цена Входза 1 млн символов
$0.648за 1 млн токенов

Модальности

Текст→Аудио

Возможности

Синтез речи

Возможности генерации медиа

tts
output_formats
  • mp3
  • opus
  • aac
  • flac
voices
  • alloy
  • ash
  • ballad
  • coral
  • echo
  • fable
  • onyx
  • nova
  • sage
  • shimmer
  • verse
defaults
voice
alloy

Разбивка цен

ТипСтавка
Текст$16.20 за 1 млн символов
Вход$0.648 за 1 млн токенов
Выход$12.96 за 1 млн токенов

Billing unit differs from the vendor's: OpenAI prices gpt-4o-mini-tts per token (text input $0.60/MTok, audio output $12.00/MTok), while this model is charged per 1M characters — the unit it is settled in here. Only tts-1 and tts-1-hd are genuinely per-character at the vendor.

Поддерживаемые параметры

inputvoiceresponse_formatinstructions

Характеристики

Дата релиза20 марта 2025openai.com ↗проверено
Базовая архитектураМультимодальная основа GPT-4o mini, дообучена для генерации аудиоopenai.com ↗проверено
Эндпоинт/v1/audio/speechdevelopers.openai.com ↗проверено
Голоса11 базовых (Alloy, Ash, Ballad, Coral, Echo, Fable, Nova, Onyx, Sage, Shimmer, Verse) + последующие добавления (Marin, Cedar)docs.aimlapi.com ↗проверено
Поддерживаемые языки50+tokenmix.ai ↗проверено
Окно контекста~2 000 входных токеновtokenmix.ai ↗к проверке
Форматы выводаMP3, Opus, AAC, FLAC, WAV, PCMdevelopers.openai.com ↗проверено
УправляемостьДа — параметр instructions для управления эмоцией, темпом, акцентом и направлением персонажа через подсказки на естественном языкеsimonwillison.net ↗проверено

Бенчмарки

BenchmarkDistributionScoreSource
Steerability benchmark (Simon Willison)
Confirmed — instructions parameter works as designed; occasional instruction-leak edge cases reportedsimonwillison.net ↗
Standard TTS benchmarks
OpenAI не опубликовала MOS (Mean Opinion Score) или WER для gpt-4o-mini-tts. Анонс фокусируется на управляемости и стоимости, а не на количественных показателях качества голоса.
—Не раскрыто—

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/audio/speech   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "openai/gpt-4o-mini-tts",
    "input": "Welcome to TheRouter.",
    "voice": "alloy"
  }'

Синтез речи (потоковый)

GPT-4o Mini TTS использует стандартный эндпоинт speech от OpenAI. Вызывайте через единый API TheRouter — модель поддерживает синхронный и потоковый режимы с управляемыми инструкциями для контроля тона.

cURL
curl https://api.therouter.ai/v1/audio/speech \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openai/gpt-4o-mini-tts",
    "input": "Welcome to TheRouter — your unified API for all AI models.",
    "voice": "nova",
    "instructions": "Speak warmly and professionally, like a friendly customer service agent.",
    "response_format": "mp3"
  }' \
  --output speech.mp3

Ещё от openai

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2025-03-20

OpenAI запускает gpt-4o-mini-tts вместе с новыми моделями распознавания речи

OpenAI запустила gpt-4o-mini-tts — экономичную управляемую модель синтеза речи за $0,015/мин, а также новые модели распознавания речи gpt-4o-transcribe и gpt-4o-mini-transcribe. Модель вводит управление на естественном языке для тона, темпа и эмоций — впервые для OpenAI TTS.

переработано TheRouteropenai.com ↗

Частые вопросы

Какие голоса доступны в gpt-4o-mini-tts?

Модель поставляется с 11 базовыми предустановленными голосами: Alloy, Ash, Ballad, Coral, Echo, Fable, Nova, Onyx, Sage, Shimmer и Verse. В последующих обновлениях были добавлены голоса Marin и Cedar. Все голоса — синтетические пресеты, модель НЕ поддерживает создание пользовательских голосов или клонирование. Прослушать все голоса можно на openai.fm.

Как работает параметр instructions?

Параметр instructions принимает подсказки на естественном языке для управления эмоцией (взволнованно, спокойно, срочно), темпом (быстрее, медленнее), акцентом ударения и направлением персонажа. Например: 'Говорите срочно и тоном серьёзного новостного диктора.' Модель смешивает эти инструкции с характеристиками базового голоса. Важно: поскольку инструкции и текст разделяют один входной канал, существует ненулевой риск случайной интерпретации части текста как инструкций — известное ограничение LLM-основанного TTS.

Какие языки поддерживает gpt-4o-mini-tts?

Модель поддерживает 50+ языков, охватывая большинство основных мировых языков. Характеристики голоса сохраняются на разных языках — один и тот же голос может говорить на нескольких языках с одинаковой идентичностью. Для наилучших результатов на неанглийских языках OpenAI рекомендует выбирать голос, соответствующий тональности целевого языка.

Как именно работает ценообразование? На основе токенов или за минуту?

Ценообразование на основе токенов: $0,60 за миллион входных (текстовых) токенов и $12 за миллион аудиовыходных токенов. При типичной скорости речи (~1500 аудиотокенов в минуту) это составляет примерно $0,015 за минуту сгенерированной речи. Через TheRouter цены следуют той же структуре: $0,015 за запрос, $0,60/MTok за ввод и $12/MTok за аудиовыход — без наценки по сравнению с прямыми ценами OpenAI.

Можно ли использовать gpt-4o-mini-tts через TheRouter?

Да — gpt-4o-mini-tts полностью доступна на TheRouter по адресу api.therouter.ai/v1. Используйте стандартный OpenAI SDK с baseURL=https://api.therouter.ai/v1 и model=openai/gpt-4o-mini-tts. Поддерживаются все функции OpenAI TTS: параметр instructions, потоковая передача, все голоса и форматы ответа. Никакой дополнительной настройки не требуется — просто замените base URL и имя модели.

Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Дата релизаopenai.com ↗2026-05-28проверено
Базовая архитектураopenai.com ↗2026-05-28проверено
Эндпоинтdevelopers.openai.com ↗2026-05-28проверено
Голосаdocs.aimlapi.com ↗2026-05-28проверено
Поддерживаемые языкиtokenmix.ai ↗2026-05-28проверено
Окно контекстаtokenmix.ai ↗2026-05-28к проверке
Форматы выводаdevelopers.openai.com ↗2026-05-28проверено
Управляемостьsimonwillison.net ↗2026-05-28проверено
Steerability benchmark (Simon Willison)simonwillison.net ↗2026-05-28проверено
Standard TTS benchmarksopenai.com ↗2026-05-28неизвестно
OpenAI запускает gpt-4o-mini-tts вместе с новыми моделями распознавания речиopenai.com ↗2026-05-28проверено
Какие голоса доступны в gpt-4o-mini-tts?docs.aimlapi.com ↗2026-05-28к проверке
Как работает параметр instructions?simonwillison.net ↗2026-05-28к проверке
Какие языки поддерживает gpt-4o-mini-tts?tokenmix.ai ↗2026-05-28к проверке
Как именно работает ценообразование? На основе токенов или за минуту?tokenmix.ai ↗2026-05-28к проверке
Можно ли использовать gpt-4o-mini-tts через TheRouter?api.therouter.ai ↗2026-05-28к проверке
Помощь и контакты