Назад к моделям

GPT Audio Mini (gpt-audio-mini) — экономичная аудио-модель OpenAI для Chat Completions API, запущенная в январе 2026 года вместе с полноценным gpt-audio. Она использует тот же улучшенный декодер, многошаговый аудиодиалог и аудиоввод/вывод в формате base64, что и старшая версия, но по примерно на 75% более низкой цене за токен, что делает её практичным выбором для голосовых приложений с высоким объёмом, где важна стоимость каждого вызова.

Как и gpt-audio, gpt-audio-mini поддерживает смешивание текстовой и аудио-модальностей в одном HTTP-вызове Chat Completions. Разработчики могут отправлять аудио (WAV/MP3 в base64) вместе с текстом и получать одну или обе модальности в ответ. Mini-версия имеет то же окно контекста 128K, поддержку инструментов/функций и потоковую передачу — разница лишь в масштабе модели, что даёт более низкое качество вывода, но существенно меньшую стоимость.

Когда выбирать
  • • Развёртывание голосовых чат-ботов, чувствительных к стоимости, где важен бюджет на аудио в каждом запросе
  • • Конвейеры анализа аудиоконтента с большим объёмом (суммаризация голосовых заметок, обработка журналов звонков)
  • • Простые приложения «голос-в-текст + текст-в-голос», где не требуется сверхнизкая задержка
  • • Прототипирование и тестирование аудио-функций перед масштабированием до полного gpt-audio или gpt-audio-1.5
Когда не выбирать
  • • Речевой вывод в реальном времени с низкой задержкой (<500 мс) — используйте gpt-realtime-mini через WebRTC/Realtime API
  • • Приложениям, требующим наилучшего качества аудио или согласованности голоса — используйте gpt-audio или gpt-audio-1.5
  • • Чисто текстовые чаты — текстовые модели (gpt-5.5, gpt-5.4-mini) дешевле
  • • Выделенные задачи транскрибации — gpt-4o-mini-transcribe специально создан для речи-в-текст и дешевле
Размер контекста
--
Максимальный вывод
--
Цена Входза 1M токенов
$0.648за 1 млн токенов
Цена Выходза 1M токенов
$2.59за 1 млн токенов

Модальности

ТекстАудио→ТекстАудио

Разбивка цен

ТипСтавка
Вход$0.648 за 1 млн токенов
Выход$2.59 за 1 млн токенов
Audio input$10.80 за 1 млн токенов
Audio output$21.60 за 1 млн токенов

Поддерживаемые параметры

temperaturemax_tokenstop_ptoolstool_choiceresponse_formatmodalitiesaudio

Характеристики

Дата релиза19 января 2026Design for Online / OpenRouter ↗проверено
Окно контекста128 000 токеновOpenRouter ↗проверено
Макс. токенов на вывод16 384 токеновOpenRouter ↗проверено
Поддерживаемые модальностиВвод: текст, аудио; Вывод: текст, аудиоdevelopers.openai.com ↗проверено
Поддерживаемые возможностиИнструменты, вызов функций, response_format, стриминг, аудиоplatform.openai.com ↗проверено
ЛицензияПроприетарная (условия API OpenAI)проверено

Бенчмарки

BenchmarkDistributionScoreSource
Audio quality (upgraded decoder)
gpt-audio-mini использует тот же улучшенный декодер, что и gpt-audio, для более естественного звучания голосов с лучшей согласованностью, но с меньшим масштабом модели для экономии. Опубликованные бенчмарки для mini-версии отсутствуют.
Upgraded decoder — same gpt-audio base with reduced scaleDesign for Online ↗

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "openai/gpt-audio-mini",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

Chat completion с аудио

Отправляйте аудио в формате base64 (WAV/MP3) в содержимом сообщения. Модель отвечает текстом и/или аудио — тот же API-паттерн, что и у gpt-audio, но по более низкой цене.

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openai/gpt-audio-mini",
    "modalities": ["text", "audio"],
    "audio": { "voice": "alloy", "format": "wav" },
    "messages": [
      {
        "role": "user",
        "content": [
          { "type": "text", "text": "What does this audio say?" },
          { "type": "input_audio", "input_audio": { "data": "<BASE64_AUDIO>", "format": "wav" } }
        ]
      }
    ]
  }'

Ещё от openai

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2026-01-19

OpenAI запускает gpt-audio и gpt-audio-mini

OpenAI выпустила две аудио-модели Chat Completions: gpt-audio (полная) и gpt-audio-mini (экономичная). Обе оснащены улучшенным декодером для более естественного звучания голоса по сравнению с предыдущим gpt-4o-audio-preview. Mini-версия стоит примерно на 75% дешевле за токен, ориентирована на высокообъёмные голосовые приложения.

переработано TheRouterDesign for Online / OpenRouter ↗

Частые вопросы

Чем gpt-audio-mini отличается от gpt-audio?

gpt-audio-mini — меньшая, более экономичная версия gpt-audio. Обе модели используют один и тот же улучшенный декодер, окно контекста 128K, вызов инструментов и аудио-ввод/вывод. Mini-модель выдаёт аудио более низкого качества, но стоит примерно на 75% дешевле за токен ($0.15/M входной текст + $10/M аудио против $2.50/M + $100/M у gpt-audio).

переработано TheRouter
Можно ли использовать gpt-audio-mini для разговоров в реальном времени с низкой задержкой?

Нет. gpt-audio-mini использует HTTP Chat Completions API, предназначенный для паттерна запрос-ответ. Для speech-to-speech в реальном времени с задержкой <500 мс используйте gpt-realtime-mini через Realtime API / WebRTC.

переработано TheRouter
Поддерживает ли gpt-audio-mini вызов инструментов/функций с аудио?

Да. gpt-audio-mini полностью поддерживает вызов инструментов и функций, включая аудио в сообщениях вместе с определениями инструментов. Вы можете отправить аудио (например, запись с номером бронирования) и поручить модели извлечь структурированные данные через вызов функций — так же, как с текстовой моделью.

Какие аудиоформаты поддерживает gpt-audio-mini?

Аудиоввод поддерживает форматы WAV и MP3, закодированные как base64 в части содержимого input_audio. Аудиовывод поддерживает формат WAV с настраиваемыми голосовыми опциями (alloy, nova и т.д.), задаваемыми через параметр audio.

Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Дата релизаDesign for Online / OpenRouter ↗2026-05-29проверено
Окно контекстаOpenRouter ↗2026-05-29проверено
Макс. токенов на выводOpenRouter ↗2026-05-29проверено
Поддерживаемые модальностиdevelopers.openai.com ↗2026-05-29проверено
Поддерживаемые возможностиplatform.openai.com ↗2026-05-29проверено
Лицензия——проверено
Audio quality (upgraded decoder)Design for Online ↗2026-05-29к проверке
OpenAI запускает gpt-audio и gpt-audio-miniDesign for Online / OpenRouter ↗2026-05-29проверено
Помощь и контакты