Назад к моделям

GPT Audio (gpt-audio) — первая общедоступная аудио-модель OpenAI для Chat Completions API. Запущенная в январе 2026 года, она добавляет нативный ввод и вывод аудио в привычный текстовый endpoint, позволяя разработчикам создавать голосовые приложения без перехода на отдельный Realtime API или сборки конвейера из транскрибации и TTS.

В отличие от Realtime-моделей (gpt-realtime-*, использующих WebRTC для низколатентного speech-to-speech), gpt-audio работает через стандартный HTTP REST API Chat Completions. Разработчики отправляют аудио в формате base64 в содержимом сообщения и получают аудио в ответ — что упрощает интеграцию в существующие чат-бэкенды. Модель оснащена улучшенным декодером для более естественного звучания голоса и лучшей согласованности по сравнению с gpt-4o-audio-preview.

Когда выбирать
  • • Голосовые чат-боты и ассистенты, которые говорят и слушают через Chat Completions
  • • Агенты поддержки с аудио-интерфейсом, ведущие естественный диалог с сохранением контекста
  • • Приложения, которым нужны и текст, и аудио в одном API-вызове — переключение между режимами в ходе диалога
  • • Суммаризация голосовых заметок, расшифровка встреч и анализ аудиоконтента
Когда не выбирать
  • • Диалоги в реальном времени с низкой задержкой (<500 мс) — используйте gpt-realtime-2 или gpt-realtime-1.5 через Realtime API / WebRTC
  • • Чисто текстовые чаты большого объёма — текстовые модели (gpt-5.5, gpt-5.5-pro) более экономичны
  • • Только транскрибация (речь-в-текст) — gpt-4o-transcribe или gpt-4o-mini-transcribe дешевле и оптимизированы для этой задачи
  • • Потоковый перевод речи между языками — используйте gpt-realtime-translate, созданный специально для этого сценария
Размер контекста
--
Максимальный вывод
--
Цена Входза 1M токенов
$2.70за 1 млн токенов
Цена Выходза 1M токенов
$10.80за 1 млн токенов

Модальности

ТекстАудио→ТекстАудио

Разбивка цен

ТипСтавка
Вход$2.70 за 1 млн токенов
Выход$10.80 за 1 млн токенов
Audio input$34.56 за 1 млн токенов
Audio output$69.12 за 1 млн токенов

Поддерживаемые параметры

temperaturemax_tokenstop_ptoolstool_choiceresponse_formatmodalitiesaudio

Характеристики

Дата релизаЯнварь 2026 (GA)OpenRouter ↗проверено
Окно контекста128 000 токеновOpenRouter ↗к проверке
Макс. токенов на вывод16 384 токеновOpenRouter ↗к проверке
Поддерживаемые модальностиВвод: текст, аудио; Вывод: текст, аудиоdevelopers.openai.com ↗проверено
ЛицензияПроприетарная (условия API OpenAI)проверено

Бенчмарки

BenchmarkDistributionScoreSource
Audio quality & voice naturalness
OpenAI сообщает, что gpt-audio использует улучшенный декодер, обеспечивающий более естественное звучание голосов и лучшую согласованность по сравнению с preview-версией. Опубликованные бенчмарки отсутствуют.
Upgraded decoder — more natural voices vs gpt-4o-audio-previewOpenRouter ↗

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "openai/gpt-audio",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

Chat completion с аудио

Отправляйте аудио в формате base64 (WAV/MP3) в содержимом сообщения. Модель может отвечать как текстом, так и аудио.

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openai/gpt-audio",
    "modalities": ["text", "audio"],
    "audio": { "voice": "alloy", "format": "wav" },
    "messages": [
      {
        "role": "user",
        "content": [
          { "type": "text", "text": "What does this audio say?" },
          { "type": "input_audio", "input_audio": { "data": "<BASE64_AUDIO>", "format": "wav" } }
        ]
      }
    ]
  }'

Ещё от openai

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2026-01-20

OpenAI запускает gpt-audio — первую GA аудио-модель для Chat Completions

OpenAI выпустила gpt-audio — первую общедоступную аудио-модель с нативным аудиовводом/выводом через Chat Completions REST API. Модель оснащена улучшенным декодером для более естественного звучания, лучшей согласованностью голоса и поддерживает как текст, так и аудио в одном API-вызове. Цена: $2.50/M входных токенов (текст) и $40/M (аудиоввод).

переработано TheRouterOpenRouter ↗

Частые вопросы

Чем gpt-audio отличается от gpt-4o-audio-preview?

gpt-audio — это GA-преемник gpt-4o-audio-preview. Он использует улучшенный декодер для более естественного звучания с лучшей согласованностью. Также доступен в Azure и имеет более широкую экосистему поддержки. В отличие от preview, gpt-audio — это production-ready модель для коммерческого развёртывания.

переработано TheRouteropenrouter.ai ↗
Можно ли использовать gpt-audio с TheRouter API?

Да. gpt-audio полностью доступен на TheRouter через стандартный Chat Completions endpoint api.therouter.ai/v1/chat/completions. Используйте ID модели "openai/gpt-audio". Аудиоввод поддерживается через формат input_audio с данными base64 (WAV/MP3). Установите параметры modalities и audio для запроса аудиовыхода.

переработано TheRouterapi.therouter.ai ↗
Какие аудиоформаты поддерживает gpt-audio для ввода и вывода?

На ввод gpt-audio принимает аудио в формате base64 (WAV или MP3). Формат указывается в content part input_audio. На вывод можно запросить аудио в формате WAV, установив audio.format в теле запроса. Поддерживаемые голоса: alloy, echo, fable, nova, shimmer.

переработано TheRouterdevelopers.openai.com ↗
Какие цены на gpt-audio через TheRouter?

TheRouter передаёт цены OpenAI без наценки. Текстовый ввод: $2.50/М токенов. Текстовый вывод: $10/М токенов. Аудиоввод: $40/М токенов. Аудиовыход: $80/М токенов. Для повторяющихся запросов возможна скидка по кешу.

переработано TheRouterapi.therouter.ai ↗
Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Дата релизаOpenRouter ↗2026-05-29проверено
Окно контекстаOpenRouter ↗2026-05-29к проверке
Макс. токенов на выводOpenRouter ↗2026-05-29к проверке
Поддерживаемые модальностиdevelopers.openai.com ↗2026-05-29проверено
Лицензия——проверено
Audio quality & voice naturalnessOpenRouter ↗2026-05-29к проверке
OpenAI запускает gpt-audio — первую GA аудио-модель для Chat CompletionsOpenRouter ↗2026-05-29проверено
Чем gpt-audio отличается от gpt-4o-audio-preview?openrouter.ai ↗2026-05-29к проверке
Можно ли использовать gpt-audio с TheRouter API?api.therouter.ai ↗2026-05-29к проверке
Какие аудиоформаты поддерживает gpt-audio для ввода и вывода?developers.openai.com ↗2026-05-29к проверке
Какие цены на gpt-audio через TheRouter?api.therouter.ai ↗2026-05-29к проверке
Помощь и контакты