Назад к моделям

GPT Audio 1.5 — это общедоступная аудио-нативная модель OpenAI, первая модель GPT Audio без суффикса '-preview', рекомендованная в качестве замены для production-вариантов gpt-4o-audio-preview и gpt-4o-mini-audio-preview. Выпущенная в феврале 2026 года вместе со своим realtime-собратом gpt-realtime-1.5, модель доступна через стандартный Chat Completions REST API на api.therouter.ai/v1 с тем же набором параметров modalities и audio. Модель принимает аудиовход и за один цикл генерирует как текстовую расшифровку, так и аудиовыход в base64, устраняя необходимость в отдельных пайплайнах Whisper и TTS.

С точки зрения маршрутизации TheRouter, gpt-audio-1.5 — важная веха: это первая полностью GA аудио-модель OpenAI, что означает гарантии production-стабильности, отсутствие внезапных деприкейшнов в том же году и значительно более низкие цены по сравнению с эпохой preview gpt-4o-audio-preview ($40/80 против $100/200 за миллион аудио-токенов — снижение на 60%). Модель также улучшает gpt-audio (первый GA snapshot от января 2026) с улучшенным следованием инструкциям, лучшим качеством многоязычной речи и повышенной надёжностью вызова инструментов. Для пользователей TheRouter она заменяет как gpt-4o-audio-preview (деприкейшн май 2026), так и gpt-audio (оригинальный GA snapshot) в качестве модели по умолчанию для аудио-ввода/вывода в Chat Completions.

Когда выбирать
  • • Production voice-in/voice-out приложения — голосовые заметки, аудиосообщения, генерация контента в стиле подкастов и системы IVR с гарантиями стабильности GA
  • • Аудио-суммаризация с улучшенным следованием инструкциям — длинные аудиозаписи транскрибируются, суммаризируются и структурируются (метки говорящих, пункты действий) одним вызовом API
  • • Многоязычные голосовые приложения — улучшенная точность для неанглийских языков делает модель подходящей для японских, индийских и европейских голосовых рабочих процессов
  • • Вызов инструментов из голоса — устные жалобы или запросы клиентов могут запускать структурированные инструменты (создание тикета, эскалация, поиск по базе знаний) одним запросом с повышенной надёжностью по сравнению с preview-моделью
Когда не выбирать
  • • Разговорный AI реального времени с задержкой аудио-к-аудио <200 мс — используйте gpt-realtime-1.5 на TheRouter (Realtime API через WebSocket) для постоянных низколатентных соединений
  • • Чисто текстовые задачи — стандартные текстовые модели GPT-4o или GPT-4o Mini дешевле ($4/$16 против $2,50/$10 за миллион текстовых токенов у GPT-4o Mini) без накладных расходов аудио-модальности
  • • Потоковая транскрипция больших объёмов — используйте gpt-4o-transcribe или gpt-4o-mini-transcribe на TheRouter для специализированных задач распознавания речи по значительно более низкой цене

Чем обслуживание в TheRouter отличается от вендорского

Как её эксплуатирует вендор

OpenAI обслуживает GPT Audio 1.5 через Chat Completions API для audio-in/audio-out запросов с теми же параметрами modalities и audio, которые описаны для vendor endpoint.

На TheRouter

TheRouter предоставляет тот же контракт Chat Completions на https://api.therouter.ai/v1: измените только base URL, API key и model id на openai/gpt-audio-1.5. Эта страница не подразумевает realtime WebSocket behavior.

Размер контекста
--
Максимальный вывод
--
Цена Входза 1M токенов
$4.32за 1 млн токенов
Цена Выходза 1M токенов
$17.28за 1 млн токенов

Модальности

ТекстАудиоИзображение→ТекстАудио

Возможности

Зрение

Разбивка цен

ТипСтавка
Вход$4.32 за 1 млн токенов
Выход$17.28 за 1 млн токенов
Audio input$34.56 за 1 млн токенов
Audio output$69.12 за 1 млн токенов
Image input$5.40 за 1 млн токенов

Поддерживаемые параметры

temperaturemax_tokenstop_ptoolstool_choiceresponse_formatmodalitiesaudio

Характеристики

Дата релиза2026-02-23 (вместе с gpt-realtime-1.5)learn.microsoft.com ↗проверено
СтатусGeneral availability (GA) — заменяет gpt-4o-audio-preview и gpt-4o-mini-audio-preview; они деприкейтнуты 2026-05-07developers.openai.com ↗проверено
Дата отсечения данныхНе раскрытонеизвестно
Модальность выводаАудио + текст (двойной вывод через параметр modalities); форматы wav, mp3, flac, opus, pcm16, aaclearn.microsoft.com ↗проверено
Поддерживаемые голосаAlloy, Ash, Ballad, Coral, Echo, Sage, Shimmer, Verse, Marin, Cedar (10 голосов)learn.microsoft.com ↗проверено
Макс. размер аудиофайла20 МБ на входной аудиофайлlearn.microsoft.com ↗проверено
Tool / function callingПоддерживается — повышенная надёжность по сравнению с gpt-4o-audio-previewtechcommunity.microsoft.com ↗проверено
Структурированный вывод (JSON)Не раскрыто публично для этой аудио-моделинеизвестно
ЛицензияOpenAI Terms of Service (проприетарная, только API)проверено

Бенчмарки

BenchmarkDistributionScoreSource
Big Bench Audio
Материалы OpenAI и Azure описывают улучшения GPT Audio 1.5 в следовании инструкциям, многоязычном аудио и вызове инструментов, но не публикуют отдельный результат Big Bench Audio для этой модели Chat Completions.
—Не раскрыто—
Multilingual WER reduction
Публикация Azure Foundry сообщает, что GPT Audio 1.5 улучшает многоязычное качество аудио, включая японский и индийские языки, но не раскрывает точные WER или показатели точности.
—Не раскрыто—
Tool calling accuracy
Публикация Azure Foundry называет улучшенное следование инструкциям и более надёжный вызов инструментов среди улучшений GPT Audio 1.5, но не раскрывает pass rate или benchmark score.
—Не раскрыто—

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "openai/gpt-audio-1.5",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

Чат с аудио-вводом/выводом

Аудиочат через OpenAI-совместимый эндпоинт TheRouter — укажите параметры modalities и audio для получения голосового ответа.

cURL
# Encode audio to base64 first:
# AUDIO_B64=$(base64 -i input.mp3)

curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openai/gpt-audio-1.5",
    "modalities": ["text", "audio"],
    "audio": {"voice": "alloy", "format": "wav"},
    "messages": [
      {
        "role": "user",
        "content": [
          {"type": "text", "text": "What is in this audio recording?"},
          {"type": "input_audio", "input_audio": {"data": "'"$AUDIO_B64"'", "format": "mp3"}}
        ]
      }
    ]
  }'

Ещё от openai

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2026-02-23

OpenAI выпускает gpt-audio-1.5 и gpt-realtime-1.5

OpenAI выпустила gpt-audio-1.5 в Chat Completions API и gpt-realtime-1.5 в Realtime API 23 февраля 2026. Обе модели предлагают улучшенное следование инструкциям, многоязычную производительность и надёжность вызова инструментов. gpt-audio-1.5 стала первой полностью GA моделью GPT Audio, заменив gpt-4o-audio-preview со значительно более низкими ценами ($40/$80 против $100/$200 за миллион аудио-токенов). gpt-4o-audio-preview и gpt-4o-mini-audio-preview деприкейтнуты 7 мая 2026.

переработано TheRouterlearn.microsoft.com ↗

Частые вопросы

Чем gpt-audio-1.5 отличается от gpt-4o-audio-preview?

gpt-audio-1.5 — это общедоступный преемник gpt-4o-audio-preview. Ключевые отличия: (1) статус GA с гарантиями production-стабильности вместо 'preview'; (2) значительно более низкие цены на аудио-токены ($40/$80 против $100/$200 за миллион); (3) улучшенное следование инструкциям, многоязычная точность и надёжность вызова инструментов. Параметры API идентичны — нужно только изменить имя модели. gpt-4o-audio-preview деприкейтнут 7 мая 2026.

переработано TheRouterdevelopers.openai.com ↗
Могу ли я использовать gpt-audio-1.5 на TheRouter сегодня?

Да. gpt-audio-1.5 полностью доступна на TheRouter через стандартный OpenAI-совместимый эндпоинт /v1/chat/completions на api.therouter.ai/v1. Просто установите имя модели 'openai/gpt-audio-1.5' в вашем существующем коде. API принимает те же параметры modalities и audio, что и gpt-4o-audio-preview — изменений миграции, кроме ID модели, не требуется.

Какие аудиоформаты поддерживает gpt-audio-1.5?

GPT Audio 1.5 поддерживает входное аудио в форматах wav, mp3, flac, opus, pcm16 и aac. Аудиовход передаётся как данные в base64 в части содержимого input_audio. Максимальный размер входного аудиофайла — 20 МБ. Аудиовыход возвращается в виде данных base64 в указанном формате (по умолчанию wav). Модель выводит как текстовую расшифровку, так и аудио, когда modalities включает и 'text', и 'audio'.

переработано TheRouterlearn.microsoft.com ↗
Как перейти с gpt-4o-audio-preview на gpt-audio-1.5?

Миграция проста: измените имя модели с 'openai/gpt-4o-audio-preview' на 'openai/gpt-audio-1.5' в ваших API-запросах. Других изменений параметров не требуется — API modalities, audio и вызова инструментов идентичны. Новая модель дешевле ($40/$80 против $100/$200 за миллион аудио-токенов для текст+аудио, и $4/$16 против $2,50/$10 для только текста). Gpt-4o-audio-preview деприкейтнут 7 мая 2026, миграция настоятельно рекомендуется.

переработано TheRouterdevelopers.openai.com ↗
Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Дата релизаlearn.microsoft.com ↗2026-08-18проверено
Статусdevelopers.openai.com ↗2026-08-18проверено
Дата отсечения данных——неизвестно
Модальность выводаlearn.microsoft.com ↗2026-08-18проверено
Поддерживаемые голосаlearn.microsoft.com ↗2026-08-18проверено
Макс. размер аудиофайлаlearn.microsoft.com ↗2026-08-18проверено
Tool / function callingtechcommunity.microsoft.com ↗2026-08-18проверено
Структурированный вывод (JSON)——неизвестно
Лицензия——проверено
Big Bench Audiotechcommunity.microsoft.com ↗2026-08-18неизвестно
Multilingual WER reductiontechcommunity.microsoft.com ↗2026-08-18неизвестно
Tool calling accuracytechcommunity.microsoft.com ↗2026-08-18неизвестно
OpenAI выпускает gpt-audio-1.5 и gpt-realtime-1.5learn.microsoft.com ↗2026-08-18проверено
Чем gpt-audio-1.5 отличается от gpt-4o-audio-preview?developers.openai.com ↗2026-08-18к проверке
Какие аудиоформаты поддерживает gpt-audio-1.5?learn.microsoft.com ↗2026-08-18к проверке
Как перейти с gpt-4o-audio-preview на gpt-audio-1.5?developers.openai.com ↗2026-08-18к проверке
Помощь и контакты