返回模型列表

GPT Audio 1.5 是 OpenAI 正式发布的音频原生模型——它是第一个去掉 '-preview' 后缀的 GPT Audio 模型,推荐替代之前的 gpt-4o-audio-preview 和 gpt-4o-mini-audio-preview 变体用于生产环境。该模型于 2026 年 2 月与实时对话兄弟模型 gpt-realtime-1.5 一同发布,通过 api.therouter.ai/v1 的标准 Chat Completions REST API 访问,使用同样的 modalities 和 audio 参数模式。模型接受音频输入,单次往返即可同时生成文本文稿和 base64 编码的音频输出,无需单独的 Whisper 转录和 TTS 管线。

从 TheRouter 路由层来看,gpt-audio-1.5 是一个重要的里程碑:它是第一个全面 GA 的 OpenAI 音频模型,具备生产稳定性保证、不会在同年意外弃用,并且相比 gpt-4o-audio-preview 预览时代大幅降价(音频 token $40/$80 对比 $100/$200 每百万——降幅达 60%)。与 2026 年 1 月的首个 GA 快照 gpt-audio 相比,1.5 版本进一步改进了指令遵循、多语言语音质量和工具调用可靠性。对于 TheRouter 用户,它同时取代 gpt-4o-audio-preview(2026 年 5 月弃用)和 gpt-audio(原始 GA 快照),成为默认的音频输入/输出 Chat Completions 模型。

适合使用
  • • 生产级语音输入/输出应用——语音笔记、语音消息、播客式内容生成和交互式语音应答(IVR)系统,现已具备 GA 稳定性保障
  • • 带改进指令遵循的音频摘要——长音频录音在单次 API 调用中完成转写、摘要和结构化(说话人标签、行动项)
  • • 多语言语音应用——改进的非英语准确性使其适用于日语、印度语系和欧洲语言的语音工作流
  • • 语音触发的工具调用——客户口头投诉或请求可在单次请求中触发结构化工具(工单创建、升级、知识库搜索),可靠性相比预览版模型有所提升
不适合使用
  • • 需要 <200 ms 音频到音频延迟的实时对话 AI——请在 TheRouter 上使用 gpt-realtime-1.5(通过 WebSocket 的 Realtime API)以获取持久低延迟连接
  • • 纯文本工作负载——标准 GPT-4o 或 GPT-4o Mini 文本模型更便宜($4/$16 对比 GPT-4o Mini 的 $2.50/$10 每百万文本 token),没有音频模态开销
  • • 高吞吐流式转录——请在 TheRouter 上使用 gpt-4o-transcribe 或 gpt-4o-mini-transcribe,以极低成本完成专门的语音转文本工作负载

供应商自营与 TheRouter 服务形态的差异

供应商自己运营时

OpenAI 通过 Chat Completions API 提供 GPT Audio 1.5,用于音频输入/输出请求,使用其官方端点文档中的相同 modalities 和 audio 参数。

在 TheRouter 上

TheRouter 在 https://api.therouter.ai/v1 暴露相同的 Chat Completions 契约:只需把 base URL、API key 和模型 ID 改为 openai/gpt-audio-1.5。此页面不暗示提供实时 WebSocket 行为。

上下文长度
--
最大输出
--
输入价格每百万 tokens
$4.32每百万 Tokens
输出价格每百万 tokens
$17.28每百万 Tokens

模态能力

文本音频图像→文本音频

能力

视觉理解

价格明细

类型费率
输入$4.32 每百万 Tokens
输出$17.28 每百万 Tokens
Audio input$34.56 每百万 Tokens
Audio output$69.12 每百万 Tokens
Image input$5.40 每百万 Tokens

支持参数

temperaturemax_tokenstop_ptoolstool_choiceresponse_formatmodalitiesaudio

模型规格

发布日期2026-02-23(与 gpt-realtime-1.5 一同发布)learn.microsoft.com ↗已核实
状态正式可用(GA)——替代 gpt-4o-audio-preview 和 gpt-4o-mini-audio-preview;这些模型于 2026-05-07 弃用developers.openai.com ↗已核实
训练数据截止未公开披露未知
输出模态音频+文本(通过 modalities 参数双输出);音频格式 wav, mp3, flac, opus, pcm16, aaclearn.microsoft.com ↗已核实
支持的语音Alloy, Ash, Ballad, Coral, Echo, Sage, Shimmer, Verse, Marin, Cedar(10 种)learn.microsoft.com ↗已核实
最大音频文件大小每个输入音频文件 20 MBlearn.microsoft.com ↗已核实
工具 / 函数调用支持——根据 2026 年 2 月发布说明,可靠性相比 gpt-4o-audio-preview 有提升techcommunity.microsoft.com ↗已核实
结构化输出 (JSON)该音频模型未公开披露未知
许可OpenAI 服务条款(闭源,仅 API)已核实

基准成绩

BenchmarkDistributionScoreSource
Big Bench Audio
OpenAI 和 Azure 材料说明 GPT Audio 1.5 改进了指令遵循、多语言音频质量和工具调用,但没有为这个 Chat Completions 模型公布单独的 Big Bench Audio 分数。
—未公开披露—
Multilingual WER reduction
Azure Foundry 发布文章称 GPT Audio 1.5 改进了多语言音频质量,包括日语和印度语系场景,但没有公布确切 WER 或准确率数据。
—未公开披露—
Tool calling accuracy
Azure Foundry 发布文章将更好的指令遵循和更可靠的工具调用列为 GPT Audio 1.5 的改进,但没有披露通过率或基准分数。
—未公开披露—

API 使用示例

所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "openai/gpt-audio-1.5",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

API 使用指南

完整 API 参考 →

音频输入输出对话

通过 TheRouter 的 OpenAI 兼容端点进行音频对话——传入 modalities 和 audio 参数即可获取语音回复。

cURL
# Encode audio to base64 first:
# AUDIO_B64=$(base64 -i input.mp3)

curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openai/gpt-audio-1.5",
    "modalities": ["text", "audio"],
    "audio": {"voice": "alloy", "format": "wav"},
    "messages": [
      {
        "role": "user",
        "content": [
          {"type": "text", "text": "What is in this audio recording?"},
          {"type": "input_audio", "input_audio": {"data": "'"$AUDIO_B64"'", "format": "mp3"}}
        ]
      }
    ]
  }'

openai 其他模型

同类模型

跨供应商的相似能力档位

动态与变更

2026-02-23

OpenAI 发布 gpt-audio-1.5 和 gpt-realtime-1.5

OpenAI 于 2026 年 2 月 23 日向 Chat Completions API 发布了 gpt-audio-1.5,向 Realtime API 发布了 gpt-realtime-1.5。两款模型均改进了指令遵循、多语言性能和工具调用可靠性。gpt-audio-1.5 成为第一个全面 GA 的 GPT Audio 模型,以显著更低的定价($40/$80 vs $100/$200 每百万音频 token)替代 gpt-4o-audio-preview 变体。gpt-4o-audio-preview 和 gpt-4o-mini-audio-preview 于 2026 年 5 月 7 日正式弃用。

TheRouter 编辑重写learn.microsoft.com ↗

常见问题

gpt-audio-1.5 与 gpt-4o-audio-preview 有什么区别?

gpt-audio-1.5 是 gpt-4o-audio-preview 的正式可用后继版本。主要区别:(1) GA 状态,提供生产稳定性保障而非'预览'版;(2) 音频 token 定价大幅降低($40/$80 vs $100/$200 每百万 token);(3) 改进的指令遵循、多语言准确性和工具调用可靠性。API 参数完全相同——只需更改模型名称。gpt-4o-audio-preview 已于 2026 年 5 月 7 日弃用。

TheRouter 编辑重写developers.openai.com ↗
我现在可以在 TheRouter 上使用 gpt-audio-1.5 吗?

是的。gpt-audio-1.5 完全可在 TheRouter 上使用,通过 api.therouter.ai/v1 的标准 OpenAI 兼容 /v1/chat/completions 端点。只需在现有代码中将模型名称设置为 'openai/gpt-audio-1.5' 即可。API 接受与 gpt-4o-audio-preview 相同的 modalities 和 audio 参数——除模型 ID 外无需迁移更改。

gpt-audio-1.5 支持哪些音频格式?

GPT Audio 1.5 支持 wav、mp3、flac、opus、pcm16 和 aac 格式的音频输入。音频输入以 base64 编码数据的形式提供在 input_audio 内容部分。最大输入音频文件大小为 20 MB。输出音频以指定格式(默认 wav)的 base64 编码数据返回。当 modalities 同时包含 'text' 和 'audio' 时,模型同时输出文本文稿和音频负载。

TheRouter 编辑重写learn.microsoft.com ↗
如何从 gpt-4o-audio-preview 迁移到 gpt-audio-1.5?

迁移非常简单:将 API 请求中的模型名称从 'openai/gpt-4o-audio-preview' 改为 'openai/gpt-audio-1.5'。无需其他参数更改——modalities、audio 和 tool-calling API 完全一致。新模型更便宜(文本+音频 $40/$80 vs $100/$200 每百万音频 token,纯文本 $4/$16 vs $2.50/$10)。请注意 gpt-4o-audio-preview 已于 2026 年 5 月 7 日弃用,强烈建议迁移。

TheRouter 编辑重写developers.openai.com ↗
事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
发布日期learn.microsoft.com ↗2026-08-18已核实
状态developers.openai.com ↗2026-08-18已核实
训练数据截止——未知
输出模态learn.microsoft.com ↗2026-08-18已核实
支持的语音learn.microsoft.com ↗2026-08-18已核实
最大音频文件大小learn.microsoft.com ↗2026-08-18已核实
工具 / 函数调用techcommunity.microsoft.com ↗2026-08-18已核实
结构化输出 (JSON)——未知
许可——已核实
Big Bench Audiotechcommunity.microsoft.com ↗2026-08-18未知
Multilingual WER reductiontechcommunity.microsoft.com ↗2026-08-18未知
Tool calling accuracytechcommunity.microsoft.com ↗2026-08-18未知
OpenAI 发布 gpt-audio-1.5 和 gpt-realtime-1.5learn.microsoft.com ↗2026-08-18已核实
gpt-audio-1.5 与 gpt-4o-audio-preview 有什么区别?developers.openai.com ↗2026-08-18待核实
gpt-audio-1.5 支持哪些音频格式?learn.microsoft.com ↗2026-08-18待核实
如何从 gpt-4o-audio-preview 迁移到 gpt-audio-1.5?developers.openai.com ↗2026-08-18待核实
帮助与联系