返回模型列表

gpt-audio

openaiopenai/gpt-audio

Audio inputs and outputs with the Chat Completions API.

GPT Audio(gpt-audio)是 OpenAI 第一个面向 Chat Completions API 的通用音频模型。于 2026 年 1 月发布,它将原生音频输入和输出引入熟悉的文本对话补全接口,开发者无需切换到单独的 Realtime API 或拼装转录 + TTS 管线即可构建语音应用。

与使用 WebRTC 以低延迟实现语音对语音的 Realtime 系列(gpt-realtime-*)不同,gpt-audio 使用标准 HTTP 的 Chat Completions REST API。开发者将 base64 编码的音频放入消息内容中发送,并接收音频回复——从而可以直接集成到现有基于聊天的后端中。与之前的 gpt-4o-audio-preview 相比,该模型升级了解码器,声音更加自然,语音一致性也更好。

适合使用
  • • 通过 Chat Completions 进行语音对话的聊天机器人和助手
  • • 优先使用音频的客服代理,支持保留上下文的自然对话
  • • 需要在同一 API 调用中同时处理文本和音频模态的应用——可在对话中切换模式
  • • 语音笔记摘要、会议总结和音频内容分析流程
不适合使用
  • • 低延迟实时语音对话(毫秒级轮替)——改用 gpt-realtime-2 或 gpt-realtime-1.5(通过 Realtime API / WebRTC)
  • • 大规模纯文本对话——纯文本模型(gpt-5.5、gpt-5.5-pro)成本更低
  • • 仅转写(语音转文本)——gpt-4o-transcribe 或 gpt-4o-mini-transcribe 更便宜且专用
  • • 跨语言流式实时翻译——应使用专为多语言实时语音翻译打造的 gpt-realtime-translate
上下文长度
--
最大输出
--
输入价格每百万 tokens
$2.70每百万 Tokens
输出价格每百万 tokens
$10.80每百万 Tokens

模态能力

文本音频→文本音频

价格明细

类型费率
输入$2.70 每百万 Tokens
输出$10.80 每百万 Tokens
Audio input$34.56 每百万 Tokens
Audio output$69.12 每百万 Tokens

支持参数

temperaturemax_tokenstop_ptoolstool_choiceresponse_formatmodalitiesaudio

模型规格

发布日期2026 年 1 月(正式发布)OpenRouter ↗已核实
上下文窗口128,000 tokensOpenRouter ↗待核实
最大输出长度16,384 tokensOpenRouter ↗待核实
支持的模态输入:文本、音频;输出:文本、音频developers.openai.com ↗已核实
许可专有许可(OpenAI API 服务条款)已核实

基准成绩

BenchmarkDistributionScoreSource
Audio quality & voice naturalness
OpenAI 表示 gpt-audio 使用了升级的解码器,比预览版 gpt-4o-audio-preview 声音更自然、一致性更好。未公布基准测试分数。
Upgraded decoder — more natural voices vs gpt-4o-audio-previewOpenRouter ↗

API 使用示例

所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "openai/gpt-audio",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

API 使用指南

完整 API 参考 →

音频 Chat 调用

在消息内容中发送 base64 编码的 WAV/MP3 音频。模型可以用文本和音频回复。

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openai/gpt-audio",
    "modalities": ["text", "audio"],
    "audio": { "voice": "alloy", "format": "wav" },
    "messages": [
      {
        "role": "user",
        "content": [
          { "type": "text", "text": "What does this audio say?" },
          { "type": "input_audio", "input_audio": { "data": "<BASE64_AUDIO>", "format": "wav" } }
        ]
      }
    ]
  }'

openai 其他模型

同类模型

跨供应商的相似能力档位

动态与变更

2026-01-20

OpenAI 发布 gpt-audio——首个面向 Chat Completions 的通用音频模型

OpenAI 发布了 gpt-audio 作为其首个通用音频模型,将原生音频输入/输出引入 Chat Completions REST API。该模型搭载升级的解码器,声音更自然、一致性更好,支持在单个 API 调用中同时处理文本和音频模态。定价为每百万输入 token(文本)$2.50、每百万(音频输入)$40。

TheRouter 编辑重写OpenRouter ↗

常见问题

gpt-audio 和 gpt-4o-audio-preview 有什么区别?

gpt-audio 是 gpt-4o-audio-preview 的正式发布版(GA)。它采用了升级的解码器,声音更自然、一致性更好。同时在 Azure 上可用,生态系统支持更广。与预览版不同,gpt-audio 是面向商业部署的生产级模型。

TheRouter 编辑重写openrouter.ai ↗
我能在 TheRouter API 中使用 gpt-audio 吗?

可以。gpt-audio 已在 TheRouter 上完整列出,可通过 api.therouter.ai/v1/chat/completions 标准 Chat Completions 端点调用。使用模型ID "openai/gpt-audio"。音频输入通过 input_audio 内容部分格式(base64 编码的 WAV/MP3 数据)支持。设置 modalities 和 audio 参数以请求音频输出。

TheRouter 编辑重写api.therouter.ai ↗
gpt-audio 支持什么音频格式输入和输出?

输入方面,gpt-audio 接受 base64 编码的 WAV 或 MP3 格式音频。格式在 input_audio 内容部分中指定。输出方面,可以通过设置请求体中的 audio.format 请求 WAV 格式音频。支持的语音包括 alloy、echo、fable、nova 和 shimmer。

TheRouter 编辑重写developers.openai.com ↗
gpt-audio 在 TheRouter 上的定价如何?

TheRouter 以 OpenAI 直接价格转售,不加价。文本输入:$2.50/百万 token。文本输出:$10/百万 token。音频输入:$40/百万 token。音频输出:$80/百万 token。重复提示可享受缓存折扣。

TheRouter 编辑重写api.therouter.ai ↗
事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
发布日期OpenRouter ↗2026-05-29已核实
上下文窗口OpenRouter ↗2026-05-29待核实
最大输出长度OpenRouter ↗2026-05-29待核实
支持的模态developers.openai.com ↗2026-05-29已核实
许可——已核实
Audio quality & voice naturalnessOpenRouter ↗2026-05-29待核实
OpenAI 发布 gpt-audio——首个面向 Chat Completions 的通用音频模型OpenRouter ↗2026-05-29已核实
gpt-audio 和 gpt-4o-audio-preview 有什么区别?openrouter.ai ↗2026-05-29待核实
我能在 TheRouter API 中使用 gpt-audio 吗?api.therouter.ai ↗2026-05-29待核实
gpt-audio 支持什么音频格式输入和输出?developers.openai.com ↗2026-05-29待核实
gpt-audio 在 TheRouter 上的定价如何?api.therouter.ai ↗2026-05-29待核实
帮助与联系