OpenAI 发布 gpt-audio——首个面向 Chat Completions 的通用音频模型
OpenAI 发布了 gpt-audio 作为其首个通用音频模型,将原生音频输入/输出引入 Chat Completions REST API。该模型搭载升级的解码器,声音更自然、一致性更好,支持在单个 API 调用中同时处理文本和音频模态。定价为每百万输入 token(文本)$2.50、每百万(音频输入)$40。
Audio inputs and outputs with the Chat Completions API.
GPT Audio(gpt-audio)是 OpenAI 第一个面向 Chat Completions API 的通用音频模型。于 2026 年 1 月发布,它将原生音频输入和输出引入熟悉的文本对话补全接口,开发者无需切换到单独的 Realtime API 或拼装转录 + TTS 管线即可构建语音应用。
与使用 WebRTC 以低延迟实现语音对语音的 Realtime 系列(gpt-realtime-*)不同,gpt-audio 使用标准 HTTP 的 Chat Completions REST API。开发者将 base64 编码的音频放入消息内容中发送,并接收音频回复——从而可以直接集成到现有基于聊天的后端中。与之前的 gpt-4o-audio-preview 相比,该模型升级了解码器,声音更加自然,语音一致性也更好。
| 类型 | 费率 |
|---|---|
| 输入 | $2.70 每百万 Tokens |
| 输出 | $10.80 每百万 Tokens |
| Audio input | $34.56 每百万 Tokens |
| Audio output | $69.12 每百万 Tokens |
| 发布日期 | 2026 年 1 月(正式发布)OpenRouter ↗ | 已核实 |
| 上下文窗口 | 128,000 tokensOpenRouter ↗ | 待核实 |
| 最大输出长度 | 16,384 tokensOpenRouter ↗ | 待核实 |
| 支持的模态 | 输入:文本、音频;输出:文本、音频developers.openai.com ↗ | 已核实 |
| 许可 | 专有许可(OpenAI API 服务条款) | 已核实 |
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
Audio quality & voice naturalness OpenAI 表示 gpt-audio 使用了升级的解码器,比预览版 gpt-4o-audio-preview 声音更自然、一致性更好。未公布基准测试分数。 | Upgraded decoder — more natural voices vs gpt-4o-audio-preview | OpenRouter ↗ |
所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。
curl https://api.therouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -d '{
"model": "openai/gpt-audio",
"messages": [
{"role": "user", "content": "Summarize the key points from this input."}
]
}'在消息内容中发送 base64 编码的 WAV/MP3 音频。模型可以用文本和音频回复。
curl https://api.therouter.ai/v1/chat/completions \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "openai/gpt-audio",
"modalities": ["text", "audio"],
"audio": { "voice": "alloy", "format": "wav" },
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "What does this audio say?" },
{ "type": "input_audio", "input_audio": { "data": "<BASE64_AUDIO>", "format": "wav" } }
]
}
]
}'OpenAI 发布了 gpt-audio 作为其首个通用音频模型,将原生音频输入/输出引入 Chat Completions REST API。该模型搭载升级的解码器,声音更自然、一致性更好,支持在单个 API 调用中同时处理文本和音频模态。定价为每百万输入 token(文本)$2.50、每百万(音频输入)$40。
gpt-audio 是 gpt-4o-audio-preview 的正式发布版(GA)。它采用了升级的解码器,声音更自然、一致性更好。同时在 Azure 上可用,生态系统支持更广。与预览版不同,gpt-audio 是面向商业部署的生产级模型。
可以。gpt-audio 已在 TheRouter 上完整列出,可通过 api.therouter.ai/v1/chat/completions 标准 Chat Completions 端点调用。使用模型ID "openai/gpt-audio"。音频输入通过 input_audio 内容部分格式(base64 编码的 WAV/MP3 数据)支持。设置 modalities 和 audio 参数以请求音频输出。
输入方面,gpt-audio 接受 base64 编码的 WAV 或 MP3 格式音频。格式在 input_audio 内容部分中指定。输出方面,可以通过设置请求体中的 audio.format 请求 WAV 格式音频。支持的语音包括 alloy、echo、fable、nova 和 shimmer。
TheRouter 以 OpenAI 直接价格转售,不加价。文本输入:$2.50/百万 token。文本输出:$10/百万 token。音频输入:$40/百万 token。音频输出:$80/百万 token。重复提示可享受缓存折扣。
| 来源 | URL | 采集于 | |
|---|---|---|---|
| 发布日期 | OpenRouter ↗ | 2026-05-29 | 已核实 |
| 上下文窗口 | OpenRouter ↗ | 2026-05-29 | 待核实 |
| 最大输出长度 | OpenRouter ↗ | 2026-05-29 | 待核实 |
| 支持的模态 | developers.openai.com ↗ | 2026-05-29 | 已核实 |
| 许可 | — | — | 已核实 |
| Audio quality & voice naturalness | OpenRouter ↗ | 2026-05-29 | 待核实 |
| OpenAI 发布 gpt-audio——首个面向 Chat Completions 的通用音频模型 | OpenRouter ↗ | 2026-05-29 | 已核实 |
| gpt-audio 和 gpt-4o-audio-preview 有什么区别? | openrouter.ai ↗ | 2026-05-29 | 待核实 |
| 我能在 TheRouter API 中使用 gpt-audio 吗? | api.therouter.ai ↗ | 2026-05-29 | 待核实 |
| gpt-audio 支持什么音频格式输入和输出? | developers.openai.com ↗ | 2026-05-29 | 待核实 |
| gpt-audio 在 TheRouter 上的定价如何? | api.therouter.ai ↗ | 2026-05-29 | 待核实 |