OpenAI 发布 gpt-audio 和 gpt-audio-mini
OpenAI 发布了两款支持音频的 Chat Completions 模型:gpt-audio(完整版)和 gpt-audio-mini(经济版)。两者都采用了升级解码器,相比之前的 gpt-4o-audio-preview 声音更自然。mini 版本每 token 定价低约 75%,面向高流量语音应用。
Cost-efficient version of GPT Audio.
GPT Audio Mini(gpt-audio-mini)是 OpenAI 面向 Chat Completions API 的经济型音频模型,于 2026 年 1 月与完整版 gpt-audio 一同发布。它拥有与大型版本相同的升级解码器、多轮音频对话以及 base64 编码的音频输入/输出能力,但每 token 成本降低约 75%,是高流量语音应用中关注单次调用成本的实用选择。
与 gpt-audio 一样,gpt-audio-mini 支持在单个 HTTP Chat Completions 调用中混合文本和音频模态。开发者可以发送音频(通过 base64 编码的 WAV/MP3)与文本,并在响应中接收一种或两种模态。mini 版本共享相同的 128K 上下文窗口、工具/函数调用支持和流式能力——区别纯粹体现在模型规模上,反映在输出质量较低但成本大幅降低。
| 类型 | 费率 |
|---|---|
| 输入 | $0.648 每百万 Tokens |
| 输出 | $2.59 每百万 Tokens |
| Audio input | $10.80 每百万 Tokens |
| Audio output | $21.60 每百万 Tokens |
| 发布日期 | 2026 年 1 月 19 日Design for Online / OpenRouter ↗ | 已核实 |
| 上下文窗口 | 128,000 tokensOpenRouter ↗ | 已核实 |
| 最大输出长度 | 16,384 tokensOpenRouter ↗ | 已核实 |
| 支持的模态 | 输入:文本、音频;输出:文本、音频developers.openai.com ↗ | 已核实 |
| 支持的能力 | 工具、函数调用、response_format、流式、音频platform.openai.com ↗ | 已核实 |
| 许可 | 专有许可(OpenAI API 服务条款) | 已核实 |
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
Audio quality (upgraded decoder) gpt-audio-mini 使用与 gpt-audio 相同的升级解码器,声音更自然、语音一致性更好,但压缩了模型规模以节省成本。mini 版本没有已发布的基准测试分数。 | Upgraded decoder — same gpt-audio base with reduced scale | Design for Online ↗ |
所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。
curl https://api.therouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -d '{
"model": "openai/gpt-audio-mini",
"messages": [
{"role": "user", "content": "Summarize the key points from this input."}
]
}'在消息内容中发送 base64 编码的 WAV/MP3 音频。模型用文本和/或音频回复——API 模式与 gpt-audio 相同,仅价格更低。
curl https://api.therouter.ai/v1/chat/completions \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "openai/gpt-audio-mini",
"modalities": ["text", "audio"],
"audio": { "voice": "alloy", "format": "wav" },
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "What does this audio say?" },
{ "type": "input_audio", "input_audio": { "data": "<BASE64_AUDIO>", "format": "wav" } }
]
}
]
}'OpenAI 发布了两款支持音频的 Chat Completions 模型:gpt-audio(完整版)和 gpt-audio-mini(经济版)。两者都采用了升级解码器,相比之前的 gpt-4o-audio-preview 声音更自然。mini 版本每 token 定价低约 75%,面向高流量语音应用。
gpt-audio-mini 是 gpt-audio 的更小、更具成本效益的变体。两者共享相同的升级解码器、128K 上下文窗口、工具调用和音频输入/输出模态。mini 模型产生的音频输出质量较低,但每 token 成本约低 75%(输入文本 $0.15/M + 音频 $10/M,而 gpt-audio 为 $2.50/M + $100/M)。
不能。gpt-audio-mini 使用基于 HTTP 的 Chat Completions API,专为请求-响应模式设计。对于低于 500ms 的实时语音对话,请改用 gpt-realtime-mini(通过 OpenAI Realtime API / WebRTC)。
是的。gpt-audio-mini 完全支持工具和函数调用,包括在消息中附带音频和工具定义。你可以发送音频(例如包含预订参考号的录音)并通过函数调用指令模型提取结构化数据——使用方式与纯文本模型相同。
音频输入支持以 base64 编码在 input_audio 内容部分发送 WAV 和 MP3 格式。音频输出支持 WAV 格式,可通过 audio 参数配置语音选项(alloy、nova 等)。
| 来源 | URL | 采集于 | |
|---|---|---|---|
| 发布日期 | Design for Online / OpenRouter ↗ | 2026-05-29 | 已核实 |
| 上下文窗口 | OpenRouter ↗ | 2026-05-29 | 已核实 |
| 最大输出长度 | OpenRouter ↗ | 2026-05-29 | 已核实 |
| 支持的模态 | developers.openai.com ↗ | 2026-05-29 | 已核实 |
| 支持的能力 | platform.openai.com ↗ | 2026-05-29 | 已核实 |
| 许可 | — | — | 已核实 |
| Audio quality (upgraded decoder) | Design for Online ↗ | 2026-05-29 | 待核实 |
| OpenAI 发布 gpt-audio 和 gpt-audio-mini | Design for Online / OpenRouter ↗ | 2026-05-29 | 已核实 |