返回模型列表

gpt-audio-mini

openaiopenai/gpt-audio-mini

Cost-efficient version of GPT Audio.

GPT Audio Mini(gpt-audio-mini)是 OpenAI 面向 Chat Completions API 的经济型音频模型,于 2026 年 1 月与完整版 gpt-audio 一同发布。它拥有与大型版本相同的升级解码器、多轮音频对话以及 base64 编码的音频输入/输出能力,但每 token 成本降低约 75%,是高流量语音应用中关注单次调用成本的实用选择。

与 gpt-audio 一样,gpt-audio-mini 支持在单个 HTTP Chat Completions 调用中混合文本和音频模态。开发者可以发送音频(通过 base64 编码的 WAV/MP3)与文本,并在响应中接收一种或两种模态。mini 版本共享相同的 128K 上下文窗口、工具/函数调用支持和流式能力——区别纯粹体现在模型规模上,反映在输出质量较低但成本大幅降低。

适合使用
  • • 对成本敏感的语音聊天机器人部署,每次请求的音频预算至关重要
  • • 高容量音频内容分析流程(语音笔记摘要、通话记录处理)
  • • 简单的语音转文字 + 文字转语音应用,不需要超低延迟
  • • 在扩展到完整的 gpt-audio 或 gpt-audio-1.5 之前,用于原型设计和测试音频功能
不适合使用
  • • 低延迟实时语音到语音(500ms 以下)——通过 WebRTC/Realtime API 使用 gpt-realtime-mini
  • • 需要顶级音频质量或语音一致性的应用——使用 gpt-audio 或 gpt-audio-1.5
  • • 纯文本聊天——纯文本模型(gpt-5.5、gpt-5.4-mini)更便宜
  • • 专用转写流程——gpt-4o-mini-transcribe 是专为仅语音转文本设计的,更便宜
上下文长度
--
最大输出
--
输入价格每百万 tokens
$0.648每百万 Tokens
输出价格每百万 tokens
$2.59每百万 Tokens

模态能力

文本音频→文本音频

价格明细

类型费率
输入$0.648 每百万 Tokens
输出$2.59 每百万 Tokens
Audio input$10.80 每百万 Tokens
Audio output$21.60 每百万 Tokens

支持参数

temperaturemax_tokenstop_ptoolstool_choiceresponse_formatmodalitiesaudio

模型规格

发布日期2026 年 1 月 19 日Design for Online / OpenRouter ↗已核实
上下文窗口128,000 tokensOpenRouter ↗已核实
最大输出长度16,384 tokensOpenRouter ↗已核实
支持的模态输入:文本、音频;输出:文本、音频developers.openai.com ↗已核实
支持的能力工具、函数调用、response_format、流式、音频platform.openai.com ↗已核实
许可专有许可(OpenAI API 服务条款)已核实

基准成绩

BenchmarkDistributionScoreSource
Audio quality (upgraded decoder)
gpt-audio-mini 使用与 gpt-audio 相同的升级解码器,声音更自然、语音一致性更好,但压缩了模型规模以节省成本。mini 版本没有已发布的基准测试分数。
Upgraded decoder — same gpt-audio base with reduced scaleDesign for Online ↗

API 使用示例

所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "openai/gpt-audio-mini",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

API 使用指南

完整 API 参考 →

音频 Chat 调用

在消息内容中发送 base64 编码的 WAV/MP3 音频。模型用文本和/或音频回复——API 模式与 gpt-audio 相同,仅价格更低。

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openai/gpt-audio-mini",
    "modalities": ["text", "audio"],
    "audio": { "voice": "alloy", "format": "wav" },
    "messages": [
      {
        "role": "user",
        "content": [
          { "type": "text", "text": "What does this audio say?" },
          { "type": "input_audio", "input_audio": { "data": "<BASE64_AUDIO>", "format": "wav" } }
        ]
      }
    ]
  }'

openai 其他模型

同类模型

跨供应商的相似能力档位

动态与变更

2026-01-19

OpenAI 发布 gpt-audio 和 gpt-audio-mini

OpenAI 发布了两款支持音频的 Chat Completions 模型:gpt-audio(完整版)和 gpt-audio-mini(经济版)。两者都采用了升级解码器,相比之前的 gpt-4o-audio-preview 声音更自然。mini 版本每 token 定价低约 75%,面向高流量语音应用。

常见问题

gpt-audio-mini 与 gpt-audio 有什么区别?

gpt-audio-mini 是 gpt-audio 的更小、更具成本效益的变体。两者共享相同的升级解码器、128K 上下文窗口、工具调用和音频输入/输出模态。mini 模型产生的音频输出质量较低,但每 token 成本约低 75%(输入文本 $0.15/M + 音频 $10/M,而 gpt-audio 为 $2.50/M + $100/M)。

TheRouter 编辑重写
我可以将 gpt-audio-mini 用于低延迟实时对话吗?

不能。gpt-audio-mini 使用基于 HTTP 的 Chat Completions API,专为请求-响应模式设计。对于低于 500ms 的实时语音对话,请改用 gpt-realtime-mini(通过 OpenAI Realtime API / WebRTC)。

TheRouter 编辑重写
gpt-audio-mini 支持带音频的工具/函数调用吗?

是的。gpt-audio-mini 完全支持工具和函数调用,包括在消息中附带音频和工具定义。你可以发送音频(例如包含预订参考号的录音)并通过函数调用指令模型提取结构化数据——使用方式与纯文本模型相同。

gpt-audio-mini 支持哪些音频格式?

音频输入支持以 base64 编码在 input_audio 内容部分发送 WAV 和 MP3 格式。音频输出支持 WAV 格式,可通过 audio 参数配置语音选项(alloy、nova 等)。

事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
发布日期Design for Online / OpenRouter ↗2026-05-29已核实
上下文窗口OpenRouter ↗2026-05-29已核实
最大输出长度OpenRouter ↗2026-05-29已核实
支持的模态developers.openai.com ↗2026-05-29已核实
支持的能力platform.openai.com ↗2026-05-29已核实
许可——已核实
Audio quality (upgraded decoder)Design for Online ↗2026-05-29待核实
OpenAI 发布 gpt-audio 和 gpt-audio-miniDesign for Online / OpenRouter ↗2026-05-29已核实
帮助与联系