返回模型列表

GPT-4o Mini TTS

openaiopenai/gpt-4o-mini-tts

Text-to-speech model powered by GPT-4o mini.

GPT-4o Mini TTS 是 OpenAI 的高性价比文本转语音模型,于 2025 年 3 月 20 日作为新一代音频模型套件的一部分发布(同期还有 gpt-4o-transcribe 和 gpt-4o-mini-transcribe)。它基于 GPT-4o 多模态基础架构,将文本输入转换为自然语音,生成成本约为每分钟 $0.015——使其成为市面上最具性价比的高质量 TTS 选项之一。该模型支持 11 种内置语音(Alloy、Ash、Ballad、Coral、Echo、Fable、Nova、Onyx、Sage、Shimmer、Verse),涵盖从深沉的权威播报到明亮有活力的营销语气,后续更新中又新增了 Marin 和 Cedar 两种语音。

GPT-4o Mini TTS 的核⼼特性是其可引导性:通过独特的 instructions 参数,开发者不仅控制模型说什么,还能控制如何说——使用自然语言提示指定情感(兴奋、平静、紧急)、语速(更快、更慢)、口音或角色方向。这使其显著区别于传统 TTS 系统(tts-1、tts-1-hd、ElevenLabs),后者的语音特征更为固定。该模型支持 50+ 种语言、同步和流式模式,并通过 /v1/audio/speech 端点与 OpenAI SDK 无缝集成——完全可通过 TheRouter 的统一 API api.therouter.ai/v1 访问。

适合使用
  • • 预算敏感的语音应用——播客旁白、有声书、IVR 系统和语音邮件,成本约 $0.015/分钟,质量媲美更昂贵的 TTS 供应商。
  • • 需要语气控制的语音代理——客服机器人可根据上下文通过 instructions 参数以同理心、紧迫感或专业口吻说话。
  • • 多语言内容生成——支持 50+ 种语言,适用于从在线教育到视频配音的全球语音应用。
  • • 原型设计和快速迭代——最便宜的 OpenAI TTS 用于尝试,由 openai.fm 交互式游乐场支持,可即时预览语音并生成代码。
不适合使用
  • • 需要完美脚本还原的场景——与所有基于 LLM 的 TTS 一样,可引导性特性意味着文本内容有可能被误解释为指令(例如括号中的舞台指示被执行而不是被朗读)。对于需要逐字再现的应用,传统 TTS 模型(tts-1、tts-1-hd)或专用语音合成可能更安全。
  • • 语音克隆或自定义语音创建——GPT-4o Mini TTS 仅限于预设合成语音。对于基于参考音频的零样本文本克隆,建议使用 Mistral Voxtral TTS 或 Fish Speech 1.5。对于精细的语音定制,ElevenLabs 提供更广泛的语音设计工具。
  • • 需要 <500ms 往返延迟的实时语音到语音对话式 AI——对于完全交互式的语音对话,具备原生语音输入/语音输出的 OpenAI Realtime API(gpt-4o-realtime-preview)比文本到语音管线更合适。
上下文长度
--
最大输出
--
文本价格按字符
$16.20每百万字符
输入价格按字符
$0.648每百万 Tokens

模态能力

文本→音频

能力

语音合成

媒体生成能力

tts
output_formats
  • mp3
  • opus
  • aac
  • flac
voices
  • alloy
  • ash
  • ballad
  • coral
  • echo
  • fable
  • onyx
  • nova
  • sage
  • shimmer
  • verse
defaults
voice
alloy

价格明细

类型费率
文本$16.20 每百万字符
输入$0.648 每百万 Tokens
输出$12.96 每百万 Tokens

Billing unit differs from the vendor's: OpenAI prices gpt-4o-mini-tts per token (text input $0.60/MTok, audio output $12.00/MTok), while this model is charged per 1M characters — the unit it is settled in here. Only tts-1 and tts-1-hd are genuinely per-character at the vendor.

支持参数

inputvoiceresponse_formatinstructions

模型规格

发布日期2025年3月20日openai.com ↗已核实
基础架构GPT-4o mini 多模态基础架构,针对音频生成微调openai.com ↗已核实
API 端点/v1/audio/speechdevelopers.openai.com ↗已核实
预设语音11种核心(Alloy, Ash, Ballad, Coral, Echo, Fable, Nova, Onyx, Sage, Shimmer, Verse)+ 后续新增(Marin, Cedar)docs.aimlapi.com ↗已核实
支持语言50+ 种语言tokenmix.ai ↗已核实
上下文窗口约 2,000 输入 tokentokenmix.ai ↗待核实
输出格式MP3, Opus, AAC, FLAC, WAV, PCMdevelopers.openai.com ↗已核实
可引导性支持 —— instructions 参数通过自然语言提示控制情感、语速、口音和角色方向simonwillison.net ↗已核实

基准成绩

BenchmarkDistributionScoreSource
Steerability benchmark (Simon Willison)
Confirmed — instructions parameter works as designed; occasional instruction-leak edge cases reportedsimonwillison.net ↗
Standard TTS benchmarks
OpenAI 没有发布 gpt-4o-mini-tts 的 MOS(平均意见分)或 WER 指标。公告重点在于可引导性和成本,而非定量的语音质量基准。
—未公开披露—

API 使用示例

所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。

cURL
curl https://api.therouter.ai/v1/audio/speech   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "openai/gpt-4o-mini-tts",
    "input": "Welcome to TheRouter.",
    "voice": "alloy"
  }'

API 使用指南

完整 API 参考 →

文本转语音(流式)

GPT-4o Mini TTS 使用标准的 OpenAI speech 端点。通过 TheRouter 的统一 API 调用——该模型支持同步和流式模式,并支持通过指令控制语气。

cURL
curl https://api.therouter.ai/v1/audio/speech \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openai/gpt-4o-mini-tts",
    "input": "Welcome to TheRouter — your unified API for all AI models.",
    "voice": "nova",
    "instructions": "Speak warmly and professionally, like a friendly customer service agent.",
    "response_format": "mp3"
  }' \
  --output speech.mp3

openai 其他模型

同类模型

跨供应商的相似能力档位

动态与变更

2025-03-20

OpenAI 发布 gpt-4o-mini-tts 及新一代语音转文本模型

OpenAI 发布了 gpt-4o-mini-tts,一款高性价比的可引导文本转语音模型($0.015/分钟),同时发布了新的 gpt-4o-transcribe 和 gpt-4o-mini-transcribe 语音转文本模型。该模型引入了用于语气、速度和情感控制的自然语言指令功能——这是 OpenAI TTS 的首次。

TheRouter 编辑重写openai.com ↗

常见问题

gpt-4o-mini-tts 有哪些可用语音?

该模型附带 11 种核心预设语音:Alloy、Ash、Ballad、Coral、Echo、Fable、Nova、Onyx、Sage、Shimmer 和 Verse。后续更新中又加入了 Marin 和 Cedar 语音。所有语音均为预设合成音——该模型不支持自定义语音创建或语音克隆。您可以在 openai.fm 上预览所有语音。

instructions 参数如何工作?

instructions 参数接受自然语言引导,影响情感(兴奋、平静、紧急)、语速(更快、更慢)、发音强调、口音和角色方向。例如:'以紧急和严肃新闻主播的语气说话。'模型会将这些指令与基础语音特征融合。注意:由于指令和文本共享同一输入通道,存在输入文本部分被误解释为指令的非零风险——这是基于 LLM 的 TTS 的一个已知限制。

gpt-4o-mini-tts 支持哪些语言?

该模型支持 50+ 种语言,覆盖大多数全球主要语言。语音特征跨语言保留——同一语音可以用多种语言以一致的风格说话。为获得非英语语言的最佳效果,OpenAI 建议选择与目标语言音调匹配的语音。

定价机制是怎样的?按 Token 计费还是按分钟?

定价基于 Token:输入(文本)$0.60/百万 Token,输出(音频)$12/百万 Token。按典型语速(约每分钟 1,500 音频 Token),相当于每分钟约 $0.015。通过 TheRouter,定价结构与 OpenAI 直连定价一致,每请求费 $0.015,输入 $0.60/百万 Token,音频输出 $12/百万 Token,零加价。

可以通过 TheRouter 使用 gpt-4o-mini-tts 吗?

可以——gpt-4o-mini-tts 在 TheRouter 上完全可用,访问地址为 api.therouter.ai/v1。使用标准 OpenAI SDK,设置 baseURL=https://api.therouter.ai/v1,model=openai/gpt-4o-mini-tts。所有 OpenAI TTS 功能均受支持:instructions 参数、流式、所有语音和响应格式。无需额外配置——只需更换 base URL 和模型名称。

事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
发布日期openai.com ↗2026-05-28已核实
基础架构openai.com ↗2026-05-28已核实
API 端点developers.openai.com ↗2026-05-28已核实
预设语音docs.aimlapi.com ↗2026-05-28已核实
支持语言tokenmix.ai ↗2026-05-28已核实
上下文窗口tokenmix.ai ↗2026-05-28待核实
输出格式developers.openai.com ↗2026-05-28已核实
可引导性simonwillison.net ↗2026-05-28已核实
Steerability benchmark (Simon Willison)simonwillison.net ↗2026-05-28已核实
Standard TTS benchmarksopenai.com ↗2026-05-28未知
OpenAI 发布 gpt-4o-mini-tts 及新一代语音转文本模型openai.com ↗2026-05-28已核实
gpt-4o-mini-tts 有哪些可用语音?docs.aimlapi.com ↗2026-05-28待核实
instructions 参数如何工作?simonwillison.net ↗2026-05-28待核实
gpt-4o-mini-tts 支持哪些语言?tokenmix.ai ↗2026-05-28待核实
定价机制是怎样的?按 Token 计费还是按分钟?tokenmix.ai ↗2026-05-28待核实
可以通过 TheRouter 使用 gpt-4o-mini-tts 吗?api.therouter.ai ↗2026-05-28待核实
帮助与联系