OpenAI 发布 gpt-4o-mini-tts 及新一代语音转文本模型
OpenAI 发布了 gpt-4o-mini-tts,一款高性价比的可引导文本转语音模型($0.015/分钟),同时发布了新的 gpt-4o-transcribe 和 gpt-4o-mini-transcribe 语音转文本模型。该模型引入了用于语气、速度和情感控制的自然语言指令功能——这是 OpenAI TTS 的首次。
Text-to-speech model powered by GPT-4o mini.
GPT-4o Mini TTS 是 OpenAI 的高性价比文本转语音模型,于 2025 年 3 月 20 日作为新一代音频模型套件的一部分发布(同期还有 gpt-4o-transcribe 和 gpt-4o-mini-transcribe)。它基于 GPT-4o 多模态基础架构,将文本输入转换为自然语音,生成成本约为每分钟 $0.015——使其成为市面上最具性价比的高质量 TTS 选项之一。该模型支持 11 种内置语音(Alloy、Ash、Ballad、Coral、Echo、Fable、Nova、Onyx、Sage、Shimmer、Verse),涵盖从深沉的权威播报到明亮有活力的营销语气,后续更新中又新增了 Marin 和 Cedar 两种语音。
GPT-4o Mini TTS 的核⼼特性是其可引导性:通过独特的 instructions 参数,开发者不仅控制模型说什么,还能控制如何说——使用自然语言提示指定情感(兴奋、平静、紧急)、语速(更快、更慢)、口音或角色方向。这使其显著区别于传统 TTS 系统(tts-1、tts-1-hd、ElevenLabs),后者的语音特征更为固定。该模型支持 50+ 种语言、同步和流式模式,并通过 /v1/audio/speech 端点与 OpenAI SDK 无缝集成——完全可通过 TheRouter 的统一 API api.therouter.ai/v1 访问。
instructions 参数以同理心、紧迫感或专业口吻说话。| 类型 | 费率 |
|---|---|
| 文本 | $16.20 每百万字符 |
| 输入 | $0.648 每百万 Tokens |
| 输出 | $12.96 每百万 Tokens |
Billing unit differs from the vendor's: OpenAI prices gpt-4o-mini-tts per token (text input $0.60/MTok, audio output $12.00/MTok), while this model is charged per 1M characters — the unit it is settled in here. Only tts-1 and tts-1-hd are genuinely per-character at the vendor.
| 发布日期 | 2025年3月20日openai.com ↗ | 已核实 |
| 基础架构 | GPT-4o mini 多模态基础架构,针对音频生成微调openai.com ↗ | 已核实 |
| API 端点 | /v1/audio/speechdevelopers.openai.com ↗ | 已核实 |
| 预设语音 | 11种核心(Alloy, Ash, Ballad, Coral, Echo, Fable, Nova, Onyx, Sage, Shimmer, Verse)+ 后续新增(Marin, Cedar)docs.aimlapi.com ↗ | 已核实 |
| 支持语言 | 50+ 种语言tokenmix.ai ↗ | 已核实 |
| 上下文窗口 | 约 2,000 输入 tokentokenmix.ai ↗ | 待核实 |
| 输出格式 | MP3, Opus, AAC, FLAC, WAV, PCMdevelopers.openai.com ↗ | 已核实 |
| 可引导性 | 支持 —— instructions 参数通过自然语言提示控制情感、语速、口音和角色方向simonwillison.net ↗ | 已核实 |
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
Steerability benchmark (Simon Willison) | Confirmed — instructions parameter works as designed; occasional instruction-leak edge cases reported | simonwillison.net ↗ | |
Standard TTS benchmarks OpenAI 没有发布 gpt-4o-mini-tts 的 MOS(平均意见分)或 WER 指标。公告重点在于可引导性和成本,而非定量的语音质量基准。 | — | 未公开披露 | — |
所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。
curl https://api.therouter.ai/v1/audio/speech -H "Content-Type: application/json" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -d '{
"model": "openai/gpt-4o-mini-tts",
"input": "Welcome to TheRouter.",
"voice": "alloy"
}'GPT-4o Mini TTS 使用标准的 OpenAI speech 端点。通过 TheRouter 的统一 API 调用——该模型支持同步和流式模式,并支持通过指令控制语气。
curl https://api.therouter.ai/v1/audio/speech \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "openai/gpt-4o-mini-tts",
"input": "Welcome to TheRouter — your unified API for all AI models.",
"voice": "nova",
"instructions": "Speak warmly and professionally, like a friendly customer service agent.",
"response_format": "mp3"
}' \
--output speech.mp3OpenAI 发布了 gpt-4o-mini-tts,一款高性价比的可引导文本转语音模型($0.015/分钟),同时发布了新的 gpt-4o-transcribe 和 gpt-4o-mini-transcribe 语音转文本模型。该模型引入了用于语气、速度和情感控制的自然语言指令功能——这是 OpenAI TTS 的首次。
该模型附带 11 种核心预设语音:Alloy、Ash、Ballad、Coral、Echo、Fable、Nova、Onyx、Sage、Shimmer 和 Verse。后续更新中又加入了 Marin 和 Cedar 语音。所有语音均为预设合成音——该模型不支持自定义语音创建或语音克隆。您可以在 openai.fm 上预览所有语音。
instructions 参数接受自然语言引导,影响情感(兴奋、平静、紧急)、语速(更快、更慢)、发音强调、口音和角色方向。例如:'以紧急和严肃新闻主播的语气说话。'模型会将这些指令与基础语音特征融合。注意:由于指令和文本共享同一输入通道,存在输入文本部分被误解释为指令的非零风险——这是基于 LLM 的 TTS 的一个已知限制。
该模型支持 50+ 种语言,覆盖大多数全球主要语言。语音特征跨语言保留——同一语音可以用多种语言以一致的风格说话。为获得非英语语言的最佳效果,OpenAI 建议选择与目标语言音调匹配的语音。
定价基于 Token:输入(文本)$0.60/百万 Token,输出(音频)$12/百万 Token。按典型语速(约每分钟 1,500 音频 Token),相当于每分钟约 $0.015。通过 TheRouter,定价结构与 OpenAI 直连定价一致,每请求费 $0.015,输入 $0.60/百万 Token,音频输出 $12/百万 Token,零加价。
可以——gpt-4o-mini-tts 在 TheRouter 上完全可用,访问地址为 api.therouter.ai/v1。使用标准 OpenAI SDK,设置 baseURL=https://api.therouter.ai/v1,model=openai/gpt-4o-mini-tts。所有 OpenAI TTS 功能均受支持:instructions 参数、流式、所有语音和响应格式。无需额外配置——只需更换 base URL 和模型名称。
| 来源 | URL | 采集于 | |
|---|---|---|---|
| 发布日期 | openai.com ↗ | 2026-05-28 | 已核实 |
| 基础架构 | openai.com ↗ | 2026-05-28 | 已核实 |
| API 端点 | developers.openai.com ↗ | 2026-05-28 | 已核实 |
| 预设语音 | docs.aimlapi.com ↗ | 2026-05-28 | 已核实 |
| 支持语言 | tokenmix.ai ↗ | 2026-05-28 | 已核实 |
| 上下文窗口 | tokenmix.ai ↗ | 2026-05-28 | 待核实 |
| 输出格式 | developers.openai.com ↗ | 2026-05-28 | 已核实 |
| 可引导性 | simonwillison.net ↗ | 2026-05-28 | 已核实 |
| Steerability benchmark (Simon Willison) | simonwillison.net ↗ | 2026-05-28 | 已核实 |
| Standard TTS benchmarks | openai.com ↗ | 2026-05-28 | 未知 |
| OpenAI 发布 gpt-4o-mini-tts 及新一代语音转文本模型 | openai.com ↗ | 2026-05-28 | 已核实 |
| gpt-4o-mini-tts 有哪些可用语音? | docs.aimlapi.com ↗ | 2026-05-28 | 待核实 |
| instructions 参数如何工作? | simonwillison.net ↗ | 2026-05-28 | 待核实 |
| gpt-4o-mini-tts 支持哪些语言? | tokenmix.ai ↗ | 2026-05-28 | 待核实 |
| 定价机制是怎样的?按 Token 计费还是按分钟? | tokenmix.ai ↗ | 2026-05-28 | 待核实 |
| 可以通过 TheRouter 使用 gpt-4o-mini-tts 吗? | api.therouter.ai ↗ | 2026-05-28 | 待核实 |