OpenAI 发布 gpt-4o-mini-tts,支持语音 Agent 指令跟随
OpenAI 发布 gpt-4o-mini-tts 及新语音转文字模型,将其定位为新语音 Agent 项目的推荐模型。与 TTS-1 HD 不同,它接受自由文本 instructions 字段以控制口音、语调、情感和说话风格。TTS-1 HD 继续受支持,在不需要指令跟随的情况下依然是质量优先预渲染音频的首选。
Text-to-speech model optimized for quality.
TTS-1 HD 是 OpenAI 的高保真文字转语音模型,于 2023 年 11 月 6 日在 OpenAI DevDay 上与 TTS-1 同步发布。它将文本转化为自然语音,专为音质而非延迟优化。定价为每百万字符 $30.00——是 TTS-1($15.00/百万字符)的两倍——是音频保真度为首要考量时的首选:有声书、播客、电子学习配音和广播媒体。它与 TTS-1 共享相同的语音集(alloy、ash、coral、echo、fable、onyx、nova、shimmer)和输出格式(MP3、Opus、AAC、FLAC、WAV、PCM),仅在质量与延迟的权衡上有所不同。
截至 2025-2026 年,OpenAI 为新语音 Agent 项目推荐 gpt-4o-mini-tts,因为它新增了指令跟随功能(通过自由文本 instructions 参数控制语调、口音和说话风格)。TTS-1 HD 依然完整支持,适合生成预渲染音频资产的生产管线——即请求不在交互关键路径上、可以接受每次合成多几百毫秒延迟以换取明显更清晰输出的场景。可通过 TheRouter 的 OpenAI 兼容端点(/v1/audio/speech)调用,无需修改客户端。
| 类型 | 费率 |
|---|---|
| 文本 | $32.40 每百万字符 |
request is price per 1M characters
| 发布日期 | 2023-11-06(OpenAI DevDay)openai.com ↗ | 已核实 |
| 定价 | 每百万字符 $30.00openai.com/api/pricing ↗ | 已核实 |
| 最大输入长度 | 每次请求最多 4 096 个字符platform.openai.com ↗ | 已核实 |
| 支持的语音 | alloy、ash、coral、echo、fable、onyx、nova、shimmer(9 种语音)platform.openai.com ↗ | 已核实 |
| 输出格式 | MP3(默认)、Opus、AAC、FLAC、WAV、PCMplatform.openai.com ↗ | 已核实 |
| 语速控制 | 0.25–4.0×(默认 1.0×)platform.openai.com ↗ | 已核实 |
| 相对 TTS-1 的延迟 | 比 TTS-1 延迟更高——为质量而非速度优化platform.openai.com ↗ | 已核实 |
| 指令跟随(语音风格控制) | 不支持——如需提示词控制语音风格,请使用 gpt-4o-mini-ttsplatform.openai.com ↗ | 已核实 |
| 速率限制(Tier 1) | 500 RPMplatform.openai.com ↗ | 已核实 |
| 训练数据截止 | 未公开披露 | 未知 |
| 许可 | 专有(OpenAI API 服务条款)openai.com/policies ↗ | 已核实 |
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
Relative audio quality vs TTS-1 OpenAI 将 TTS-1 HD 描述为以更高延迟换取比 TTS-1 更高的音频质量。未公开数字化的 MOS 或 CMOS 指标。 | Higher quality than TTS-1qualitative | platform.openai.com ↗ |
所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。
curl https://api.therouter.ai/v1/audio/speech -H "Content-Type: application/json" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -d '{
"model": "openai/tts-1-hd",
"input": "Welcome to TheRouter.",
"voice": "alloy"
}'curl https://api.therouter.ai/v1/audio/speech \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "openai/tts-1-hd",
"input": "The quick brown fox jumped over the lazy dog.",
"voice": "nova"
}' \
--output speech-hd.mp3OpenAI 发布 gpt-4o-mini-tts 及新语音转文字模型,将其定位为新语音 Agent 项目的推荐模型。与 TTS-1 HD 不同,它接受自由文本 instructions 字段以控制口音、语调、情感和说话风格。TTS-1 HD 继续受支持,在不需要指令跟随的情况下依然是质量优先预渲染音频的首选。
微软宣布 Azure OpenAI Service 和 Azure AI Speech 同时支持 TTS-1 和 TTS-1 HD,为企业级、符合数据驻留要求的用户提供 OpenAI 最高保真 TTS 服务。这使 TTS-1 HD 对需要数据保留在 Azure 地理边界内的受监管行业(医疗、金融、政府)可用。
OpenAI 在 DevDay 2023 上发布了首批生产级文字转语音模型:TTS-1 用于低延迟流式传输,TTS-1 HD 用于高保真输出。两款模型均支持 6 种初始语音(alloy、echo、fable、onyx、nova、shimmer)、多种输出格式以及 OpenAI Audio API(/v1/audio/speech),使任何应用都可以通过单次 API 调用添加自然语音生成能力。
TTS-1 HD 针对音频质量优化,更适合需要仔细聆听的内容——播客、有声书、企业配音。TTS-1 针对低延迟优化,更适合实时或流式应用。TTS-1 HD 定价 $30/百万字符;TTS-1 定价 $15/百万字符。两者支持相同的语音、输出格式和语速控制。
任何新的语音 Agent 或对话应用都应使用 gpt-4o-mini-tts——它新增了指令跟随功能(通过 instructions 控制语调、口音和个性),是 OpenAI 的推荐路径。当你需要为预渲染、非交互内容提供最高音频质量且不需要风格控制时,使用 TTS-1 HD——有声书、播客片段或在线离线合成的企业电子学习内容。
将客户端的 baseURL 指向 https://api.therouter.ai/v1,使用 TheRouter API key,并将 model 设置为 openai/tts-1-hd。其他所有参数(voice、speed、response_format、input)与 OpenAI SDK 完全相同。TheRouter 透明地处理路由、计费和速率限制聚合。
MP3 是默认格式,适用于大多数网页和移动端交付。对于将在 DAW 中后期处理或进一步编辑的内容,使用 FLAC(无损)或 WAV。Opus 在等效质量下文件体积比 MP3 更小,适合带宽受限的交付场景。PCM 最适合直接的音频管线集成(如电话或实时混音)。
| 来源 | URL | 采集于 | |
|---|---|---|---|
| 发布日期 | openai.com ↗ | 2026-06-09 | 已核实 |
| 定价 | openai.com/api/pricing ↗ | 2026-06-09 | 已核实 |
| 最大输入长度 | platform.openai.com ↗ | 2026-06-09 | 已核实 |
| 支持的语音 | platform.openai.com ↗ | 2026-06-09 | 已核实 |
| 输出格式 | platform.openai.com ↗ | 2026-06-09 | 已核实 |
| 语速控制 | platform.openai.com ↗ | 2026-06-09 | 已核实 |
| 相对 TTS-1 的延迟 | platform.openai.com ↗ | 2026-06-09 | 已核实 |
| 指令跟随(语音风格控制) | platform.openai.com ↗ | 2026-06-09 | 已核实 |
| 速率限制(Tier 1) | platform.openai.com ↗ | 2026-06-09 | 已核实 |
| 训练数据截止 | — | — | 未知 |
| 许可 | openai.com/policies ↗ | 2026-06-09 | 已核实 |
| Relative audio quality vs TTS-1 | platform.openai.com ↗ | 2026-06-09 | 已核实 |
| OpenAI 发布 gpt-4o-mini-tts,支持语音 Agent 指令跟随 | openai.com ↗ | 2026-06-09 | 已核实 |
| OpenAI TTS 语音登陆 Azure OpenAI 服务 | techcommunity.microsoft.com ↗ | 2026-06-09 | 已核实 |
| OpenAI DevDay:TTS-1 和 TTS-1 HD 正式发布 | openai.com ↗ | 2026-06-09 | 已核实 |
| TTS-1 HD 和 TTS-1 有什么区别? | platform.openai.com ↗ | 2026-06-09 | 待核实 |
| 新项目应该选 TTS-1 HD 还是 gpt-4o-mini-tts? | platform.openai.com ↗ | 2026-06-09 | 待核实 |
| 如何通过 TheRouter 使用 TTS-1 HD? | platform.openai.com ↗ | 2026-06-09 | 待核实 |
| 使用 TTS-1 HD 时应该选哪种输出格式? | platform.openai.com ↗ | 2026-06-09 | 待核实 |