OpenAI 发布 gpt-4o-mini-tts,支持语音 Agent 指令跟随
OpenAI 发布 gpt-4o-mini-tts 及新语音转文字模型,将其定位为语音 Agent 的推荐模型。与 TTS-1 不同,它接受自由文本的 instructions 字段以控制口音、语调、情感和说话风格。TTS-1 继续可用,现定位为低延迟、低成本的旧版选项。
Text-to-speech model optimized for speed.
TTS-1 是 OpenAI 于 2023 年 11 月 6 日在 OpenAI DevDay 上发布的首个生产级文字转语音模型。它将文本转化为自然语音,专为低延迟、实时应用场景优化。模型定价为每百万字符 $15.00——是其高保真版本 TTS-1 HD($30.00/百万字符)价格的一半——使其成为对成本敏感、流式场景的首选,在可接受稍低质量的前提下换取更快的首音频响应。支持 9 种内置语音(alloy、ash、coral、echo、fable、onyx、nova、shimmer),输出格式包括 MP3、Opus、AAC、FLAC、WAV 或 PCM。
截至 2025-2026 年,OpenAI 将 gpt-4o-mini-tts 定位为新语音 Agent 的推荐选项(支持指令控制,如"像一个善解人意的客服那样说话"),而 TTS-1 依然完整支持,适合已有存量业务、优先考虑延迟或成本可预测性的团队。TTS-1 可通过 TheRouter 的 OpenAI 兼容端点(/v1/audio/speech)调用,无需修改客户端——相同的 Authorization 头和请求体格式可直接使用。速率限制按等级设置:Free/Tier 1 为 3-500 RPM;Tier 5 为 10,000 RPM。
| 类型 | 费率 |
|---|---|
| 文本 | $16.20 每百万字符 |
request is price per 1M characters
| 发布日期 | 2023-11-06(OpenAI DevDay)openai.com ↗ | 已核实 |
| 定价 | 每百万字符 $15.00openai.com/api/pricing ↗ | 已核实 |
| 最大输入长度 | 每次请求最多 4 096 个字符platform.openai.com ↗ | 已核实 |
| 支持的语音 | alloy、ash、coral、echo、fable、onyx、nova、shimmer(9 种语音)platform.openai.com ↗ | 已核实 |
| 输出格式 | MP3(默认)、Opus、AAC、FLAC、WAV、PCMplatform.openai.com ↗ | 已核实 |
| 语速控制 | 0.25–4.0×(默认 1.0×)platform.openai.com ↗ | 已核实 |
| 速率限制(Tier 1) | 500 RPMplatform.openai.com ↗ | 已核实 |
| 指令跟随(语音风格控制) | 不支持——如需提示词控制语音风格,请使用 gpt-4o-mini-ttsplatform.openai.com ↗ | 已核实 |
| 训练数据截止 | 未公开披露 | 未知 |
| 许可 | 专有(OpenAI API 服务条款)openai.com/policies ↗ | 已核实 |
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
Relative latency vs TTS-1 HD OpenAI 表示,TTS-1 比 TTS-1 HD 延迟更低,但质量略低。未公开数字化的首音频时间指标。 | Lower latency than TTS-1 HDqualitative | platform.openai.com ↗ |
所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。
curl https://api.therouter.ai/v1/audio/speech -H "Content-Type: application/json" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -d '{
"model": "openai/tts-1",
"input": "Welcome to TheRouter.",
"voice": "alloy"
}'curl https://api.therouter.ai/v1/audio/speech \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "openai/tts-1",
"input": "The quick brown fox jumped over the lazy dog.",
"voice": "alloy"
}' \
--output speech.mp3OpenAI 发布 gpt-4o-mini-tts 及新语音转文字模型,将其定位为语音 Agent 的推荐模型。与 TTS-1 不同,它接受自由文本的 instructions 字段以控制口音、语调、情感和说话风格。TTS-1 继续可用,现定位为低延迟、低成本的旧版选项。
微软宣布 Azure OpenAI Service 和 Azure AI Speech 支持 TTS-1 和 TTS-1 HD 语音,为企业客户提供 Azure 原生访问原版六种语音(alloy、echo、fable、onyx、nova、shimmer)的途径。这将 TTS-1 的覆盖范围扩展到需要 Azure 数据驻留的受监管行业。
TTS-1 针对速度和低延迟优化——适合实时流式传输和对话应用。TTS-1 HD 针对音质优化,更适合预录制内容(如播客、有声书或任何听众会仔细聆听输出的场合)。TTS-1 定价 $15/百万字符;TTS-1 HD 定价 $30/百万字符。
如果你需要指令跟随(通过自由文本 instructions 字段控制口音、语调或个性),则应迁移。如果你的管线稳定、不需要风格控制、并希望以 $15/百万字符保持可预测的成本,则保留 TTS-1 即可。TTS-1 不会被弃用,将继续得到支持。
将客户端的 baseURL 指向 https://api.therouter.ai/v1,使用 TheRouter API key,并将 model 设置为 openai/tts-1。其他所有参数(voice、speed、response_format、input)与 OpenAI SDK 完全相同。TheRouter 透明地处理路由、计费和速率限制聚合。
TTS-1 支持 9 种内置语音:alloy、ash、coral、echo、fable、onyx、nova 和 shimmer。TTS-1 不支持自定义或克隆语音。如需零样本语音克隆,可考虑 TheRouter 上提供的开源模型,如 fish-speech-1.5 或 cosyvoice2-0.5b。
| 来源 | URL | 采集于 | |
|---|---|---|---|
| 发布日期 | openai.com ↗ | 2026-06-03 | 已核实 |
| 定价 | openai.com/api/pricing ↗ | 2026-06-03 | 已核实 |
| 最大输入长度 | platform.openai.com ↗ | 2026-06-03 | 已核实 |
| 支持的语音 | platform.openai.com ↗ | 2026-06-03 | 已核实 |
| 输出格式 | platform.openai.com ↗ | 2026-06-03 | 已核实 |
| 语速控制 | platform.openai.com ↗ | 2026-06-03 | 已核实 |
| 速率限制(Tier 1) | platform.openai.com ↗ | 2026-06-03 | 已核实 |
| 指令跟随(语音风格控制) | platform.openai.com ↗ | 2026-06-03 | 已核实 |
| 训练数据截止 | — | — | 未知 |
| 许可 | openai.com/policies ↗ | 2026-06-03 | 已核实 |
| Relative latency vs TTS-1 HD | platform.openai.com ↗ | 2026-06-03 | 已核实 |
| OpenAI 发布 gpt-4o-mini-tts,支持语音 Agent 指令跟随 | openai.com ↗ | 2026-06-03 | 已核实 |
| OpenAI TTS 语音登陆 Azure OpenAI 服务 | techcommunity.microsoft.com ↗ | 2026-06-03 | 已核实 |
| TTS-1 和 TTS-1 HD 有什么区别? | platform.openai.com ↗ | 2026-06-03 | 待核实 |
| 我应该从 TTS-1 迁移到 gpt-4o-mini-tts 吗? | platform.openai.com ↗ | 2026-06-03 | 待核实 |
| 如何通过 TheRouter 使用 TTS-1? | platform.openai.com ↗ | 2026-06-03 | 待核实 |
| 有哪些可用语音?我能使用自定义语音吗? | platform.openai.com ↗ | 2026-06-03 | 待核实 |