返回模型列表

TTS-1 HD 是 OpenAI 的高保真文字转语音模型,于 2023 年 11 月 6 日在 OpenAI DevDay 上与 TTS-1 同步发布。它将文本转化为自然语音,专为音质而非延迟优化。定价为每百万字符 $30.00——是 TTS-1($15.00/百万字符)的两倍——是音频保真度为首要考量时的首选:有声书、播客、电子学习配音和广播媒体。它与 TTS-1 共享相同的语音集(alloy、ash、coral、echo、fable、onyx、nova、shimmer)和输出格式(MP3、Opus、AAC、FLAC、WAV、PCM),仅在质量与延迟的权衡上有所不同。

截至 2025-2026 年,OpenAI 为新语音 Agent 项目推荐 gpt-4o-mini-tts,因为它新增了指令跟随功能(通过自由文本 instructions 参数控制语调、口音和说话风格)。TTS-1 HD 依然完整支持,适合生成预渲染音频资产的生产管线——即请求不在交互关键路径上、可以接受每次合成多几百毫秒延迟以换取明显更清晰输出的场景。可通过 TheRouter 的 OpenAI 兼容端点(/v1/audio/speech)调用,无需修改客户端。

适合使用
  • • 听众会逐句审听的有声书和长篇配音——TTS-1 HD 的高保真在长时间收听时可被明显感知
  • • 将要发布或分发的播客制作和营销视频——TTS-1 HD 相较于 TTS-1 的质量差异对非技术受众也能听出
  • • 将被反复播放的电子学习和企业培训配音——减少音频伪影提升感知专业度
  • • 音频资产的批量预渲染(产品演示、说明视频、IVR 录音),合成离线进行且每次请求成本可预测
不适合使用
  • • 首音频延迟至关重要的实时对话 Agent——使用 TTS-1 降低延迟,或使用 gpt-4o-realtime-preview 进行原生流式语音
  • • 需要通过提示词控制语音风格(语调、口音、情感)的新语音 Agent——改用支持 instructions 参数的 gpt-4o-mini-tts
  • • 成本敏感的大批量管线,质量溢价难以合理化——TTS-1 以 $15/百万字符在半价下提供可接受的质量
上下文长度
--
最大输出
--
文本价格按字符
$32.40每百万字符

模态能力

文本→音频

能力

语音合成

媒体生成能力

tts
output_formats
  • mp3
  • opus
  • aac
  • flac
voices
  • alloy
  • echo
  • fable
  • onyx
  • nova
  • shimmer
defaults
voice
alloy

价格明细

类型费率
文本$32.40 每百万字符

request is price per 1M characters

支持参数

inputvoiceresponse_formatspeed

模型规格

发布日期2023-11-06(OpenAI DevDay)openai.com ↗已核实
定价每百万字符 $30.00openai.com/api/pricing ↗已核实
最大输入长度每次请求最多 4 096 个字符platform.openai.com ↗已核实
支持的语音alloy、ash、coral、echo、fable、onyx、nova、shimmer(9 种语音)platform.openai.com ↗已核实
输出格式MP3(默认)、Opus、AAC、FLAC、WAV、PCMplatform.openai.com ↗已核实
语速控制0.25–4.0×(默认 1.0×)platform.openai.com ↗已核实
相对 TTS-1 的延迟比 TTS-1 延迟更高——为质量而非速度优化platform.openai.com ↗已核实
指令跟随(语音风格控制)不支持——如需提示词控制语音风格,请使用 gpt-4o-mini-ttsplatform.openai.com ↗已核实
速率限制(Tier 1)500 RPMplatform.openai.com ↗已核实
训练数据截止未公开披露未知
许可专有(OpenAI API 服务条款)openai.com/policies ↗已核实

基准成绩

BenchmarkDistributionScoreSource
Relative audio quality vs TTS-1
OpenAI 将 TTS-1 HD 描述为以更高延迟换取比 TTS-1 更高的音频质量。未公开数字化的 MOS 或 CMOS 指标。
Higher quality than TTS-1qualitativeplatform.openai.com ↗

API 使用示例

所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。

cURL
curl https://api.therouter.ai/v1/audio/speech   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "openai/tts-1-hd",
    "input": "Welcome to TheRouter.",
    "voice": "alloy"
  }'

API 使用指南

完整 API 参考 →

语音生成(v1/audio/speech)

cURL
curl https://api.therouter.ai/v1/audio/speech \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openai/tts-1-hd",
    "input": "The quick brown fox jumped over the lazy dog.",
    "voice": "nova"
  }' \
  --output speech-hd.mp3

openai 其他模型

同类模型

跨供应商的相似能力档位

动态与变更

2025-03-20

OpenAI 发布 gpt-4o-mini-tts,支持语音 Agent 指令跟随

OpenAI 发布 gpt-4o-mini-tts 及新语音转文字模型,将其定位为新语音 Agent 项目的推荐模型。与 TTS-1 HD 不同,它接受自由文本 instructions 字段以控制口音、语调、情感和说话风格。TTS-1 HD 继续受支持,在不需要指令跟随的情况下依然是质量优先预渲染音频的首选。

TheRouter 编辑重写openai.com ↗
2024-03-30

OpenAI TTS 语音登陆 Azure OpenAI 服务

微软宣布 Azure OpenAI Service 和 Azure AI Speech 同时支持 TTS-1 和 TTS-1 HD,为企业级、符合数据驻留要求的用户提供 OpenAI 最高保真 TTS 服务。这使 TTS-1 HD 对需要数据保留在 Azure 地理边界内的受监管行业(医疗、金融、政府)可用。

TheRouter 编辑重写techcommunity.microsoft.com ↗
2023-11-06

OpenAI DevDay:TTS-1 和 TTS-1 HD 正式发布

OpenAI 在 DevDay 2023 上发布了首批生产级文字转语音模型:TTS-1 用于低延迟流式传输,TTS-1 HD 用于高保真输出。两款模型均支持 6 种初始语音(alloy、echo、fable、onyx、nova、shimmer)、多种输出格式以及 OpenAI Audio API(/v1/audio/speech),使任何应用都可以通过单次 API 调用添加自然语音生成能力。

TheRouter 编辑重写openai.com ↗

常见问题

TTS-1 HD 和 TTS-1 有什么区别?

TTS-1 HD 针对音频质量优化,更适合需要仔细聆听的内容——播客、有声书、企业配音。TTS-1 针对低延迟优化,更适合实时或流式应用。TTS-1 HD 定价 $30/百万字符;TTS-1 定价 $15/百万字符。两者支持相同的语音、输出格式和语速控制。

TheRouter 编辑重写platform.openai.com ↗
新项目应该选 TTS-1 HD 还是 gpt-4o-mini-tts?

任何新的语音 Agent 或对话应用都应使用 gpt-4o-mini-tts——它新增了指令跟随功能(通过 instructions 控制语调、口音和个性),是 OpenAI 的推荐路径。当你需要为预渲染、非交互内容提供最高音频质量且不需要风格控制时,使用 TTS-1 HD——有声书、播客片段或在线离线合成的企业电子学习内容。

TheRouter 编辑重写platform.openai.com ↗
如何通过 TheRouter 使用 TTS-1 HD?

将客户端的 baseURL 指向 https://api.therouter.ai/v1,使用 TheRouter API key,并将 model 设置为 openai/tts-1-hd。其他所有参数(voice、speed、response_format、input)与 OpenAI SDK 完全相同。TheRouter 透明地处理路由、计费和速率限制聚合。

TheRouter 编辑重写platform.openai.com ↗
使用 TTS-1 HD 时应该选哪种输出格式?

MP3 是默认格式,适用于大多数网页和移动端交付。对于将在 DAW 中后期处理或进一步编辑的内容,使用 FLAC(无损)或 WAV。Opus 在等效质量下文件体积比 MP3 更小,适合带宽受限的交付场景。PCM 最适合直接的音频管线集成(如电话或实时混音)。

TheRouter 编辑重写platform.openai.com ↗
事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
发布日期openai.com ↗2026-06-09已核实
定价openai.com/api/pricing ↗2026-06-09已核实
最大输入长度platform.openai.com ↗2026-06-09已核实
支持的语音platform.openai.com ↗2026-06-09已核实
输出格式platform.openai.com ↗2026-06-09已核实
语速控制platform.openai.com ↗2026-06-09已核实
相对 TTS-1 的延迟platform.openai.com ↗2026-06-09已核实
指令跟随(语音风格控制)platform.openai.com ↗2026-06-09已核实
速率限制(Tier 1)platform.openai.com ↗2026-06-09已核实
训练数据截止——未知
许可openai.com/policies ↗2026-06-09已核实
Relative audio quality vs TTS-1platform.openai.com ↗2026-06-09已核实
OpenAI 发布 gpt-4o-mini-tts,支持语音 Agent 指令跟随openai.com ↗2026-06-09已核实
OpenAI TTS 语音登陆 Azure OpenAI 服务techcommunity.microsoft.com ↗2026-06-09已核实
OpenAI DevDay:TTS-1 和 TTS-1 HD 正式发布openai.com ↗2026-06-09已核实
TTS-1 HD 和 TTS-1 有什么区别?platform.openai.com ↗2026-06-09待核实
新项目应该选 TTS-1 HD 还是 gpt-4o-mini-tts?platform.openai.com ↗2026-06-09待核实
如何通过 TheRouter 使用 TTS-1 HD?platform.openai.com ↗2026-06-09待核实
使用 TTS-1 HD 时应该选哪种输出格式?platform.openai.com ↗2026-06-09待核实
帮助与联系