返回模型列表

gpt-realtime-whisper

openaiopenai/gpt-realtime-whisper

Whisper-class automatic speech recognition over the realtime channel. Audio in, transcribed text out.

GPT-Realtime-Whisper 是 OpenAI 的流式语音转文字模型,于 2026 年 5 月 7 日与 GPT-Realtime-2 和 GPT-Realtime-Translate 一同发布。它将实时音频转为文字,在说话者讲话时流式输出增量转录文本——无需等待整句话结束。专为低延迟场景设计,提供从 'minimal' 到 'xhigh' 的可调节延迟设置,让开发者根据场景在延迟和准确性之间权衡。

TheRouter 通过一次普通 HTTP 请求提供该模型 —— POST /v1/audio/transcriptions,multipart,与 Whisper 完全相同的契约 —— 并且完全没有开放 realtime 流式通道。你上传音频,拿回一个 JSON。没有增量 delta,没有会话要建立,不需要写 WebSocket 或 WebRTC 客户端,也没有 delay / 轮次检测这类旋钮。所有 /v1/realtime 路径对所有模型、在鉴权之前,一律返回 501 realtime_websocket_not_supported —— 所以看到这个错误时,你的 API key 不是原因。

适合使用
  • • 会议、网络研讨会和直播的准实时字幕 —— 在 TheRouter 上需由客户端切片、逐片提交,因此字幕滞后约一个切片长度加一次往返(秒级),且切片边界处可能丢词或重复
  • • 合规和质量监控——将对话转为文本用于法规存档、质量保证或分析流水线
  • • 多语种转录流水线——搭配 GPT-Realtime-Translate 同时获取源语言转录和翻译音频,给用户两者兼具的体验
  • • 需要文字可见的语音控制界面——在语音代理回复的同时向用户展示系统听到的内容
不适合使用
  • • 对话式语音代理——需要推理、工具调用和语音回复的助手,请使用 GPT-Realtime-2
  • • 预录音频转录——处理文件或有边界的音频请求,请使用 gpt-4o-transcribe($0.006/分钟,更高准确率)或 gpt-4o-mini-transcribe($0.003/分钟)
  • • 实时翻译——GPT-Realtime-Whisper 只转写不翻译。请使用 GPT-Realtime-Translate 进行语音到语音翻译

供应商自营与 TheRouter 服务形态的差异

供应商自己运营时

一条流式实时通道:WebSocket 会话在说话者仍在讲话时就持续输出增量转录 delta,delay 可从 'minimal' 调到 'xhigh',并带轮次检测。

在 TheRouter 上

一次普通 HTTP 请求:POST /v1/audio/transcriptions,multipart,返回一个 JSON。没有增量 delta,没有会话要建立,不需要写 WebSocket 或 WebRTC 客户端,也没有 delay 与轮次检测旋钮。所有 /v1/realtime 路径对所有模型、在鉴权之前,一律返回 501 realtime_websocket_not_supported。

上下文长度
--
最大输出
--
音频价格按音频分钟
$0.0184每分钟音频

模态能力

音频→文本

能力

语音识别

价格明细

类型费率
音频$0.0184 每分钟音频

request is price per minute of audio, the only unit OpenAI publishes for this model.

支持参数

filelanguagepromptresponse_formattemperature

模型规格

发布日期2026 年 5 月 7 日developers.openai.com ↗已核实
知识截止日期2024 年 9 月 30 日developers.openai.com ↗已核实
上下文窗口16,000 tokensdevelopers.openai.com ↗已核实
最大输出 tokens2,000 tokensdevelopers.openai.com ↗已核实
计费单位按处理的音频分钟计费,取自每次响应的 duration 字段 —— 既非按 token,也非按次。十次 6 秒请求与一次 60 秒请求费用相同。OpenAI 官方标价为 $0.017/分钟。developers.openai.com ↗已核实
API 端点上游端点(OpenAI 直连专用,在 TheRouter 上不可达):/v1/realtime/transcription_sessions,会话类型 'transcription',走 WebRTC 或 WebSocket。在 TheRouter 上入口是 POST /v1/audio/transcriptions —— 所有 /v1/realtime 路径都在鉴权之前返回 501 realtime_websocket_not_supported,因此 API key 绝不是原因。详见《实时转录接入指南》。developers.openai.com ↗已核实
延迟调优在 TheRouter 上不可用。 audio.input.transcription.delay(minimal / low / medium / high / xhigh)是 realtime 会话参数,而这里不存在 realtime 会话 —— 传了也不生效。实际接受的参数只有:file、language、prompt、response_format、temperature。在 TheRouter 上,延迟由你的客户端切片长度加上每片一次 HTTP 往返决定(实测每片 1.7–6.9 秒),而非由 delay 设置决定。developers.openai.com ↗已核实
支持的功能在 TheRouter 上 —— 流式:不支持。 响应是整段音频转录完成后返回的单个 JSON,没有增量 delta,因为该模型在上游所用的流式传输通道在这里没有对外开放。准实时效果需由客户端切片、每片发一次请求来实现。提示词引导:支持 —— 接受 prompt 参数(这一点在 OpenAI 自己的 GA realtime 会话上反而不可用)。函数调用:不支持。结构化输出:不支持。微调:不支持。developers.openai.com ↗已核实
音频输入格式在 TheRouter 上:作为 multipart file 部分上传的容器文件 —— WAV、MP3、FLAC、M4A、MPEG、MPGA、OGG 或 WebM,上限 25 MB。不接受裸 PCM:上游 realtime 会话在其流上接收 24 kHz 单声道 PCM16,但该通道在这里未开放,因此 PCM 必须先封装进容器(例如加 WAV 头)再上传。每个切片必须能独立解码 —— 从长文件里直接切出的字节片段不是合法音频。file 部分必须带有真实扩展名的文件名,格式由它推断。developers.openai.com ↗已核实

基准成绩

BenchmarkDistributionScoreSource
Azure WER improvement
Azure Foundry 文档指出 GPT-Realtime-Whisper 的词错误率相比之前的 gpt-4o 实时转录降低约 50%。这是来自供应商的相对声明,并非独立的绝对 WER 基准分数。
~50% lower WER than gpt-4o realtime% reductionlearn.microsoft.com ↗

API 使用示例

所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。

cURL
curl https://api.therouter.ai/v1/audio/transcriptions   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -F "model=openai/gpt-realtime-whisper"   -F "file=@speech.mp3"

API 使用指南

完整 API 参考 →

转录(TheRouter)

在 TheRouter 上,GPT-Realtime-Whisper 通过 POST /v1/audio/transcriptions 提供服务——与 Whisper 相同的 REST 端点——而非 chat completions 或 WebSocket 路径。TheRouter 在这个不变的公开契约背后桥接了供应商的实时通道;请求层面的行为与其他任何转录模型完全一致。支持的参数:file、language、prompt、response_format、temperature。按音频分钟计费,既非按 token 也非按次。该模型在 TheRouter 上没有 chat/completions 路由——按那种方式调用会返回 503。完整的协议层契约、准实时切片方案,以及 Java / Go / Python 参考实现,见《实时转录接入指南》:https://therouter.ai/guides/multimodal/realtime-transcription/zh

cURL
curl https://api.therouter.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -F file="@speech.wav" \
  -F model="openai/gpt-realtime-whisper" \
  -F language="en" \
  -F prompt="Technical terms: TheRouter, API" \
  -F response_format="json" \
  -F temperature="0"

openai 其他模型

同类模型

跨供应商的相似能力档位

动态与变更

2026-05-07

OpenAI 发布 GPT-Realtime-Whisper,与 GPT-Realtime-2 和 GPT-Realtime-Translate 一同推出

2026 年 5 月 7 日,OpenAI 发布了三款新的实时音频模型:GPT-Realtime-2(128K 上下文语音代理)、GPT-Realtime-Translate(流式翻译,$0.034/分钟)和 GPT-Realtime-Whisper(流式语音转文字,$0.017/分钟)。GPT-Realtime-Whisper 专为实时转录设计,具有可调延迟——'minimal' 设置提供近乎即时的转录增量,而 'xhigh' 偏向准确性而非速度。该模型通过专用的转录会话端点连接,支持 WebRTC(浏览器)或 WebSocket(服务端媒体管道)。也可通过 Azure Foundry 使用,WER 比之前的实时转录模型降低约 50%。

TheRouter 编辑重写developers.openai.com ↗

常见问题

这个模型的官方文档说只能走 WebSocket,TheRouter 有 wss:// 接入吗?

有,而且已部分上线 —— 生产实测 2026-07-29。带有效 key 调 POST /v1/realtime/sessions(model 为本模型)返回 200,含 session_token 与 expires_at(不带 key 是 401,不是 501)。但拿这个 token 连 wss://api.therouter.ai/v1/realtime 目前返回 503 upstream_unavailable——'This model is not configured for realtime billing'——也就是能拿到 token 但还用不了。对话式 realtime 家族(openai/gpt-realtime、openai/gpt-realtime-2)仍处 gated,创建会话返回 404 model_not_found。未实现的子路径(/v1/realtime/transcription_sessions、/calls、/client_secrets)返回 501 而非裸 404,这样客户端在它们之间回退时不会被误导去怀疑自己的 URL 或 key。今天该基于什么开发:POST /v1/audio/transcriptions —— 它端到端可用,且不受 socket 上线进度影响。另外 TheRouter 的流式在反方向也存在:/v1/audio/speech(TTS)通过 SSE 或 chunked HTTP 流式输出,从不使用 WebSocket。

GPT-Realtime-Whisper 和 gpt-4o-transcribe 有什么区别?

在上游,两者的区别是流式 vs 批量。在 TheRouter 上这个区别不存在:两个模型都走同一个 POST /v1/audio/transcriptions 请求,都返回一份完整转录,都不流式。这里真正的差别只剩价格和准确率 —— 而且权衡方向与名字给人的印象相反。GPT-Realtime-Whisper 标价 $0.017/分钟,gpt-4o-transcribe 是 $0.006/分钟,前者贵约 2.8 倍,而 gpt-4o-transcribe 在预录音频上通常绝对准确率更高。除非你确实需要这个模型,在 TheRouter 上 gpt-4o-transcribe 在成本和准确率两方面都是更好的默认选择。(此处为 OpenAI 标价;实际收费见各模型页的定价卡片。)

我可以通过标准 OpenAI chat completions SDK 使用 GPT-Realtime-Whisper 吗?

原生不支持,在 TheRouter 上也不支持。原生场景下,OpenAI 的 GPT-Realtime-Whisper 使用专用的 /v1/realtime/transcription_sessions 端点(WebRTC 或 WebSocket)——你需要管理持久连接,通过 input_audio_buffer.append 事件流式发送音频,并处理到达的转录增量。在 TheRouter 上,该模型仅通过 POST /v1/audio/transcriptions 提供服务——标准 REST 转录契约,请求输入、完整转录输出。该模型在 TheRouter 上没有 chat/completions 路由;按那种方式调用会返回 503。

'delay' 设置有什么作用,我该选择哪个?

延迟设置控制流式转录的延迟/准确性权衡。较低的值(minimal、low)更快发出转录增量,但可能因模型音频上下文较少而词错误率更高。较高的值(high、xhigh)等待更多上下文再发出文本,牺牲显示延迟换取准确性。OpenAI 建议实时字幕从 'low' 开始,平衡场景从 'medium' 开始。请用实际音频测试——麦克风、背景噪音、口音和领域词汇都会影响最佳设置。

我可以用自定义词汇或提示词引导模型的转录吗?

GPT-Realtime-Whisper 的 GA 实时会话不支持提示词引导。请改用语言提示('language' 参数)。如果未来版本支持提示词引导,OpenAI 建议使用简短关键词列表(如 'Keywords: 美托洛尔, 阿托伐他汀, 糖化血红蛋白')而非完整的自然语言指令。生产使用中,将关键词引导视为辅助而非保证——继续手动评估名称、数字、日期和领域术语。

GPT-Realtime-Whisper 与传统 Whisper 在延迟方面相比如何?

传统 Whisper(whisper-1)按块处理音频,必须等待整个话语完成后才能转录——它不是原生流式的。GPT-Realtime-Whisper 随着音频到达持续发出增量转录文本,延迟从 'minimal'(近乎即时的局部文本)到 'xhigh'(更多上下文、更好准确性)可调。对于实时字幕和流媒体应用,延迟改进显著:用户看到文本在句子中间就出现了,而非等待数秒。对于延迟不重要的预录音频文件,gpt-4o-transcribe 或 gpt-4o-mini-transcribe 以更低成本提供更高准确率。

事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
发布日期developers.openai.com ↗2026-05-30已核实
知识截止日期developers.openai.com ↗2026-05-30已核实
上下文窗口developers.openai.com ↗2026-05-30已核实
最大输出 tokensdevelopers.openai.com ↗2026-05-30已核实
计费单位developers.openai.com ↗2026-05-30已核实
API 端点developers.openai.com ↗2026-05-30已核实
延迟调优developers.openai.com ↗2026-05-30已核实
支持的功能developers.openai.com ↗2026-05-30已核实
音频输入格式developers.openai.com ↗2026-05-30已核实
Azure WER improvementlearn.microsoft.com ↗2026-05-30单一来源
OpenAI 发布 GPT-Realtime-Whisper,与 GPT-Realtime-2 和 GPT-Realtime-Translate 一同推出developers.openai.com ↗2026-05-30已核实
这个模型的官方文档说只能走 WebSocket,TheRouter 有 wss:// 接入吗?therouter.ai ↗2026-07-29待核实
GPT-Realtime-Whisper 和 gpt-4o-transcribe 有什么区别?developers.openai.com ↗2026-05-30待核实
我可以通过标准 OpenAI chat completions SDK 使用 GPT-Realtime-Whisper 吗?developers.openai.com ↗2026-05-30待核实
'delay' 设置有什么作用,我该选择哪个?developers.openai.com ↗2026-05-30待核实
我可以用自定义词汇或提示词引导模型的转录吗?developers.openai.com ↗2026-05-30待核实
GPT-Realtime-Whisper 与传统 Whisper 在延迟方面相比如何?developers.openai.com ↗2026-05-30待核实
帮助与联系