返回模型列表

gpt-realtime-whisper

openaiopenai/gpt-realtime-whisper

供应商自营与 TheRouter 服务形态的差异

供应商自己运营时

一条流式实时通道:WebSocket 会话在说话者仍在讲话时就持续输出增量转录 delta,delay 可从 'minimal' 调到 'xhigh',并带轮次检测。

在 TheRouter 上

一次普通 HTTP 请求:POST /v1/audio/transcriptions,multipart,返回一个 JSON。没有增量 delta,没有会话要建立,不需要写 WebSocket 或 WebRTC 客户端,也没有 delay 与轮次检测旋钮。所有 /v1/realtime 路径对所有模型、在鉴权之前,一律返回 501 realtime_websocket_not_supported。

API 使用指南

转录(TheRouter)

在 TheRouter 上,GPT-Realtime-Whisper 通过 POST /v1/audio/transcriptions 提供服务——与 Whisper 相同的 REST 端点——而非 chat completions 或 WebSocket 路径。TheRouter 在这个不变的公开契约背后桥接了供应商的实时通道;请求层面的行为与其他任何转录模型完全一致。支持的参数:file、language、prompt、response_format、temperature。按音频分钟计费,既非按 token 也非按次。该模型在 TheRouter 上没有 chat/completions 路由——按那种方式调用会返回 503。完整的协议层契约、准实时切片方案,以及 Java / Go / Python 参考实现,见《实时转录接入指南》:https://therouter.ai/guides/multimodal/realtime-transcription/zh

cURL
curl https://api.therouter.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -F file="@speech.wav" \
  -F model="openai/gpt-realtime-whisper" \
  -F language="en" \
  -F prompt="Technical terms: TheRouter, API" \
  -F response_format="json" \
  -F temperature="0"

客户端切片实现准实时转录

TheRouter 上没有流式转录端点,准实时输出的做法是在客户端切片、每片发一次普通请求。下面两段代码都已于 2026-07-29 对生产环境实跑,输出与指南中一致。它们演示的两个点正是接入方最常出错的地方:每个切片必须是能独立解码的完整容器(直接从长文件里切出的字节片段会被 400 拒绝),以及 WAV 头不是固定 44 字节 —— 真实录音在 data 之前常带 LIST/FLLR 块,必须真正遍历 RIFF chunk。请预期切片边界会丢词或重复、每片 1.7–6.9 秒;对准确率敏感的场景应整段提交。

cURL
# Segment locally, then post each segment to the same endpoint.
# Each piece must decode on its own — split with a tool that writes a real
# container per piece (ffmpeg here), never with `split`/`dd` on the bytes.
ffmpeg -i speech.wav -f segment -segment_time 3 -c copy chunk-%03d.wav

for f in chunk-*.wav; do
  curl -sS https://api.therouter.ai/v1/audio/transcriptions \
    -H "Authorization: Bearer $THEROUTER_API_KEY" \
    -F file="@$f" \
    -F model="openai/gpt-realtime-whisper" \
    -F language="en" | python3 -c 'import json,sys; print(json.load(sys.stdin)["text"])'
done
事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
发布日期developers.openai.com ↗2026-05-30已核实
知识截止日期developers.openai.com ↗2026-05-30已核实
上下文窗口developers.openai.com ↗2026-05-30已核实
最大输出 tokensdevelopers.openai.com ↗2026-05-30已核实
计费单位developers.openai.com ↗2026-05-30已核实
API 端点developers.openai.com ↗2026-05-30已核实
延迟调优developers.openai.com ↗2026-05-30已核实
支持的功能developers.openai.com ↗2026-05-30已核实
音频输入格式developers.openai.com ↗2026-05-30已核实
Azure WER improvementlearn.microsoft.com ↗2026-05-30单一来源
OpenAI 发布 GPT-Realtime-Whisper,与 GPT-Realtime-2 和 GPT-Realtime-Translate 一同推出developers.openai.com ↗2026-05-30已核实
这个模型的官方文档说只能走 WebSocket,TheRouter 有 wss:// 接入吗?therouter.ai ↗2026-07-29待核实
GPT-Realtime-Whisper 和 gpt-4o-transcribe 有什么区别?developers.openai.com ↗2026-05-30待核实
我可以通过标准 OpenAI chat completions SDK 使用 GPT-Realtime-Whisper 吗?developers.openai.com ↗2026-05-30待核实
'delay' 设置有什么作用,我该选择哪个?developers.openai.com ↗2026-05-30待核实
我可以用自定义词汇或提示词引导模型的转录吗?developers.openai.com ↗2026-05-30待核实
GPT-Realtime-Whisper 与传统 Whisper 在延迟方面相比如何?developers.openai.com ↗2026-05-30待核实
帮助与联系