gpt-realtime-whisper
供应商自营与 TheRouter 服务形态的差异
一条流式实时通道:WebSocket 会话在说话者仍在讲话时就持续输出增量转录 delta,delay 可从 'minimal' 调到 'xhigh',并带轮次检测。
一次普通 HTTP 请求:POST /v1/audio/transcriptions,multipart,返回一个 JSON。没有增量 delta,没有会话要建立,不需要写 WebSocket 或 WebRTC 客户端,也没有 delay 与轮次检测旋钮。所有 /v1/realtime 路径对所有模型、在鉴权之前,一律返回 501 realtime_websocket_not_supported。
API 使用指南
转录(TheRouter)
在 TheRouter 上,GPT-Realtime-Whisper 通过 POST /v1/audio/transcriptions 提供服务——与 Whisper 相同的 REST 端点——而非 chat completions 或 WebSocket 路径。TheRouter 在这个不变的公开契约背后桥接了供应商的实时通道;请求层面的行为与其他任何转录模型完全一致。支持的参数:file、language、prompt、response_format、temperature。按音频分钟计费,既非按 token 也非按次。该模型在 TheRouter 上没有 chat/completions 路由——按那种方式调用会返回 503。完整的协议层契约、准实时切片方案,以及 Java / Go / Python 参考实现,见《实时转录接入指南》:https://therouter.ai/guides/multimodal/realtime-transcription/zh
curl https://api.therouter.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-F file="@speech.wav" \
-F model="openai/gpt-realtime-whisper" \
-F language="en" \
-F prompt="Technical terms: TheRouter, API" \
-F response_format="json" \
-F temperature="0"客户端切片实现准实时转录
TheRouter 上没有流式转录端点,准实时输出的做法是在客户端切片、每片发一次普通请求。下面两段代码都已于 2026-07-29 对生产环境实跑,输出与指南中一致。它们演示的两个点正是接入方最常出错的地方:每个切片必须是能独立解码的完整容器(直接从长文件里切出的字节片段会被 400 拒绝),以及 WAV 头不是固定 44 字节 —— 真实录音在 data 之前常带 LIST/FLLR 块,必须真正遍历 RIFF chunk。请预期切片边界会丢词或重复、每片 1.7–6.9 秒;对准确率敏感的场景应整段提交。
# Segment locally, then post each segment to the same endpoint.
# Each piece must decode on its own — split with a tool that writes a real
# container per piece (ffmpeg here), never with `split`/`dd` on the bytes.
ffmpeg -i speech.wav -f segment -segment_time 3 -c copy chunk-%03d.wav
for f in chunk-*.wav; do
curl -sS https://api.therouter.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-F file="@$f" \
-F model="openai/gpt-realtime-whisper" \
-F language="en" | python3 -c 'import json,sys; print(json.load(sys.stdin)["text"])'
done事实档案 — 本页每条断言可在此回溯来源
| 来源 | URL | 采集于 | |
|---|---|---|---|
| 发布日期 | developers.openai.com ↗ | 2026-05-30 | 已核实 |
| 知识截止日期 | developers.openai.com ↗ | 2026-05-30 | 已核实 |
| 上下文窗口 | developers.openai.com ↗ | 2026-05-30 | 已核实 |
| 最大输出 tokens | developers.openai.com ↗ | 2026-05-30 | 已核实 |
| 计费单位 | developers.openai.com ↗ | 2026-05-30 | 已核实 |
| API 端点 | developers.openai.com ↗ | 2026-05-30 | 已核实 |
| 延迟调优 | developers.openai.com ↗ | 2026-05-30 | 已核实 |
| 支持的功能 | developers.openai.com ↗ | 2026-05-30 | 已核实 |
| 音频输入格式 | developers.openai.com ↗ | 2026-05-30 | 已核实 |
| Azure WER improvement | learn.microsoft.com ↗ | 2026-05-30 | 单一来源 |
| OpenAI 发布 GPT-Realtime-Whisper,与 GPT-Realtime-2 和 GPT-Realtime-Translate 一同推出 | developers.openai.com ↗ | 2026-05-30 | 已核实 |
| 这个模型的官方文档说只能走 WebSocket,TheRouter 有 wss:// 接入吗? | therouter.ai ↗ | 2026-07-29 | 待核实 |
| GPT-Realtime-Whisper 和 gpt-4o-transcribe 有什么区别? | developers.openai.com ↗ | 2026-05-30 | 待核实 |
| 我可以通过标准 OpenAI chat completions SDK 使用 GPT-Realtime-Whisper 吗? | developers.openai.com ↗ | 2026-05-30 | 待核实 |
| 'delay' 设置有什么作用,我该选择哪个? | developers.openai.com ↗ | 2026-05-30 | 待核实 |
| 我可以用自定义词汇或提示词引导模型的转录吗? | developers.openai.com ↗ | 2026-05-30 | 待核实 |
| GPT-Realtime-Whisper 与传统 Whisper 在延迟方面相比如何? | developers.openai.com ↗ | 2026-05-30 | 待核实 |