OpenAI 发布 gpt-4o-transcribe 的 2025 年 12 月快照,WER 进一步降低
OpenAI 为 gpt-4o-transcribe 推出了 2025-12-15 更新快照,在 Common Voice 和 FLEURS 基准上的准确率有所提升。相同底板也驱动着分离变体。传统 whisper-1 和初始 gpt-4o-transcribe 2025-03-20 快照预计于 2026 年 6 月退役,使分离模型成为剩余的转录选项之一。
Transcription model that identifies who is speaking when.
GPT-4o Transcribe Diarize 是 OpenAI 内置说话人分离(Diarization)功能的语音转文本模型,约于 2025 年 10 月首次被报道。基于与基础版 gpt-4o-transcribe 相同的 GPT-4o 多模态架构,它原生增加了识别「谁在什么时候说话」的能力——返回说话人标签("A:"、"B:" 等)和段落级时间戳。这使得它成为以往需要将独立语音识别模型通过聚类后端流水线才能实现的直接替代方案。
该模型使用相同的 /v1/audio/transcriptions 端点,定价与基础转录模型相同(约 $0.0066/分钟)。关键区别在于 diarized_json 响应格式,它以结构化段落而非纯文本的形式返回。与基础模型不同,gpt-4o-transcribe-diarize 不支持提示词(prompting)或 Realtime API,音频块限制为 1,400 秒。说话人标签自动分配为 A/B/C,除非提供了明确的说话人引用。据 OpenAI 的 Pete Bakkum 表示,其词错误率(WER)「大致相当于」基础版 gpt-4o-transcribe——如果您不需要说话人分离,请使用基础模型。
| 类型 | 费率 |
|---|---|
| 音频 | $0.0071 每分钟音频 |
| 输入 | $2.70 每百万 Tokens |
| 输出 | $10.80 每百万 Tokens |
| Audio input | $6.48 每百万 Tokens |
| Estimated | $0.0065 每分钟 |
request is price per minute (official: same $0.006/min as gpt-4o-transcribe; the earlier +10% diarization surcharge does not exist on OpenAI's rate card)
| 发布日期 | OpenAI 未公开披露;Azure Foundry 将该模型列为正式可用ai.azure.com ↗ | 未知 |
| 架构 | 基于 GPT-4o 的语音转文本模型,支持说话人分离式转录ai.azure.com ↗ | 已核实 |
| API 端点 | /v1/audio/transcriptions(兼容 OpenAI SDK)developers.openai.com ↗ | 已核实 |
| 语言识别 | 改进的语音转文本语言识别;分离版本的确切支持语言数量未公开披露ai.azure.com ↗ | 未知 |
| 最大文件大小 | Transcriptions API 文件上传限制为 25 MBdevelopers.openai.com ↗ | 已核实 |
| 响应格式 | diarized_json 返回带说话人标签和开始/结束时间戳的段落,并包含完整转录文本developers.openai.com ↗ | 已核实 |
| 说话人标签 | 提供说话人参考时使用已知说话人名称;否则按 A、B、... 顺序标记说话人developers.openai.com ↗ | 已核实 |
| 支持音频格式 | mp3, mp4, mpeg, mpga, m4a, wav, webmdevelopers.openai.com ↗ | 已核实 |
| 许可 | 闭源/专有(仅 API 访问,无开源权重版本)openai.com ↗ | 已核实 |
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
AA-WER (base gpt-4o-transcribe, combined rank) Artificial Analysis 为基础版 gpt-4o-transcribe 进行的独立语音识别评测。据 OpenAI,分离变体的 WER 预计相当。截至 2026 年 5 月,尚无 gpt-4o-transcribe-diarize 的独立 AA-WER 分数。 | — | 未公开披露 | — |
FLEURS (multilingual WER — base gpt-4o-transcribe) OpenAI 报告,基础版 gpt-4o-transcribe 架构在 FLEURS(100+语言)上持续优于 Whisper。分离变体共享相同的多语言底板。具体总分未公开。 | Improved WER over Whisper v2/v3 across all language groups | openai.com ↗ |
所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。
curl https://api.therouter.ai/v1/audio/transcriptions -H "Authorization: Bearer $THE_ROUTER_API_KEY" -F "model=openai/gpt-4o-transcribe-diarize" -F "file=@speech.mp3"转录多说话人音频文件,使用 diarized_json 响应格式获取带说话人标签的段落。
curl https://api.therouter.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-F "file=@meeting.mp3" \
-F "model=openai/gpt-4o-transcribe-diarize" \
-F "response_format=diarized_json"OpenAI 为 gpt-4o-transcribe 推出了 2025-12-15 更新快照,在 Common Voice 和 FLEURS 基准上的准确率有所提升。相同底板也驱动着分离变体。传统 whisper-1 和初始 gpt-4o-transcribe 2025-03-20 快照预计于 2026 年 6 月退役,使分离模型成为剩余的转录选项之一。
OpenAI 悄悄将 gpt-4o-transcribe-diarize 模型添加到 /v1/audio/transcriptions 端点,在 GPT-4o Transcribe 底板之上提供原生说话人分离功能。该模型使用 diarized_json 响应格式,返回带说话人标签的段落和时间戳。早期报告指出 1,400 秒音频块限制和 Realtime API 不支持为其主要约束。
分离变体增加了原生说话人识别——通过 diarized_json 响应格式返回带说话人标签(A:、B: 等)和开始/结束时间戳的结构化段落。基础版 gpt-4o-transcribe 返回纯文本,无说话人归属。注意事项:分离模型不支持 prompt 参数、不支持 Realtime API、音频段限制为 1,400 秒。据 OpenAI 称 WER「大致相当」,因此如不需要说话人分离,请使用基础模型。
说话人标签默认为 A:、B:、C: 等。您可以为说话人归属提供音频引用(将段落链接到已知语音特征),但模型不会永久学习名称——这是每次请求的归属,不是持久的说话人识别。
不支持。gpt-4o-transcribe-diarize 仅通过 /v1/audio/transcriptions 端点提供基于文件/批次的转录。它不支持 Realtime API 或流式音频输入。如需实时转录,可使用 gpt-4o-mini-transcribe(非分离)通过 Realtime API,或考虑 Deepgram 和 AssemblyAI 提供的流式说话人分离。
不支持。这是与基础版 gpt-4o-transcribe 的关键区别。根据 OpenAI 的语音转文本指南,gpt-4o-transcribe-diarize 目前不支持提示词(prompting)。如果需要对领域特定术语进行上下文偏置,请使用基础版 gpt-4o-transcribe 模型。
每次请求限制约 1,400 秒(约 23 分钟)的音频。这短于基础版 gpt-4o-transcribe 的 25 MB / 约 25 分钟限制。对于更长的录音,请分段处理,并在客户端重新组装分离后的段落。
| 来源 | URL | 采集于 | |
|---|---|---|---|
| 发布日期 | ai.azure.com ↗ | 2026-08-10 | 未知 |
| 架构 | ai.azure.com ↗ | 2026-08-10 | 已核实 |
| API 端点 | developers.openai.com ↗ | 2026-05-28 | 已核实 |
| 语言识别 | ai.azure.com ↗ | 2026-08-10 | 未知 |
| 最大文件大小 | developers.openai.com ↗ | 2026-08-10 | 已核实 |
| 响应格式 | developers.openai.com ↗ | 2026-08-10 | 已核实 |
| 说话人标签 | developers.openai.com ↗ | 2026-08-10 | 已核实 |
| 支持音频格式 | developers.openai.com ↗ | 2026-08-10 | 已核实 |
| 许可 | openai.com ↗ | 2026-08-10 | 已核实 |
| AA-WER (base gpt-4o-transcribe, combined rank) | openai.com ↗ | 2026-08-10 | 未知 |
| FLEURS (multilingual WER — base gpt-4o-transcribe) | openai.com ↗ | 2026-08-10 | 已核实 |
| OpenAI 发布 gpt-4o-transcribe 的 2025 年 12 月快照,WER 进一步降低 | developers.openai.com ↗ | 2026-05-28 | 已核实 |
| GPT-4o Transcribe Diarize 在 OpenAI API 上可用 | ndurner.github.io ↗ | 2026-05-28 | 已核实 |
| gpt-4o-transcribe-diarize 与基础版 gpt-4o-transcribe 有何不同? | ndurner.github.io ↗ | 2026-05-28 | 待核实 |
| 能否使用自定义说话人名称而不是 A/B/C? | learn.microsoft.com ↗ | 2026-05-28 | 待核实 |
| gpt-4o-transcribe-diarize 是否支持 Realtime API? | community.openai.com ↗ | 2026-05-28 | 待核实 |
| gpt-4o-transcribe-diarize 是否支持 prompt 参数进行上下文偏置? | platform.openai.com ↗ | 2026-05-28 | 待核实 |
| gpt-4o-transcribe-diarize 的音频段限制是多少? | ndurner.github.io ↗ | 2026-05-28 | 待核实 |