返回模型列表

GPT-4o Transcribe Diarize

openaiopenai/gpt-4o-transcribe-diarize

Transcription model that identifies who is speaking when.

GPT-4o Transcribe Diarize 是 OpenAI 内置说话人分离(Diarization)功能的语音转文本模型,约于 2025 年 10 月首次被报道。基于与基础版 gpt-4o-transcribe 相同的 GPT-4o 多模态架构,它原生增加了识别「谁在什么时候说话」的能力——返回说话人标签("A:"、"B:" 等)和段落级时间戳。这使得它成为以往需要将独立语音识别模型通过聚类后端流水线才能实现的直接替代方案。

该模型使用相同的 /v1/audio/transcriptions 端点,定价与基础转录模型相同(约 $0.0066/分钟)。关键区别在于 diarized_json 响应格式,它以结构化段落而非纯文本的形式返回。与基础模型不同,gpt-4o-transcribe-diarize 不支持提示词(prompting)或 Realtime API,音频块限制为 1,400 秒。说话人标签自动分配为 A/B/C,除非提供了明确的说话人引用。据 OpenAI 的 Pete Bakkum 表示,其词错误率(WER)「大致相当于」基础版 gpt-4o-transcribe——如果您不需要说话人分离,请使用基础模型。

适合使用
  • • 客服通话转录——通过原生说话人标签区分座席与客户对话,无需单独的说话人分离流水线。使用 diarized_json 进行结构化通话后分析。
  • • 会议转录和纪要——在多参与方的对话中自动将发言归因到说话人。结合 TheRouter 的转录端点实现简单的 SDK 集成。
  • • 访谈和证词转录——无需后处理即可实现可靠的说话人分离。1,400 秒的音频块限制覆盖了大多数单次访谈需求。
  • • 覆盖 100 种以上语言的多语言分离式转录——统一的 GPT-4o 基础架构在一次推理中完成语言检测和说话人归属,简化国际语音工作流。
不适合使用
  • • 无需说话人分离的简单转录——请使用 gpt-4o-transcribe(相同端点,相同定价,无需分离开销,延迟略低)。
  • • 需要说话人标签的实时流式转录——gpt-4o-transcribe-diarize 不支持 Realtime API。如需带说话人分离的实时字幕,请考虑 Deepgram 或 AssemblyAI。
  • • 依赖提示词偏置的转录——该模型不支持 prompt 参数(与 gpt-4o-transcribe 不同)。需要技术/医学术语的上下文偏置转录时,请使用基础模型。
  • • 本地/隔离环境部署——GPT-4o Transcribe Diarize 是闭源且仅通过 API 访问的。自托管分离式转录请使用开源 WhisperX 或 NVIDIA Parakeet + 聚类后端。
上下文长度
--
最大输出
--
音频价格按音频分钟
$0.0071每分钟音频
输入价格按音频分钟
$2.70每百万 Tokens

模态能力

音频→文本

能力

语音识别

价格明细

类型费率
音频$0.0071 每分钟音频
输入$2.70 每百万 Tokens
输出$10.80 每百万 Tokens
Audio input$6.48 每百万 Tokens
Estimated$0.0065 每分钟

request is price per minute (official: same $0.006/min as gpt-4o-transcribe; the earlier +10% diarization surcharge does not exist on OpenAI's rate card)

支持参数

filelanguagepromptresponse_formattemperature

模型规格

发布日期OpenAI 未公开披露;Azure Foundry 将该模型列为正式可用ai.azure.com ↗未知
架构基于 GPT-4o 的语音转文本模型,支持说话人分离式转录ai.azure.com ↗已核实
API 端点/v1/audio/transcriptions(兼容 OpenAI SDK)developers.openai.com ↗已核实
语言识别改进的语音转文本语言识别;分离版本的确切支持语言数量未公开披露ai.azure.com ↗未知
最大文件大小Transcriptions API 文件上传限制为 25 MBdevelopers.openai.com ↗已核实
响应格式diarized_json 返回带说话人标签和开始/结束时间戳的段落,并包含完整转录文本developers.openai.com ↗已核实
说话人标签提供说话人参考时使用已知说话人名称;否则按 A、B、... 顺序标记说话人developers.openai.com ↗已核实
支持音频格式mp3, mp4, mpeg, mpga, m4a, wav, webmdevelopers.openai.com ↗已核实
许可闭源/专有(仅 API 访问,无开源权重版本)openai.com ↗已核实

基准成绩

BenchmarkDistributionScoreSource
AA-WER (base gpt-4o-transcribe, combined rank)
Artificial Analysis 为基础版 gpt-4o-transcribe 进行的独立语音识别评测。据 OpenAI,分离变体的 WER 预计相当。截至 2026 年 5 月,尚无 gpt-4o-transcribe-diarize 的独立 AA-WER 分数。
—未公开披露—
FLEURS (multilingual WER — base gpt-4o-transcribe)
OpenAI 报告,基础版 gpt-4o-transcribe 架构在 FLEURS(100+语言)上持续优于 Whisper。分离变体共享相同的多语言底板。具体总分未公开。
Improved WER over Whisper v2/v3 across all language groupsopenai.com ↗

API 使用示例

所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。

cURL
curl https://api.therouter.ai/v1/audio/transcriptions   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -F "model=openai/gpt-4o-transcribe-diarize"   -F "file=@speech.mp3"

API 使用指南

完整 API 参考 →

带说话人分离的音频转录

转录多说话人音频文件,使用 diarized_json 响应格式获取带说话人标签的段落。

cURL
curl https://api.therouter.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -F "file=@meeting.mp3" \
  -F "model=openai/gpt-4o-transcribe-diarize" \
  -F "response_format=diarized_json"

openai 其他模型

同类模型

跨供应商的相似能力档位

动态与变更

2025-12-15

OpenAI 发布 gpt-4o-transcribe 的 2025 年 12 月快照,WER 进一步降低

OpenAI 为 gpt-4o-transcribe 推出了 2025-12-15 更新快照,在 Common Voice 和 FLEURS 基准上的准确率有所提升。相同底板也驱动着分离变体。传统 whisper-1 和初始 gpt-4o-transcribe 2025-03-20 快照预计于 2026 年 6 月退役,使分离模型成为剩余的转录选项之一。

TheRouter 编辑重写developers.openai.com ↗
2025-10-24

GPT-4o Transcribe Diarize 在 OpenAI API 上可用

OpenAI 悄悄将 gpt-4o-transcribe-diarize 模型添加到 /v1/audio/transcriptions 端点,在 GPT-4o Transcribe 底板之上提供原生说话人分离功能。该模型使用 diarized_json 响应格式,返回带说话人标签的段落和时间戳。早期报告指出 1,400 秒音频块限制和 Realtime API 不支持为其主要约束。

TheRouter 编辑重写ndurner.github.io ↗

常见问题

gpt-4o-transcribe-diarize 与基础版 gpt-4o-transcribe 有何不同?

分离变体增加了原生说话人识别——通过 diarized_json 响应格式返回带说话人标签(A:、B: 等)和开始/结束时间戳的结构化段落。基础版 gpt-4o-transcribe 返回纯文本,无说话人归属。注意事项:分离模型不支持 prompt 参数、不支持 Realtime API、音频段限制为 1,400 秒。据 OpenAI 称 WER「大致相当」,因此如不需要说话人分离,请使用基础模型。

TheRouter 编辑重写ndurner.github.io ↗
能否使用自定义说话人名称而不是 A/B/C?

说话人标签默认为 A:、B:、C: 等。您可以为说话人归属提供音频引用(将段落链接到已知语音特征),但模型不会永久学习名称——这是每次请求的归属,不是持久的说话人识别。

TheRouter 编辑重写learn.microsoft.com ↗
gpt-4o-transcribe-diarize 是否支持 Realtime API?

不支持。gpt-4o-transcribe-diarize 仅通过 /v1/audio/transcriptions 端点提供基于文件/批次的转录。它不支持 Realtime API 或流式音频输入。如需实时转录,可使用 gpt-4o-mini-transcribe(非分离)通过 Realtime API,或考虑 Deepgram 和 AssemblyAI 提供的流式说话人分离。

TheRouter 编辑重写community.openai.com ↗
gpt-4o-transcribe-diarize 是否支持 prompt 参数进行上下文偏置?

不支持。这是与基础版 gpt-4o-transcribe 的关键区别。根据 OpenAI 的语音转文本指南,gpt-4o-transcribe-diarize 目前不支持提示词(prompting)。如果需要对领域特定术语进行上下文偏置,请使用基础版 gpt-4o-transcribe 模型。

TheRouter 编辑重写platform.openai.com ↗
gpt-4o-transcribe-diarize 的音频段限制是多少?

每次请求限制约 1,400 秒(约 23 分钟)的音频。这短于基础版 gpt-4o-transcribe 的 25 MB / 约 25 分钟限制。对于更长的录音,请分段处理,并在客户端重新组装分离后的段落。

TheRouter 编辑重写ndurner.github.io ↗
事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
发布日期ai.azure.com ↗2026-08-10未知
架构ai.azure.com ↗2026-08-10已核实
API 端点developers.openai.com ↗2026-05-28已核实
语言识别ai.azure.com ↗2026-08-10未知
最大文件大小developers.openai.com ↗2026-08-10已核实
响应格式developers.openai.com ↗2026-08-10已核实
说话人标签developers.openai.com ↗2026-08-10已核实
支持音频格式developers.openai.com ↗2026-08-10已核实
许可openai.com ↗2026-08-10已核实
AA-WER (base gpt-4o-transcribe, combined rank)openai.com ↗2026-08-10未知
FLEURS (multilingual WER — base gpt-4o-transcribe)openai.com ↗2026-08-10已核实
OpenAI 发布 gpt-4o-transcribe 的 2025 年 12 月快照,WER 进一步降低developers.openai.com ↗2026-05-28已核实
GPT-4o Transcribe Diarize 在 OpenAI API 上可用ndurner.github.io ↗2026-05-28已核实
gpt-4o-transcribe-diarize 与基础版 gpt-4o-transcribe 有何不同?ndurner.github.io ↗2026-05-28待核实
能否使用自定义说话人名称而不是 A/B/C?learn.microsoft.com ↗2026-05-28待核实
gpt-4o-transcribe-diarize 是否支持 Realtime API?community.openai.com ↗2026-05-28待核实
gpt-4o-transcribe-diarize 是否支持 prompt 参数进行上下文偏置?platform.openai.com ↗2026-05-28待核实
gpt-4o-transcribe-diarize 的音频段限制是多少?ndurner.github.io ↗2026-05-28待核实
帮助与联系