返回模型列表

GPT-4o Transcribe 是 OpenAI 的下一代语音转文本模型,于 2025 年 3 月 20 日发布。基于 GPT-4o 多模态架构构建,它取代了传统的 whisper-1 API,在 99 种以上语言的词错误率(WER)上实现了显著改善。该模型利用 GPT-4o 的通用语言理解能力,更准确地转录技术术语、专有名词、混合语言内容和带口音的语音——这些都是 Whisper 历史上容易出现幻觉的领域。

该模型通过现有的 /v1/audio/transcriptions 端点提供服务,采用按分钟计费($0.006/分钟),适用于大规模转录场景。GPT-4o Transcribe 在行业标准中具备竞争力——Artificial Analysis 将其列为与 Speechmatics 和 AssemblyAI 并驾齐驱的顶级竞争者,综合准确率仅落后 ElevenLabs Scribe 一个百分点。OpenAI 发布了 2025 年 12 月快照(gpt-4o-transcribe-2025-12-15),在 Common Voice 和 FLEURS 基准测试上进一步降低了 WER。该模型是闭源的,仅通过 API 访问;与 Whisper 不同,没有开源权重版本。

适合使用
  • • 大规模通用转录(会议、播客、客服电话),定价具有竞争力——$0.006/分钟,大多数语言的 WER 均优于 Whisper。
  • • 需要准确转录技术/医疗/法律术语的应用——GPT-4o 的语言理解能力相比纯声学模型减少领域特定误识。
  • • OpenAI 生态集成——whisper-1 用户可无缝替换,相同的端点和 SDK,更高的准确率和有竞争力的定价。
  • • 覆盖 99 种以上语言的多语言转录,通过强化学习为主的训练方法,更好地处理口音、语码转换和不同语速。
不适合使用
  • • 完整的说话人分离(Diarization)——GPT-4o Transcribe 不原生识别谁在什么时候说话。这方面请使用 gpt-4o-transcribe-diarize(带说话人标签的独立模型)或 AssemblyAI。
  • • 需要逐字时间戳的实时流式转录——该模型以分块方式工作,不是真正的流式转录。实时字幕场景建议 Deepgram。
  • • 本地/隔离环境部署——GPT-4o Transcribe 是闭源且仅通过 API 访问的。自托管转录请使用开源的 Whisper 或 NVIDIA Parakeet,数据完全自主可控。
  • • Whisper 本已表现不佳的低资源语言——WER 改进集中在中高资源语言。此类场景建议使用专门的语音识别服务。
上下文长度
--
最大输出
--
音频价格按音频分钟
$0.0065每分钟音频
输入价格按音频分钟
$2.70每百万 Tokens

模态能力

音频→文本

能力

语音识别

价格明细

类型费率
音频$0.0065 每分钟音频
输入$2.70 每百万 Tokens
输出$10.80 每百万 Tokens
Audio input$6.48 每百万 Tokens
Estimated$0.0065 每分钟

request is estimated price per minute

支持参数

filelanguagepromptresponse_formattemperature

模型规格

发布日期2025年3月20日(初始快照);2025年12月15日更新openai.com ↗已核实
架构GPT-4o 多模态基础架构,并经过面向音频的专门预训练openai.com ↗已核实
API 端点/v1/audio/transcriptions(兼容 OpenAI SDK)developers.openai.com ↗已核实
支持语言数量OpenAI 未公开披露确切支持语言数量;OpenAI 文档说明该模型具备更好的语言识别能力,并在覆盖 100 多种语言的 FLEURS 评测中验证。openai.com ↗未知
训练方法大规模音频预训练 + 强化学习为主的 WER 降低方法openai.com ↗已核实
最大文件大小每次请求 25 MB(建议将较长音频分段,每段 < 25 分钟)tokenmix.ai ↗已核实
支持音频格式mp3、mp4、mpeg、mpga、m4a、wav、webmdevelopers.openai.com ↗已核实
许可闭源/专有(仅 API 访问,无开源权重版本)techcrunch.com ↗已核实

基准成绩

BenchmarkDistributionScoreSource
FLEURS (multilingual WER — all languages)
OpenAI 报告 GPT-4o Transcribe 在 FLEURS 所有语言评测中的 WER 均低于 Whisper v2 与 Whisper v3。FLEURS 覆盖 100 多种语言;OpenAI 在公告中未发布单一汇总分数。
Outperforms Whisper v2/v3 across all language evaluations per OpenAIopenai.com ↗
Artificial Analysis AA-WER (combined rank)
二级报道引用了 GPT-4o Transcribe 的 Artificial Analysis 排名,但 OpenAI 未公开发布该模型的官方 AA-WER 排名或综合分数。因此本页不将该二级排名视为已验证的厂商基准。
—未公开披露—
Common Voice & FLEURS (Dec 2025 snapshot)
OpenAI 表示,2025 年 12 月转录快照在无语言提示的 Common Voice 与 FLEURS 上相比旧模型有更低 WER,并在内部噪声评测中相较 Whisper v2 幻觉减少约 90%,相较此前 GPT-4o-transcribe 模型减少约 70%。OpenAI 未公开该模型完整的 Common Voice/FLEURS 数值表。
Lower WER than prior models; exact numeric deltas not publicly discloseddevelopers.openai.com ↗

API 使用示例

所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。

cURL
curl https://api.therouter.ai/v1/audio/transcriptions   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -F "model=openai/gpt-4o-transcribe"   -F "file=@speech.mp3"

API 使用指南

完整 API 参考 →

音频转录

通过 TheRouter 的兼容 OpenAI 的 /v1/audio/transcriptions 端点,使用 GPT-4o Transcribe 转录音频文件。

cURL
curl https://api.therouter.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -F "file=@recording.mp3" \
  -F "model=openai/gpt-4o-transcribe" \
  -F "response_format=json"

openai 其他模型

同类模型

跨供应商的相似能力档位

动态与变更

2025-12-15

OpenAI 发布 2025 年 12 月快照,WER 进一步降低

OpenAI 为 gpt-4o-transcribe 推出了 2025-12-15 更新快照,在 Common Voice 和 FLEURS 基准上的准确率有所提升。此次更新降低了 WER,特别是在零样本语言检测场景中。传统的 whisper-1 和初始的 2025-03-20 快照预计于 2026 年 6 月退役。

TheRouter 编辑重写developers.openai.com ↗
2025-03-20

OpenAI 发布 gpt-4o-transcribe 和 gpt-4o-mini-transcribe

OpenAI 推出基于 GPT-4o 架构的新一代语音转文本模型,取代了传统的 whisper-1 端点。模型在 99+ 语言上实现显著 WER 降低,通过强化学习为主的训练减少了幻觉,改善了带口音语音、技术术语和嘈杂环境的准确率。注意:与 Whisper 不同,不开源。

TheRouter 编辑重写openai.com ↗

常见问题

gpt-4o-transcribe 与 whisper-1 有何不同?

GPT-4o Transcribe 使用 GPT-4o 多模态架构替代 Whisper 的专用编码器-解码器架构。它在 99 种以上语言上实现更低的 WER(特别是在带口音语音和技术术语上),更不容易产生幻觉,并按分钟计费($0.006/分钟 vs Whisper 的按 token 计费)。但与 Whisper(MIT 许可,可自托管)不同,它是闭源且仅 API 访问的。通过 TheRouter 可以以有竞争力的路由价格访问。

TheRouter 编辑重写openai.com ↗
gpt-4o-transcribe 支持说话人分离吗?

不,基础版 gpt-4o-transcribe 不识别不同说话者。它返回单一转录文本,不带说话人标签。如需要说话人分离,请使用 gpt-4o-transcribe-diarize 模型(通过 TheRouter 以 openai/gpt-4o-transcribe-diarize 访问)或 AssemblyAI 等第三方服务。

TheRouter 编辑重写tokenmix.ai ↗
可以获取逐字时间戳吗?

本机不支持。response_format=verbose_json 模式仅返回段落级时间戳。如需逐字精度,建议使用 Deepgram 或 AssemblyAI,它们原生支持逐字时间戳。

TheRouter 编辑重写tokenmix.ai ↗
最大音频文件大小是多少?

每次请求 25 MB。对于较长音频,请分割为最大 25 MB(约 25 分钟)的片段。该模型没有正式的批量转录端点,因此大型媒体库需要自行构建队列。

TheRouter 编辑重写developers.openai.com ↗
gpt-4o-transcribe 对哪些语言效果最好?

该模型支持 99+ 种语言,在英语、西班牙语、法语、德语、意大利语、葡萄牙语、中文(普通话)、日语、韩语、阿拉伯语和俄语上表现最佳。与 Whisper 相比,WER 改进最显著的是 Whisper 之前表现不佳的语言(例如泰米尔语、泰卢固语、马拉雅拉姆语等印度和达罗毗荼语言)。对于覆盖不好的语言,建议使用专门的语音识别服务或自托管 Whisper 模型。

TheRouter 编辑重写techcrunch.com ↗
gpt-4o-transcribe 可以通过 TheRouter 使用吗?

是的。使用 model=openai/gpt-4o-transcribe,设置 baseURL=https://api.therouter.ai/v1 和标准 OpenAI SDK。TheRouter 以有竞争力的价格将您的请求路由到 OpenAI 转录 API 的最佳可用端点。

事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
发布日期openai.com ↗2026-05-28已核实
架构openai.com ↗2026-08-25已核实
API 端点developers.openai.com ↗2026-05-28已核实
支持语言数量openai.com ↗2026-08-25未知
训练方法openai.com ↗2026-05-28已核实
最大文件大小tokenmix.ai ↗2026-05-28已核实
支持音频格式developers.openai.com ↗2026-08-25已核实
许可techcrunch.com ↗2026-05-28已核实
FLEURS (multilingual WER — all languages)openai.com ↗2026-08-25已核实
Artificial Analysis AA-WER (combined rank)openai.com ↗2026-08-25未知
Common Voice & FLEURS (Dec 2025 snapshot)developers.openai.com ↗2026-08-25已核实
OpenAI 发布 2025 年 12 月快照,WER 进一步降低developers.openai.com ↗2026-05-28已核实
OpenAI 发布 gpt-4o-transcribe 和 gpt-4o-mini-transcribeopenai.com ↗2026-05-28已核实
gpt-4o-transcribe 与 whisper-1 有何不同?openai.com ↗2026-05-28待核实
gpt-4o-transcribe 支持说话人分离吗?tokenmix.ai ↗2026-05-28待核实
可以获取逐字时间戳吗?tokenmix.ai ↗2026-05-28待核实
最大音频文件大小是多少?developers.openai.com ↗2026-05-28待核实
gpt-4o-transcribe 对哪些语言效果最好?techcrunch.com ↗2026-05-28待核实
gpt-4o-transcribe 可以通过 TheRouter 使用吗?api.therouter.ai ↗2026-05-28待核实
帮助与联系