OpenAI 发布 2025 年 12 月快照,WER 进一步降低
OpenAI 为 gpt-4o-transcribe 推出了 2025-12-15 更新快照,在 Common Voice 和 FLEURS 基准上的准确率有所提升。此次更新降低了 WER,特别是在零样本语言检测场景中。传统的 whisper-1 和初始的 2025-03-20 快照预计于 2026 年 6 月退役。
Speech-to-text model powered by GPT-4o.
GPT-4o Transcribe 是 OpenAI 的下一代语音转文本模型,于 2025 年 3 月 20 日发布。基于 GPT-4o 多模态架构构建,它取代了传统的 whisper-1 API,在 99 种以上语言的词错误率(WER)上实现了显著改善。该模型利用 GPT-4o 的通用语言理解能力,更准确地转录技术术语、专有名词、混合语言内容和带口音的语音——这些都是 Whisper 历史上容易出现幻觉的领域。
该模型通过现有的 /v1/audio/transcriptions 端点提供服务,采用按分钟计费($0.006/分钟),适用于大规模转录场景。GPT-4o Transcribe 在行业标准中具备竞争力——Artificial Analysis 将其列为与 Speechmatics 和 AssemblyAI 并驾齐驱的顶级竞争者,综合准确率仅落后 ElevenLabs Scribe 一个百分点。OpenAI 发布了 2025 年 12 月快照(gpt-4o-transcribe-2025-12-15),在 Common Voice 和 FLEURS 基准测试上进一步降低了 WER。该模型是闭源的,仅通过 API 访问;与 Whisper 不同,没有开源权重版本。
| 类型 | 费率 |
|---|---|
| 音频 | $0.0065 每分钟音频 |
| 输入 | $2.70 每百万 Tokens |
| 输出 | $10.80 每百万 Tokens |
| Audio input | $6.48 每百万 Tokens |
| Estimated | $0.0065 每分钟 |
request is estimated price per minute
| 发布日期 | 2025年3月20日(初始快照);2025年12月15日更新openai.com ↗ | 已核实 |
| 架构 | GPT-4o 多模态基础架构,并经过面向音频的专门预训练openai.com ↗ | 已核实 |
| API 端点 | /v1/audio/transcriptions(兼容 OpenAI SDK)developers.openai.com ↗ | 已核实 |
| 支持语言数量 | OpenAI 未公开披露确切支持语言数量;OpenAI 文档说明该模型具备更好的语言识别能力,并在覆盖 100 多种语言的 FLEURS 评测中验证。openai.com ↗ | 未知 |
| 训练方法 | 大规模音频预训练 + 强化学习为主的 WER 降低方法openai.com ↗ | 已核实 |
| 最大文件大小 | 每次请求 25 MB(建议将较长音频分段,每段 < 25 分钟)tokenmix.ai ↗ | 已核实 |
| 支持音频格式 | mp3、mp4、mpeg、mpga、m4a、wav、webmdevelopers.openai.com ↗ | 已核实 |
| 许可 | 闭源/专有(仅 API 访问,无开源权重版本)techcrunch.com ↗ | 已核实 |
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
FLEURS (multilingual WER — all languages) OpenAI 报告 GPT-4o Transcribe 在 FLEURS 所有语言评测中的 WER 均低于 Whisper v2 与 Whisper v3。FLEURS 覆盖 100 多种语言;OpenAI 在公告中未发布单一汇总分数。 | Outperforms Whisper v2/v3 across all language evaluations per OpenAI | openai.com ↗ | |
Artificial Analysis AA-WER (combined rank) 二级报道引用了 GPT-4o Transcribe 的 Artificial Analysis 排名,但 OpenAI 未公开发布该模型的官方 AA-WER 排名或综合分数。因此本页不将该二级排名视为已验证的厂商基准。 | — | 未公开披露 | — |
Common Voice & FLEURS (Dec 2025 snapshot) OpenAI 表示,2025 年 12 月转录快照在无语言提示的 Common Voice 与 FLEURS 上相比旧模型有更低 WER,并在内部噪声评测中相较 Whisper v2 幻觉减少约 90%,相较此前 GPT-4o-transcribe 模型减少约 70%。OpenAI 未公开该模型完整的 Common Voice/FLEURS 数值表。 | Lower WER than prior models; exact numeric deltas not publicly disclosed | developers.openai.com ↗ |
所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。
curl https://api.therouter.ai/v1/audio/transcriptions -H "Authorization: Bearer $THE_ROUTER_API_KEY" -F "model=openai/gpt-4o-transcribe" -F "file=@speech.mp3"通过 TheRouter 的兼容 OpenAI 的 /v1/audio/transcriptions 端点,使用 GPT-4o Transcribe 转录音频文件。
curl https://api.therouter.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-F "file=@recording.mp3" \
-F "model=openai/gpt-4o-transcribe" \
-F "response_format=json"OpenAI 为 gpt-4o-transcribe 推出了 2025-12-15 更新快照,在 Common Voice 和 FLEURS 基准上的准确率有所提升。此次更新降低了 WER,特别是在零样本语言检测场景中。传统的 whisper-1 和初始的 2025-03-20 快照预计于 2026 年 6 月退役。
OpenAI 推出基于 GPT-4o 架构的新一代语音转文本模型,取代了传统的 whisper-1 端点。模型在 99+ 语言上实现显著 WER 降低,通过强化学习为主的训练减少了幻觉,改善了带口音语音、技术术语和嘈杂环境的准确率。注意:与 Whisper 不同,不开源。
GPT-4o Transcribe 使用 GPT-4o 多模态架构替代 Whisper 的专用编码器-解码器架构。它在 99 种以上语言上实现更低的 WER(特别是在带口音语音和技术术语上),更不容易产生幻觉,并按分钟计费($0.006/分钟 vs Whisper 的按 token 计费)。但与 Whisper(MIT 许可,可自托管)不同,它是闭源且仅 API 访问的。通过 TheRouter 可以以有竞争力的路由价格访问。
不,基础版 gpt-4o-transcribe 不识别不同说话者。它返回单一转录文本,不带说话人标签。如需要说话人分离,请使用 gpt-4o-transcribe-diarize 模型(通过 TheRouter 以 openai/gpt-4o-transcribe-diarize 访问)或 AssemblyAI 等第三方服务。
本机不支持。response_format=verbose_json 模式仅返回段落级时间戳。如需逐字精度,建议使用 Deepgram 或 AssemblyAI,它们原生支持逐字时间戳。
每次请求 25 MB。对于较长音频,请分割为最大 25 MB(约 25 分钟)的片段。该模型没有正式的批量转录端点,因此大型媒体库需要自行构建队列。
该模型支持 99+ 种语言,在英语、西班牙语、法语、德语、意大利语、葡萄牙语、中文(普通话)、日语、韩语、阿拉伯语和俄语上表现最佳。与 Whisper 相比,WER 改进最显著的是 Whisper 之前表现不佳的语言(例如泰米尔语、泰卢固语、马拉雅拉姆语等印度和达罗毗荼语言)。对于覆盖不好的语言,建议使用专门的语音识别服务或自托管 Whisper 模型。
是的。使用 model=openai/gpt-4o-transcribe,设置 baseURL=https://api.therouter.ai/v1 和标准 OpenAI SDK。TheRouter 以有竞争力的价格将您的请求路由到 OpenAI 转录 API 的最佳可用端点。
| 来源 | URL | 采集于 | |
|---|---|---|---|
| 发布日期 | openai.com ↗ | 2026-05-28 | 已核实 |
| 架构 | openai.com ↗ | 2026-08-25 | 已核实 |
| API 端点 | developers.openai.com ↗ | 2026-05-28 | 已核实 |
| 支持语言数量 | openai.com ↗ | 2026-08-25 | 未知 |
| 训练方法 | openai.com ↗ | 2026-05-28 | 已核实 |
| 最大文件大小 | tokenmix.ai ↗ | 2026-05-28 | 已核实 |
| 支持音频格式 | developers.openai.com ↗ | 2026-08-25 | 已核实 |
| 许可 | techcrunch.com ↗ | 2026-05-28 | 已核实 |
| FLEURS (multilingual WER — all languages) | openai.com ↗ | 2026-08-25 | 已核实 |
| Artificial Analysis AA-WER (combined rank) | openai.com ↗ | 2026-08-25 | 未知 |
| Common Voice & FLEURS (Dec 2025 snapshot) | developers.openai.com ↗ | 2026-08-25 | 已核实 |
| OpenAI 发布 2025 年 12 月快照,WER 进一步降低 | developers.openai.com ↗ | 2026-05-28 | 已核实 |
| OpenAI 发布 gpt-4o-transcribe 和 gpt-4o-mini-transcribe | openai.com ↗ | 2026-05-28 | 已核实 |
| gpt-4o-transcribe 与 whisper-1 有何不同? | openai.com ↗ | 2026-05-28 | 待核实 |
| gpt-4o-transcribe 支持说话人分离吗? | tokenmix.ai ↗ | 2026-05-28 | 待核实 |
| 可以获取逐字时间戳吗? | tokenmix.ai ↗ | 2026-05-28 | 待核实 |
| 最大音频文件大小是多少? | developers.openai.com ↗ | 2026-05-28 | 待核实 |
| gpt-4o-transcribe 对哪些语言效果最好? | techcrunch.com ↗ | 2026-05-28 | 待核实 |
| gpt-4o-transcribe 可以通过 TheRouter 使用吗? | api.therouter.ai ↗ | 2026-05-28 | 待核实 |