返回模型列表

GPT-4o Mini Transcribe

openaiopenai/gpt-4o-mini-transcribe

Speech-to-text model powered by GPT-4o mini.

GPT-4o Mini Transcribe 是 OpenAI 基于 GPT-4o Mini 架构推出的高性价比语音转文本模型。与最初的 Whisper 模型相比,它在词错误率(WER)、语言识别精度和整体准确率上都有显著提升。该模型专为开发者在较低价格点上获得可靠转录能力而设计——相比全尺寸的 GPT-4o Transcribe,它仍然受益于强化学习增强的准确度。

OpenAI 在训练中采用了强化学习范式,将转录准确度推至业界领先水平,同时减少了幻觉。该模型支持 99 种以上语言,对口音、嘈杂环境和语速变化的处理能力优于之前的 Whisper 模型。在 FLEURS 多语言基准测试中,GPT-4o Transcribe(全尺寸版)在主要语言上均实现了个位数 WER;GPT-4o Mini Transcribe 紧随其后,作为成本优化的替代方案。

适合使用
  • • 呼叫中心转录与分析 — 在口音和嘈杂音频中保持高准确度,成本有竞争力。
  • • 会议纪要自动化 — 将录制或实时会议音频转录为可搜索文本。
  • • 内容字幕生成 — 为视频内容生成 99 种以上语言的字幕。
  • • 语音 Agent 管线 — 在语音应用中转录用户语音,供下游大语言模型处理。
不适合使用
  • • 实时语音到语音场景 — 建议使用 OpenAI 的 Realtime API 模型(gpt-realtime-*)以获得最小端到端延迟。
  • • 预算灵活且需要最高准确率的场景 — GPT-4o Transcribe(全尺寸)或 ElevenLabs Scribe 在独立基准测试中可能更优。
  • • 说话人分离 — 如需识别说话人,请使用 openai/gpt-4o-transcribe-diarize。
上下文长度
--
最大输出
--
音频价格按音频分钟
$0.0032每分钟音频
输入价格按音频分钟
$1.35每百万 Tokens

模态能力

音频→文本

能力

语音识别

价格明细

类型费率
音频$0.0032 每分钟音频
输入$1.35 每百万 Tokens
输出$5.40 每百万 Tokens
Audio input$3.24 每百万 Tokens
Estimated$0.0032 每分钟

request is estimated price per minute

支持参数

filelanguagepromptresponse_formattemperature

模型规格

发布日期2025 年 3 月 20 日openai.com ↗已核实
支持语言99 种以上语言,通过 ISO-639-1 语言代码指定openai.com ↗已核实
架构GPT-4o Mini,经过强化学习增强语音预训练openai.com ↗已核实
输入音频格式mp3, mp4, mpeg, mpga, m4a, wav, webm, flac, ogg, ogaplatform.openai.com ↗已核实
最大文件大小25 MBplatform.openai.com ↗已核实
训练数据截止未公开披露未知

基准成绩

BenchmarkDistributionScoreSource
FLEURS English WER
OpenAI 博客中报告 gpt-4o-transcribe(全尺寸版)在 FLEURS 英语子集上 WER 为 2.46%。Mini 变体的 WER 预计会更高,但确切数值尚未独立发布。
~2.46% (gpt-4o-transcribe reference)%openai.com ↗
FLEURS Multilingual
OpenAI 报告在 FLEURS 主要语言上均达到个位数 WER。gpt-4o-transcribe 系列在所有语言评估中均匹配或优于 Whisper v2/v3。
Single-digit WER across major languagesopenai.com ↗

API 使用示例

所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。

cURL
curl https://api.therouter.ai/v1/audio/transcriptions   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -F "model=openai/gpt-4o-mini-transcribe"   -F "file=@speech.mp3"

API 使用指南

语音转文字

通过 TheRouter 的标准 OpenAI /v1/audio/transcriptions 端点转录音频文件。支持多种音频格式和可选语言提示以提高准确度。

cURL
curl https://api.therouter.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -F "file=@recording.mp3" \
  -F "model=openai/gpt-4o-mini-transcribe" \
  -F "response_format=json" \
  -F "language=en"

openai 其他模型

同类模型

跨供应商的相似能力档位

动态与变更

2025-03-20

OpenAI 发布下一代音频模型,包括 GPT-4o Mini Transcribe

OpenAI 发布了 gpt-4o-transcribe、gpt-4o-mini-transcribe 和 gpt-4o-mini-tts — 一个新的语音转文本和文本转语音模型家族。转录模型采用重强化学习训练,在 FLEURS 多语言基准测试中全面超越 Whisper v2/v3。

TheRouter 编辑重写openai.com ↗

常见问题

GPT-4o Mini Transcribe 和 Whisper-1 有什么区别?

GPT-4o Mini Transcribe 使用 GPT-4o Mini 作为骨干网,并经过强化学习增强预训练,在所有评估语言中实现了显著更低的词错误率。对口音、嘈杂环境和语速变化的处理能力优于 Whisper。Whisper-1 仍然可用于遗留集成,但新项目推荐使用新一代模型。

GPT-4o Mini Transcribe 可以用于实时/流式转录吗?

不可以 — 该模型仅支持标准的 /v1/audio/transcriptions 端点,处理上传的音频文件。实时流式转录请使用 OpenAI 的 Realtime API 模型(gpt-realtime-*),支持基于 WebSocket 的音频流,延迟更低。

TheRouter 编辑重写
转录输出的格式是什么?

支持的响应格式包括:json(默认)、text、srt(SubRip 字幕格式)、verbose_json(含时间戳和分段)以及 vtt(WebVTT)。json 和 verbose_json 格式提供结构化输出,可用于下游管线。

事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
发布日期openai.com ↗2026-05-28已核实
支持语言openai.com ↗2026-05-28已核实
架构openai.com ↗2026-05-28已核实
输入音频格式platform.openai.com ↗2026-05-28已核实
最大文件大小platform.openai.com ↗2026-05-28已核实
训练数据截止——未知
FLEURS English WERopenai.com ↗2026-05-28待核实
FLEURS Multilingualopenai.com ↗2026-05-28待核实
OpenAI 发布下一代音频模型,包括 GPT-4o Mini Transcribeopenai.com ↗2026-05-28已核实
GPT-4o Mini Transcribe 和 Whisper-1 有什么区别?openai.com ↗2026-05-28待核实
转录输出的格式是什么?platform.openai.com ↗2026-05-28待核实
帮助与联系