GPT-Realtime-2.1 与 2.1-Mini:每位 AI 运营商现在都需要做出的语音路由决策
OpenAI 于 7 月 6 日发布了 GPT-Realtime-2.1 和 GPT-Realtime-2.1-mini。双层模型结构、可配置的推理力度与新的音频定价基准,正在改变运营商路由语音 agent 流量的方式。
归档条目:由 AI 根据所引信源辅助生成,发布时未经逐篇审阅。责任编辑:Joe Werner。

OpenAI 于 7 月 6 日发布了两款新的实时语音模型:GPT-Realtime-2.1 和 GPT-Realtime-2.1-mini。此次更新为实时语音工作负载引入了双层架构——一个完整推理模型与一个更快、成本更低的蒸馏版本——并支持可配置的推理力度(reasoning effort),可在延迟和输出质量之间灵活权衡。对于构建语音 agent 或通过 AI 网关路由语音流量的运营商而言,这次发布同时改变了三件事:模型选择决策、成本结构,以及延迟预期。
发生了什么
GPT-Realtime-2.1 是一款经过更新的实时推理模型,在字母数字识别、静音与噪声处理以及打断行为方面均有所改进。GPT-Realtime-2.1-mini 是针对速度和成本优化的蒸馏版本,适合延迟敏感型高并发语音应用。
两款模型均通过 Realtime API(v1/realtime)提供。GPT-Realtime-2.1 定价:
- 文本 token:输入 $4.00 / 输出 $24.00(每百万 token,缓存输入 $0.40)
- 音频 token:输入 $32.00 / 输出 $64.00(每百万 token,缓存输入 $0.40)
- 图像 token:输入 $5.00(每百万 token,缓存输入 $0.50)
GPT-Realtime-2.1 支持可配置的推理力度,运营商可以在快速低力度响应与较慢高力度推理之间灵活调节,具体取决于应用场景。更高的推理力度会增加延迟和输出 token 消耗——这一质量与成本的权衡现在直接落在路由层。
GPT-Realtime-2.1-mini 是蒸馏模型:速度更快、成本更低,专为轮次切换优先于深度推理的实时语音场景而设计。
为什么这对 AI 工程团队很重要
双模型结构意味着"使用 Realtime API"不再是单一的路由决策。团队现在需要决定:
-
按工作负载类型选择全量版或 mini 版。 GPT-Realtime-2.1 适合处理复杂查询的面向用户语音 agent,例如金融或医疗问题、多步骤指令,以及对准确性和上下文追踪要求较高的场景。GPT-Realtime-2.1-mini 适合高并发、延迟敏感型流程:IVR 意图识别、实时转录与路由、对话式 FAQ,或轮次切换密集的使用场景。
-
推理力度作为路由参数。 GPT-Realtime-2.1 的可配置推理力度,实际上是在同一模型内的质量层级选择器。运营商在处理混合语音工作负载时,可以对低复杂度轮次使用
low力度,并在检测到复杂意图时升级为high力度——无需切换 endpoint。这是一种新的路由模式,语音路由策略需要将其纳入考量。 -
规模化场景下的音频 token 定价。 音频输入 $32.00/MTok、音频输出 $64.00/MTok 是实时语音工作负载的主要成本驱动因素。将所有流量默认路由到 GPT-Realtime-2.1 的策略,将比将常规交互路由到 2.1-mini 的策略花费多得多。对于每天处理数百万语音轮次的团队而言,路由策略直接决定了月度账单。
-
字母数字识别与打断行为改进。 2.1 更新专门提到了字母数字识别的提升——对于处理 ID、订单号、电话号码和验证码的语音 agent 至关重要——以及打断处理改进。这些可靠性提升影响哪个质量层级值得承接生产流量。
路由层的视角
对于通过 AI gateway 路由语音流量的团队,2.1 版本构建了分层路由模型,与文本 workload 的现有策略如出一辙:
决策框架:
| 信号 | 路由目标 |
|---|---|
| 复杂多轮查询、金融/医疗场景 | GPT-Realtime-2.1,推理力度:high |
| 一般对话查询、中等复杂度 | GPT-Realtime-2.1,推理力度:low |
| 高并发、延迟关键、意图简单 | GPT-Realtime-2.1-mini |
| 2.1 触达速率限制时的 fallback | GPT-Realtime-2.1-mini |
推理力度参数值得特别关注。与需要路由到不同模型 ID 的全量/mini 切分不同,推理力度是 GPT-Realtime-2.1 的逐请求参数。这意味着语音网关可以根据转录文本或会话上下文实现意图复杂度检测,并在不改变下游 endpoint 的情况下传递相应的力度级别。对于希望保持单一模型 endpoint 同时按轮次类型区分成本和质量的运营商而言,这是一种实用的模式。
迁移前的成本建模: 更新路由策略前,按 2.1 定价基准计算当前音频 token 量。若现有 workload 运行在 GPT-Realtime-2 上,对比每音频 token 费率,评估可靠性改进是否能证明成本差异的合理性。
速率限制规划: 两款模型可能各自维护独立 rate limit 池。当 2.1 触达速率限制时,fallback 到 2.1-mini 而非直接失败——对大多数轮次而言质量可接受。
TheRouter 用户应关注和尝试的内容
如果您通过 TheRouter 路由语音 agent 流量,2.1 版本发布是重新审视 provider 路由策略的好时机。检查当前的模型 ID 配置,判断 2.1 与 2.1-mini 的分流策略是否适合您的工作负载组合。模型目录 追踪可用的模型 ID;在更新生产路由规则前,请确认两款新模型均已出现在列表中。
推理力度参数并非传统意义上的路由标志——它是请求层面的属性。语音网关团队应评估路由层是否能够从上游意图分类传递力度提示,或者是否更简单的策略(对超过长度阈值的所有轮次使用全量模型)就已足够。
最后,审查语音工作负载的 fallback 链。有了双层实时模型家族,fallback 优先级应为:主层(2.1 或 2.1-mini,根据策略)→ 对立层 → 优雅降级。
相关阅读
AI 路由新闻与供应商动态 →
GPT-Live 语音 API 路由:全双工语音把委派策略变成新的控制点
GPT-Live 语音 API 路由正在成为新的运营决策:OpenAI 将全双工语音、后台模型委派和实时安全控制推向开发者场景。

OpenAI 的「每美元有效智能」评分框架:每位 AI 网关运营者需要的路由策略清单
OpenAI 发布了一套四维评估框架——「每美元有效智能(Useful Intelligence per Dollar)」,将模型评估从每 token 成本重构为每次成功任务成本。以下是每位路由运营者今天需要做出的改变。

OpenAI 将于12月11日停用 gpt-5 和 o3 快照版本:路由团队必须现在开始审查
OpenAI 已弃用六个初代 gpt-5 和 o3 模型快照,全部将于2026年12月11日停止服务。仍在路由策略中使用带日期 model ID 的团队有六个月时间迁移——完整审查清单在此。