GPT-Realtime-2.1 与 2.1-Mini:每位 AI 运营商现在都需要做出的语音路由决策

OpenAI 于 7 月 6 日发布了 GPT-Realtime-2.1 和 GPT-Realtime-2.1-mini。双层模型结构、可配置的推理力度与新的音频定价基准,正在改变运营商路由语音 agent 流量的方式。

发布于 来源 OpenAI API Changelog

归档条目:由 AI 根据所引信源辅助生成,发布时未经逐篇审阅。责任编辑:Joe Werner。

抽象路由示意图:语音音频流在全量模型与 mini 模型两个层级之间分流

OpenAI 于 7 月 6 日发布了两款新的实时语音模型:GPT-Realtime-2.1 和 GPT-Realtime-2.1-mini。此次更新为实时语音工作负载引入了双层架构——一个完整推理模型与一个更快、成本更低的蒸馏版本——并支持可配置的推理力度(reasoning effort),可在延迟和输出质量之间灵活权衡。对于构建语音 agent 或通过 AI 网关路由语音流量的运营商而言,这次发布同时改变了三件事:模型选择决策、成本结构,以及延迟预期。

发生了什么

GPT-Realtime-2.1 是一款经过更新的实时推理模型,在字母数字识别、静音与噪声处理以及打断行为方面均有所改进。GPT-Realtime-2.1-mini 是针对速度和成本优化的蒸馏版本,适合延迟敏感型高并发语音应用。

两款模型均通过 Realtime API(v1/realtime)提供。GPT-Realtime-2.1 定价:

  • 文本 token:输入 $4.00 / 输出 $24.00(每百万 token,缓存输入 $0.40)
  • 音频 token:输入 $32.00 / 输出 $64.00(每百万 token,缓存输入 $0.40)
  • 图像 token:输入 $5.00(每百万 token,缓存输入 $0.50)

GPT-Realtime-2.1 支持可配置的推理力度,运营商可以在快速低力度响应与较慢高力度推理之间灵活调节,具体取决于应用场景。更高的推理力度会增加延迟和输出 token 消耗——这一质量与成本的权衡现在直接落在路由层。

GPT-Realtime-2.1-mini 是蒸馏模型:速度更快、成本更低,专为轮次切换优先于深度推理的实时语音场景而设计。

为什么这对 AI 工程团队很重要

双模型结构意味着"使用 Realtime API"不再是单一的路由决策。团队现在需要决定:

  1. 按工作负载类型选择全量版或 mini 版。 GPT-Realtime-2.1 适合处理复杂查询的面向用户语音 agent,例如金融或医疗问题、多步骤指令,以及对准确性和上下文追踪要求较高的场景。GPT-Realtime-2.1-mini 适合高并发、延迟敏感型流程:IVR 意图识别、实时转录与路由、对话式 FAQ,或轮次切换密集的使用场景。

  2. 推理力度作为路由参数。 GPT-Realtime-2.1 的可配置推理力度,实际上是在同一模型内的质量层级选择器。运营商在处理混合语音工作负载时,可以对低复杂度轮次使用 low 力度,并在检测到复杂意图时升级为 high 力度——无需切换 endpoint。这是一种新的路由模式,语音路由策略需要将其纳入考量。

  3. 规模化场景下的音频 token 定价。 音频输入 $32.00/MTok、音频输出 $64.00/MTok 是实时语音工作负载的主要成本驱动因素。将所有流量默认路由到 GPT-Realtime-2.1 的策略,将比将常规交互路由到 2.1-mini 的策略花费多得多。对于每天处理数百万语音轮次的团队而言,路由策略直接决定了月度账单。

  4. 字母数字识别与打断行为改进。 2.1 更新专门提到了字母数字识别的提升——对于处理 ID、订单号、电话号码和验证码的语音 agent 至关重要——以及打断处理改进。这些可靠性提升影响哪个质量层级值得承接生产流量。

路由层的视角

对于通过 AI gateway 路由语音流量的团队,2.1 版本构建了分层路由模型,与文本 workload 的现有策略如出一辙:

决策框架:

信号路由目标
复杂多轮查询、金融/医疗场景GPT-Realtime-2.1,推理力度:high
一般对话查询、中等复杂度GPT-Realtime-2.1,推理力度:low
高并发、延迟关键、意图简单GPT-Realtime-2.1-mini
2.1 触达速率限制时的 fallbackGPT-Realtime-2.1-mini

推理力度参数值得特别关注。与需要路由到不同模型 ID 的全量/mini 切分不同,推理力度是 GPT-Realtime-2.1 的逐请求参数。这意味着语音网关可以根据转录文本或会话上下文实现意图复杂度检测,并在不改变下游 endpoint 的情况下传递相应的力度级别。对于希望保持单一模型 endpoint 同时按轮次类型区分成本和质量的运营商而言,这是一种实用的模式。

迁移前的成本建模: 更新路由策略前,按 2.1 定价基准计算当前音频 token 量。若现有 workload 运行在 GPT-Realtime-2 上,对比每音频 token 费率,评估可靠性改进是否能证明成本差异的合理性。

速率限制规划: 两款模型可能各自维护独立 rate limit 池。当 2.1 触达速率限制时,fallback 到 2.1-mini 而非直接失败——对大多数轮次而言质量可接受。

TheRouter 用户应关注和尝试的内容

如果您通过 TheRouter 路由语音 agent 流量,2.1 版本发布是重新审视 provider 路由策略的好时机。检查当前的模型 ID 配置,判断 2.1 与 2.1-mini 的分流策略是否适合您的工作负载组合。模型目录 追踪可用的模型 ID;在更新生产路由规则前,请确认两款新模型均已出现在列表中。

推理力度参数并非传统意义上的路由标志——它是请求层面的属性。语音网关团队应评估路由层是否能够从上游意图分类传递力度提示,或者是否更简单的策略(对超过长度阈值的所有轮次使用全量模型)就已足够。

最后,审查语音工作负载的 fallback 链。有了双层实时模型家族,fallback 优先级应为:主层(2.1 或 2.1-mini,根据策略)→ 对立层 → 优雅降级。

帮助与联系