Gemini 预置吞吐量现已支持队列 7 个待处理订单:多订单 GA 对路由团队意味着什么
Google 于 7 月 1 日正式发布(GA)多个待处理 Provisioned Throughput 订单功能——你现在可以同时为同一模型和地区提交最多 7 个订单,彻底消除了过去每次等待 10 个工作日才能激活下一个订单的串行瓶颈。
归档条目:由 AI 根据所引信源辅助生成,发布时未经逐篇审阅。责任编辑:Joe Werner。

2026 年 7 月 1 日,Google 在 Gemini Enterprise Agent Platform 上正式发布(GA)多个待处理 Provisioned Throughput(预置吞吐量)订单功能。你现在可以同时为同一模型和地区提交最多 7 个待处理订单,无需等待前一个订单激活。对于通过 GCP 路由大量 Gemini 模型流量的 AI 工程团队来说,这一变化消除了此前每次必须等待 10 个工作日才能激活下一个订单的串行规划瓶颈。
发生了什么
Gemini Enterprise Agent Platform 的 Provisioned Throughput(PT)允许团队预留专属推理容量,而非与共享资源竞争。在 7 月 1 日之前,提交订单是一个串行过程:提交一个订单,等待激活(通常需要 10 个工作日以内),然后才能提交下一个。如果你需要为计划中的流量峰值扩充容量,就必须提前数月规划,并手动启动每个步骤。
7 月 1 日的 GA 版本改变了这一现状。你现在可以同时为同一 Google 模型和地区排队最多 7 个标准 PT 订单。订单按商业合理努力原则依序处理和激活,但你不再需要全程盯着流程:一次性提交所有扩容订单,让队列自动执行。
该功能可通过 Google Cloud Console 的 Gemini Enterprise Agent Platform Provisioned Throughput 管理页面使用,需要 roles/aiplatform.provisionedThroughputAdmin 角色下的 aiplatform.provisionedThroughputs.create 和 .update 权限。
为什么这对 AI 工程团队很重要
Provisioned Throughput 是在大规模运行 Gemini 模型时避免 429 资源耗尽错误的主要手段。已经从按量付费迁移到 PT 的团队都清楚,激活延迟是主要摩擦点:今天提交订单无法保证明天的容量。多订单排队改变了这一局面。
无需手动跟进即可完成容量扩容。 如果你计划在三个月内将容量从 10k QPM 扩展到 30k QPM,现在可以今天就提交三个顺序订单——10k、20k 和 30k GSU——每个订单设置为在前一个激活后自动排队。计划扩容不再需要日历提醒和手动重新协调 GCP 采购流程。
用于模型迁移的重叠订单。 PT 订单在同一发布商内与模型绑定。你可以将现有 PT 订单的模型分配从 Gemini 3.1 Flash 切换到 Gemini 3.5 Flash,但不能从 Google 切换到 Anthropic。多个待处理订单使得以重叠 PT 预留来分阶段完成模型迁移成为可能:在新模型 PT 激活排队期间,保持旧模型 PT 处于活跃状态。
为计费团队提供可预期性。 PT 是一种承诺——你无法在期限内取消。多个待处理订单为计费和 FinOps 团队提供了单次审批工作流:一个采购周期可以授权完整的扩容计划,而无需在每个激活步骤重新审批。
路由/运营视角
对于路由团队来说,这一变化的核心在于如何规划 Gemini 容量:
7 月 1 日之前: 将 Gemini PT 视为一次性提交承诺。如果需要容量余量,则路由到按量付费,接受 429 风险或过度采购单个大订单。
7 月 1 日之后: 提交扩容计划队列。对于将 Gemini 作为多 provider 路由策略中某个目标的团队,这意味着你可以提前锁定 GCP 容量,将 PT 作为可靠的容量层而非 fallback。
超出当前激活 PT 水平的流量仍会自动按按量付费计费。这意味着从 PT → 按量付费的路由 fallback 路径不变;多个待处理订单只是让你可以随着流量增长缩小该 fallback 窗口。
检查路由策略时的关键事项:
- 确认当前激活的 PT 配额覆盖基础流量: 待处理订单不是激活容量。只有当前已激活的订单才计入吞吐量保证。
- Single Zone PT 仍需直接联系 GCP 客户经理: 多个待处理订单仅适用于标准 PT。Single Zone Provisioned Throughput 仍是手动销售流程。
- 模型切换需要等待当前期限到期或手动修改订单: 你可以更改 PT 订单的模型分配,但会在下次续期时生效或通过变更请求处理,不会立即生效。
TheRouter 用户应关注或尝试什么
如果你通过 API gateway 将流量路由到 Gemini 3.1 Pro、Gemini 3.5 Flash 或任何 Google 发布的模型,PT 队列变化与你的容量层规划密切相关。已经使用 PT 的团队现在可以一次性锁定容量扩容计划,无需串行规划。此前因激活窗口问题而推迟使用 PT 的按量付费团队,现在切换的协调成本更低。
参见 Gemini Enterprise Agent Platform 语义治理策略 了解 6 月 29 日随 PT 更新同期发布的运营治理版本,以及 Gemini Model Armor Agent Gateway GA 了解适用于所有通过 GCP Agent Gateway 流量的内容安全层。
相关阅读
AI 路由新闻与供应商动态 →
Nano Banana 2 Lite 是你的新默认 Gemini 图像端点 — 三层路由决策框架
Google Nano Banana 2 Lite(gemini-3.1-flash-lite-image)于 6 月 30 日发布,$0.034/千张,4 秒延迟。如果你仍在路由至 gemini-2.5-flash-image,你用的是上上代模型。本文提供每个图像管线团队需要的三层路由框架。

2026 Gemini API 图像生成迁移:修复 failed to fetch,并准备 8 月 17 日停服
2026 年 Gemini API 图像生成已进入两波迁移:6 月 25 日后 preview 图像模型会触发 failed to fetch 类故障,Imagen 4 GA endpoint 将于 8 月 17 日停服。现在应审计模型 ID,迁到 gemini-3.1-flash-image 或 gemini-3-pro-image,并测试 generateContent 调用链路。

Gemini 非全球端点定价 7 月 1 日正式生效:每个路由团队必须考量的 10% 区域溢价
2026 年 7 月 1 日起,Gemini 3 及以上版本对非全球(区域)端点收取 10% 溢价。将流量路由至 eu-west1、asia-northeast1 等非全球位置的团队需立即审查成本模型。