
Google Cloud API Gateway model routing 的规格优先路线和共享主机限制
Google Cloud API Gateway model routing 已进入 Public Preview。它用 OpenAPI 规格承载 serverless 路由,可转发 Gemini、Claude 和 OpenAI 请求,前提是所有后端都在 Vertex AI。

Google Cloud API Gateway model routing 已进入 Public Preview。它用 OpenAPI 规格承载 serverless 路由,可转发 Gemini、Claude 和 OpenAI 请求,前提是所有后端都在 Vertex AI。

Google Nano Banana 2 Lite(gemini-3.1-flash-lite-image)于 6 月 30 日发布,$0.034/千张,4 秒延迟。如果你仍在路由至 gemini-2.5-flash-image,你用的是上上代模型。本文提供每个图像管线团队需要的三层路由框架。

Google 于 7 月 1 日正式发布(GA)多个待处理 Provisioned Throughput 订单功能——你现在可以同时为同一模型和地区提交最多 7 个订单,彻底消除了过去每次等待 10 个工作日才能激活下一个订单的串行瓶颈。

2026 年 Gemini API 图像生成已进入两波迁移:6 月 25 日后 preview 图像模型会触发 failed to fetch 类故障,Imagen 4 GA endpoint 将于 8 月 17 日停服。现在应审计模型 ID,迁到 gemini-3.1-flash-image 或 gemini-3-pro-image,并测试 generateContent 调用链路。

Google Gemini Omni Flash 进入 API 公测,模型 ID 为 gemini-omni-flash-preview,定价约 $0.10/秒,全新 Interactions API 让多轮视频编辑成为路由策略问题。

2026 年 7 月 1 日起,Gemini 3 及以上版本对非全球(区域)端点收取 10% 溢价。将流量路由至 eu-west1、asia-northeast1 等非全球位置的团队需立即审查成本模型。

Google 的语义治理策略引擎(SGP)现已在 Gemini 企业级 Agent 平台进入公开预览,它在模型与工具之间充当运行时拦截层,阻断偏离原始用户意图或违反自然语言业务约束的工具调用——无需重新部署 Agent 代码。

Google 已将 Agent Gateway 上的 Model Armor 升至正式可用(GA),将提示注入防御和内容扫描直接嵌入所有 agent 流量路径,无需修改任何 agent 代码。

Google 已于 2026 年 6 月 19 日起停止接受无限制 Gemini API Key 的请求。任何未配置显式 API 限制的 Key 现在会返回错误。以下是通过 gateway 路由 Gemini 流量的 operator 需要立即审查的凭据配置。

Google 的 Gemini Enterprise 本周将 workflow agents 与可复用 skills 推进至 GA,两者均需申请 allowlist。本文梳理架构决策树,以及这对企业 AI 工程团队的路由规划意味着什么。

Gemini Memory Bank(Agent Platform 记忆库)是 Google 为 AI Agent 提供的托管式持久记忆层,6 月 17 日正式 GA 并开放全球端点。本文详解 agent platform memory bank 的工作原理、Session 机制、CMEK 约束,以及有状态 Agent 路由策略。

Gemini CLI 将于 2026 年 6 月 18 日停止服务消费端请求。在默认迁移到 Antigravity CLI 之前,先搞清楚 unified-backend 模型对 provider 独立性意味着什么——以及 Claude Code 或 Codex CLI 的多 provider routing 如何改变这道选择题。

Google 于 2026 年 5 月 26 日正式宣布弃用 Vertex AI Extensions,硬性关闭日期为 11 月 26 日。在 Google 上路由 Agent 工作流的团队必须在截止日期前将代码解释器、Search 和自定义 Extension 迁移到 Gemini Enterprise Agent Platform。

Google Gemini 3.5 Live Translate 通过 Gemini API 开放公开预览,支持 70+ 种语言的连续语音对语音翻译。新模型 ID 对语音 agent 路由团队意味着什么。

Vertex AI 本身并未弃用,但 Google 将在 2026 年 6 月 30 日关闭所有 Imagen 2.x/3.x/4.x 和 Veo 2.x/3.0 GA 端点。用这份关停清单将图像和视频路由迁移到 gemini-2.5-flash-image 与 veo-3.1 端点。

谷歌每月9.2亿美元租用SpaceX GPU,说明Gemini算力并非无限。AI团队应重新评估供应商关联故障、2026年第四季度配额变化与多供应商备用路径。

Vertex AI 生成式 AI SDK 已弃用,模块将于 2026 年 6 月 24 日移除。如果你的团队通过 vertexai.generative_models 或相关 import 路由到 Google,以下是确保生产代码继续运行的迁移要点。

Gemini 2.0 Flash 与 Flash-Lite 已于 2026 年 6 月 1 日完成关停。本文说明哪些模型 ID 已被移除、哪些替代方案(gemini-2.5-flash-lite、gemini-3.1-flash-lite)真正可用、实际成本差距,以及如何最快速地审计可能仍引用已失效 endpoint 的 fallback 链。

Google I/O 2026 发布了 Antigravity 2.0、Gemini API 中的 Managed Agents,以及可通过单次 API 调用启动隔离 Linux 环境的 Interactions API。对于使用多 provider 路由的团队而言,影响远不止一次 CLI 更名。

Google 在 I/O 2026 发布的 Gemini 3.5 Flash 定价为每百万 token 输入 $1.50 / 输出 $9.00,是上一代 Flash 模型的 3-6 倍。这次定价重构,加上新推出的 Interactions API,意味着「Flash = 便宜备用」的路由逻辑已经失效。