Gemini 3.5 Flash 已不再是「便宜 Flash」:Google 定价重构对路由策略的影响

Google 在 I/O 2026 发布的 Gemini 3.5 Flash 定价为每百万 token 输入 $1.50 / 输出 $9.00,是上一代 Flash 模型的 3-6 倍。这次定价重构,加上新推出的 Interactions API,意味着「Flash = 便宜备用」的路由逻辑已经失效。

发布于 来源 Google AI Blog

归档条目:由 AI 根据所引信源辅助生成,发布时未经逐篇审阅。责任编辑:Joe Werner。

抽象编辑风格插画,表达多层路由决策与成本感知的 AI 提供商策略

如果你的路由策略里有一条「Gemini Flash = 便宜兜底」的规则,Google I/O 2026 刚刚让它失效了。

5 月 19 日,Google 在 I/O 2026 大会上正式发布 Gemini 3.5 Flash,模型 ID 为 gemini-3.5-flash,直接进入 GA 状态,没有预览期。但对路由团队来说,关键数字是定价:输入 $1.50 / 百万 token,输出 $9.00 / 百万 token——是上一代 Gemini 3 Flash Preview($0.50/$3.00)的 3 倍,是 Gemini 3.1 Flash-Lite($0.25/$1.50)的 6 倍。

Google 同时推出了公开测试版 Interactions API——一个服务端会话状态管理层,设计上与 OpenAI Responses API 的模式类似。你现有的代理层能否透明地路由这类请求,比模型的 benchmark 分数更值得关注。

发生了什么

Google I/O 2026(5 月 19-20 日)是 Gemini 模型面向开发者变化最密集的一次发布。API 团队需要关注的核心内容:

  • Gemini 3.5 Flash(gemini-3.5-flash):首日直接 GA。支持 1,048,576 token 上下文窗口,最大输出 65,536 token,支持 thinking 模式。Google 内部已在 Gemini Search、Antigravity 智能体平台、Google AI Studio、Gemini Enterprise 全面采用。
  • Gemini Interactions API(公开测试版):新 API 层,内置多步工具调用、服务端会话历史管理和编排原语,明确对标 OpenAI Responses 的设计理念。
  • Gemini 3.5 Pro:承诺「下月」发布(6 月 2026)。定价未公布,但按趋势判断将高于 Gemini 3.1 Pro 当前的 $2/$12。
  • 上下文缓存与批量折扣:3.5 Flash 支持批量 50% 折扣,上下文缓存费率尚未完整公布。

对比参考,Google 当前 Flash 系列价格跨度已达 6 倍:

模型输入($/百万 token)输出($/百万 token)
Gemini 3.1 Flash-Lite$0.25$1.50
Gemini 3 Flash Preview$0.50$3.00
Gemini 3.5 Flash$1.50$9.00
Gemini 3.1 Pro Preview$2.00$12.00

Gemini 3.5 Flash 在成本上已经更接近 Pro 层,而非其前代 Flash 模型。

为什么 AI 工程团队需要关注

长期以来,「Flash = 便宜快速」的命名惯例让许多路由策略把 Gemini Flash 当作默认的低成本备用选项。3.5 Flash 打破了这个假设。

成本模型需要重新校准。 把高并发、中等复杂度任务路由到任何名字里带 gemini-*-flash 的模型的团队,现在需要检查配置里的具体模型 ID。如果硬编码了 gemini-flash 或 gemini-3-flash 的别名,而后端实际指向了 3.5 Flash,价格已经是完全不同的量级。

Interactions API 引入代理透传风险。 新的测试版 API 采用服务端历史管理(类似 OpenAI Responses)。如果你的路由层直接透传请求体而不理解 Interactions API 的 schema,可能会静默失败或丢失会话连续性。标准 /v1/chat/completions 调用不受影响——Interactions API 是叠加的新接口,不是替换——但计划采用它的团队需要提前验证路由层的兼容性。

Gemini 3.5 Pro 数周内到来。 新旗舰 Pro 模型将成为 Google 第三个定价锚点。6 月在 Google 提供商上做多模型路由策略的团队,面对的是一张还没有填完的价格表。

上下文缓存改变有效成本。 对于长上下文场景(智能体记忆、大型代码库、长文档),3.5 Flash 的上下文缓存和批量折扣可以显著降低 $9/M 输出的实际成本——但前提是路由层或应用层明确启用缓存,而非默认生效。

路由 / 运营视角的分析

对路由团队来说,实质变化是 Google Gemini 层级策略从两层变成了三层:

  1. 超低价层:gemini-3.1-flash-lite——用于高并发分类、简单摘要、路由预判。
  2. 中价层(原来的「Flash」位置):gemini-3-flash-preview——依然是中等任务的性价比选项。
  3. 高价 Flash 层:gemini-3.5-flash——新的 Google 内部默认模型。适合编码、智能体任务、长链推理和多模态工作,质量提升值得 3 倍溢价。

回退链的成本影响:如果你的主力提供商故障后回退到 Gemini Flash,而配置里写的是 3.5 Flash,回退成本相比 2026 年初的策略可能已经翻了 3 倍。成本感知的回退配置需要显式区分 gemini-3-flash-preview 和 gemini-3.5-flash。

Interactions API 的代理架构问题:新 API 把会话连续性绑定到 Google 服务端,而非客户端。如果路由层在会话中途把请求切换到不同提供商(如故障转移),Interactions API 的会话会断掉。使用无状态 /generateContent 或 /chat/completions 的团队不受影响,但随着 Interactions API 走向 GA,这一点值得提前规划。

成本归因:在启用 thinking 模式的情况下,3.5 Flash 每次请求产生的 token 数量远高于无 thinking 的 Flash 模型。根据 Artificial Analysis 的基准数据,以高/thinking 模式运行标准套件的成本约 $1,551——甚至高于 Gemini 3.1 Pro Preview 的 $892。使用量计费仪表板需要把推理 token 的膨胀纳入归因。

TheRouter 用户应该关注什么

  • 立即审查你的 Gemini 模型 ID。 如果任何路由规则或模型配置里有未锁定版本的 gemini-flash 引用,在 Google 可能调整别名解析之前,请先验证实际指向的模型。显式模型 ID(gemini-3-flash-preview、gemini-3.5-flash)对成本可预测性更安全。
  • 更新回退成本阈值。 如果 Gemini Flash 被配置为低成本备用目标,新定价意味着你的回退成本上限已经改变。检查把 Gemini Flash 当作「低价次选」的路由策略。
  • 跟踪 Interactions API 的 GA 时间线。 新的测试版 API 对现有 /chat/completions 集成没有破坏性影响,但如果你在 Gemini 上构建长程智能体工作流,现在开始规划迁移路径优于 GA 后再应对。
  • 为简单路由任务评估 Gemini 3.1 Flash-Lite。 以 $0.25/$1.50 的价格,Flash-Lite 依然是路由前分类、意图检测、廉价摘要步骤的理想选项。把它显式加入路由目标,可以保留「Flash」原本承诺的成本特性。
  • 为 Gemini 3.5 Pro 做准备。 数周后,新旗舰 Pro 模型将到来。预留一个路由槽位,在发布时立即跑评估。

Google I/O 2026 的核心教训不是 Gemini 变聪明了(确实变了)——而是 Google 重新定价了其推理经济,2026 年 5 月之前写下的路由策略需要同步更新。

本文涉及的模型

帮助与联系