Gemini 3.5 Flash 已不再是「便宜 Flash」:Google 定价重构对路由策略的影响
Google 在 I/O 2026 发布的 Gemini 3.5 Flash 定价为每百万 token 输入 $1.50 / 输出 $9.00,是上一代 Flash 模型的 3-6 倍。这次定价重构,加上新推出的 Interactions API,意味着「Flash = 便宜备用」的路由逻辑已经失效。
归档条目:由 AI 根据所引信源辅助生成,发布时未经逐篇审阅。责任编辑:Joe Werner。

如果你的路由策略里有一条「Gemini Flash = 便宜兜底」的规则,Google I/O 2026 刚刚让它失效了。
5 月 19 日,Google 在 I/O 2026 大会上正式发布 Gemini 3.5 Flash,模型 ID 为 gemini-3.5-flash,直接进入 GA 状态,没有预览期。但对路由团队来说,关键数字是定价:输入 $1.50 / 百万 token,输出 $9.00 / 百万 token——是上一代 Gemini 3 Flash Preview($0.50/$3.00)的 3 倍,是 Gemini 3.1 Flash-Lite($0.25/$1.50)的 6 倍。
Google 同时推出了公开测试版 Interactions API——一个服务端会话状态管理层,设计上与 OpenAI Responses API 的模式类似。你现有的代理层能否透明地路由这类请求,比模型的 benchmark 分数更值得关注。
发生了什么
Google I/O 2026(5 月 19-20 日)是 Gemini 模型面向开发者变化最密集的一次发布。API 团队需要关注的核心内容:
- Gemini 3.5 Flash(
gemini-3.5-flash):首日直接 GA。支持 1,048,576 token 上下文窗口,最大输出 65,536 token,支持 thinking 模式。Google 内部已在 Gemini Search、Antigravity 智能体平台、Google AI Studio、Gemini Enterprise 全面采用。 - Gemini Interactions API(公开测试版):新 API 层,内置多步工具调用、服务端会话历史管理和编排原语,明确对标 OpenAI Responses 的设计理念。
- Gemini 3.5 Pro:承诺「下月」发布(6 月 2026)。定价未公布,但按趋势判断将高于 Gemini 3.1 Pro 当前的 $2/$12。
- 上下文缓存与批量折扣:3.5 Flash 支持批量 50% 折扣,上下文缓存费率尚未完整公布。
对比参考,Google 当前 Flash 系列价格跨度已达 6 倍:
| 模型 | 输入($/百万 token) | 输出($/百万 token) |
|---|---|---|
| Gemini 3.1 Flash-Lite | $0.25 | $1.50 |
| Gemini 3 Flash Preview | $0.50 | $3.00 |
| Gemini 3.5 Flash | $1.50 | $9.00 |
| Gemini 3.1 Pro Preview | $2.00 | $12.00 |
Gemini 3.5 Flash 在成本上已经更接近 Pro 层,而非其前代 Flash 模型。
为什么 AI 工程团队需要关注
长期以来,「Flash = 便宜快速」的命名惯例让许多路由策略把 Gemini Flash 当作默认的低成本备用选项。3.5 Flash 打破了这个假设。
成本模型需要重新校准。 把高并发、中等复杂度任务路由到任何名字里带 gemini-*-flash 的模型的团队,现在需要检查配置里的具体模型 ID。如果硬编码了 gemini-flash 或 gemini-3-flash 的别名,而后端实际指向了 3.5 Flash,价格已经是完全不同的量级。
Interactions API 引入代理透传风险。 新的测试版 API 采用服务端历史管理(类似 OpenAI Responses)。如果你的路由层直接透传请求体而不理解 Interactions API 的 schema,可能会静默失败或丢失会话连续性。标准 /v1/chat/completions 调用不受影响——Interactions API 是叠加的新接口,不是替换——但计划采用它的团队需要提前验证路由层的兼容性。
Gemini 3.5 Pro 数周内到来。 新旗舰 Pro 模型将成为 Google 第三个定价锚点。6 月在 Google 提供商上做多模型路由策略的团队,面对的是一张还没有填完的价格表。
上下文缓存改变有效成本。 对于长上下文场景(智能体记忆、大型代码库、长文档),3.5 Flash 的上下文缓存和批量折扣可以显著降低 $9/M 输出的实际成本——但前提是路由层或应用层明确启用缓存,而非默认生效。
路由 / 运营视角的分析
对路由团队来说,实质变化是 Google Gemini 层级策略从两层变成了三层:
- 超低价层:
gemini-3.1-flash-lite——用于高并发分类、简单摘要、路由预判。 - 中价层(原来的「Flash」位置):
gemini-3-flash-preview——依然是中等任务的性价比选项。 - 高价 Flash 层:
gemini-3.5-flash——新的 Google 内部默认模型。适合编码、智能体任务、长链推理和多模态工作,质量提升值得 3 倍溢价。
回退链的成本影响:如果你的主力提供商故障后回退到 Gemini Flash,而配置里写的是 3.5 Flash,回退成本相比 2026 年初的策略可能已经翻了 3 倍。成本感知的回退配置需要显式区分 gemini-3-flash-preview 和 gemini-3.5-flash。
Interactions API 的代理架构问题:新 API 把会话连续性绑定到 Google 服务端,而非客户端。如果路由层在会话中途把请求切换到不同提供商(如故障转移),Interactions API 的会话会断掉。使用无状态 /generateContent 或 /chat/completions 的团队不受影响,但随着 Interactions API 走向 GA,这一点值得提前规划。
成本归因:在启用 thinking 模式的情况下,3.5 Flash 每次请求产生的 token 数量远高于无 thinking 的 Flash 模型。根据 Artificial Analysis 的基准数据,以高/thinking 模式运行标准套件的成本约 $1,551——甚至高于 Gemini 3.1 Pro Preview 的 $892。使用量计费仪表板需要把推理 token 的膨胀纳入归因。
TheRouter 用户应该关注什么
- 立即审查你的 Gemini 模型 ID。 如果任何路由规则或模型配置里有未锁定版本的
gemini-flash引用,在 Google 可能调整别名解析之前,请先验证实际指向的模型。显式模型 ID(gemini-3-flash-preview、gemini-3.5-flash)对成本可预测性更安全。 - 更新回退成本阈值。 如果 Gemini Flash 被配置为低成本备用目标,新定价意味着你的回退成本上限已经改变。检查把 Gemini Flash 当作「低价次选」的路由策略。
- 跟踪 Interactions API 的 GA 时间线。 新的测试版 API 对现有
/chat/completions集成没有破坏性影响,但如果你在 Gemini 上构建长程智能体工作流,现在开始规划迁移路径优于 GA 后再应对。 - 为简单路由任务评估 Gemini 3.1 Flash-Lite。 以 $0.25/$1.50 的价格,Flash-Lite 依然是路由前分类、意图检测、廉价摘要步骤的理想选项。把它显式加入路由目标,可以保留「Flash」原本承诺的成本特性。
- 为 Gemini 3.5 Pro 做准备。 数周后,新旗舰 Pro 模型将到来。预留一个路由槽位,在发布时立即跑评估。
Google I/O 2026 的核心教训不是 Gemini 变聪明了(确实变了)——而是 Google 重新定价了其推理经济,2026 年 5 月之前写下的路由策略需要同步更新。
本文涉及的模型
相关阅读
AI 路由新闻与供应商动态 →
Gemini 非全球端点定价 7 月 1 日正式生效:每个路由团队必须考量的 10% 区域溢价
2026 年 7 月 1 日起,Gemini 3 及以上版本对非全球(区域)端点收取 10% 溢价。将流量路由至 eu-west1、asia-northeast1 等非全球位置的团队需立即审查成本模型。

Gemini 2.0 Flash 已于 2026 年 6 月关停(EOL):替代方案与现在该做什么
Gemini 2.0 Flash 与 Flash-Lite 已于 2026 年 6 月 1 日完成关停。本文说明哪些模型 ID 已被移除、哪些替代方案(gemini-2.5-flash-lite、gemini-3.1-flash-lite)真正可用、实际成本差距,以及如何最快速地审计可能仍引用已失效 endpoint 的 fallback 链。

Nano Banana 2 Lite 是你的新默认 Gemini 图像端点 — 三层路由决策框架
Google Nano Banana 2 Lite(gemini-3.1-flash-lite-image)于 6 月 30 日发布,$0.034/千张,4 秒延迟。如果你仍在路由至 gemini-2.5-flash-image,你用的是上上代模型。本文提供每个图像管线团队需要的三层路由框架。