Gemini 3.7 Flash 正式版:API 集成与多厂商路由指南
Gemini 3.7 Flash 于 2026 年 8 月 13 日正式发布,是 Google 面向编程和 Agent 场景最强的工作马力模型。本指南涵盖 API 接入、定价、基准测试亮点、多厂商路由,以及与上一代的对比。
Google 于 2026 年 8 月 13 日发布了 Gemini 3.7 Flash,Flash 系列最新的主力模型。相比 Gemini 3.6 Flash,它在编程准确性、Agent 工具调用和知识工作领域都有明显提升。推出价为 $0.75 / 百万输入 token、$3.75 / 百万输出 token,有效期至 2026 年 12 月 31 日(之后恢复标准价,翻倍)。模型支持文本、图片、音频和视频输入,上下文窗口 1M token,最大输出 64K token,适合用在生产级 Agent 流水线中。
OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。
来源: Google Blog — Introducing Gemini 3.7 Flash, 2026-08-20 检索; Gemini 3.7 Flash Model Card — Google DeepMind, 2026-08-20 检索; Gemini API Pricing — Google Cloud, 2026-08-20 检索; OpenRouter — Gemini 3.7 Flash, 2026-08-20 检索; Artificial Analysis — Gemini 3.7 Flash, 2026-08-20 检索。
3 分钟快速上手
1. 获取 API key
在 ai.google.dev 创建或获取 Gemini API key。如果需要使用 Enterprise Agent Platform,请在 Google Cloud 项目中启用 Gemini API。
2. 安装 SDK
Python(Google GenAI SDK)
pip install google-genai
Python(OpenAI SDK,用于兼容端点)
pip install openai
3. 发送第一个请求
使用 Google GenAI SDK
from google import genai
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="用三句话解释 gRPC 和 REST 的区别。",
)
print(response.text)
使用 OpenAI SDK(通过兼容端点)
from openai import OpenAI
client = OpenAI(
api_key="your-api-key",
base_url="https://generativelanguage.googleapis.com/v1beta/openai/",
)
response = client.chat.completions.create(
model="gemini-3.7-flash",
messages=[
{"role": "user", "content": "用三句话解释 gRPC 和 REST 的区别。"}
],
)
print(response.choices[0].message.content)
两种方式返回相同的模型输出。OpenAI 兼容端点让你在切换厂商时不用重写业务代码。
3.6 Flash 到 3.7 Flash 的变化
Gemini 3.7 Flash 在 3.6 Flash 发布三周后推出。Google 表示,这一版本是开发者反馈和核心推理算法改进的直接产物。实际差异集中在三个方面。
编程准确性方面。 FrontierCode 1.1 Main(生产代码质量)从 34.4% 升至 43.6%。DeepSWE v1.1(长周期软件工程)从 49.0% 升至 65.3%。同代模型做到这样的提升,幅度不小。
Agent 工作流方面。 Terminal-bench 2.1(Agent 终端编码)从 78.0% 升至 85.8%。AutomationBench(企业工作流自动化)从 17.0% 升至 30.4%,接近翻倍。OSWorld-2.0(Agent 桌面操作)从 33.8% 升至 47.9%。
知识工作方面。 GDP.pdf(专业 PDF 文档理解)从 22.0% 升至 34.0%。Harvey LAB-AA(复杂法律工作流)从 85.1% 升至 90.7%。
模型在遇到障碍时处理得更好,在需要时会主动确认意图,对多步指令的遵循也更可靠,减少了人工介入和重试次数。
来源: Gemini 3.7 Flash Model Card — Google DeepMind, 2026-08-20 检索。
价格与上下文窗口
| 项目 | Gemini 3.7 Flash |
|---|---|
| 输入价格 | $0.75 / 百万 token(推出价,至 2026 年 12 月 31 日) |
| 输出价格 | $3.75 / 百万 token(推出价,至 2026 年 12 月 31 日) |
| 标准输入价格(2027 年 1 月起) | $1.50 / 百万 token |
| 标准输出价格(2027 年 1 月起) | $7.50 / 百万 token |
| 上下文窗口 | 1,000,000 token |
| 最大输出 | 64,000 token |
| 输入模态 | 文本、图片、音频、视频、PDF |
| 输出模态 | 文本 |
| 知识截止 | 2026 年 3 月 |
按推出价计算,3.7 Flash 的价格是 3.6 Flash 最初发布时的一半。对于跑大批量 Agent 循环或批处理任务的团队来说,Gemini 3.7 Flash 是 GA 级工作马力模型中性价比最高的选项之一。
来源: Google Cloud Pricing — Gemini Enterprise Agent Platform, 2026-08-20 检索; Google DeepMind Model Card, 2026-08-20 检索。
基准测试对比
| 基准测试 | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| FrontierCode 1.1 Main | 43.6% | 34.4% | 42.7% | 41.3% |
| DeepSWE v1.1 | 65.3% | 49.0% | 53.8% | 69.6% |
| WebDev Arena Elo | 1588 | 1538 | 1541 | 1523 |
| Terminal-bench 2.1 | 85.8% | 78.0% | 80.4% | 87.4% |
| AutomationBench | 30.4% | 17.0% | 10.7% | 23.6% |
| GDP.pdf | 34.0% | 22.0% | 28.0% | 24.7% |
| LVBench(长视频) | 85.4% | 84.2% | 68.5% | 78.9% |
| 128k MRCR v2(8-needle) | 97.0% | 91.8% | 81.5% | 93.5% |
| OSWorld-2.0 | 47.9% | 33.8% | — | 50.2% |
| HLE-Verified | 53.6% | 51.2% | 31.0% | 51.1% |
Gemini 3.7 Flash 在 Web 开发、自动化、长上下文召回和视频理解方面领先。GPT-5.6 Terra 在 Terminal-bench 2.1 和 DeepSWE 上略胜一筹。Claude Sonnet 5 在这组测试中落后较多,但它在 extended thinking 和结构化输出方面有自己的优势。
所有基准数据来自 Gemini 3.7 Flash Model Card(Google DeepMind,2026 年 8 月),为厂商自测数据,独立评测正在进行中。
通过 TheRouter 实现多厂商路由
只依赖单一厂商意味着单点故障。TheRouter 将 OpenAI 兼容请求路由到已配置的厂商,并支持 fallback 以提升可用性。
一个典型的路由配置示例
from openai import OpenAI
client = OpenAI(
api_key="your-therouter-api-key",
base_url="https://api.therouter.ai/v1",
)
# TheRouter 将 'google/gemini-3.7-flash' 解析到 Google 厂商
response = client.chat.completions.create(
model="google/gemini-3.7-flash",
messages=[
{"role": "user", "content": "写一个解析 ISO 8601 日期的 Python 函数。"}
],
)
print(response.choices[0].message.content)
配置了 model fallback 后,如果 Google 端点不可用,TheRouter 可以将请求透明地路由到备选厂商。这对于跑夜间批量任务的 coding agent 很重要,因为厂商的短暂故障不应该卡住整条流水线。
更多 fallback 配置细节,参阅我们的 model fallback 路由指南。
注意 截至本文发布时,
google/gemini-3.7-flash尚未进入 TheRouter 的models-data.ts。当前 Google 模型可用性请查看 Google 厂商页面。
Thinking 模式与自定义
Gemini 3.7 Flash 支持可配置的 thinking 策略。你可以通过调整 thinking budget 来控制质量、成本和延迟之间的平衡。
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="调试这段 Python 报错并给出修复方案:...",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(
thinking_budget=4096,
)
),
)
print(response.text)
更高的 thinking budget 能提升复杂多步骤任务的准确性,代价是延迟和 token 消耗增加。简单请求用低 budget 就够了,响应速度快、成本低。在 Agent 循环中这种灵活性很实用,有些轮次需要深度推理(代码审查、调试),有些只需要快速回复(状态检查、格式化)。
支持的能力
| 能力 | 是否支持 |
|---|---|
| 文本生成 | 是 |
| 多模态输入(图片、音频、视频、PDF) | 是 |
| 函数调用 / 工具调用 | 是 |
| Thinking 模式 | 是(可配置 budget) |
| 搜索增强 | 是 |
| Computer use | 是(内置工具,继承自 3.5 Flash) |
| Managed Agents | 是 |
| Interactions API | 是 |
| 代码执行 | 是 |
| Context caching | 是 |
| Batch API | 请查看 Google 文档 |
Gemini 3.7 Flash 继承了 Flash 系列的全部能力,包括 3.5 Flash 引入的内置 computer use 工具。Computer use 集成的详细用法,参阅我们的 Gemini 3.5 Flash computer use 指南。
与竞品的价格对比
| 模型 | 输入 / 百万 token | 输出 / 百万 token | 上下文窗口 |
|---|---|---|---|
| Gemini 3.7 Flash | $0.75 | $3.75 | 1M |
| Gemini 3.6 Flash | $0.75 | $3.75 | 1M |
| Claude Sonnet 5 | $2.00 | $10.00 | 200K |
| GPT-5.6 Terra | $2.00 | $12.00 | 256K |
| DeepSeek V4 Flash | $0.14 | $0.28 | 128K |
| Qwen3.7-Max | ¥2.00 | ¥8.00 | 1M |
在前沿级别的模型中,Gemini 3.7 Flash 提供了最大的上下文窗口和最低的价格。DeepSeek V4 Flash 更便宜但上下文窗口更小、内置能力也更少。Qwen3.7-Max 上下文窗口相同但按人民币计价,通过 DashScope 获取。
来源: 截至 2026 年 8 月的官方厂商文档和聚合器数据。具体费率可能变动。
常见错误与处理方式
429 Too Many Requests 触发了频率限制。Google 按账户层级设置每分钟 RPM 和 TPM 上限。解决方案包括实现指数退避、升级到付费层级,或通过 TheRouter 配合 fallback 分散负载。
400 Invalid value at 'contents' 请求体格式有问题。常见原因是发送了空的 contents 数组或使用了不支持的参数。对照 generateContent API 文档检查一下。
503 Service Unavailable 临时故障,带退避重试即可。生产环境中建议配置 model fallback,让请求自动重路由。
gemini-3.7-flash not found 确认使用了正确的 model ID。Google AI Studio 用 gemini-3.7-flash,Vertex AI / Enterprise Agent Platform 用完整限定名。该模型于 2026 年 8 月 13 日正式发布。
生产环境检查清单
在生产环境部署 Gemini 3.7 Flash 前,逐项确认以下内容。
- API key 权限范围。 使用项目专用 key,权限最小化。按计划轮换 key。
- 频率限制余量。 在 Google Cloud Console 检查 RPM/TPM 配额。在上线前(而非故障时)申请提升。
- Thinking budget 调优。 分析你的工作负载。Agent 循环中轮次多的场景,高 thinking budget 代价很大。从低值开始,只在准确性有要求的地方增加。
- Fallback 路由。 至少配置一个备选模型(如
google/gemini-3.6-flash或deepseek/deepseek-chat),让短暂故障不会卡住流水线。 - 上下文窗口使用量。 1M token 是上限,监控实际使用量。大上下文请求成本更高、延迟更大。
- 推出价到期时间。 当前价格 2026 年 12 月 31 日到期。2027 年预算要按输入 2x、输出 2x 来规划。
- 内容安全。 Gemini 3.7 Flash 包含更新的 Frontier Safety 防护,覆盖 CBRN 和网络攻防领域。审阅 model card 了解内容策略影响。
TheRouter 集成说明
TheRouter 将 OpenAI 兼容请求路由到已配置的厂商,在产品路径支持的情况下提供 provider/model routing 和 fallback,并在已实现的范围内提供统一的账单/核算界面。
对于 Gemini 模型,这意味着你只需写一次 OpenAI SDK 代码,把 base_url 指向 TheRouter,就能获得厂商级别的可用性保障,不需要集成特定厂商的 SDK。当 google/gemini-3.7-flash 进入模型目录后,从直接调用 Google API 切换到路由调用只需要改 base URL 和 API key。
当前 TheRouter 上 Google 模型的可用性,请查看 Google 厂商页面。
延伸阅读
- Gemini 3.5 Flash Agentic Computer Use 指南,computer use 内置工具、Managed Agents、Interactions API
- Managed Agents API 对比: DashScope、Gemini、OpenAI,跨厂商 Agent API 接口对比
- 2026 年 Coding Agent 模型路由对比,Gemini 3.7 Flash 在 coding agent 工作流中的表现
- LLM API 上下文窗口限制: 跨厂商参考,各主要厂商的上下文窗口对比
- 2026 年 LLM API 成本优化路由策略,prompt caching、批处理与 fallback 路由的成本控制方法