← 全部文章

Gemini 3.7 Flash 正式版:API 集成与多厂商路由指南

Gemini 3.7 Flash 于 2026 年 8 月 13 日正式发布,是 Google 面向编程和 Agent 场景最强的工作马力模型。本指南涵盖 API 接入、定价、基准测试亮点、多厂商路由,以及与上一代的对比。

· TheRouter

Google 于 2026 年 8 月 13 日发布了 Gemini 3.7 Flash,Flash 系列最新的主力模型。相比 Gemini 3.6 Flash,它在编程准确性、Agent 工具调用和知识工作领域都有明显提升。推出价为 $0.75 / 百万输入 token、$3.75 / 百万输出 token,有效期至 2026 年 12 月 31 日(之后恢复标准价,翻倍)。模型支持文本、图片、音频和视频输入,上下文窗口 1M token,最大输出 64K token,适合用在生产级 Agent 流水线中。

OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。

来源: Google Blog — Introducing Gemini 3.7 Flash, 2026-08-20 检索; Gemini 3.7 Flash Model Card — Google DeepMind, 2026-08-20 检索; Gemini API Pricing — Google Cloud, 2026-08-20 检索; OpenRouter — Gemini 3.7 Flash, 2026-08-20 检索; Artificial Analysis — Gemini 3.7 Flash, 2026-08-20 检索。

3 分钟快速上手

1. 获取 API key

在 ai.google.dev 创建或获取 Gemini API key。如果需要使用 Enterprise Agent Platform,请在 Google Cloud 项目中启用 Gemini API。

2. 安装 SDK

Python(Google GenAI SDK)

pip install google-genai

Python(OpenAI SDK,用于兼容端点)

pip install openai

3. 发送第一个请求

使用 Google GenAI SDK

from google import genai

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="用三句话解释 gRPC 和 REST 的区别。",
)
print(response.text)

使用 OpenAI SDK(通过兼容端点)

from openai import OpenAI

client = OpenAI(
    api_key="your-api-key",
    base_url="https://generativelanguage.googleapis.com/v1beta/openai/",
)

response = client.chat.completions.create(
    model="gemini-3.7-flash",
    messages=[
        {"role": "user", "content": "用三句话解释 gRPC 和 REST 的区别。"}
    ],
)
print(response.choices[0].message.content)

两种方式返回相同的模型输出。OpenAI 兼容端点让你在切换厂商时不用重写业务代码。

3.6 Flash 到 3.7 Flash 的变化

Gemini 3.7 Flash 在 3.6 Flash 发布三周后推出。Google 表示,这一版本是开发者反馈和核心推理算法改进的直接产物。实际差异集中在三个方面。

编程准确性方面。 FrontierCode 1.1 Main(生产代码质量)从 34.4% 升至 43.6%。DeepSWE v1.1(长周期软件工程)从 49.0% 升至 65.3%。同代模型做到这样的提升,幅度不小。

Agent 工作流方面。 Terminal-bench 2.1(Agent 终端编码)从 78.0% 升至 85.8%。AutomationBench(企业工作流自动化)从 17.0% 升至 30.4%,接近翻倍。OSWorld-2.0(Agent 桌面操作)从 33.8% 升至 47.9%。

知识工作方面。 GDP.pdf(专业 PDF 文档理解)从 22.0% 升至 34.0%。Harvey LAB-AA(复杂法律工作流)从 85.1% 升至 90.7%。

模型在遇到障碍时处理得更好,在需要时会主动确认意图,对多步指令的遵循也更可靠,减少了人工介入和重试次数。

来源: Gemini 3.7 Flash Model Card — Google DeepMind, 2026-08-20 检索。

价格与上下文窗口

项目Gemini 3.7 Flash
输入价格$0.75 / 百万 token(推出价,至 2026 年 12 月 31 日)
输出价格$3.75 / 百万 token(推出价,至 2026 年 12 月 31 日)
标准输入价格(2027 年 1 月起)$1.50 / 百万 token
标准输出价格(2027 年 1 月起)$7.50 / 百万 token
上下文窗口1,000,000 token
最大输出64,000 token
输入模态文本、图片、音频、视频、PDF
输出模态文本
知识截止2026 年 3 月

按推出价计算,3.7 Flash 的价格是 3.6 Flash 最初发布时的一半。对于跑大批量 Agent 循环或批处理任务的团队来说,Gemini 3.7 Flash 是 GA 级工作马力模型中性价比最高的选项之一。

来源: Google Cloud Pricing — Gemini Enterprise Agent Platform, 2026-08-20 检索; Google DeepMind Model Card, 2026-08-20 检索。

基准测试对比

基准测试Gemini 3.7 FlashGemini 3.6 FlashClaude Sonnet 5GPT-5.6 Terra
FrontierCode 1.1 Main43.6%34.4%42.7%41.3%
DeepSWE v1.165.3%49.0%53.8%69.6%
WebDev Arena Elo1588153815411523
Terminal-bench 2.185.8%78.0%80.4%87.4%
AutomationBench30.4%17.0%10.7%23.6%
GDP.pdf34.0%22.0%28.0%24.7%
LVBench(长视频)85.4%84.2%68.5%78.9%
128k MRCR v2(8-needle)97.0%91.8%81.5%93.5%
OSWorld-2.047.9%33.8%—50.2%
HLE-Verified53.6%51.2%31.0%51.1%

Gemini 3.7 Flash 在 Web 开发、自动化、长上下文召回和视频理解方面领先。GPT-5.6 Terra 在 Terminal-bench 2.1 和 DeepSWE 上略胜一筹。Claude Sonnet 5 在这组测试中落后较多,但它在 extended thinking 和结构化输出方面有自己的优势。

所有基准数据来自 Gemini 3.7 Flash Model Card(Google DeepMind,2026 年 8 月),为厂商自测数据,独立评测正在进行中。

通过 TheRouter 实现多厂商路由

只依赖单一厂商意味着单点故障。TheRouter 将 OpenAI 兼容请求路由到已配置的厂商,并支持 fallback 以提升可用性。

一个典型的路由配置示例

from openai import OpenAI

client = OpenAI(
    api_key="your-therouter-api-key",
    base_url="https://api.therouter.ai/v1",
)

# TheRouter 将 'google/gemini-3.7-flash' 解析到 Google 厂商
response = client.chat.completions.create(
    model="google/gemini-3.7-flash",
    messages=[
        {"role": "user", "content": "写一个解析 ISO 8601 日期的 Python 函数。"}
    ],
)
print(response.choices[0].message.content)

配置了 model fallback 后,如果 Google 端点不可用,TheRouter 可以将请求透明地路由到备选厂商。这对于跑夜间批量任务的 coding agent 很重要,因为厂商的短暂故障不应该卡住整条流水线。

更多 fallback 配置细节,参阅我们的 model fallback 路由指南。

注意 截至本文发布时,google/gemini-3.7-flash 尚未进入 TheRouter 的 models-data.ts。当前 Google 模型可用性请查看 Google 厂商页面。

Thinking 模式与自定义

Gemini 3.7 Flash 支持可配置的 thinking 策略。你可以通过调整 thinking budget 来控制质量、成本和延迟之间的平衡。

from google import genai
from google.genai import types

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="调试这段 Python 报错并给出修复方案:...",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(
            thinking_budget=4096,
        )
    ),
)
print(response.text)

更高的 thinking budget 能提升复杂多步骤任务的准确性,代价是延迟和 token 消耗增加。简单请求用低 budget 就够了,响应速度快、成本低。在 Agent 循环中这种灵活性很实用,有些轮次需要深度推理(代码审查、调试),有些只需要快速回复(状态检查、格式化)。

支持的能力

能力是否支持
文本生成是
多模态输入(图片、音频、视频、PDF)是
函数调用 / 工具调用是
Thinking 模式是(可配置 budget)
搜索增强是
Computer use是(内置工具,继承自 3.5 Flash)
Managed Agents是
Interactions API是
代码执行是
Context caching是
Batch API请查看 Google 文档

Gemini 3.7 Flash 继承了 Flash 系列的全部能力,包括 3.5 Flash 引入的内置 computer use 工具。Computer use 集成的详细用法,参阅我们的 Gemini 3.5 Flash computer use 指南。

与竞品的价格对比

模型输入 / 百万 token输出 / 百万 token上下文窗口
Gemini 3.7 Flash$0.75$3.751M
Gemini 3.6 Flash$0.75$3.751M
Claude Sonnet 5$2.00$10.00200K
GPT-5.6 Terra$2.00$12.00256K
DeepSeek V4 Flash$0.14$0.28128K
Qwen3.7-Max¥2.00¥8.001M

在前沿级别的模型中,Gemini 3.7 Flash 提供了最大的上下文窗口和最低的价格。DeepSeek V4 Flash 更便宜但上下文窗口更小、内置能力也更少。Qwen3.7-Max 上下文窗口相同但按人民币计价,通过 DashScope 获取。

来源: 截至 2026 年 8 月的官方厂商文档和聚合器数据。具体费率可能变动。

常见错误与处理方式

429 Too Many Requests 触发了频率限制。Google 按账户层级设置每分钟 RPM 和 TPM 上限。解决方案包括实现指数退避、升级到付费层级,或通过 TheRouter 配合 fallback 分散负载。

400 Invalid value at 'contents' 请求体格式有问题。常见原因是发送了空的 contents 数组或使用了不支持的参数。对照 generateContent API 文档检查一下。

503 Service Unavailable 临时故障,带退避重试即可。生产环境中建议配置 model fallback,让请求自动重路由。

gemini-3.7-flash not found 确认使用了正确的 model ID。Google AI Studio 用 gemini-3.7-flash,Vertex AI / Enterprise Agent Platform 用完整限定名。该模型于 2026 年 8 月 13 日正式发布。

生产环境检查清单

在生产环境部署 Gemini 3.7 Flash 前,逐项确认以下内容。

  1. API key 权限范围。 使用项目专用 key,权限最小化。按计划轮换 key。
  2. 频率限制余量。 在 Google Cloud Console 检查 RPM/TPM 配额。在上线前(而非故障时)申请提升。
  3. Thinking budget 调优。 分析你的工作负载。Agent 循环中轮次多的场景,高 thinking budget 代价很大。从低值开始,只在准确性有要求的地方增加。
  4. Fallback 路由。 至少配置一个备选模型(如 google/gemini-3.6-flash 或 deepseek/deepseek-chat),让短暂故障不会卡住流水线。
  5. 上下文窗口使用量。 1M token 是上限,监控实际使用量。大上下文请求成本更高、延迟更大。
  6. 推出价到期时间。 当前价格 2026 年 12 月 31 日到期。2027 年预算要按输入 2x、输出 2x 来规划。
  7. 内容安全。 Gemini 3.7 Flash 包含更新的 Frontier Safety 防护,覆盖 CBRN 和网络攻防领域。审阅 model card 了解内容策略影响。

TheRouter 集成说明

TheRouter 将 OpenAI 兼容请求路由到已配置的厂商,在产品路径支持的情况下提供 provider/model routing 和 fallback,并在已实现的范围内提供统一的账单/核算界面。

对于 Gemini 模型,这意味着你只需写一次 OpenAI SDK 代码,把 base_url 指向 TheRouter,就能获得厂商级别的可用性保障,不需要集成特定厂商的 SDK。当 google/gemini-3.7-flash 进入模型目录后,从直接调用 Google API 切换到路由调用只需要改 base URL 和 API key。

当前 TheRouter 上 Google 模型的可用性,请查看 Google 厂商页面。

延伸阅读

本文涉及的模型

帮助与联系