← 全部文章

Gemini 3.8 Flash API 完整路由指南:Flash 定价 + 前沿编程基准

Gemini 3.8 Flash 于 2026 年 9 月 2 日发布,是 Google Flash 产品线中推理能力最强的模型。沿用 3.7 Flash 的 $0.75/$3.75 入门定价,但 agentic 推理能力大幅提升。本指南覆盖 API 接入、定价(含隐藏的 thinking token 成本)、基准测试、多供应商路由和生产部署。

· TheRouter

Google 于 2026 年 9 月 2 日发布了 Gemini 3.8 Flash,在六周内连续推出的第三个 Flash 模型,定位为 Flash 产品线中推理能力最强的"工作马"。入门定价与 3.7 Flash 保持一致,输入 $0.75 / 1M tokens,输出 $3.75 / 1M tokens,有效期至 2026 年 12 月 31 日。最大的变化体现在 agentic 推理上(Artificial Analysis agentic 指数相比 3.7 Flash 提升近 5 个点),而纯编程基准几乎没有变化。对运营者来说,这是一次免费升级,价格不变、1M token 上下文不变、API 接口也不变。但 thinking token 的计费方式意味着实际成本取决于你如何配置推理强度。

OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。

来源: Google Blog — Introducing Gemini 3.8 Flash and 3.8 Flash Cyber, 检索于 2026-09-09; Codersera — Gemini 3.8 Flash Complete Guide, 检索于 2026-09-09; OpenRouter — Gemini 3.8 Flash, 检索于 2026-09-09; Artificial Analysis — Gemini 3.8 Flash, 检索于 2026-09-09.

三分钟快速上手

1. 获取 API 密钥

在 ai.google.dev 创建或获取 Gemini API 密钥。如果使用 Enterprise Agent Platform,需在 Google Cloud 项目中启用 Gemini API。

2. 安装 SDK

Python(Google GenAI SDK)

pip install google-genai

Python(OpenAI SDK,用于 OpenAI 兼容端点)

pip install openai

3. 第一个请求

使用 Google GenAI SDK

from google import genai

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.8-flash",
    contents="Write a Python function that retries HTTP requests with exponential backoff.",
)
print(response.text)

使用 OpenAI SDK(通过 OpenAI 兼容端点)

from openai import OpenAI

client = OpenAI(
    api_key="your-api-key",
    base_url="https://generativelanguage.googleapis.com/v1beta/openai/",
)

response = client.chat.completions.create(
    model="gemini-3.8-flash",
    messages=[
        {"role": "user", "content": "Write a Python function that retries HTTP requests with exponential backoff."}
    ],
)
print(response.choices[0].message.content)

两种方式返回相同的模型输出。OpenAI 兼容端点让你在不改写应用代码的前提下切换供应商。

相比 Gemini 3.7 Flash 有什么变化

Gemini 3.8 Flash 在 3.7 Flash 发布三周后上线。价格、上下文窗口、输出上限、输入模态和功能矩阵完全相同。差异全部体现在模型质量上,变化真实但分布不均。

指标3.7 Flash3.8 Flash变化来源
Artificial Analysis 智能指数5659+3独立评测
Artificial Analysis Agentic 指数45.150.0+4.9独立评测
Artificial Analysis 编程指数76.176.3+0.2独立评测
HLE-Verified53.6%54.9%+1.3 ppGoogle
Vals Finance Agent v259.0%61.4%+2.4 ppGoogle
Harvey Legal Agent8.8%10.0%+1.2 ppGoogle
LMArena 文本(High)1491 ± 81494 ± 9在误差范围内独立评测
输出速度279 tok/s299 tok/s+20 tok/s独立评测
首 token 延迟12.01 s13.21 s+1.20 s(变差)独立评测

规律很清楚,agentic 多步推理有实质性进步,纯编程几乎没动,人类偏好评分(LMArena)在误差范围内不可区分。

有一项真实的退步。首 token 延迟从 12.01 秒涨到 13.21 秒,慢了约 10%。Google 官方没有提及这一点。在 Design Arena 上,OpenRouter 的分数显示 3.8 Flash 略逊于 3.7 Flash(1311 vs 1318 Elo)。

Google 自己的解释是 3.8 Flash "更努力地工作",会执行更多推理步骤并反复调用工具。这带来了 agentic 能力的提升,同时也推高了首 token 延迟和 token 消耗。

来源: Codersera — Gemini 3.8 Flash Complete Guide, 检索于 2026-09-09; Google Blog — Introducing Gemini 3.8 Flash, 检索于 2026-09-09; Artificial Analysis, 检索于 2026-09-09.

定价、层级和 Thinking Token 陷阱

层级输入 / 1M tokens输出 / 1M tokens
标准(入门价,至 2026-12-31)$0.75$3.75
标准(2027-01-01 起)$1.50$7.50
Batch API$0.375$1.875
Flex 推理$0.375$1.875
Priority 推理$1.35$6.75
缓存输入(读取)$0.075—
缓存存储$0.50 / 1M tokens / 小时—

这张表里有两个容易忽略的细节。

Thinking token 按输出价格计费。 Gemini 3.8 Flash 默认使用 medium 推理强度,每一个内部 thinking token 都按输出费率($3.75 / 1M)收费。这些 token 不会出现在响应内容中,但会出现在账单上。Google 的 thinking 文档通过 total_thought_tokens 字段暴露了这个计数。

入门定价会过期。 2027 年 1 月 1 日起标准费率翻倍,输入 $1.50,输出 $7.50。做年度预算时需要按两个半年分别计算。

一个包含 thinking token 的计费实例

以一个典型的 agentic 调用为例,假设 30,000 输入 token,800 可见输出 token,6,000 thinking token(默认 medium 强度)。

  • 输入 30,000 × $0.75 / 1M = $0.0225
  • 输出 + thinking (800 + 6,000) × $3.75 / 1M = $0.0255
  • 合计 $0.048 / 次调用

只计算可见输出的天真估算是 $0.026,实际账单是它的 1.9 倍。按每天 1,000 次调用计算,差额约 $22/天,即每月约 $660。

三个控制成本的杠杆。

  1. 把 thinking_level 降到 low。 对不需要深度推理的任务,这直接削减最贵的 token 类别。
  2. 使用 Batch API。 非面向用户的任务走 Batch,输入输出均半价。
  3. 缓存稳定前缀。 缓存读取费用 $0.075 / 1M,是输入价的 1/10。注意 $0.50/小时 的存储费用,只有高频复用时缓存才划算。

来源: Codersera — Gemini 3.8 Flash Complete Guide, 检索于 2026-09-09; Google Blog, 检索于 2026-09-09.

模型规格和功能

属性Gemini 3.8 Flash
Model IDgemini-3.8-flash
GA 日期2026 年 9 月 2 日
输入模态文本、图片、视频、音频、PDF
输出模态仅文本
输入 token 上限1,048,576
输出 token 上限65,536
Thinking支持,low / medium / high(默认 medium)
Function calling / 结构化输出支持
上下文缓存支持
Batch API / Flex / Priority全部支持
Search grounding支持
代码执行支持
Computer use支持(Preview)
Live API不支持
图片 / 音频生成不支持

有两个缺失功能需要注意。没有 Live API,不能做双向实时语音会话;也没有图片/音频生成,这些功能在 Google 的 Omni 和 Image 专用模型上。Google 也没有公布知识截止日期,如果你的工作依赖最新信息,请使用 search grounding 或 URL context。

Thinking Mode 配置

Gemini 3.8 Flash 默认启用推理模式,无法完全关闭,只能设置为 low、medium 或 high。这是控制该模型成本最关键的一个参数。

from google import genai
from google.genai import types

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.8-flash",
    contents="Debug this Python traceback and suggest a fix: ...",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(
            thinking_budget=2048,  # 较低的预算 = 更少的 thinking token = 更低的成本
        )
    ),
)

# 查看实际 thinking token 使用量
print(f"Thinking tokens: {response.usage_metadata.thoughts_token_count}")
print(f"Output tokens: {response.usage_metadata.candidates_token_count}")
print(response.text)

在 agent 循环中,有些轮次需要深度推理(代码审查、调试),有些只需要快速响应(状态检查、格式化)。按调用级别调整 thinking level 比设置全局默认值更有效。

与竞品的定价对比

模型输入 / 1M tokens输出 / 1M tokens上下文窗口备注
Gemini 3.8 Flash$0.75$3.751M入门价至 2026 年 12 月
Gemini 3.7 Flash$0.75$3.751M入门价至 2026 年 12 月
Claude Fable 5.1$3.00$15.00200K缓存读取 $0.75/MTok
GPT-6 Astra$10.00$50.00256K前沿级
Claude Sonnet 5$2.00$10.00200K中间级
DeepSeek V4 Flash$0.14$0.28128K预算级,上下文较小

按入门价计算,Gemini 3.8 Flash 的输入和输出列表价格是 Claude Fable 5.1 的 1/4。它还拥有 Flash/中间级类别中最大的上下文窗口(1M tokens)。不过 thinking token 会推高实际输出成本,而 Claude Fable 5.1 的缓存读取便宜 75%,在高频复用 prompt 的场景下可以缩小差距。

关于 Fable 5.1 缓存经济性的详细对比,见 2026 年 9 月前沿模型对比。

通过 TheRouter 进行多供应商路由

生产环境中依赖单一供应商意味着单点故障。TheRouter 将 OpenAI 兼容的请求路由到已配置的供应商,并支持 fallback 以保证可用性。

from openai import OpenAI

client = OpenAI(
    api_key="your-therouter-api-key",
    base_url="https://api.therouter.ai/v1",
)

# TheRouter 将 'google/gemini-3.8-flash' 解析到 Google 供应商
response = client.chat.completions.create(
    model="google/gemini-3.8-flash",
    messages=[
        {"role": "user", "content": "Write a Python function to parse ISO 8601 dates."}
    ],
)
print(response.choices[0].message.content)

配置了 model fallback 后,如果 Google 端点不可用,TheRouter 会透明地将请求路由到备选供应商。对于夜间运行批处理任务的编程 agent 来说,这能防止供应商的临时故障拖住整条流水线。

Fallback 配置的细节见 model fallback 路由指南。

注意: 截至本文发布时,google/gemini-3.8-flash 尚未加入 TheRouter 的模型目录。请查看 Google 供应商页面 了解最新可用性。

常见错误及解决方法

429 Too Many Requests 触发了速率限制。Google 按账户层级强制执行 RPM 和 TPM 限制。实施指数退避重试,升级账户层级,或通过 TheRouter 配合 fallback 分散负载。

400 Invalid value at 'contents' 请求体格式错误。常见原因是发送了空的 contents 数组或使用了不支持的参数。检查 generateContent 的 API 参考文档。

503 Service Unavailable 临时中断。带退避重试。生产环境中配置 model fallback 让请求自动重路由。

gemini-3.8-flash not found 确认 Model ID 正确。Google AI Studio 使用 gemini-3.8-flash,Vertex AI / Enterprise Agent Platform 上使用完整限定名。该模型于 2026 年 9 月 2 日 GA。

账单意外偏高 检查响应元数据中的 total_thought_tokens。默认 medium 强度下,thinking token 可能是可见输出 token 的 5-10 倍。对日常任务降到 low。

生产部署清单

部署 Gemini 3.8 Flash 到生产环境前,确认以下事项。

  1. API 密钥权限控制。 使用项目专属密钥,最小权限原则,定期轮换。
  2. 速率限制余量。 在 Google Cloud Console 检查 RPM/TPM 配额,在上线前而非故障期间申请提升。
  3. Thinking 预算调优。 分析你的工作负载。默认 medium 强度在多轮 agent 循环中很贵。从 low 开始,只在准确率提升能证明成本合理的地方调高。
  4. Fallback 路由。 至少配置一个替代模型(如 google/gemini-3.7-flash 或 deepseek/deepseek-chat),防止临时故障阻断流水线。
  5. 上下文窗口监控。 1M tokens 是上限,监控实际用量。大上下文请求的成本更高、延迟更大。
  6. 入门定价截止日期。 当前费率 2026 年 12 月 31 日到期。2027 年预算按 2 倍费率规划。
  7. Thinking token 成本感知。 记录每个请求的 thoughts_token_count。建设追踪实际成本(输出 + thinking)的仪表盘,而不仅仅是可见输出。

TheRouter 集成说明

TheRouter 将 OpenAI 兼容的请求路由到已配置的供应商,支持 provider/model 路由和 fallback,并提供统一的计费/核算界面。

对 Gemini 模型而言,你只需写一次 OpenAI SDK 代码,把 base_url 指向 TheRouter,就能获得供应商级别的容灾能力,无需集成供应商专属 SDK。当 google/gemini-3.8-flash 进入模型目录后,从直连 Google API 切换到路由调用只需改 base URL 和 API key。

查看 TheRouter 上 Google 模型的最新可用性,见 Google 供应商页面。

延伸阅读

帮助与联系