Gemini 2.5 Flash 稳定 GA
Google 将 Gemini 2.5 Flash 设为 GA,简化为单一 thinking/non-thinking 价格层,并将 Flash-Lite 定位为更便宜的高吞吐选项。
Best for balancing reasoning and speed. Gemini 2.5 Flash offers thinking capabilities with strong performance across coding, math, and reasoning tasks at an efficient price point.
Gemini 2.5 Flash 是 Google 2.5 系列的通用主力模型,在 Google I/O 展示 05-20 preview 后,于 2025 年 6 月 17 日稳定 GA。它的定位是价格/性能平衡:1,048,576 token 输入窗口、65,536 token 输出上限、原生 Gemini API 的多模态输入(文本、图像、视频、音频)、文本输出、工具调用、结构化输出、代码执行、URL context、搜索 grounding,以及可控 thinking budget。
在 TheRouter 上,Gemini 2.5 Flash 是团队需要长上下文推理和 agentic 工具能力、但不想承担 Pro 级成本时的默认 Google 选择。它比 Gemini 2.0 Flash 更强且更可控,比 Gemini 2.5 Pro 更便宜,也比 Flash-Lite 更适合编程、多步分析、检索密集客服和高吞吐文档工作流。如果首要目标是前沿级代码准确率而不是成本,应路由到 Gemini 3 Flash/Pro 或 GPT-5.5 级模型。
| 类型 | 费率 |
|---|---|
| 输入 | $0.324 每百万 Tokens |
| 输出 | $2.70 每百万 Tokens |
| 发布日期 | 2025-06-17(稳定 GA)developers.googleblog.com ↗ | 已核实 |
| 知识截止 | 2025 年 1 月ai.google.dev ↗ | 已核实 |
| 输入 / 输出模态 | 原生 Gemini API:文本、图像、视频、音频输入;文本输出。TheRouter 暴露文本/图像/PDF 输入和文本输出。ai.google.dev ↗ | 已核实 |
| 原生工具能力 | 函数调用、结构化输出、代码执行、文件搜索、URL context、搜索 grounding、地图 grounding、缓存、Batch API、Flex 和 Priority inferenceai.google.dev ↗ | 已核实 |
| 许可 | 专有 API 模型;按 Google Gemini API / Google Cloud 条款提供,非开放权重ai.google.dev ↗ | 已核实 |
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
Global-MMLU-Lite 聚合器报告的 Gemini 2.5 Flash benchmark;在对照 Google model card 表格前应作为方向性指标。 | 88.4%% | llm-stats.com ↗ | |
AIME 2024 聚合器报告的数学结果;Google 另称 05-20 Flash 更新在推理 benchmark 上有提升。 | 88.0%% | llm-stats.com ↗ | |
GPQA 聚合器报告的科学/推理分数;在匹配底层 model-card 方法前保持 medium confidence。 | 82.8%% | llm-stats.com ↗ | |
MMMU 聚合器报告的稳定 Flash 系列多模态分数。 | 79.7%% | llm-stats.com ↗ |
所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。
curl https://api.therouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -d '{
"model": "google/gemini-2.5-flash",
"messages": [
{"role": "user", "content": "Summarize the key points from this input."}
]
}'当你需要 Google 长上下文推理但不想更换 SDK 时,可通过 TheRouter 以 OpenAI-compatible chat model 调用 Gemini 2.5 Flash。
curl https://api.therouter.ai/v1/chat/completions -H "Authorization: Bearer $THEROUTER_API_KEY" -H "Content-Type: application/json" -d '{"model":"google/gemini-2.5-flash","messages":[{"role":"user","content":"Summarize the migration risk in this pull request."}]}'Google 将 Gemini 2.5 Flash 设为 GA,简化为单一 thinking/non-thinking 价格层,并将 Flash-Lite 定位为更便宜的高吞吐选项。
Google 称更新后的 Flash preview 在推理、多模态、代码和长上下文方面更强,并在内部评测中减少 20-30% token 使用。
对于成本平衡型生产流量,是。它以远低于 Pro 级模型的成本提供 1M 上下文、thinking、工具调用、结构化输出和多模态输入。若是前沿自主编程,应评估 Gemini 3 或 GPT-5.5 级模型。
Flash 是更强的价格/性能模型,适合推理和 agentic 工作流;Flash-Lite 优化最低延迟和成本,thinking 默认关闭,更适合大规模分类、摘要和简单抽取。
支持。TheRouter 通过 OpenAI-compatible chat completions 暴露该模型,supported_params 包含 tools。超出通用函数调用的 Gemini 原生工具特性,应在具体 TheRouter 路由上验证后再对外宣传。
| 来源 | URL | 采集于 | |
|---|---|---|---|
| 发布日期 | developers.googleblog.com ↗ | 2026-06-03 | 已核实 |
| 知识截止 | ai.google.dev ↗ | 2026-06-03 | 已核实 |
| 输入 / 输出模态 | ai.google.dev ↗ | 2026-06-03 | 已核实 |
| 原生工具能力 | ai.google.dev ↗ | 2026-06-03 | 已核实 |
| 许可 | ai.google.dev ↗ | 2026-06-03 | 已核实 |
| Global-MMLU-Lite | llm-stats.com ↗ | 2026-06-03 | 待核实 |
| AIME 2024 | llm-stats.com ↗ | 2026-06-03 | 待核实 |
| GPQA | llm-stats.com ↗ | 2026-06-03 | 待核实 |
| MMMU | llm-stats.com ↗ | 2026-06-03 | 待核实 |
| Gemini 2.5 Flash 稳定 GA | developers.googleblog.com ↗ | 2026-06-03 | 已核实 |
| Google I/O 更新提升 Flash 效率与推理 | blog.google ↗ | 2026-06-03 | 已核实 |
| Gemini 2.5 Flash 是 TheRouter 上默认 Google 模型的正确选择吗? | ai.google.dev ↗ | 2026-06-03 | 待核实 |
| Gemini 2.5 Flash 与 Gemini 2.5 Flash-Lite 有什么不同? | developers.googleblog.com ↗ | 2026-06-03 | 待核实 |
| Gemini 2.5 Flash 是否通过 TheRouter 支持 OpenAI-compatible 工具调用? | ai.google.dev ↗ | 2026-06-03 | 待核实 |