← 全部文章

2026 年 9 月 AI 模型发布汇总:GPT-6 Astra、Fable 5.1、Gemini 3.8 Flash 及 V4.1 Flash 的 API 路由变更日志

2026 年 9 月前两周,五款主要文本生成模型密集上线。本文汇总每款模型的定价、规格与路由建议,并链接到各自的详细指南。

· TheRouter

2026 年 9 月头十天里,五款主力文本生成模型接连上线。如果你正在运行 API 路由层,每一款都会改变至少一个路由决策的成本计算。这篇参考页面把五次发布集中在一起,列出规格、定价,附上每款模型的专项指南链接。

OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。

9 月发布时间线

日期模型厂商输入 $/M输出 $/M上下文亮点
9 月 1 日Claude Fable 5.1Anthropic$10.00$50.001M缓存读取 75% 折扣($2.50/M)
9 月 1 日Claude Mythos 5.1Anthropic———仅限研究,尚无公开 API
9 月 2 日Gemini 3.8 FlashGoogle$0.75$3.751M促销价持续至 2026 年 12 月 31 日
9 月 2 日Qwen3.8-Max-0902阿里巴巴 / DashScope~$1.69~$5.071M快照更新,编码能力提升
9 月 4 日GPT-6 AstraOpenAI$10.00$50.00256K最大输出 128K token;缓存输入 $1.00/M
9 月 10 日DeepSeek V4.1 FlashDeepSeek$0.15$1.10128K非高峰价格;高峰 $0.30/$2.20

以上均为标准 API 价格。促销价、批量价和非高峰折扣在下方各模型章节中标注。

GPT-6 Astra

GPT-6 Astra 是 OpenAI 在 2026 年 9 月发布的旗舰模型,9 月 4 日上线。256K 上下文窗口,最大输出 128K token,定价 $10/$50 每百万 token。

主要规格

  • Model ID gpt-6-astra
  • 上下文窗口 256,000 token
  • 最大输出 128,000 token
  • 定价 $10/M 输入,$50/M 输出,$1/M 缓存输入
  • 批量定价 $5/M 输入,$25/M 输出(五折)
  • Effort 级别 Low、Medium、High(推理算力弹性调节)

路由建议。 GPT-6 Astra 在输出价格上比 Gemini 3.8 Flash 贵 13 倍。把复杂推理、多步 agentic 工作流和需要大输出窗口的任务路由到这里。简单的分类、抽取或摘要任务更适合 flash 层。

相比 GPT-5.6 Sol 的变化。 GPT-6 Astra 引入了 effort 级别控制和更大的输出窗口。如果你之前用了 GPT-5.6 Sol 的 programmatic tool calling,这个特性仍然保留。定价从 $7.50/$30 涨到了 $10/$50。

完整集成指南请参考 GPT-6 Astra API 路由指南。

Claude Fable 5.1

Anthropic 在 9 月 1 日同时发布了 Claude Fable 5.1 和研究导向的 Mythos 5.1。Fable 5.1 保持了和 Fable 5 相同的标价($10/$50),但推出了明显的缓存读取折扣。

主要规格

  • Model ID claude-fable-5-1-20260901
  • 上下文窗口 1,000,000 token
  • 最大输出 128,000 token(开启 extended thinking 时)
  • 定价 $10/M 输入,$50/M 输出
  • 缓存读取 $2.50/M(相比标准输入价 75% 折扣)
  • 缓存写入 $12.50/M
  • 批量定价 $5/M 输入,$25/M 输出(五折)

路由建议。 75% 的缓存读取折扣是最大亮点。如果你的工作负载涉及重复的系统提示、RAG 上下文或多轮对话中稳定的前缀部分,实际输入成本从 $10/M 降到 $2.50/M。这使得 Fable 5.1 在缓存输入方面比 GPT-6 Astra 更便宜,同时输出定价持平。

相比 Fable 5 的变化。 编码和 agentic 任务的 benchmark 分数有所提升。缓存读取折扣是新增功能。Extended thinking 的输出限制提高。Model ID 从 claude-fable-5-20260601 变更为 claude-fable-5-1-20260901。

缓存经济学和配置详情请参考 Claude Fable 5.1 路由指南。

Gemini 3.8 Flash

Google 在 9 月 2 日发布了 Gemini 3.8 Flash,距离 Gemini 3.7 Flash 仅三周。定价不变,依然面向低成本生产工作负载。

主要规格

  • Model ID gemini-3.8-flash
  • 上下文窗口 1,000,000 token
  • 最大输出 65,536 token
  • 定价 $0.75/M 输入,$3.75/M 输出(促销价,持续至 2026 年 12 月 31 日)
  • Thinking mode 支持

路由建议。 $0.75/$3.75 的价格让 Gemini 3.8 Flash 和 DeepSeek V4.1 Flash 同处 flash 价格层。输出比 GPT-6 Astra 便宜 13 倍。当延迟和成本比顶级推理深度更重要时,把大流量任务路由到这里。

相比 Gemini 3.7 Flash 的变化。 编码和 STEM 任务的 benchmark 分数提升。价格不变。上下文窗口保持 1M。新增了 computer-use 能力(参考 Gemini 3.5 Flash computer use 指南了解相关模式)。

完整路由指南请参考 Gemini 3.8 Flash 路由指南。

DeepSeek V4.1 Flash

DeepSeek 在 9 月 10 日发布了 V4.1 Flash,这是 DeepSeek V4.1 的蒸馏变体,主打速度和成本。

主要规格

  • Model ID deepseek-chat(可用时自动路由到 V4.1 Flash)
  • 上下文窗口 128,000 token
  • 最大输出 16,384 token
  • 非高峰定价 $0.15/M 输入,$1.10/M 输出
  • 高峰定价 $0.30/M 输入,$2.20/M 输出
  • 缓存命中 $0.003/M 输入(非高峰),$0.007/M(高峰)

路由建议。 DeepSeek V4.1 Flash 是本文所有模型中最便宜的,非高峰价格仅 $0.15/$1.10。高峰/非高峰定价增加了调度维度。如果你的工作负载能安排在非高峰窗口运行,这是简单任务成本最低的路径。缓存命中价 $0.003/M 几乎等于免费。

相比 V4 Flash 的变化。 编码任务的 benchmark 分数提升。输入和输出价格均有下调。从 V4.1 蒸馏而来,速度更快,质量和 V4 Flash 可比。

集成详情请参考 DeepSeek V4.1 Flash 完整指南。

Qwen3.8-Max-0902

阿里巴巴在 9 月 2 日发布了 Qwen3.8-Max 的新快照,这是 8 月 3 日首发以来 2.4 万亿参数旗舰模型的首次更新。

主要规格

  • Model ID qwen3.8-max-2026-09-02(也可用 qwen3.8-max)
  • 上下文窗口 1,000,000 token
  • 最大输出 16,384 token(thinking mode 下 32,768)
  • 定价 约 ¥12/M 输入,约 ¥36/M 输出(约 $1.69/$5.07)
  • Thinking mode 通过 enable_thinking: true 开启

路由建议。 Qwen3.8-Max-0902 是需要 DashScope 覆盖的运营者最具性价比的旗舰级模型。定价介于 flash 层和西方旗舰层之间。如果你通过 DashScope 的 OpenAI 兼容端点路由,无需改动代码。使用无版本号的 qwen3.8-max model ID 即可自动获取快照更新。

相比 8 月 3 日首发版的变化。 编码性能提升,SWE-Bench 分数据称有所提高。价格不变,API 接口不变。

完整指南请参考 Qwen3.8-Max API 指南。

跨模型对比

GPT-6 AstraFable 5.1Gemini 3.8 FlashV4.1 FlashQwen3.8-Max-0902
输入 $/M$10.00$10.00$0.75$0.15~$1.69
输出 $/M$50.00$50.00$3.75$1.10~$5.07
缓存读取$1.00/M$2.50/M$0.19/M$0.003/M—
上下文256K1M1M128K1M
最大输出128K128K65K16K16K
批量折扣50%50%———
OpenAI 兼容原生是是是是(DashScope)

如何看这张表。 旗舰层(GPT-6 Astra、Fable 5.1)的输出价格是 flash 层(Gemini 3.8 Flash、V4.1 Flash)的 13 倍。Qwen3.8-Max 位于两者之间。你的路由配置应该反映这个价差,把复杂推理发到旗舰层,大流量简单任务发到 flash 层。

路由决策树

  1. 任务需要深度多步推理吗? 路由到 GPT-6 Astra 或 Claude Fable 5.1。如果工作负载包含重复上下文,优先选择 Fable 5.1 以利用缓存读取折扣。
  2. 是大批量抽取、分类或摘要任务吗? 路由到 Gemini 3.8 Flash 或 DeepSeek V4.1 Flash。V4.1 Flash 更便宜,但有高峰/非高峰定价和较小的上下文窗口。
  3. 需要 DashScope 或国内厂商? 通过 DashScope 的 OpenAI 兼容端点路由到 Qwen3.8-Max。
  4. 需要 fallback 链? 一个实用方案是主模型 gpt-6-astra → fallback claude-fable-5-1-20260901 → 兜底 gemini-3.8-flash。兼顾旗舰推理能力和 flash 层的弹性。

详细的 fallback 配置请参考 LLM API fallback 路由指南。

本文未覆盖的内容

  • Claude Mythos 5.1 和 Fable 5.1 同日发布,但目前仅限研究访问,没有公开 API 定价。API 开放后我们会单独覆盖。
  • 厂商特定 benchmark。 各厂商在不同评测集上报告分数。本文没有尝试跨模型的 benchmark 标准化。各模型的详细 benchmark 数据请查阅上方链接的专项指南。
  • TheRouter 实时模型可用性。 本文提到的 model ID 反映的是上游厂商的可用状态。请检查你的路由网关的模型列表以确认当前覆盖情况。

常见问题

9 月新模型中,哪个最适合编码 agent?

GPT-6 Astra 和 Claude Fable 5.1 在编码 benchmark 上都表现不错。如果你的 agent 使用长且重复的系统提示,Fable 5.1 的缓存读取折扣会让长期成本更低。Qwen3.8-Max-0902 在需要 DashScope 覆盖时是有力选择。更全面的对比请参考编码 agent 路由对比。

DeepSeek V4.1 Flash 能用于生产环境吗?

V4.1 Flash 于 9 月 10 日正式发布,支持 OpenAI 兼容调用,通过 DeepSeek API 提供服务。生产使用的主要限制在于高峰/非高峰定价模式和 16K 最大输出。配置详情请参考 DeepSeek V4.1 Flash 指南。

Gemini 3.8 Flash 和 DeepSeek V4.1 Flash 相比如何?

两者都在 flash 价格层,但 Gemini 3.8 Flash 有 1M 上下文窗口,V4.1 Flash 只有 128K。Gemini 促销价 $0.75/$3.75,V4.1 Flash 非高峰价 $0.15/$1.10。V4.1 Flash 更便宜,Gemini 上下文更大。路由细节请参考 GPT-6 Astra vs Gemini 3.8 Flash 对比。

Gemini 3.8 Flash 的促销价什么时候结束?

Google 的促销价 $0.75/$3.75 每百万 token 持续到 2026 年 12 月 31 日。之后会恢复标准价格。最新信息请查看 Google 定价页面。

能用同一个 OpenAI SDK 客户端调用全部五款模型吗?

可以。五款模型都支持 OpenAI 兼容请求格式。你只需要把 base_url 指向各厂商的端点(或你的路由网关),然后切换 model 参数。各厂商端点详情请参考 OpenAI 兼容 API 厂商参考。

帮助与联系