2026 年 9 月 AI 模型发布汇总:GPT-6 Astra、Fable 5.1、Gemini 3.8 Flash 及 V4.1 Flash 的 API 路由变更日志
2026 年 9 月前两周,五款主要文本生成模型密集上线。本文汇总每款模型的定价、规格与路由建议,并链接到各自的详细指南。
2026 年 9 月头十天里,五款主力文本生成模型接连上线。如果你正在运行 API 路由层,每一款都会改变至少一个路由决策的成本计算。这篇参考页面把五次发布集中在一起,列出规格、定价,附上每款模型的专项指南链接。
OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。
9 月发布时间线
| 日期 | 模型 | 厂商 | 输入 $/M | 输出 $/M | 上下文 | 亮点 |
|---|---|---|---|---|---|---|
| 9 月 1 日 | Claude Fable 5.1 | Anthropic | $10.00 | $50.00 | 1M | 缓存读取 75% 折扣($2.50/M) |
| 9 月 1 日 | Claude Mythos 5.1 | Anthropic | — | — | — | 仅限研究,尚无公开 API |
| 9 月 2 日 | Gemini 3.8 Flash | $0.75 | $3.75 | 1M | 促销价持续至 2026 年 12 月 31 日 | |
| 9 月 2 日 | Qwen3.8-Max-0902 | 阿里巴巴 / DashScope | ~$1.69 | ~$5.07 | 1M | 快照更新,编码能力提升 |
| 9 月 4 日 | GPT-6 Astra | OpenAI | $10.00 | $50.00 | 256K | 最大输出 128K token;缓存输入 $1.00/M |
| 9 月 10 日 | DeepSeek V4.1 Flash | DeepSeek | $0.15 | $1.10 | 128K | 非高峰价格;高峰 $0.30/$2.20 |
以上均为标准 API 价格。促销价、批量价和非高峰折扣在下方各模型章节中标注。
GPT-6 Astra
GPT-6 Astra 是 OpenAI 在 2026 年 9 月发布的旗舰模型,9 月 4 日上线。256K 上下文窗口,最大输出 128K token,定价 $10/$50 每百万 token。
主要规格
- Model ID
gpt-6-astra - 上下文窗口 256,000 token
- 最大输出 128,000 token
- 定价 $10/M 输入,$50/M 输出,$1/M 缓存输入
- 批量定价 $5/M 输入,$25/M 输出(五折)
- Effort 级别 Low、Medium、High(推理算力弹性调节)
路由建议。 GPT-6 Astra 在输出价格上比 Gemini 3.8 Flash 贵 13 倍。把复杂推理、多步 agentic 工作流和需要大输出窗口的任务路由到这里。简单的分类、抽取或摘要任务更适合 flash 层。
相比 GPT-5.6 Sol 的变化。 GPT-6 Astra 引入了 effort 级别控制和更大的输出窗口。如果你之前用了 GPT-5.6 Sol 的 programmatic tool calling,这个特性仍然保留。定价从 $7.50/$30 涨到了 $10/$50。
完整集成指南请参考 GPT-6 Astra API 路由指南。
Claude Fable 5.1
Anthropic 在 9 月 1 日同时发布了 Claude Fable 5.1 和研究导向的 Mythos 5.1。Fable 5.1 保持了和 Fable 5 相同的标价($10/$50),但推出了明显的缓存读取折扣。
主要规格
- Model ID
claude-fable-5-1-20260901 - 上下文窗口 1,000,000 token
- 最大输出 128,000 token(开启 extended thinking 时)
- 定价 $10/M 输入,$50/M 输出
- 缓存读取 $2.50/M(相比标准输入价 75% 折扣)
- 缓存写入 $12.50/M
- 批量定价 $5/M 输入,$25/M 输出(五折)
路由建议。 75% 的缓存读取折扣是最大亮点。如果你的工作负载涉及重复的系统提示、RAG 上下文或多轮对话中稳定的前缀部分,实际输入成本从 $10/M 降到 $2.50/M。这使得 Fable 5.1 在缓存输入方面比 GPT-6 Astra 更便宜,同时输出定价持平。
相比 Fable 5 的变化。 编码和 agentic 任务的 benchmark 分数有所提升。缓存读取折扣是新增功能。Extended thinking 的输出限制提高。Model ID 从 claude-fable-5-20260601 变更为 claude-fable-5-1-20260901。
缓存经济学和配置详情请参考 Claude Fable 5.1 路由指南。
Gemini 3.8 Flash
Google 在 9 月 2 日发布了 Gemini 3.8 Flash,距离 Gemini 3.7 Flash 仅三周。定价不变,依然面向低成本生产工作负载。
主要规格
- Model ID
gemini-3.8-flash - 上下文窗口 1,000,000 token
- 最大输出 65,536 token
- 定价 $0.75/M 输入,$3.75/M 输出(促销价,持续至 2026 年 12 月 31 日)
- Thinking mode 支持
路由建议。 $0.75/$3.75 的价格让 Gemini 3.8 Flash 和 DeepSeek V4.1 Flash 同处 flash 价格层。输出比 GPT-6 Astra 便宜 13 倍。当延迟和成本比顶级推理深度更重要时,把大流量任务路由到这里。
相比 Gemini 3.7 Flash 的变化。 编码和 STEM 任务的 benchmark 分数提升。价格不变。上下文窗口保持 1M。新增了 computer-use 能力(参考 Gemini 3.5 Flash computer use 指南了解相关模式)。
完整路由指南请参考 Gemini 3.8 Flash 路由指南。
DeepSeek V4.1 Flash
DeepSeek 在 9 月 10 日发布了 V4.1 Flash,这是 DeepSeek V4.1 的蒸馏变体,主打速度和成本。
主要规格
- Model ID
deepseek-chat(可用时自动路由到 V4.1 Flash) - 上下文窗口 128,000 token
- 最大输出 16,384 token
- 非高峰定价 $0.15/M 输入,$1.10/M 输出
- 高峰定价 $0.30/M 输入,$2.20/M 输出
- 缓存命中 $0.003/M 输入(非高峰),$0.007/M(高峰)
路由建议。 DeepSeek V4.1 Flash 是本文所有模型中最便宜的,非高峰价格仅 $0.15/$1.10。高峰/非高峰定价增加了调度维度。如果你的工作负载能安排在非高峰窗口运行,这是简单任务成本最低的路径。缓存命中价 $0.003/M 几乎等于免费。
相比 V4 Flash 的变化。 编码任务的 benchmark 分数提升。输入和输出价格均有下调。从 V4.1 蒸馏而来,速度更快,质量和 V4 Flash 可比。
集成详情请参考 DeepSeek V4.1 Flash 完整指南。
Qwen3.8-Max-0902
阿里巴巴在 9 月 2 日发布了 Qwen3.8-Max 的新快照,这是 8 月 3 日首发以来 2.4 万亿参数旗舰模型的首次更新。
主要规格
- Model ID
qwen3.8-max-2026-09-02(也可用qwen3.8-max) - 上下文窗口 1,000,000 token
- 最大输出 16,384 token(thinking mode 下 32,768)
- 定价 约 ¥12/M 输入,约 ¥36/M 输出(约 $1.69/$5.07)
- Thinking mode 通过
enable_thinking: true开启
路由建议。 Qwen3.8-Max-0902 是需要 DashScope 覆盖的运营者最具性价比的旗舰级模型。定价介于 flash 层和西方旗舰层之间。如果你通过 DashScope 的 OpenAI 兼容端点路由,无需改动代码。使用无版本号的 qwen3.8-max model ID 即可自动获取快照更新。
相比 8 月 3 日首发版的变化。 编码性能提升,SWE-Bench 分数据称有所提高。价格不变,API 接口不变。
完整指南请参考 Qwen3.8-Max API 指南。
跨模型对比
| GPT-6 Astra | Fable 5.1 | Gemini 3.8 Flash | V4.1 Flash | Qwen3.8-Max-0902 | |
|---|---|---|---|---|---|
| 输入 $/M | $10.00 | $10.00 | $0.75 | $0.15 | ~$1.69 |
| 输出 $/M | $50.00 | $50.00 | $3.75 | $1.10 | ~$5.07 |
| 缓存读取 | $1.00/M | $2.50/M | $0.19/M | $0.003/M | — |
| 上下文 | 256K | 1M | 1M | 128K | 1M |
| 最大输出 | 128K | 128K | 65K | 16K | 16K |
| 批量折扣 | 50% | 50% | — | — | — |
| OpenAI 兼容 | 原生 | 是 | 是 | 是 | 是(DashScope) |
如何看这张表。 旗舰层(GPT-6 Astra、Fable 5.1)的输出价格是 flash 层(Gemini 3.8 Flash、V4.1 Flash)的 13 倍。Qwen3.8-Max 位于两者之间。你的路由配置应该反映这个价差,把复杂推理发到旗舰层,大流量简单任务发到 flash 层。
路由决策树
- 任务需要深度多步推理吗? 路由到 GPT-6 Astra 或 Claude Fable 5.1。如果工作负载包含重复上下文,优先选择 Fable 5.1 以利用缓存读取折扣。
- 是大批量抽取、分类或摘要任务吗? 路由到 Gemini 3.8 Flash 或 DeepSeek V4.1 Flash。V4.1 Flash 更便宜,但有高峰/非高峰定价和较小的上下文窗口。
- 需要 DashScope 或国内厂商? 通过 DashScope 的 OpenAI 兼容端点路由到 Qwen3.8-Max。
- 需要 fallback 链? 一个实用方案是主模型
gpt-6-astra→ fallbackclaude-fable-5-1-20260901→ 兜底gemini-3.8-flash。兼顾旗舰推理能力和 flash 层的弹性。
详细的 fallback 配置请参考 LLM API fallback 路由指南。
本文未覆盖的内容
- Claude Mythos 5.1 和 Fable 5.1 同日发布,但目前仅限研究访问,没有公开 API 定价。API 开放后我们会单独覆盖。
- 厂商特定 benchmark。 各厂商在不同评测集上报告分数。本文没有尝试跨模型的 benchmark 标准化。各模型的详细 benchmark 数据请查阅上方链接的专项指南。
- TheRouter 实时模型可用性。 本文提到的 model ID 反映的是上游厂商的可用状态。请检查你的路由网关的模型列表以确认当前覆盖情况。
常见问题
9 月新模型中,哪个最适合编码 agent?
GPT-6 Astra 和 Claude Fable 5.1 在编码 benchmark 上都表现不错。如果你的 agent 使用长且重复的系统提示,Fable 5.1 的缓存读取折扣会让长期成本更低。Qwen3.8-Max-0902 在需要 DashScope 覆盖时是有力选择。更全面的对比请参考编码 agent 路由对比。
DeepSeek V4.1 Flash 能用于生产环境吗?
V4.1 Flash 于 9 月 10 日正式发布,支持 OpenAI 兼容调用,通过 DeepSeek API 提供服务。生产使用的主要限制在于高峰/非高峰定价模式和 16K 最大输出。配置详情请参考 DeepSeek V4.1 Flash 指南。
Gemini 3.8 Flash 和 DeepSeek V4.1 Flash 相比如何?
两者都在 flash 价格层,但 Gemini 3.8 Flash 有 1M 上下文窗口,V4.1 Flash 只有 128K。Gemini 促销价 $0.75/$3.75,V4.1 Flash 非高峰价 $0.15/$1.10。V4.1 Flash 更便宜,Gemini 上下文更大。路由细节请参考 GPT-6 Astra vs Gemini 3.8 Flash 对比。
Gemini 3.8 Flash 的促销价什么时候结束?
Google 的促销价 $0.75/$3.75 每百万 token 持续到 2026 年 12 月 31 日。之后会恢复标准价格。最新信息请查看 Google 定价页面。
能用同一个 OpenAI SDK 客户端调用全部五款模型吗?
可以。五款模型都支持 OpenAI 兼容请求格式。你只需要把 base_url 指向各厂商的端点(或你的路由网关),然后切换 model 参数。各厂商端点详情请参考 OpenAI 兼容 API 厂商参考。