← 全部文章

2026 年 Q4 大模型 API 定价全景:GPT-6.1 Sol、Opus 5.5 与 Astra 取消后的新格局

2026 年第四季度主流大模型 API 定价完整参考。OpenAI 取消了 GPT-6.1 Astra,GPT-6.1 Sol 以 $2/$10 的价格成为 OpenAI 最强公开模型。我们整理了各家厂商每个档位的价格、缓存折扣和批量处理费率,帮你按预算做好路由配置。

· updated 2026-10-03· TheRouter

OpenAI 的旗舰 API 档位消失了。 2026 年 9 月 29 日,OpenAI 以安全顾虑为由取消了 GPT-6.1 Astra。自 GPT-6 Astra 以来 OpenAI 一直维持的 $10/$50 顶级价格带就此终结。GPT-6.1 Sol 以 $2/$10 的价格登顶 OpenAI 公开模型阵容,与上一代 GPT-6 Sol 价格持平。与此同时,Claude Opus 5.5 以 $4/$20 上线,Fable 5.1 以 $10/$50 守住了扩展推理的最高位,DeepSeek V4.1 Flash 以极低价格替换了 V4 Pro。价格底线在下沉,价格天花板在塌缩,"前沿"和"中端"之间的差距从未如此之小。

这篇文章是截至 2026 年 10 月 3 日的完整定价表。收藏它,发给你的团队,用它来配路由。

OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。

数据来源(均获取于 2026-10-03)
OpenAI API Pricing · Anthropic Claude Pricing · DeepSeek Pricing · DashScope 模型定价 · SiliconFlow Pricing · Gemini API Pricing

Astra 取消之后

2026 年 9 月 29 日之前,API 定价版图有一条清晰的顶线。OpenAI 对 GPT-6 Astra 收费 $10/$50,Anthropic 对 Fable 5.1 收费 $10/$50。这两个是"需要最强能力就付这个价"的模型。

然后 OpenAI 在 DevDay 上以安全顾虑取消了 GPT-6.1 Astra。同日发布的 GPT-6.1 Sol 定价 $2/$10,官方说法是"以 Astra 标准 API 价格的五分之一,提供接近 Astra 水平的编程、计算机使用和专业工作能力"。那个"五分之一"的对比对象,已经不再发售。

实际影响很直接。OpenAI 最强的公开模型现在和 Claude Sonnet 5 价格相同。OpenAI 这边的"旗舰"价格带一夜之间从 $10/$50 掉到 $2/$10。Anthropic 仍然以 Fable 5.1 守着 $10/$50、以 Opus 5.5 守着 $4/$20,但 GPT-6.1 Sol 在 $2/$10 带来的竞争压力是实实在在的。

完整定价表

价格单位均为每百万 token(输入/输出),另有标注的除外。缓存和批量列为厂商公布的折扣价,短横线表示厂商未公布该费率。

前沿档(输入 $4 以上)

模型厂商输入输出缓存输入批量上下文
Claude Fable 5.1Anthropic$10.00$50.00$0.25$5.00/$25.001M
Claude Fable 5Anthropic$10.00$50.00$1.00$5.00/$25.001M
Claude Opus 5.5Anthropic$4.00$20.00$0.20$2.00/$10.001M

Fable 5.1 的缓存读取价格比 Fable 5 砍了 75%($0.25 对 $1.00),长上下文 agentic 工作负载如果能命中缓存,成本会显著下降。Astra 取消后,Fable 5.1 是西方主流厂商中唯一还在 $10/$50 价位的模型。

中端档(输入 $1 至 $4)

模型厂商输入输出缓存输入批量上下文
GPT-6.1 SolOpenAI$2.00$10.00$0.10—1M
GPT-6 SolOpenAI$2.00$10.00$0.10$1.00/$5.001M
Claude Sonnet 5Anthropic$2.00$10.00$0.20$1.00/$5.00200K
Qwen3.8-MaxDashScope~$2.00~$6.00——1M
GPT-6 LunaOpenAI$1.00$4.00$0.10$0.50/$2.001M

GPT-6.1 Sol 和 Claude Sonnet 5 标价完全一致。关键区别在于 GPT-6.1 Sol 拥有 1M 上下文窗口和 $0.10 的缓存输入价,而 Sonnet 5 上下文上限 200K 但有 50% 折扣的批量处理价。Qwen3.8-Max 处于同一价格带,输出价格明显更低(价格从人民币按近似汇率换算;DashScope 还有促销折扣可进一步降低价格)。

性价比档(输入 $0.10 至 $1)

模型厂商输入输出缓存输入批量上下文
Gemini 3.8 FlashGoogle$0.75$3.75——1M
Kimi K3Moonshot~$0.55~$2.20——256K
GPT-6.1 Sol MiniOpenAI$0.30$1.20$0.015$0.15/$0.601M
DeepSeek V4.1 FlashDeepSeek$0.15$0.60$0.003—128K
Qwen3.8-FlashDashScope~$0.15~$0.47——256K

Q4 2026 的主战场在这里。DeepSeek V4.1 Flash 在 9 月 14 日替换了 V4 Pro,非高峰价格降到 $0.15/$0.60(高峰价格翻倍)。V4 Pro 的请求现在自动路由到 V4.1 Flash。Qwen3.8-Flash 在 DashScope 上的输入价格与 DeepSeek 持平。Gemini 3.8 Flash 以 $0.75/$3.75 的入门价位运行,Google 已表示 2027 年会涨价。

免费和近免费档

模型厂商输入输出上下文
DeepSeek V4 FlashDeepSeek$0.07$0.28128K
多种开源模型SiliconFlow$0.00$0.00不等

SiliconFlow 继续提供 Qwen、DeepSeek、GLM 等开源模型的免费 API 访问(有速率限制)。DeepSeek V4 Flash 以 $0.07/$0.28 的非高峰价格,是主流厂商中最便宜的付费选项。

价格平行带

三组自然聚类,不同厂商的模型落在几乎相同的价格上。

$2/$10 带 竞争最激烈。GPT-6.1 Sol、GPT-6 Sol、Claude Sonnet 5 都是输入 $2、输出 $10,Qwen3.8-Max 以 ~$2/$6 紧跟。对路由层来说,这几个模型在成本上可以互换,差异在于能力、上下文窗口和区域可用性。

$0.15/$0.60 带 是成本优化的甜蜜点。DeepSeek V4.1 Flash 和 Qwen3.8-Flash 都落在这里。DeepSeek 有高峰/非高峰价差(表中为非高峰价;高峰翻倍)。Qwen3.8-Flash 定价包含 DashScope 促销折扣,可能变动。

$10/$50 带 现在只剩 Anthropic。Claude Fable 5.1 和 Fable 5 都是 $10/$50。Astra 取消后,没有 OpenAI 模型占据这个价位。运营者需要判断的问题是 Fable 档是否值得花 GPT-6.1 Sol 五倍的价钱。对于需要扩展推理和 agentic 工作负载的场景,答案可能是"值得",尤其是在 Fable 5.1 缓存读取只要 $0.25 的情况下。

缓存经济学

Prompt caching 已经成为 Q4 2026 最大的单一成本杠杆。缓存与未缓存输入价格的差距悬殊到令人惊讶。

厂商模型未缓存输入缓存输入节省
OpenAIGPT-6.1 Sol$2.00$0.1095%
AnthropicOpus 5.5$4.00$0.2095%
AnthropicFable 5.1$10.00$0.2597.5%
DeepSeekV4.1 Flash$0.15$0.00398%
OpenAIGPT-6.1 Sol Mini$0.30$0.01595%

OpenAI 的缓存是自动的(不需要改 API 调用,重复前缀自动缓存)。Anthropic 需要显式缓存控制头。DeepSeek 通过 KV cache 机制自动缓存。DashScope 通过单独的 API 提供显式上下文缓存。

对于系统提示、few-shot 示例或文档上下文在请求之间保持不变的工作负载,实际每 token 成本可以降到标价的 2% 到 5%。一个把稳定前缀固定住、只轮换用户输入的路由层,可以在不换厂商的情况下砍掉 90% 以上的成本。

批量处理折扣

各家厂商对批量 API 的支持程度不同。

厂商批量折扣交付时间备注
OpenAI输入输出各减 50%24 小时JSONL 上传,异步返回
Anthropic输入输出各减 50%24 小时类似 JSONL 格式
DashScope减 50%24 小时OpenAI 兼容的批量端点
DeepSeek——无批量 API
Google——通过 Vertex AI 可用

如果你的工作负载能接受 24 小时延迟,OpenAI 和 Anthropic 的批量处理可以把账单砍一半。DashScope 也提供同等折扣。DeepSeek 尚未推出批量 API。

按预算路由决策树

输入预算低于 $0.50/M → DeepSeek V4.1 Flash($0.15)、Qwen3.8-Flash(~$0.15)、DeepSeek V4 Flash($0.07)或 SiliconFlow 免费档。适合大批量、延迟不敏感的工作负载。DeepSeek 的非高峰价格让夜间批量任务成本极低。

$0.50 到 $2/M → Gemini 3.8 Flash($0.75)、GPT-6.1 Sol Mini($0.30)、Kimi K3(~$0.55)。成本与能力的平衡点。Gemini 3.8 Flash 在这个价位提供 1M 上下文。

$2 到 $4/M → GPT-6.1 Sol($2.00)、Claude Sonnet 5($2.00)、Qwen3.8-Max(~$2.00)。大部分生产工作负载的"后 Astra 前沿"。按任务类型在三者之间路由即可,GPT-6.1 Sol 强在编程和计算机使用,Sonnet 5 强在细腻的写作和分析,Qwen3.8-Max 在中文任务上表现最好。

$4 到 $10/M → Claude Opus 5.5($4.00)。前沿推理模型中性价比最优。Astra 取消后这个价格带只有它一家。

$10+/M → Claude Fable 5.1($10.00)。扩展推理、长周期 agentic 工作,以及缓存读取经济性($0.25/M)能摊薄高基价的场景。

TheRouter 配置示例

通过 TheRouter 将 OpenAI 兼容请求路由到这些厂商,Q4 2026 的成本优化配置可以这样写。

# 按任务复杂度和成本目标路由
routes:
  - match: { capability: "frontier-reasoning" }
    providers:
      - model: claude-fable-5.1
        weight: 80
      - model: claude-opus-5.5
        weight: 20
        
  - match: { capability: "general" }
    providers:
      - model: gpt-6.1-sol
        weight: 50
      - model: claude-sonnet-5
        weight: 30
      - model: qwen3.8-max
        weight: 20
        
  - match: { capability: "high-volume" }
    providers:
      - model: deepseek-v4.1-flash
        weight: 60
      - model: qwen3.8-flash
        weight: 40

TheRouter 将 OpenAI 兼容请求路由到已配置的厂商,并在产品路径支持的情况下提供厂商/模型路由和 fallback。

Q4 2026 需要关注的动向

OpenAI 下一次预期发布在 10 月 19 日左右。 他们是否会在被取消的 Astra 的 $10/$50 价位推出新模型,还是继续把能力压到 $2/$10 的 Sol 档,将重塑这张表。

DeepSeek 计划涨价 已有报道,但具体费率和生效日期尚未确认。如果 DeepSeek 将 V4.1 Flash 涨到 $0.15/$0.60 以上,它和 Qwen3.8-Flash 的成本优势差距会缩小。

GPT-3.5-turbo-0125 于 10 月 23 日退役。 如果你还在用这个模型,替代路径是 GPT-6.1 Sol Mini($0.30/$1.20),更便宜也更强。

DashScope 10 月 10 日下线波 将退役多个旧版 Qwen 模型。完整列表和替代方案见我们的 DashScope 2026 年 10 月大规模下线迁移指南。

FAQ

2026 年 Q4 最便宜的前沿级大模型 API 是哪个?

GPT-6.1 Sol 和 Claude Sonnet 5 都是 $2/$10 每百万 token。Astra 被取消后,GPT-6.1 Sol 实际上已是 OpenAI 最强公开模型,价格却停在了过去的"中端"档位。配置细节见我们的 GPT-6.1 Sol 集成指南。

Claude Opus 5.5 多少钱?

输入 $4/百万 token,输出 $20/百万 token。缓存读取 $0.20/M。比 Opus 5($5/$25)便宜 20%,是 $4 档唯一的模型。迁移细节见我们的 Claude Opus 5.5 路由指南。

GPT-6.1 Astra 为什么被取消了?

OpenAI 在 2026 年 9 月 29 日的 DevDay 上以安全顾虑为由取消了 GPT-6.1 Astra。该模型预期定价约 $10/$50,目标竞品是 Claude Fable 5.1。取消后,Fable 5.1 成为西方厂商中唯一在 $10/$50 价位的模型。中端替代方案对比见我们的 GPT-6.1 Sol vs Claude Sonnet 5 对比。

DeepSeek 的高峰/非高峰定价怎么回事?

DeepSeek 按一天中的时段(UTC)收取不同费率。非高峰费率是本文中展示的基础费率,高峰费率是两倍。V4.1 Flash 的价格就是高峰 $0.30/$1.20 对非高峰 $0.15/$0.60。如果可以把批量工作安排在非高峰时段,成本直接减半。详见我们的 DeepSeek V4.1 Flash 指南。

哪些厂商支持 prompt caching?

OpenAI(自动)、Anthropic(显式缓存控制)、DeepSeek(自动 KV cache)、DashScope(显式上下文缓存 API)和 Google Gemini(上下文缓存,有存储价格)。SiliconFlow 目前不提供 prompt caching。实现细节见我们的 跨厂商 prompt caching 对比。

GPT-6.1 Sol、Claude Sonnet 5 和 Qwen3.8-Max 价格差不多,怎么选?

三个都在 ~$2/M 输入的价位。GPT-6.1 Sol 在编程和计算机使用方面表现突出,拥有 1M 上下文窗口。Claude Sonnet 5 擅长细腻的写作和分析,上下文 200K。Qwen3.8-Max 是中文任务的最佳选择,通过 DashScope 提供有竞争力的推理能力,价格约 ~$2/$6。按任务类型而不是价格来路由。Benchmark 对比见我们的 中端模型对比。

SiliconFlow 真的免费吗?

SiliconFlow 为多个开源模型提供有速率限制的免费 API 访问。生产工作负载可以选择付费档来解除速率限制并获得 SLA 保障。免费档适合开发、测试和低频应用。当前免费模型列表见我们的 SiliconFlow 免费模型指南。


本文定价数据采集于 2026 年 10 月 3 日。大模型 API 价格变动频繁,最新费率请直接查阅各厂商官方定价页面。DashScope 价格按近似汇率从人民币换算。DeepSeek 价格为非高峰费率,高峰费率翻倍。

帮助与联系