← 全部文章

AI 模型上下文窗口定价经济学:1M+ 上下文各服务商每有效 Token 成本对比

所有前沿模型都宣称支持 1M Token 上下文,但填满这个窗口的成本从 $0.15 到 $10 不等。我们在 128K、256K、512K、1M 四个深度上拆解了 OpenAI、Anthropic、Google、DeepSeek、DashScope 的实际成本,并展示上下文感知路由如何控制账单。

· TheRouter

30 秒结论。2026 年 9 月的前沿模型全都宣称支持 1M Token 上下文窗口,但真正填满这个窗口的成本差距超过 70 倍。DeepSeek V4.1 Flash 非高峰期的 1M Token 输入仅需 $0.15,OpenAI GPT-6 Astra 长上下文档位则要 $20.00。缓存策略、阶梯定价和输出成本会进一步放大这个差距。本文在 128K、256K、512K、1M 四个上下文深度上逐一计算各主要服务商的实际费用,然后演示上下文长度感知路由如何把账单控制在合理范围内。

这篇文章和我们的上下文窗口限制参考不重叠,那篇讲窗口大小和有效上下文基准评测。这也和我们的 Prompt 缓存对比不同,那篇讲缓存机制。这里关注的是填充上下文的实际美元成本,大多数团队在收到账单之前都不会认真算这笔账。

OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。

1M 上下文定价总表

所有价格单位为每 1M Token,美元,截至 2026 年 9 月。服务商有阶梯定价(超过特定上下文阈值后费率不同)时同时列出两档。

服务商模型上下文输入 $/M输入 $/M(长上下文)缓存命中 $/M输出 $/M输出 $/M(长上下文)
OpenAIGPT-6 Astra1M$10.00$20.00 (>272K)$1.00 / $2.00$50.00$75.00
OpenAIGPT-5.6 Sol1M$4.00$8.00 (>272K)$0.40 / $0.80$20.00$30.00
OpenAIGPT-5.6 Luna1M$0.20$0.40 (>272K)$0.02 / $0.04$1.20$1.80
AnthropicClaude Fable 5.11M$10.00平价$0.25$50.00平价
AnthropicClaude Opus 4.81M$5.00平价$0.50$25.00平价
AnthropicClaude Sonnet 51M$2.00平价$0.20$10.00平价
GoogleGemini 3.8 Flash1M$0.75$1.50 (>200K)$0.075$3.75$7.50
DeepSeekV4.1 Flash1M$0.15 (非高峰) / $0.30 (高峰)平价$0.003 / $0.006$0.60 / $1.20平价
DeepSeekV4 Pro1M$0.66 / $1.32平价$0.022 / $0.044$1.98 / $3.96平价
DashScopeQwen3.8-Max1M$2.00平价$0.25$6.00平价

数据来源。OpenAI 定价(2026-09-19 抓取)、Anthropic 定价(2026-09-19 抓取)、DeepSeek 定价(2026-09-19 抓取)、DashScope 定价(2026-09-19 抓取)、Gemini 定价 来自第三方汇总(2026-09-19 抓取)。

三个明显的规律。

  1. OpenAI 长上下文加倍收费。 GPT-5.6 和 GPT-6 系列在超过 272K Token 时输入单价翻倍、输出单价涨 50%。一个 500K Token 的 Prompt 发给 GPT-5.6 Sol,前 272K 按 $4.00/M 计,剩余按 $8.00/M 计,混合费率约 $5.50/M。
  2. Anthropic 和 DeepSeek 全窗口平价。 1M Token 的 Prompt 和 10K Token 的 Prompt 按同样的单价算。长上下文负载不会遇到阶梯陷阱。
  3. 缓存经济学在规模化场景下占主导。 DeepSeek V4.1 Flash 非高峰期缓存命中价 $0.003/M,比已经很便宜的缓存未命中价低 98%。Anthropic Fable 5.1 缓存命中价 $0.25/M,比 $10.00/M 的基础输入价低 97.5%。

填满上下文窗口到底花多少钱?

上面的表格给的是每百万 Token 的单价。下面换算成特定深度下纯输入(不含缓存、不含输出)的实际费用。

上下文深度DeepSeek V4.1 Flash (非高峰)GPT-5.6 LunaGemini 3.8 FlashQwen3.8-MaxClaude Sonnet 5GPT-5.6 SolClaude Opus 4.8GPT-6 Astra
128K Token$0.02$0.03$0.10$0.26$0.26$0.51$0.64$1.28
256K Token$0.04$0.05$0.19$0.51$0.51$1.02$1.28$2.56
512K Token$0.08$0.10$0.58$1.02$1.02$2.88$2.56$7.68
1M Token$0.15$0.20$1.13$2.00$2.00$5.60$5.00$14.60

注。GPT-5.6 Sol 和 GPT-6 Astra 的 1M 数据采用混合费率(前 272K 按短上下文价,剩余 728K 按长上下文价)。Gemini 3.8 Flash 的 512K 和 1M 采用混合费率(前 200K 按 $0.75,其余按 $1.50)。DeepSeek 全部使用非高峰价。

DeepSeek V4.1 Flash($0.15)和 GPT-6 Astra($14.60)在 1M Token 处的价差达到约 97 倍。这并非拿入门款和旗舰款做不对等比较,两个模型都有 1M Token 窗口,价差来自架构、市场定位和阶梯定价策略的综合结果。

如果一个业务每天发送 100 个请求、每个请求 500K Token 的上下文,月度纯输入账单从约 $240(DeepSeek V4.1 Flash 非高峰)到约 $23,000(GPT-6 Astra)。这已经是一个人力成本级别的差距。

缓存经济学改变规模化场景的成本结构

原始输入单价只是故事的一半。如果你的业务有可重复的前缀(系统 Prompt、Tool Schema、多个请求共用的文档片段),缓存会大幅压低有效输入成本。

服务商模型缓存未命中 $/M缓存命中 $/M命中节省率回收一次写入所需的命中次数
DeepSeekV4.1 Flash (非高峰)$0.15$0.00398%1(无写入溢价)
AnthropicClaude Sonnet 5$2.00$0.2090%~1.2(5 分钟写入 $2.50)
AnthropicClaude Fable 5.1$10.00$0.2597.5%~1.3(5 分钟写入 $12.50)
OpenAIGPT-5.6 Sol$4.00$0.4090%~1.4(写入 $5.00)
GoogleGemini 3.8 Flash$0.75$0.07590%上下文缓存至 2026 年 12 月免费
DashScopeQwen3.8-Max$2.00$0.2587.5%因缓存模式而异

规律很明确,只要每次缓存写入后命中一两次以上,所有服务商的有效输入成本就能降低 87%-98%。DeepSeek 的隐式缓存没有写入溢价,采用门槛最低,不需要刻意调整 Prompt 结构。

举一个实际场景。合同审查业务用相同的 200K Token 系统 Prompt 和 Schema 处理 50 份合同。在 Claude Opus 4.8 上,不用缓存每天输入费用约 $20.00,用缓存(1 次写入 + 49 次命中)每天约 $2.50。在 DeepSeek V4.1 Flash 上,同样的负载从 $1.50/天降到 $0.16/天。

每有效 Token 成本问题

上下文中并非所有 Token 都在发挥作用。一个 1M Token 的 Prompt 里 60% 是填充、模板或模型实际忽略的噪声,那么每有效 Token 的成本大约是标价的 2.5 倍。

BenchLM(2026-09-19 抓取)的分析直接指出了这一点,宣称的上下文和有效上下文是两个不同的数字。两者之间的差距随着上下文长度的增加而变大。在 128K Token 时大多数前沿模型仍然能保持很强的召回能力,到 500K+ 时部分模型的召回率会明显下降,这意味着窗口远端的 Token 付了钱但没有被利用。

这创造了超越单价的第二个定价维度,即上下文利用质量。一个单价贵 3 倍但在 500K 处保持 95% 召回率的模型,每有效 Token 成本可能低于单价便宜但只有 60% 召回率的模型。

截至 2026 年 9 月还没有标准化的跨服务商有效上下文基准测试覆盖所有深度。已知的参考点如下。

  • DeepSeek V4 Pro 在 1M Token 处报告了较强的 NIAH(大海捞针)分数
  • Claude Opus 4.8 和 Fable 5 在 Anthropic 发布的评估中保持了全窗口召回能力
  • Google Gemini 3.1 Pro 在 BenchLM 2026 年 4 月的评估中 500K-1M 区间有效上下文得分最高
  • OpenAI GPT-5.5 在同一评估中 LongBench v2 和 MRCRv2(128-256K)得分最高

实际意义很简单,在选定长上下文工作的服务商之前,先在你真实的上下文深度上测试召回率。一个 $0.15/M 但 500K 处召回率只有 50% 的模型,每有效 Token 的成本高于一个 $2.00/M 但召回率 95% 的模型。

输出成本,被忽视的乘数

输入定价吸引了大部分注意力。但对于需要生成长输出的业务(报告起草、代码生成、文档翻译),输出定价的影响往往更大。

模型输出 $/M(短上下文)输出 $/M(长上下文)最大输出 Token
DeepSeek V4.1 Flash$0.60 (非高峰)平价384K
GPT-5.6 Luna$1.20$1.80 (>272K)128K
Gemini 3.8 Flash$3.75$7.50 (>200K)64K
Claude Sonnet 5$10.00平价64K
Qwen3.8-Max$6.00平价32K
GPT-5.6 Sol$20.00$30.00 (>272K)128K
Claude Opus 4.8$25.00平价64K
GPT-6 Astra$50.00$75.00 (>272K)128K

DeepSeek V4 Pro 的 384K 最大输出是结构性优势,是其他模型的 3 到 6 倍。需要在单次调用中生成完整文档草稿的业务,这已经超出价格层面,属于能力层面的优势,路由无法替代。

如果一个业务每个请求生成 50K Token 输出、每天 100 个请求,DeepSeek V4.1 Flash 非高峰期月度输出成本约 $90,Claude Sonnet 5 约 $1,500,GPT-6 Astra 约 $7,500。生成密集型业务中,输出成本可能超过输入成本。

上下文感知路由策略

面对这样的价差,最有效的成本控制手段是基于上下文长度的路由,把请求按输入上下文深度分发到不同的服务商。

一组简单的规则。

上下文深度路由目标理由
<32K Token任意服务商(质量优先)低上下文时成本差异可忽略不计
32K–128K Token按用例选质量/成本最优的服务商成本开始有差异,服务商质量差异开始显现
128K–256K Token优先平价服务商(Anthropic、DeepSeek)或缓存密集型工作流阶梯定价服务商(OpenAI、Google)开始收取溢价
256K–1M TokenDeepSeek 或 Anthropic + 缓存阶梯服务商收 2 倍价,平价服务商费率不变

TheRouter 这样的网关可以在基础设施层面实现这种路由。应用把所有请求发到同一个 OpenAI 兼容端点,网关根据请求中的 Token 数量决定路由方向。再结合 fallback 路由,长上下文请求自动落在成本最低的合格服务商上,主服务商不可用时自动切换到备选。

我们在成本优化路由指南中更详细地描述了这个模式。上下文长度维度是大多数成本优化指南遗漏的路由信号。

真实业务场景测算

RAG 场景,200K 检索上下文

检索增强生成管线每次查询传入 200K Token 的检索结果和 2K Token 的系统 Prompt。每天 500 次查询。

  • DeepSeek V4.1 Flash(非高峰,系统 Prompt 已缓存),每次查询输入约 $0.03 + 缓存前缀 $0.003。月度约 $465。
  • Claude Sonnet 5(系统 Prompt 已缓存),每次查询输入约 $0.40 + 缓存前缀 $0.004。月度约 $6,060。
  • GPT-5.6 Sol,每次查询输入约 $0.81(全在短上下文档位内)。月度约 $12,150。

代码仓库分析,500K Token

代码审查 Agent 每次加载 500K Token 的仓库快照。每天 20 次审查。

  • DeepSeek V4.1 Flash(非高峰),每次审查 $0.08。月度约 $48。
  • Claude Opus 4.8,每次审查 $2.56。月度约 $1,536。
  • GPT-6 Astra(混合费率),每次审查 $7.68。月度约 $4,608。

文档处理,1M Token

法务文档处理系统处理 800K 到 1M Token 的完整合同。每天 10 份文档。

  • DeepSeek V4.1 Flash(非高峰),每份 $0.15。月度约 $45。
  • Claude Sonnet 5,每份 $2.00。月度约 $600。
  • GPT-5.6 Sol(混合费率),每份 $5.60。月度约 $1,680。

在每一种场景下,把长上下文负载路由到 DeepSeek、把短上下文推理路由到更高质量模型的组合方案,都能得到最佳的成本/质量比。

FAQ

填满 1M Token 上下文窗口要花多少钱?

从 $0.15(DeepSeek V4.1 Flash 非高峰期)到 $20.00(OpenAI GPT-6 Astra 长上下文档位),差距超过 130 倍。价差反映的是模型层级、架构和定价策略的综合结果。

所有服务商对不同上下文长度收费一样吗?

不一样。OpenAI 在 GPT-5.6 和 GPT-6 模型上对超过 272K Token 的请求输入价翻倍、输出价涨 50%。Google Gemini 在超过 200K Token 时翻倍。Anthropic 和 DeepSeek 在整个 1M 窗口内保持平价。DashScope 部分 Qwen 模型在 128K Token 以上使用更高价格档位。

什么是每有效 Token 成本?

每有效 Token 成本考虑的是上下文利用质量。如果模型在长上下文窗口中忽略了 40% 的 Token,你的每有效 Token 实际成本大约是原始单价的 1.67 倍。一个便宜但长上下文召回率差的模型,每有效 Token 的花费可能高于一个昂贵但召回率高的模型。

Prompt 缓存如何降低长上下文成本?

缓存把重复的 Prompt 前缀存下来,后续调用只付缓存命中价。Anthropic 命中价是基础输入价的 10%(Fable 5.1 为 2.5%),OpenAI 为 10%,DeepSeek 非高峰期低至 2%。对于有稳定系统 Prompt 或共享文档前缀的业务,缓存能把有效输入成本降低 87%-98%。

路由能降低上下文窗口成本吗?

能。上下文感知路由把短上下文请求发给任何服务商,把长上下文负载路由到成本最低且质量合格的服务商。TheRouter 这样的网关可以根据输入 Token 数量自动路由,不需要修改应用代码。再结合模型 fallback,就能同时控制长上下文成本和保持可用性。

是不是应该永远选最便宜的长上下文服务商?

不一定。每有效 Token 成本比每原始 Token 成本更重要。如果最便宜的服务商在你的实际上下文深度上召回率很差,你可能需要更多重试或得到更低质量的输出,两者都会抬高总成本。投入生产前先在你实际的上下文深度上测试召回率。


定价数据于 2026 年 9 月 19 日采集。价格会变,做采购决策前请核对服务商定价页面。

帮助与联系