AI 模型上下文窗口定价经济学:1M+ 上下文各服务商每有效 Token 成本对比
所有前沿模型都宣称支持 1M Token 上下文,但填满这个窗口的成本从 $0.15 到 $10 不等。我们在 128K、256K、512K、1M 四个深度上拆解了 OpenAI、Anthropic、Google、DeepSeek、DashScope 的实际成本,并展示上下文感知路由如何控制账单。
30 秒结论。2026 年 9 月的前沿模型全都宣称支持 1M Token 上下文窗口,但真正填满这个窗口的成本差距超过 70 倍。DeepSeek V4.1 Flash 非高峰期的 1M Token 输入仅需 $0.15,OpenAI GPT-6 Astra 长上下文档位则要 $20.00。缓存策略、阶梯定价和输出成本会进一步放大这个差距。本文在 128K、256K、512K、1M 四个上下文深度上逐一计算各主要服务商的实际费用,然后演示上下文长度感知路由如何把账单控制在合理范围内。
这篇文章和我们的上下文窗口限制参考不重叠,那篇讲窗口大小和有效上下文基准评测。这也和我们的 Prompt 缓存对比不同,那篇讲缓存机制。这里关注的是填充上下文的实际美元成本,大多数团队在收到账单之前都不会认真算这笔账。
OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。
1M 上下文定价总表
所有价格单位为每 1M Token,美元,截至 2026 年 9 月。服务商有阶梯定价(超过特定上下文阈值后费率不同)时同时列出两档。
| 服务商 | 模型 | 上下文 | 输入 $/M | 输入 $/M(长上下文) | 缓存命中 $/M | 输出 $/M | 输出 $/M(长上下文) |
|---|---|---|---|---|---|---|---|
| OpenAI | GPT-6 Astra | 1M | $10.00 | $20.00 (>272K) | $1.00 / $2.00 | $50.00 | $75.00 |
| OpenAI | GPT-5.6 Sol | 1M | $4.00 | $8.00 (>272K) | $0.40 / $0.80 | $20.00 | $30.00 |
| OpenAI | GPT-5.6 Luna | 1M | $0.20 | $0.40 (>272K) | $0.02 / $0.04 | $1.20 | $1.80 |
| Anthropic | Claude Fable 5.1 | 1M | $10.00 | 平价 | $0.25 | $50.00 | 平价 |
| Anthropic | Claude Opus 4.8 | 1M | $5.00 | 平价 | $0.50 | $25.00 | 平价 |
| Anthropic | Claude Sonnet 5 | 1M | $2.00 | 平价 | $0.20 | $10.00 | 平价 |
| Gemini 3.8 Flash | 1M | $0.75 | $1.50 (>200K) | $0.075 | $3.75 | $7.50 | |
| DeepSeek | V4.1 Flash | 1M | $0.15 (非高峰) / $0.30 (高峰) | 平价 | $0.003 / $0.006 | $0.60 / $1.20 | 平价 |
| DeepSeek | V4 Pro | 1M | $0.66 / $1.32 | 平价 | $0.022 / $0.044 | $1.98 / $3.96 | 平价 |
| DashScope | Qwen3.8-Max | 1M | $2.00 | 平价 | $0.25 | $6.00 | 平价 |
数据来源。OpenAI 定价(2026-09-19 抓取)、Anthropic 定价(2026-09-19 抓取)、DeepSeek 定价(2026-09-19 抓取)、DashScope 定价(2026-09-19 抓取)、Gemini 定价 来自第三方汇总(2026-09-19 抓取)。
三个明显的规律。
- OpenAI 长上下文加倍收费。 GPT-5.6 和 GPT-6 系列在超过 272K Token 时输入单价翻倍、输出单价涨 50%。一个 500K Token 的 Prompt 发给 GPT-5.6 Sol,前 272K 按 $4.00/M 计,剩余按 $8.00/M 计,混合费率约 $5.50/M。
- Anthropic 和 DeepSeek 全窗口平价。 1M Token 的 Prompt 和 10K Token 的 Prompt 按同样的单价算。长上下文负载不会遇到阶梯陷阱。
- 缓存经济学在规模化场景下占主导。 DeepSeek V4.1 Flash 非高峰期缓存命中价 $0.003/M,比已经很便宜的缓存未命中价低 98%。Anthropic Fable 5.1 缓存命中价 $0.25/M,比 $10.00/M 的基础输入价低 97.5%。
填满上下文窗口到底花多少钱?
上面的表格给的是每百万 Token 的单价。下面换算成特定深度下纯输入(不含缓存、不含输出)的实际费用。
| 上下文深度 | DeepSeek V4.1 Flash (非高峰) | GPT-5.6 Luna | Gemini 3.8 Flash | Qwen3.8-Max | Claude Sonnet 5 | GPT-5.6 Sol | Claude Opus 4.8 | GPT-6 Astra |
|---|---|---|---|---|---|---|---|---|
| 128K Token | $0.02 | $0.03 | $0.10 | $0.26 | $0.26 | $0.51 | $0.64 | $1.28 |
| 256K Token | $0.04 | $0.05 | $0.19 | $0.51 | $0.51 | $1.02 | $1.28 | $2.56 |
| 512K Token | $0.08 | $0.10 | $0.58 | $1.02 | $1.02 | $2.88 | $2.56 | $7.68 |
| 1M Token | $0.15 | $0.20 | $1.13 | $2.00 | $2.00 | $5.60 | $5.00 | $14.60 |
注。GPT-5.6 Sol 和 GPT-6 Astra 的 1M 数据采用混合费率(前 272K 按短上下文价,剩余 728K 按长上下文价)。Gemini 3.8 Flash 的 512K 和 1M 采用混合费率(前 200K 按 $0.75,其余按 $1.50)。DeepSeek 全部使用非高峰价。
DeepSeek V4.1 Flash($0.15)和 GPT-6 Astra($14.60)在 1M Token 处的价差达到约 97 倍。这并非拿入门款和旗舰款做不对等比较,两个模型都有 1M Token 窗口,价差来自架构、市场定位和阶梯定价策略的综合结果。
如果一个业务每天发送 100 个请求、每个请求 500K Token 的上下文,月度纯输入账单从约 $240(DeepSeek V4.1 Flash 非高峰)到约 $23,000(GPT-6 Astra)。这已经是一个人力成本级别的差距。
缓存经济学改变规模化场景的成本结构
原始输入单价只是故事的一半。如果你的业务有可重复的前缀(系统 Prompt、Tool Schema、多个请求共用的文档片段),缓存会大幅压低有效输入成本。
| 服务商 | 模型 | 缓存未命中 $/M | 缓存命中 $/M | 命中节省率 | 回收一次写入所需的命中次数 |
|---|---|---|---|---|---|
| DeepSeek | V4.1 Flash (非高峰) | $0.15 | $0.003 | 98% | 1(无写入溢价) |
| Anthropic | Claude Sonnet 5 | $2.00 | $0.20 | 90% | ~1.2(5 分钟写入 $2.50) |
| Anthropic | Claude Fable 5.1 | $10.00 | $0.25 | 97.5% | ~1.3(5 分钟写入 $12.50) |
| OpenAI | GPT-5.6 Sol | $4.00 | $0.40 | 90% | ~1.4(写入 $5.00) |
| Gemini 3.8 Flash | $0.75 | $0.075 | 90% | 上下文缓存至 2026 年 12 月免费 | |
| DashScope | Qwen3.8-Max | $2.00 | $0.25 | 87.5% | 因缓存模式而异 |
规律很明确,只要每次缓存写入后命中一两次以上,所有服务商的有效输入成本就能降低 87%-98%。DeepSeek 的隐式缓存没有写入溢价,采用门槛最低,不需要刻意调整 Prompt 结构。
举一个实际场景。合同审查业务用相同的 200K Token 系统 Prompt 和 Schema 处理 50 份合同。在 Claude Opus 4.8 上,不用缓存每天输入费用约 $20.00,用缓存(1 次写入 + 49 次命中)每天约 $2.50。在 DeepSeek V4.1 Flash 上,同样的负载从 $1.50/天降到 $0.16/天。
每有效 Token 成本问题
上下文中并非所有 Token 都在发挥作用。一个 1M Token 的 Prompt 里 60% 是填充、模板或模型实际忽略的噪声,那么每有效 Token 的成本大约是标价的 2.5 倍。
BenchLM(2026-09-19 抓取)的分析直接指出了这一点,宣称的上下文和有效上下文是两个不同的数字。两者之间的差距随着上下文长度的增加而变大。在 128K Token 时大多数前沿模型仍然能保持很强的召回能力,到 500K+ 时部分模型的召回率会明显下降,这意味着窗口远端的 Token 付了钱但没有被利用。
这创造了超越单价的第二个定价维度,即上下文利用质量。一个单价贵 3 倍但在 500K 处保持 95% 召回率的模型,每有效 Token 成本可能低于单价便宜但只有 60% 召回率的模型。
截至 2026 年 9 月还没有标准化的跨服务商有效上下文基准测试覆盖所有深度。已知的参考点如下。
- DeepSeek V4 Pro 在 1M Token 处报告了较强的 NIAH(大海捞针)分数
- Claude Opus 4.8 和 Fable 5 在 Anthropic 发布的评估中保持了全窗口召回能力
- Google Gemini 3.1 Pro 在 BenchLM 2026 年 4 月的评估中 500K-1M 区间有效上下文得分最高
- OpenAI GPT-5.5 在同一评估中 LongBench v2 和 MRCRv2(128-256K)得分最高
实际意义很简单,在选定长上下文工作的服务商之前,先在你真实的上下文深度上测试召回率。一个 $0.15/M 但 500K 处召回率只有 50% 的模型,每有效 Token 的成本高于一个 $2.00/M 但召回率 95% 的模型。
输出成本,被忽视的乘数
输入定价吸引了大部分注意力。但对于需要生成长输出的业务(报告起草、代码生成、文档翻译),输出定价的影响往往更大。
| 模型 | 输出 $/M(短上下文) | 输出 $/M(长上下文) | 最大输出 Token |
|---|---|---|---|
| DeepSeek V4.1 Flash | $0.60 (非高峰) | 平价 | 384K |
| GPT-5.6 Luna | $1.20 | $1.80 (>272K) | 128K |
| Gemini 3.8 Flash | $3.75 | $7.50 (>200K) | 64K |
| Claude Sonnet 5 | $10.00 | 平价 | 64K |
| Qwen3.8-Max | $6.00 | 平价 | 32K |
| GPT-5.6 Sol | $20.00 | $30.00 (>272K) | 128K |
| Claude Opus 4.8 | $25.00 | 平价 | 64K |
| GPT-6 Astra | $50.00 | $75.00 (>272K) | 128K |
DeepSeek V4 Pro 的 384K 最大输出是结构性优势,是其他模型的 3 到 6 倍。需要在单次调用中生成完整文档草稿的业务,这已经超出价格层面,属于能力层面的优势,路由无法替代。
如果一个业务每个请求生成 50K Token 输出、每天 100 个请求,DeepSeek V4.1 Flash 非高峰期月度输出成本约 $90,Claude Sonnet 5 约 $1,500,GPT-6 Astra 约 $7,500。生成密集型业务中,输出成本可能超过输入成本。
上下文感知路由策略
面对这样的价差,最有效的成本控制手段是基于上下文长度的路由,把请求按输入上下文深度分发到不同的服务商。
一组简单的规则。
| 上下文深度 | 路由目标 | 理由 |
|---|---|---|
| <32K Token | 任意服务商(质量优先) | 低上下文时成本差异可忽略不计 |
| 32K–128K Token | 按用例选质量/成本最优的服务商 | 成本开始有差异,服务商质量差异开始显现 |
| 128K–256K Token | 优先平价服务商(Anthropic、DeepSeek)或缓存密集型工作流 | 阶梯定价服务商(OpenAI、Google)开始收取溢价 |
| 256K–1M Token | DeepSeek 或 Anthropic + 缓存 | 阶梯服务商收 2 倍价,平价服务商费率不变 |
TheRouter 这样的网关可以在基础设施层面实现这种路由。应用把所有请求发到同一个 OpenAI 兼容端点,网关根据请求中的 Token 数量决定路由方向。再结合 fallback 路由,长上下文请求自动落在成本最低的合格服务商上,主服务商不可用时自动切换到备选。
我们在成本优化路由指南中更详细地描述了这个模式。上下文长度维度是大多数成本优化指南遗漏的路由信号。
真实业务场景测算
RAG 场景,200K 检索上下文
检索增强生成管线每次查询传入 200K Token 的检索结果和 2K Token 的系统 Prompt。每天 500 次查询。
- DeepSeek V4.1 Flash(非高峰,系统 Prompt 已缓存),每次查询输入约 $0.03 + 缓存前缀 $0.003。月度约 $465。
- Claude Sonnet 5(系统 Prompt 已缓存),每次查询输入约 $0.40 + 缓存前缀 $0.004。月度约 $6,060。
- GPT-5.6 Sol,每次查询输入约 $0.81(全在短上下文档位内)。月度约 $12,150。
代码仓库分析,500K Token
代码审查 Agent 每次加载 500K Token 的仓库快照。每天 20 次审查。
- DeepSeek V4.1 Flash(非高峰),每次审查 $0.08。月度约 $48。
- Claude Opus 4.8,每次审查 $2.56。月度约 $1,536。
- GPT-6 Astra(混合费率),每次审查 $7.68。月度约 $4,608。
文档处理,1M Token
法务文档处理系统处理 800K 到 1M Token 的完整合同。每天 10 份文档。
- DeepSeek V4.1 Flash(非高峰),每份 $0.15。月度约 $45。
- Claude Sonnet 5,每份 $2.00。月度约 $600。
- GPT-5.6 Sol(混合费率),每份 $5.60。月度约 $1,680。
在每一种场景下,把长上下文负载路由到 DeepSeek、把短上下文推理路由到更高质量模型的组合方案,都能得到最佳的成本/质量比。
FAQ
填满 1M Token 上下文窗口要花多少钱?
从 $0.15(DeepSeek V4.1 Flash 非高峰期)到 $20.00(OpenAI GPT-6 Astra 长上下文档位),差距超过 130 倍。价差反映的是模型层级、架构和定价策略的综合结果。
所有服务商对不同上下文长度收费一样吗?
不一样。OpenAI 在 GPT-5.6 和 GPT-6 模型上对超过 272K Token 的请求输入价翻倍、输出价涨 50%。Google Gemini 在超过 200K Token 时翻倍。Anthropic 和 DeepSeek 在整个 1M 窗口内保持平价。DashScope 部分 Qwen 模型在 128K Token 以上使用更高价格档位。
什么是每有效 Token 成本?
每有效 Token 成本考虑的是上下文利用质量。如果模型在长上下文窗口中忽略了 40% 的 Token,你的每有效 Token 实际成本大约是原始单价的 1.67 倍。一个便宜但长上下文召回率差的模型,每有效 Token 的花费可能高于一个昂贵但召回率高的模型。
Prompt 缓存如何降低长上下文成本?
缓存把重复的 Prompt 前缀存下来,后续调用只付缓存命中价。Anthropic 命中价是基础输入价的 10%(Fable 5.1 为 2.5%),OpenAI 为 10%,DeepSeek 非高峰期低至 2%。对于有稳定系统 Prompt 或共享文档前缀的业务,缓存能把有效输入成本降低 87%-98%。
路由能降低上下文窗口成本吗?
能。上下文感知路由把短上下文请求发给任何服务商,把长上下文负载路由到成本最低且质量合格的服务商。TheRouter 这样的网关可以根据输入 Token 数量自动路由,不需要修改应用代码。再结合模型 fallback,就能同时控制长上下文成本和保持可用性。
是不是应该永远选最便宜的长上下文服务商?
不一定。每有效 Token 成本比每原始 Token 成本更重要。如果最便宜的服务商在你的实际上下文深度上召回率很差,你可能需要更多重试或得到更低质量的输出,两者都会抬高总成本。投入生产前先在你实际的上下文深度上测试召回率。
定价数据于 2026 年 9 月 19 日采集。价格会变,做采购决策前请核对服务商定价页面。