2026 年各大 LLM API 上下文窗口对比:最大 Token 数、定价分层与实际可用范围
跨服务商 LLM API 上下文窗口参考。对比 OpenAI、Anthropic、DeepSeek、通义千问(DashScope)、Google Gemini、Kimi、SiliconFlow 的最大输入 Token、最大输出 Token、长上下文定价差异与实际限制。
现在每家主流 LLM API 都把上下文窗口标到了几十万甚至上百万 token。对于运维和调用方来说,真正需要搞清楚的是那个窗口实际要花多少钱、最大输出限制是多少、服务商在哪个阈值之后开始加价或降速。
OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。
数据来源均已标注检索日期。OpenAI API Pricing,2026-08-07 检索;Anthropic Models Overview,2026-08-07 检索;DeepSeek Models & Pricing,2026-08-07 检索;DashScope 模型计费,2026-08-07 检索;Google Gemini 3.5 Flash Model Card,2026-08-07 检索;Kimi K3 指南,2026-08-07 检索。
速查表
| 服务商 | 模型 | 上下文窗口 | 最大输出 | 长上下文加价 | OpenAI SDK 兼容 |
|---|---|---|---|---|---|
| Gemini 3.5 Pro | 2M | 64K | 128K 以上加价 | base_url 覆盖 | |
| OpenAI | GPT-5.6 Sol/Terra/Luna | 1.05M | 128K | 272K 以上 2 倍输入、1.5 倍输出 | 原生 |
| Anthropic | Claude Opus 4.8 / Sonnet 5 | 1M | 128K(batch 300K) | 不加价 | base_url 覆盖 |
| DeepSeek | V4 Pro / V4 Flash | 1M | 384K | 不加价 | 原生 |
| DashScope | Qwen3.8-Max / Qwen3.7-Max | 1M | 128K | Qwen3.8/3.7-Max 统一价;旧版 Qwen3-Max 阶梯加价 | OpenAI 兼容端点 |
| Kimi | K3 | 1M | — | — | base_url 覆盖 |
| SiliconFlow | 按托管模型而定 | 最高 1M | 按模型 | 不加价 | 原生 |
| Gemini 3.5 Flash | 1M | 64K | 128K 以上加价 | base_url 覆盖 |
数据截至 2026 年 8 月。"上下文窗口"指单次请求可接受的最大 token 总量(输入 + 输出),除非另行说明。请以各服务商最新文档为准。
OpenAI:272K 是加价分水岭
OpenAI 从 GPT-5.6 系列开始明确区分 short-context 和 long-context 定价,分界线在 272K token。
GPT-5.6 上下文规格
| 模型 | 上下文窗口 | 最大输出 | 短上下文输入 | 长上下文输入 | 短上下文输出 | 长上下文输出 |
|---|---|---|---|---|---|---|
| GPT-5.6 Sol | 1.05M | 128K | $5.00 | $10.00 | $30.00 | $45.00 |
| GPT-5.6 Terra | 1.05M | 128K | $2.00 | $4.00 | $12.00 | $18.00 |
| GPT-5.6 Luna | 1.05M | 128K | $0.20 | $0.40 | $1.20 | $1.80 |
请求总 token 一旦过 272K,输入价翻倍,输出价变成 1.5 倍。这个阈值按整个请求计算,不是逐 token 分段。
缓存可以缓解成本。 Sol 的缓存命中输入价只要 $0.50/M(正常短上下文 $5.00/M),长上下文场景下缓存命中也只需 $1.00/M。如果请求之间有大量重复的 system prompt 或参考文档,缓存能把长上下文的有效输入成本压到跟短上下文差不多。
旧版模型 GPT-5.5 同样支持 1.05M 上下文和 128K 最大输出,272K 分界线不变。GPT-5.4 上限 272K。GPT-5.4-mini 和 GPT-5.4-nano 没有长上下文定价层。
详见 GPT-5.6 Sol、Terra、Luna 模型分层对比。
Anthropic:1M 上下文,不收附加费
Anthropic 在 2026 年 3 月向所有用户开放了 Claude Opus 4.8 和 Claude Sonnet 5 的 1M 上下文窗口,没有添加长上下文定价层。
Claude 上下文规格
| 模型 | 上下文窗口 | 最大输出 | 输入价 | 输出价 |
|---|---|---|---|---|
| Claude Opus 4.8 | 1M | 128K(batch 300K) | $5.00 | $25.00 |
| Claude Sonnet 5 | 1M | 128K(batch 300K) | $2.00 | $10.00 |
| Claude Sonnet 4 | 200K | 128K | $3.00 | $15.00 |
| Claude Haiku 3.5 | 200K | 8K | $0.80 | $4.00 |
没有长上下文加价意味着 Claude 是 300K 到 1M token 范围内性价比最高的选项之一。Prompt caching 命中价为基础价的 10%(Opus 4.8 缓存命中 $0.50/M,Sonnet 5 缓存命中 $0.20/M)。
Extended thinking 消耗的是输出 token 预算。一个用了 60K 思考 token 的请求,可见回复只剩 68K 的空间(总共 128K)。batch API 的 300K 输出上限为重度思考场景留了更多余量。
DeepSeek:1M 上下文、384K 输出、最低 token 单价
DeepSeek V4 的最大输出 token 数在所有量产 API 中排第一,达到 384K,搭配 1M 上下文窗口,没有长上下文加价。
DeepSeek V4 上下文规格
| 模型 | 上下文窗口 | 最大输出 | 输入(未命中缓存) | 输入(命中缓存) | 输出 |
|---|---|---|---|---|---|
| V4 Flash | 1M | 384K | $0.14 | $0.0028 | $0.28 |
| V4 Pro | 1M | 384K | $0.435 | $0.003625 | $0.87 |
缓存命中折扣达到 98%,是所有服务商中最激进的。如果请求前缀高度重复,V4 Flash 配合缓存的有效输入成本不到 $0.003/M token,无论上下文多长。
两款模型原生支持 OpenAI 和 Anthropic API 格式。V4 Flash 并发上限 2,500,V4 Pro 并发上限 500。
注意 DeepSeek 已宣布近期将大幅提价。当前定价可能无法持续。详见 DeepSeek API 完整指南。
DashScope(阿里百炼):按上下文长度阶梯定价
DashScope 的特点是阶梯定价,单次请求的 token 总量越大,每百万 token 的单价越高。
千问 Max 系列上下文规格(北京区,人民币/百万 Token)
| 模型 | 上下文窗口 | 最大输出 | 输入 ≤32K | 输入 32K–128K | 输入 128K–1M | 输出 |
|---|---|---|---|---|---|---|
| Qwen3.8-Max | 1M | 128K | ¥12 | ¥12(统一价) | ¥12(统一价) | ¥36 |
| Qwen3.7-Max | 1M | 128K | ¥12(限时 ¥6) | ¥12(限时 ¥6) | ¥12(限时 ¥6) | ¥36(限时 ¥18) |
| Qwen3-Max | 256K | 128K | ¥2.5 | ¥4 | ¥7 | ¥10–¥28 |
Qwen3.8-Max 和 Qwen3.7-Max 已经改为 1M 范围内统一定价,比旧版 Qwen3-Max 的阶梯结构更简单。按当前限时折扣价计算,Qwen3.7-Max 的输入成本约 $0.83/M(¥6),输出约 $2.48/M(¥18),在长上下文场景下结合上下文缓存折扣,能与 DeepSeek V4 Pro 竞争。
旧版 Qwen3-Max 仍然使用阶梯定价,且阈值按整个请求的输入 token 总量判定,不分段累进。
Google Gemini:Pro 达到 2M 上下文,Flash 为 1M
Google 在 Gemini 3.5 Pro 上提供了全行业最大的量产上下文窗口,达到 2M token。
Gemini 上下文规格
| 模型 | 上下文窗口 | 最大输出 | 输入价 | 输出价 | 长上下文加价 |
|---|---|---|---|---|---|
| Gemini 3.5 Pro | 2M | 64K | 按量 | 按量 | 128K 以上加价 |
| Gemini 3.5 Flash | 1M | 64K | $1.50 | $9.00 | 128K 以上加价 |
| Gemini 3.6 Flash | 1M | 64K | — | — | — |
64K 最大输出在本次对比中是旗舰模型里最低的。如果需要在单次请求中生成长文档或详细分析,这个上限会比上下文窗口先成为瓶颈。
Kimi K3:1M 上下文、开源权重
Moonshot 的 Kimi K3 配备 1M 上下文窗口和 2.8 万亿参数。模型权重在 2026 年 7 月 27 日公开。
Kimi K3 上下文规格
| 模型 | 上下文窗口 | 最大输出 | 输入价 | 输出价 |
|---|---|---|---|---|
| K3 | 1M(1,048,576) | — | $0.35 | $2.00 |
| K3(思考 token) | 1M | — | — | $1.40 |
K3 支持推理强度控制(目前只有 max 可用)。思考 token 按折扣后的输出价计费。该模型也作为第三方模型托管在 DashScope 上。
详见 Kimi K3 API 接入指南。
SiliconFlow:托管开源模型
SiliconFlow 托管 200+ 开源模型,提供 OpenAI 兼容 API。上下文窗口取决于底层模型本身。
| 托管模型 | 上下文窗口 | 最大输出 | 价格(输入/输出,每百万 Token) |
|---|---|---|---|
| DeepSeek V4 Flash(托管) | 最高 1M | 按模型 | 有免费额度 |
| Qwen3 系列(托管) | 32K–128K | 按模型 | 不等 |
| 其他开源模型 | 4K–128K | 按模型 | 部分模型免费 |
SiliconFlow 不额外收取长上下文费用。免费模型有限流,高吞吐场景下可能不够用。详见 SiliconFlow 免费模型路由指南。
决策树:按上下文需求选择服务商
- 需要超过 1M 的上下文? → Google Gemini 3.5 Pro(2M)是唯一选项。
- 需要超过 128K 的输出 token? → DeepSeek V4(384K 最大输出)是唯一选项。
- 平均请求不超过 272K token? → OpenAI GPT-5.6 Luna($0.20/$1.20)或 DeepSeek V4 Flash($0.14/$0.28)成本最低。
- 经常发送 300K 到 1M token 的请求? → Anthropic(不加价)或 DeepSeek(不加价 + 最低基础价)比 OpenAI(272K 以上 2 倍加价)划算得多。
- 需要中国区部署? → DashScope Qwen3.7-Max 或 Qwen3.8-Max(1M 上下文,人民币计费,北京/新加坡区域)。
- 需要免费额度用于原型开发? → SiliconFlow(部分模型免费)或 DashScope(新账号有免费配额)。
长上下文场景的实际花费
下表展示了 500K 输入 + 10K 输出的单次请求在各服务商的实际费用,含缓存和不含缓存两种情况。
| 服务商 | 模型 | 500K 输入 + 10K 输出(无缓存) | 80% 缓存命中 |
|---|---|---|---|
| OpenAI | GPT-5.6 Sol | $5.45(长上下文费率) | $1.35 |
| OpenAI | GPT-5.6 Luna | $0.21 | $0.05 |
| Anthropic | Claude Opus 4.8 | $2.75 | $0.50 |
| Anthropic | Claude Sonnet 5 | $1.10 | $0.22 |
| DeepSeek | V4 Flash | $0.073 | $0.004 |
| DeepSeek | V4 Pro | $0.226 | $0.012 |
| DashScope | Qwen3.7-Max(限时价) | ≈$0.47 | ≈$0.10 |
| Gemini 3.5 Flash | ≈$0.84 | — |
DeepSeek V4 Flash 配合缓存,在同等长上下文场景下比 OpenAI GPT-5.6 Sol 便宜约 1,300 倍。即便不用缓存,差距也有 75 倍。这是多服务商路由中影响成本最大的单一变量。
标称数字之外的实际限制
有效窗口 vs. 标称窗口。 有些服务商在产品侧实际暴露的窗口比 API 标称的小。例如 OpenAI 的 Codex 产品被报告只暴露了 GPT-5.6 的约 258K token,远低于 1.05M 的标称值。API 端点和产品界面的表现可能不同。
长上下文的吞吐量。 填满 1M token 的上下文窗口需要时间来传输和处理。所有服务商的首 token 延迟(TTFT)和每秒 token 数(TPS)都会随上下文长度增加而下降。DeepSeek V4 的 CSA/HCA 注意力机制专门针对长上下文效率做了优化,号称比 V3.2 减少 90% 的 KV cache。
token 计数差异。 各服务商使用不同的 tokenizer。同一篇文档在 OpenAI(tiktoken)、Anthropic(Claude tokenizer)和 DeepSeek(自定义 tokenizer)上会产生不同的 token 数。一家的 1M token 窗口装进去的文本量和另一家的 1M 并不完全一样。
截断行为。 各服务商对超出窗口的请求处理方式不同。有的静默截断输入(丢弃最旧的消息),有的直接返回错误,还有的虽然截断但会在响应元数据里带上警告信息。上线前务必用超长输入测试一下你所用服务商的实际表现。
TheRouter 与基于上下文长度的路由
TheRouter 等 OpenAI 兼容的路由网关可以检测请求的估计输入长度,做出路由决策。
- 短请求(32K 以内)路由到最便宜的模型(DeepSeek V4 Flash、GPT-5.6 Luna 或 SiliconFlow 免费模型)
- 中等请求(32K 到 272K)仍在 OpenAI 短上下文费率范围内,按质量/成本偏好路由
- 长请求(272K 以上)避开 OpenAI 以规避 2 倍加价,路由到 DeepSeek V4 或 Anthropic Claude
- 超长请求(1M 以上)只有 Google Gemini 3.5 Pro 支持
这种按上下文长度感知的路由,是多服务商架构下回报率最高的优化手段之一。详见 LLM API 成本优化路由策略 和 Model Fallback 路由。
常见问题
哪家服务商的长上下文性价比最高?
DeepSeek V4 Flash 遥遥领先。$0.14/M 输入和 $0.28/M 输出,没有长上下文加价,缓存命中折扣 98%。在任何 1M 以内的上下文长度上,它都是最便宜的选择。代价是 DeepSeek 已经宣布即将提价。
开启 extended thinking / reasoning 模式后,能用完整个上下文窗口吗?
思考 token 消耗的是输出预算,不影响上下文窗口。Claude 用 60K 思考 token 后,可见回复只剩 68K(总共 128K)。DeepSeek V4 的 384K 最大输出为思考 + 回复留了充足空间。OpenAI o3/o4-mini 的推理 token 独立于上下文窗口,但影响费用。
最大输出和上下文窗口成正比吗?
不成正比。Google Gemini 上下文最大(2M)但最大输出最小(64K)。DeepSeek 最大输出最高(384K)但上下文 1M。各服务商之间没有统一的比例关系。
有没有"无限"上下文的模型?
截至 2026 年 8 月,没有量产 API 提供无限上下文。2M token(Gemini 3.5 Pro)是当前上限。一些研究原型和本地推理方案声称支持更大窗口,但没有公开可用的 API 端点能稳定提供。
发送请求前怎么估算 token 数?
使用服务商的 tokenizer 库。OpenAI 开源了 tiktoken。Anthropic 提供 token 计数 API。粗略换算规则是 1 token ≈ 4 个英文字符或 ≈ 1.5 个中文字符,但实际数量因 tokenizer 而异。