← 全部文章

2026 年各大 LLM API 上下文窗口对比:最大 Token 数、定价分层与实际可用范围

跨服务商 LLM API 上下文窗口参考。对比 OpenAI、Anthropic、DeepSeek、通义千问(DashScope)、Google Gemini、Kimi、SiliconFlow 的最大输入 Token、最大输出 Token、长上下文定价差异与实际限制。

· updated 2026-08-07· TheRouter

现在每家主流 LLM API 都把上下文窗口标到了几十万甚至上百万 token。对于运维和调用方来说,真正需要搞清楚的是那个窗口实际要花多少钱、最大输出限制是多少、服务商在哪个阈值之后开始加价或降速。

OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。

数据来源均已标注检索日期。OpenAI API Pricing,2026-08-07 检索;Anthropic Models Overview,2026-08-07 检索;DeepSeek Models & Pricing,2026-08-07 检索;DashScope 模型计费,2026-08-07 检索;Google Gemini 3.5 Flash Model Card,2026-08-07 检索;Kimi K3 指南,2026-08-07 检索。

速查表

服务商模型上下文窗口最大输出长上下文加价OpenAI SDK 兼容
GoogleGemini 3.5 Pro2M64K128K 以上加价base_url 覆盖
OpenAIGPT-5.6 Sol/Terra/Luna1.05M128K272K 以上 2 倍输入、1.5 倍输出原生
AnthropicClaude Opus 4.8 / Sonnet 51M128K(batch 300K)不加价base_url 覆盖
DeepSeekV4 Pro / V4 Flash1M384K不加价原生
DashScopeQwen3.8-Max / Qwen3.7-Max1M128KQwen3.8/3.7-Max 统一价;旧版 Qwen3-Max 阶梯加价OpenAI 兼容端点
KimiK31M——base_url 覆盖
SiliconFlow按托管模型而定最高 1M按模型不加价原生
GoogleGemini 3.5 Flash1M64K128K 以上加价base_url 覆盖

数据截至 2026 年 8 月。"上下文窗口"指单次请求可接受的最大 token 总量(输入 + 输出),除非另行说明。请以各服务商最新文档为准。

OpenAI:272K 是加价分水岭

OpenAI 从 GPT-5.6 系列开始明确区分 short-context 和 long-context 定价,分界线在 272K token。

GPT-5.6 上下文规格

模型上下文窗口最大输出短上下文输入长上下文输入短上下文输出长上下文输出
GPT-5.6 Sol1.05M128K$5.00$10.00$30.00$45.00
GPT-5.6 Terra1.05M128K$2.00$4.00$12.00$18.00
GPT-5.6 Luna1.05M128K$0.20$0.40$1.20$1.80

请求总 token 一旦过 272K,输入价翻倍,输出价变成 1.5 倍。这个阈值按整个请求计算,不是逐 token 分段。

缓存可以缓解成本。 Sol 的缓存命中输入价只要 $0.50/M(正常短上下文 $5.00/M),长上下文场景下缓存命中也只需 $1.00/M。如果请求之间有大量重复的 system prompt 或参考文档,缓存能把长上下文的有效输入成本压到跟短上下文差不多。

旧版模型 GPT-5.5 同样支持 1.05M 上下文和 128K 最大输出,272K 分界线不变。GPT-5.4 上限 272K。GPT-5.4-mini 和 GPT-5.4-nano 没有长上下文定价层。

详见 GPT-5.6 Sol、Terra、Luna 模型分层对比。

Anthropic:1M 上下文,不收附加费

Anthropic 在 2026 年 3 月向所有用户开放了 Claude Opus 4.8 和 Claude Sonnet 5 的 1M 上下文窗口,没有添加长上下文定价层。

Claude 上下文规格

模型上下文窗口最大输出输入价输出价
Claude Opus 4.81M128K(batch 300K)$5.00$25.00
Claude Sonnet 51M128K(batch 300K)$2.00$10.00
Claude Sonnet 4200K128K$3.00$15.00
Claude Haiku 3.5200K8K$0.80$4.00

没有长上下文加价意味着 Claude 是 300K 到 1M token 范围内性价比最高的选项之一。Prompt caching 命中价为基础价的 10%(Opus 4.8 缓存命中 $0.50/M,Sonnet 5 缓存命中 $0.20/M)。

Extended thinking 消耗的是输出 token 预算。一个用了 60K 思考 token 的请求,可见回复只剩 68K 的空间(总共 128K)。batch API 的 300K 输出上限为重度思考场景留了更多余量。

详见 Anthropic Claude API 完整指南。

DeepSeek:1M 上下文、384K 输出、最低 token 单价

DeepSeek V4 的最大输出 token 数在所有量产 API 中排第一,达到 384K,搭配 1M 上下文窗口,没有长上下文加价。

DeepSeek V4 上下文规格

模型上下文窗口最大输出输入(未命中缓存)输入(命中缓存)输出
V4 Flash1M384K$0.14$0.0028$0.28
V4 Pro1M384K$0.435$0.003625$0.87

缓存命中折扣达到 98%,是所有服务商中最激进的。如果请求前缀高度重复,V4 Flash 配合缓存的有效输入成本不到 $0.003/M token,无论上下文多长。

两款模型原生支持 OpenAI 和 Anthropic API 格式。V4 Flash 并发上限 2,500,V4 Pro 并发上限 500。

注意 DeepSeek 已宣布近期将大幅提价。当前定价可能无法持续。详见 DeepSeek API 完整指南。

DashScope(阿里百炼):按上下文长度阶梯定价

DashScope 的特点是阶梯定价,单次请求的 token 总量越大,每百万 token 的单价越高。

千问 Max 系列上下文规格(北京区,人民币/百万 Token)

模型上下文窗口最大输出输入 ≤32K输入 32K–128K输入 128K–1M输出
Qwen3.8-Max1M128K¥12¥12(统一价)¥12(统一价)¥36
Qwen3.7-Max1M128K¥12(限时 ¥6)¥12(限时 ¥6)¥12(限时 ¥6)¥36(限时 ¥18)
Qwen3-Max256K128K¥2.5¥4¥7¥10–¥28

Qwen3.8-Max 和 Qwen3.7-Max 已经改为 1M 范围内统一定价,比旧版 Qwen3-Max 的阶梯结构更简单。按当前限时折扣价计算,Qwen3.7-Max 的输入成本约 $0.83/M(¥6),输出约 $2.48/M(¥18),在长上下文场景下结合上下文缓存折扣,能与 DeepSeek V4 Pro 竞争。

旧版 Qwen3-Max 仍然使用阶梯定价,且阈值按整个请求的输入 token 总量判定,不分段累进。

详见 DashScope Qwen3.7 系列完整指南。

Google Gemini:Pro 达到 2M 上下文,Flash 为 1M

Google 在 Gemini 3.5 Pro 上提供了全行业最大的量产上下文窗口,达到 2M token。

Gemini 上下文规格

模型上下文窗口最大输出输入价输出价长上下文加价
Gemini 3.5 Pro2M64K按量按量128K 以上加价
Gemini 3.5 Flash1M64K$1.50$9.00128K 以上加价
Gemini 3.6 Flash1M64K———

64K 最大输出在本次对比中是旗舰模型里最低的。如果需要在单次请求中生成长文档或详细分析,这个上限会比上下文窗口先成为瓶颈。

Kimi K3:1M 上下文、开源权重

Moonshot 的 Kimi K3 配备 1M 上下文窗口和 2.8 万亿参数。模型权重在 2026 年 7 月 27 日公开。

Kimi K3 上下文规格

模型上下文窗口最大输出输入价输出价
K31M(1,048,576)—$0.35$2.00
K3(思考 token)1M——$1.40

K3 支持推理强度控制(目前只有 max 可用)。思考 token 按折扣后的输出价计费。该模型也作为第三方模型托管在 DashScope 上。

详见 Kimi K3 API 接入指南。

SiliconFlow:托管开源模型

SiliconFlow 托管 200+ 开源模型,提供 OpenAI 兼容 API。上下文窗口取决于底层模型本身。

托管模型上下文窗口最大输出价格(输入/输出,每百万 Token)
DeepSeek V4 Flash(托管)最高 1M按模型有免费额度
Qwen3 系列(托管)32K–128K按模型不等
其他开源模型4K–128K按模型部分模型免费

SiliconFlow 不额外收取长上下文费用。免费模型有限流,高吞吐场景下可能不够用。详见 SiliconFlow 免费模型路由指南。

决策树:按上下文需求选择服务商

  1. 需要超过 1M 的上下文? → Google Gemini 3.5 Pro(2M)是唯一选项。
  2. 需要超过 128K 的输出 token? → DeepSeek V4(384K 最大输出)是唯一选项。
  3. 平均请求不超过 272K token? → OpenAI GPT-5.6 Luna($0.20/$1.20)或 DeepSeek V4 Flash($0.14/$0.28)成本最低。
  4. 经常发送 300K 到 1M token 的请求? → Anthropic(不加价)或 DeepSeek(不加价 + 最低基础价)比 OpenAI(272K 以上 2 倍加价)划算得多。
  5. 需要中国区部署? → DashScope Qwen3.7-Max 或 Qwen3.8-Max(1M 上下文,人民币计费,北京/新加坡区域)。
  6. 需要免费额度用于原型开发? → SiliconFlow(部分模型免费)或 DashScope(新账号有免费配额)。

长上下文场景的实际花费

下表展示了 500K 输入 + 10K 输出的单次请求在各服务商的实际费用,含缓存和不含缓存两种情况。

服务商模型500K 输入 + 10K 输出(无缓存)80% 缓存命中
OpenAIGPT-5.6 Sol$5.45(长上下文费率)$1.35
OpenAIGPT-5.6 Luna$0.21$0.05
AnthropicClaude Opus 4.8$2.75$0.50
AnthropicClaude Sonnet 5$1.10$0.22
DeepSeekV4 Flash$0.073$0.004
DeepSeekV4 Pro$0.226$0.012
DashScopeQwen3.7-Max(限时价)≈$0.47≈$0.10
GoogleGemini 3.5 Flash≈$0.84—

DeepSeek V4 Flash 配合缓存,在同等长上下文场景下比 OpenAI GPT-5.6 Sol 便宜约 1,300 倍。即便不用缓存,差距也有 75 倍。这是多服务商路由中影响成本最大的单一变量。

标称数字之外的实际限制

有效窗口 vs. 标称窗口。 有些服务商在产品侧实际暴露的窗口比 API 标称的小。例如 OpenAI 的 Codex 产品被报告只暴露了 GPT-5.6 的约 258K token,远低于 1.05M 的标称值。API 端点和产品界面的表现可能不同。

长上下文的吞吐量。 填满 1M token 的上下文窗口需要时间来传输和处理。所有服务商的首 token 延迟(TTFT)和每秒 token 数(TPS)都会随上下文长度增加而下降。DeepSeek V4 的 CSA/HCA 注意力机制专门针对长上下文效率做了优化,号称比 V3.2 减少 90% 的 KV cache。

token 计数差异。 各服务商使用不同的 tokenizer。同一篇文档在 OpenAI(tiktoken)、Anthropic(Claude tokenizer)和 DeepSeek(自定义 tokenizer)上会产生不同的 token 数。一家的 1M token 窗口装进去的文本量和另一家的 1M 并不完全一样。

截断行为。 各服务商对超出窗口的请求处理方式不同。有的静默截断输入(丢弃最旧的消息),有的直接返回错误,还有的虽然截断但会在响应元数据里带上警告信息。上线前务必用超长输入测试一下你所用服务商的实际表现。

TheRouter 与基于上下文长度的路由

TheRouter 等 OpenAI 兼容的路由网关可以检测请求的估计输入长度,做出路由决策。

  • 短请求(32K 以内)路由到最便宜的模型(DeepSeek V4 Flash、GPT-5.6 Luna 或 SiliconFlow 免费模型)
  • 中等请求(32K 到 272K)仍在 OpenAI 短上下文费率范围内,按质量/成本偏好路由
  • 长请求(272K 以上)避开 OpenAI 以规避 2 倍加价,路由到 DeepSeek V4 或 Anthropic Claude
  • 超长请求(1M 以上)只有 Google Gemini 3.5 Pro 支持

这种按上下文长度感知的路由,是多服务商架构下回报率最高的优化手段之一。详见 LLM API 成本优化路由策略 和 Model Fallback 路由。

常见问题

哪家服务商的长上下文性价比最高?

DeepSeek V4 Flash 遥遥领先。$0.14/M 输入和 $0.28/M 输出,没有长上下文加价,缓存命中折扣 98%。在任何 1M 以内的上下文长度上,它都是最便宜的选择。代价是 DeepSeek 已经宣布即将提价。

开启 extended thinking / reasoning 模式后,能用完整个上下文窗口吗?

思考 token 消耗的是输出预算,不影响上下文窗口。Claude 用 60K 思考 token 后,可见回复只剩 68K(总共 128K)。DeepSeek V4 的 384K 最大输出为思考 + 回复留了充足空间。OpenAI o3/o4-mini 的推理 token 独立于上下文窗口,但影响费用。

最大输出和上下文窗口成正比吗?

不成正比。Google Gemini 上下文最大(2M)但最大输出最小(64K)。DeepSeek 最大输出最高(384K)但上下文 1M。各服务商之间没有统一的比例关系。

有没有"无限"上下文的模型?

截至 2026 年 8 月,没有量产 API 提供无限上下文。2M token(Gemini 3.5 Pro)是当前上限。一些研究原型和本地推理方案声称支持更大窗口,但没有公开可用的 API 端点能稳定提供。

发送请求前怎么估算 token 数?

使用服务商的 tokenizer 库。OpenAI 开源了 tiktoken。Anthropic 提供 token 计数 API。粗略换算规则是 1 token ≈ 4 个英文字符或 ≈ 1.5 个中文字符,但实际数量因 tokenizer 而异。

帮助与联系