2026 年下半年 AI API 成本分级参考:定价、缓存经济学与回退路由策略
一份面向 2026 年下半年的 AI API 成本分级参考。我们把每个主流模型对应到定价区间,对比 OpenAI、Anthropic、DashScope 和 DeepSeek 的缓存经济学,并给出 TheRouter 回退配置示例,让每一次请求都能在成本和能力之间取得平衡。
2026 年下半年,用不到 1 美元就能跑完一百万 token 的推理。 DeepSeek V4.1 Flash 非高峰输入价低至 $0.15/1M。SiliconFlow 提供多个零成本模型。前沿端,GPT-6 Astra 和 Claude Fable 5.1 都标价 $10/$50 每百万 token,但缓存经济学可以把实际成本砍掉 75-90%。下面这张表把每个主流模型对应到它所属的成本层级,方便你按预算搭建回退链。
跨供应商比较 API 价格时,统一到美元每百万 token口径,并区分输入与输出。多数供应商的输出 token 价是输入的 2–5 倍,所以"补全长度大" 的负载与"检索为主"的负载在同样的标称单价下成本会差很多。
- 统一货币(USD)——发表日按汇率折算并标注。
- 区分输入/输出——永远不要给单一"混合价"。
- 每行引到供应商自己的价格页 + 抓取日期。
- 注明长上下文阶梯价——长上下文常常单独跳一档。
四个成本层级
2026 年 9 月在售的每一个 API 模型都可以落入四个定价区间之一。搞清楚一个模型落在哪个区间,是搭建成本敏感路由的第一步。
第一层——前沿(每百万输出 token $10-50)
这些模型代表当前最强能力。你为顶级推理、编码和多模态付出溢价。
| 服务商 | 模型 | 输入 / 1M | 输出 / 1M | 缓存读取 / 1M | 批处理 |
|---|---|---|---|---|---|
| OpenAI | GPT-6 Astra | $10.00 | $50.00 | $1.00(9 折) | $5.00 / $25.00 |
| Anthropic | Claude Fable 5.1 | $10.00 | $50.00 | $0.25(75% 折扣) | $5.00 / $25.00 |
| Anthropic | Claude Opus 4.8 | $15.00 | $75.00 | $1.50 | $7.50 / $37.50 |
| OpenAI | GPT-5.6 Sol | $2.00 | $10.00 | $0.50 | $1.00 / $5.00 |
复杂推理链、前沿级别代码生成,以及输出质量直接影响收入的任务都落在这个层级。这里最值得关注的是缓存。如果你的请求共享较长的 system prompt,Claude Fable 5.1 的 $0.25/1M 缓存读取价格会让实际成本远低于标牌价。
Source OpenAI API Pricing (retrieved 2026-09-15), Anthropic Pricing (retrieved 2026-09-15)
第二层——中端(每百万输出 token $2-8)
通用能力强、能承担大部分生产负载的模型,价格只有前沿层的几分之一。
| 服务商 | 模型 | 输入 / 1M | 输出 / 1M | 缓存读取 / 1M | 备注 |
|---|---|---|---|---|---|
| DashScope | Qwen3.8-Max | $2.00 | $6.00 | $0.25(隐式) | 2.4T MoE,1M 上下文 |
| DashScope | Qwen3.8-Max-0902 | $2.00 | $6.00 | $0.25 | 9 月 2 日快照,编码更强 |
| Anthropic | Claude Sonnet 5 | $3.00 | $15.00 | $0.30 | 成本与质量的平衡点 |
| DeepSeek | V4 Pro | $0.66 | $1.98 | $0.022 | 非高峰价,高峰翻倍 |
生产流量的默认层级。Qwen3.8-Max 以 $2/$6 的价格在中文和多语言任务上交出接近前沿的质量。DeepSeek V4 Pro 在中端价位提供推理能力。
Source DashScope 模型定价 (retrieved 2026-09-15), DeepSeek API Pricing (retrieved 2026-09-15)
第三层——闪速(每百万输出 token $0.15-3.75)
为速度和成本优化。闪速模型处理高吞吐、低延迟的场景,在质量够用的前提下把单价压到最低。
| 服务商 | 模型 | 输入 / 1M | 输出 / 1M | 缓存读取 / 1M | 备注 |
|---|---|---|---|---|---|
| Gemini 3.8 Flash | $0.75 | $3.75 | $0.019 | 上市优惠价 | |
| DeepSeek | V4.1 Flash | $0.30 | $1.20 | $0.006 | 高峰价,非高峰减半 |
| DeepSeek | V4.1 Flash(非高峰) | $0.15 | $0.60 | $0.003 | 本层最低价 |
| DashScope | Qwen3.8-Flash | $0.05 | $0.40 | 自动 | 多模态,OpenAI 兼容 |
| Anthropic | Claude Haiku 3.5 | $0.80 | $4.00 | $0.08 | Anthropic 最便宜的选项 |
自动补全、分类、摘要、数据提取,以及每天处理数百万 token 的场景。DeepSeek V4.1 Flash 非高峰价($0.15/$0.60)是本层最便宜的有能力模型。Qwen3.8-Flash 以 $0.05/$0.40 的价格在简单任务上更划算。
Source DeepSeek V4.1 Flash Pricing (retrieved 2026-09-15), Google Gemini Pricing (retrieved 2026-09-15), DashScope Pricing (retrieved 2026-09-15)
第四层——免费/近免费
多个服务商在限速范围内提供零成本模型。适合原型开发、低流量生产和预算受限的场景。
| 服务商 | 模型 | 成本 | 限速 |
|---|---|---|---|
| SiliconFlow | DeepSeek V4(免费) | $0.00 | 按等级固定 RPM/TPM |
| SiliconFlow | Qwen3(免费版) | $0.00 | 按等级固定 RPM/TPM |
| Gemini 3.8 Flash(免费额度) | $0.00 | 15 RPM,1M TPM |
开发、测试、演示和低流量内部工具。不要在免费层上构建生产系统,限速会在规模化时卡住你。
Source SiliconFlow Pricing (retrieved 2026-09-15)
缓存经济学:被忽视的成本杠杆
裸 token 单价只讲了一半故事。在生产环境中,提示词缓存决定了你的实际成本。如果你的应用每次请求都带同一段 system prompt(绝大多数应用都是这样),缓存经济学比标牌价更重要。
各服务商的缓存机制
OpenAI 对超过 1,024 token 的提示词自动缓存。缓存 token 的价格视模型不同降低 50-90%。GPT-6 Astra 缓存输入 $1.00/1M,相对标准 $10.00 打了 9 折。无需改动 API 调用。
Anthropic 提供显式缓存,需要在请求中设置 cache_control 断点。Claude Fable 5.1 缓存读取 $0.25/1M(75% 折扣)。缓存写入 $12.50/1M(一次性写入溢价)。默认 TTL 5 分钟,近期更新后可延长至 1 小时。只要你反复使用同一段前缀,写入成本很快被摊薄。
DashScope 的隐式缓存在 Qwen3.8-Max 和 Qwen3.8-Flash 上全自动运行。不需要改 API,不需要显式控制。平台自动检测共享前缀并按缓存价格计费。也提供显式缓存以支持更精细的控制。
DeepSeek 的自动缓存与 OpenAI 类似。V4.1 Flash 非高峰缓存命中低至 $0.003/1M,在所有服务商中最便宜。
不同缓存命中率下的实际成本
假设每天发送 1,000 万输入 token,system prompt 长度 8K。
| 服务商 / 模型 | 0% 缓存 | 50% 缓存 | 80% 缓存 | 95% 缓存 |
|---|---|---|---|---|
| GPT-6 Astra | $100.00 | $55.00 | $28.00 | $14.50 |
| Claude Fable 5.1 | $100.00 | $51.25 | $20.50 | $5.88 |
| Qwen3.8-Max | $20.00 | $11.25 | $6.50 | $3.13 |
| V4.1 Flash(非高峰) | $1.50 | $0.77 | $0.33 | $0.11 |
在 95% 缓存命中率下(system prompt 稳定的应用很常见),Claude Fable 5.1 实际每天每 1,000 万输入 token 的成本是 $5.88,远低于标牌价给人的印象。但 DeepSeek V4.1 Flash 以 $0.11/天的成本仍然便宜了 50 倍。
批处理与异步定价:量大从优
如果你的场景能容忍延迟(最长 24 小时),批处理可以在大多数服务商处再砍掉 50% 的成本。
| 服务商 | 批处理折扣 | API |
|---|---|---|
| OpenAI | 标准价 5 折 | Batch API |
| Anthropic | 标准价 5 折 | Message Batches |
| DashScope | OpenAI 兼容批量接口 | 批量接口 |
批处理适合评测跑分、数据标注、内容生成流水线,以及任何不需要实时流式返回的场景。
选择决策树
从你的任务出发。
-
任务是否安全关键或直接影响收入? 用第一层(GPT-6 Astra 或 Claude Fable 5.1)。前沿模型和闪速模型之间的差价,放在生产环境中一次错误输出的代价面前微不足道。
-
是否为常规生产负载? 从第二层开始。Qwen3.8-Max 以 $2/$6 的价格能应对大多数任务。如果需要西方服务商的可靠性保障,Claude Sonnet 5 以 $3/$15 是一个合理的默认选择。
-
是否为大批量、低复杂度的场景? 用第三层。DeepSeek V4.1 Flash 非高峰($0.15/$0.60)省到极致。Gemini 3.8 Flash($0.75/$3.75)适合偏好 Google 基础设施可靠性的团队。
-
是否处于开发或原型阶段? 用第四层。SiliconFlow 免费模型或 Gemini 免费额度。
-
延迟不重要? 在任何层级上叠加批处理,再省 50%。
TheRouter 路由配置:跨层级回退链
TheRouter 将 OpenAI 兼容请求路由到已配置的服务商,支持服务商/模型级别的路由与回退。下面是一个从低价向高价逐级升级的实用配置。
from openai import OpenAI
client = OpenAI(
base_url="https://api.therouter.ai/v1",
api_key="your-therouter-key"
)
# 先走闪速层,回退到中端层,再到前沿层
response = client.chat.completions.create(
model="deepseek/deepseek-v4.1-flash", # 第三层:$0.15/$0.60
messages=[{"role": "user", "content": "总结这份文档..."}],
extra_body={
"fallback_models": [
"dashscope/qwen3.8-max", # 第二层:$2/$6
"anthropic/claude-fable-5.1" # 第一层:$10/$50
]
}
)
这条配置优先尝试最便宜的模型。如果 DeepSeek V4.1 Flash 不可用或触发限速,自动回退到 Qwen3.8-Max,再到 Claude Fable 5.1。你在每次请求上都拿到最便宜的可用模型,不需要改动应用代码。
按任务类型分流的进阶配置。
# 大批量分类——只走闪速层
classify_response = client.chat.completions.create(
model="dashscope/qwen3.8-flash", # $0.05/$0.40
messages=[{"role": "user", "content": "分类:..."}],
extra_body={
"fallback_models": ["deepseek/deepseek-v4.1-flash"]
}
)
# 复杂推理——中端为主,前沿回退
reason_response = client.chat.completions.create(
model="dashscope/qwen3.8-max", # $2/$6
messages=[{"role": "user", "content": "分析:..."}],
extra_body={
"fallback_models": ["anthropic/claude-fable-5.1"]
}
)
月度成本估算
把层级差异换算成具体数字。下表是每天 1M、10M、100M 输入 token 在各层级的月度成本(仅输入 token,不含缓存,标准价)。
| 层级 | 模型 | 1M/天 | 10M/天 | 100M/天 |
|---|---|---|---|---|
| 1 | GPT-6 Astra | $300/月 | $3,000/月 | $30,000/月 |
| 1 | Claude Fable 5.1 | $300/月 | $3,000/月 | $30,000/月 |
| 2 | Qwen3.8-Max | $60/月 | $600/月 | $6,000/月 |
| 3 | Gemini 3.8 Flash | $22.50/月 | $225/月 | $2,250/月 |
| 3 | V4.1 Flash(非高峰) | $4.50/月 | $45/月 | $450/月 |
| 3 | Qwen3.8-Flash | $1.50/月 | $15/月 | $150/月 |
| 4 | SiliconFlow 免费 | $0 | $0(限速) | 不适用 |
每天处理 1 亿 token 时,第一层和第三层之间差 $29,550/月。这就是一个路由层能帮你省下的钱。
OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。
常见问题
哪个服务商的缓存经济学最好?
DeepSeek 的绝对缓存读取价格最低(V4.1 Flash 非高峰 $0.003/1M)。Claude Fable 5.1 的百分比折扣最大(75%)。对大多数场景来说,答案取决于你选的基础模型。缓存折扣只有在未缓存模型满足质量要求时才有意义。
不在中国的团队应该用中国服务商吗?
DashScope(阿里云百炼)提供国际端点,支持美元计费。DeepSeek 的 API 全球可访问。两者都兼容 OpenAI 协议,切换只需要改 base URL 和 API key。主要权衡是延迟,从北美或欧洲请求中国基础设施会增加 100-200ms 往返时间。具体接入方式参见我们的 DashScope 指南和 DeepSeek 指南。
怎么处理 DeepSeek 的高峰/非高峰定价?
DeepSeek 在工作日高峰时段(北京时间)价格翻倍。如果你的场景时间灵活,把批量任务安排在非高峰窗口。TheRouter 的回退路由也能在 DeepSeek 高峰时段自动把流量切换到其他服务商,维持成本目标。更多模式参见我们的成本优化策略指南。
SiliconFlow 免费层能用于生产吗?
SiliconFlow 免费模型受 RPM 和 TPM 限制,按账户等级设定上限。适合原型开发、内部工具和低流量应用。对需要稳定吞吐的生产场景,建议升级到 SiliconFlow 付费计划或使用 DeepSeek V4.1 Flash 作为预算替代。限速细节参见我们的 SiliconFlow 指南。
TheRouter 怎么帮助优化成本?
TheRouter 将 OpenAI 兼容请求路由到已配置的服务商,支持服务商/模型级别的路由与回退。你定义一条回退链,优先尝试低价模型。如果某个服务商宕机或触发限速,流量自动切换到下一个服务商。结果是你始终拿到最便宜的可用模型,不需要人工干预。入门配置参见快速开始。
为什么输出 token 总是比输入贵?
所有服务商的输出 token 价格都是输入的 2-5 倍,因为生成计算量远大于提示词处理。这让输出密集型场景(长文生成、代码编写)在前沿模型上的花费不成比例地高。对这类场景,优先考虑闪速层模型,只有在质量确实不够时再升级到前沿。
定价数据检索于 2026 年 9 月 15 日。价格经常变化,做购买决定前请核对官方定价页面。所有价格以美元每百万 token 计,除非另有说明。DashScope/DeepSeek 人民币价格按近似市场汇率折算。