← 全部文章

2026 年下半年 AI API 成本分级参考:定价、缓存经济学与回退路由策略

一份面向 2026 年下半年的 AI API 成本分级参考。我们把每个主流模型对应到定价区间,对比 OpenAI、Anthropic、DashScope 和 DeepSeek 的缓存经济学,并给出 TheRouter 回退配置示例,让每一次请求都能在成本和能力之间取得平衡。

· updated 2026-09-15· TheRouter

2026 年下半年,用不到 1 美元就能跑完一百万 token 的推理。 DeepSeek V4.1 Flash 非高峰输入价低至 $0.15/1M。SiliconFlow 提供多个零成本模型。前沿端,GPT-6 Astra 和 Claude Fable 5.1 都标价 $10/$50 每百万 token,但缓存经济学可以把实际成本砍掉 75-90%。下面这张表把每个主流模型对应到它所属的成本层级,方便你按预算搭建回退链。

跨供应商比较 API 价格时,统一到美元每百万 token口径,并区分输入与输出。多数供应商的输出 token 价是输入的 2–5 倍,所以"补全长度大" 的负载与"检索为主"的负载在同样的标称单价下成本会差很多。

  • 统一货币(USD)——发表日按汇率折算并标注。
  • 区分输入/输出——永远不要给单一"混合价"。
  • 每行引到供应商自己的价格页 + 抓取日期。
  • 注明长上下文阶梯价——长上下文常常单独跳一档。

四个成本层级

2026 年 9 月在售的每一个 API 模型都可以落入四个定价区间之一。搞清楚一个模型落在哪个区间,是搭建成本敏感路由的第一步。

第一层——前沿(每百万输出 token $10-50)

这些模型代表当前最强能力。你为顶级推理、编码和多模态付出溢价。

服务商模型输入 / 1M输出 / 1M缓存读取 / 1M批处理
OpenAIGPT-6 Astra$10.00$50.00$1.00(9 折)$5.00 / $25.00
AnthropicClaude Fable 5.1$10.00$50.00$0.25(75% 折扣)$5.00 / $25.00
AnthropicClaude Opus 4.8$15.00$75.00$1.50$7.50 / $37.50
OpenAIGPT-5.6 Sol$2.00$10.00$0.50$1.00 / $5.00

复杂推理链、前沿级别代码生成,以及输出质量直接影响收入的任务都落在这个层级。这里最值得关注的是缓存。如果你的请求共享较长的 system prompt,Claude Fable 5.1 的 $0.25/1M 缓存读取价格会让实际成本远低于标牌价。

Source OpenAI API Pricing (retrieved 2026-09-15), Anthropic Pricing (retrieved 2026-09-15)

第二层——中端(每百万输出 token $2-8)

通用能力强、能承担大部分生产负载的模型,价格只有前沿层的几分之一。

服务商模型输入 / 1M输出 / 1M缓存读取 / 1M备注
DashScopeQwen3.8-Max$2.00$6.00$0.25(隐式)2.4T MoE,1M 上下文
DashScopeQwen3.8-Max-0902$2.00$6.00$0.259 月 2 日快照,编码更强
AnthropicClaude Sonnet 5$3.00$15.00$0.30成本与质量的平衡点
DeepSeekV4 Pro$0.66$1.98$0.022非高峰价,高峰翻倍

生产流量的默认层级。Qwen3.8-Max 以 $2/$6 的价格在中文和多语言任务上交出接近前沿的质量。DeepSeek V4 Pro 在中端价位提供推理能力。

Source DashScope 模型定价 (retrieved 2026-09-15), DeepSeek API Pricing (retrieved 2026-09-15)

第三层——闪速(每百万输出 token $0.15-3.75)

为速度和成本优化。闪速模型处理高吞吐、低延迟的场景,在质量够用的前提下把单价压到最低。

服务商模型输入 / 1M输出 / 1M缓存读取 / 1M备注
GoogleGemini 3.8 Flash$0.75$3.75$0.019上市优惠价
DeepSeekV4.1 Flash$0.30$1.20$0.006高峰价,非高峰减半
DeepSeekV4.1 Flash(非高峰)$0.15$0.60$0.003本层最低价
DashScopeQwen3.8-Flash$0.05$0.40自动多模态,OpenAI 兼容
AnthropicClaude Haiku 3.5$0.80$4.00$0.08Anthropic 最便宜的选项

自动补全、分类、摘要、数据提取,以及每天处理数百万 token 的场景。DeepSeek V4.1 Flash 非高峰价($0.15/$0.60)是本层最便宜的有能力模型。Qwen3.8-Flash 以 $0.05/$0.40 的价格在简单任务上更划算。

Source DeepSeek V4.1 Flash Pricing (retrieved 2026-09-15), Google Gemini Pricing (retrieved 2026-09-15), DashScope Pricing (retrieved 2026-09-15)

第四层——免费/近免费

多个服务商在限速范围内提供零成本模型。适合原型开发、低流量生产和预算受限的场景。

服务商模型成本限速
SiliconFlowDeepSeek V4(免费)$0.00按等级固定 RPM/TPM
SiliconFlowQwen3(免费版)$0.00按等级固定 RPM/TPM
GoogleGemini 3.8 Flash(免费额度)$0.0015 RPM,1M TPM

开发、测试、演示和低流量内部工具。不要在免费层上构建生产系统,限速会在规模化时卡住你。

Source SiliconFlow Pricing (retrieved 2026-09-15)

缓存经济学:被忽视的成本杠杆

裸 token 单价只讲了一半故事。在生产环境中,提示词缓存决定了你的实际成本。如果你的应用每次请求都带同一段 system prompt(绝大多数应用都是这样),缓存经济学比标牌价更重要。

各服务商的缓存机制

OpenAI 对超过 1,024 token 的提示词自动缓存。缓存 token 的价格视模型不同降低 50-90%。GPT-6 Astra 缓存输入 $1.00/1M,相对标准 $10.00 打了 9 折。无需改动 API 调用。

Anthropic 提供显式缓存,需要在请求中设置 cache_control 断点。Claude Fable 5.1 缓存读取 $0.25/1M(75% 折扣)。缓存写入 $12.50/1M(一次性写入溢价)。默认 TTL 5 分钟,近期更新后可延长至 1 小时。只要你反复使用同一段前缀,写入成本很快被摊薄。

DashScope 的隐式缓存在 Qwen3.8-Max 和 Qwen3.8-Flash 上全自动运行。不需要改 API,不需要显式控制。平台自动检测共享前缀并按缓存价格计费。也提供显式缓存以支持更精细的控制。

DeepSeek 的自动缓存与 OpenAI 类似。V4.1 Flash 非高峰缓存命中低至 $0.003/1M,在所有服务商中最便宜。

不同缓存命中率下的实际成本

假设每天发送 1,000 万输入 token,system prompt 长度 8K。

服务商 / 模型0% 缓存50% 缓存80% 缓存95% 缓存
GPT-6 Astra$100.00$55.00$28.00$14.50
Claude Fable 5.1$100.00$51.25$20.50$5.88
Qwen3.8-Max$20.00$11.25$6.50$3.13
V4.1 Flash(非高峰)$1.50$0.77$0.33$0.11

在 95% 缓存命中率下(system prompt 稳定的应用很常见),Claude Fable 5.1 实际每天每 1,000 万输入 token 的成本是 $5.88,远低于标牌价给人的印象。但 DeepSeek V4.1 Flash 以 $0.11/天的成本仍然便宜了 50 倍。

批处理与异步定价:量大从优

如果你的场景能容忍延迟(最长 24 小时),批处理可以在大多数服务商处再砍掉 50% 的成本。

服务商批处理折扣API
OpenAI标准价 5 折Batch API
Anthropic标准价 5 折Message Batches
DashScopeOpenAI 兼容批量接口批量接口

批处理适合评测跑分、数据标注、内容生成流水线,以及任何不需要实时流式返回的场景。

选择决策树

从你的任务出发。

  1. 任务是否安全关键或直接影响收入? 用第一层(GPT-6 Astra 或 Claude Fable 5.1)。前沿模型和闪速模型之间的差价,放在生产环境中一次错误输出的代价面前微不足道。

  2. 是否为常规生产负载? 从第二层开始。Qwen3.8-Max 以 $2/$6 的价格能应对大多数任务。如果需要西方服务商的可靠性保障,Claude Sonnet 5 以 $3/$15 是一个合理的默认选择。

  3. 是否为大批量、低复杂度的场景? 用第三层。DeepSeek V4.1 Flash 非高峰($0.15/$0.60)省到极致。Gemini 3.8 Flash($0.75/$3.75)适合偏好 Google 基础设施可靠性的团队。

  4. 是否处于开发或原型阶段? 用第四层。SiliconFlow 免费模型或 Gemini 免费额度。

  5. 延迟不重要? 在任何层级上叠加批处理,再省 50%。

TheRouter 路由配置:跨层级回退链

TheRouter 将 OpenAI 兼容请求路由到已配置的服务商,支持服务商/模型级别的路由与回退。下面是一个从低价向高价逐级升级的实用配置。

from openai import OpenAI

client = OpenAI(
    base_url="https://api.therouter.ai/v1",
    api_key="your-therouter-key"
)

# 先走闪速层,回退到中端层,再到前沿层
response = client.chat.completions.create(
    model="deepseek/deepseek-v4.1-flash",  # 第三层:$0.15/$0.60
    messages=[{"role": "user", "content": "总结这份文档..."}],
    extra_body={
        "fallback_models": [
            "dashscope/qwen3.8-max",          # 第二层:$2/$6
            "anthropic/claude-fable-5.1"       # 第一层:$10/$50
        ]
    }
)

这条配置优先尝试最便宜的模型。如果 DeepSeek V4.1 Flash 不可用或触发限速,自动回退到 Qwen3.8-Max,再到 Claude Fable 5.1。你在每次请求上都拿到最便宜的可用模型,不需要改动应用代码。

按任务类型分流的进阶配置。

# 大批量分类——只走闪速层
classify_response = client.chat.completions.create(
    model="dashscope/qwen3.8-flash",  # $0.05/$0.40
    messages=[{"role": "user", "content": "分类:..."}],
    extra_body={
        "fallback_models": ["deepseek/deepseek-v4.1-flash"]
    }
)

# 复杂推理——中端为主,前沿回退
reason_response = client.chat.completions.create(
    model="dashscope/qwen3.8-max",  # $2/$6
    messages=[{"role": "user", "content": "分析:..."}],
    extra_body={
        "fallback_models": ["anthropic/claude-fable-5.1"]
    }
)

完整配置选项参见模型回退指南和快速开始。

月度成本估算

把层级差异换算成具体数字。下表是每天 1M、10M、100M 输入 token 在各层级的月度成本(仅输入 token,不含缓存,标准价)。

层级模型1M/天10M/天100M/天
1GPT-6 Astra$300/月$3,000/月$30,000/月
1Claude Fable 5.1$300/月$3,000/月$30,000/月
2Qwen3.8-Max$60/月$600/月$6,000/月
3Gemini 3.8 Flash$22.50/月$225/月$2,250/月
3V4.1 Flash(非高峰)$4.50/月$45/月$450/月
3Qwen3.8-Flash$1.50/月$15/月$150/月
4SiliconFlow 免费$0$0(限速)不适用

每天处理 1 亿 token 时,第一层和第三层之间差 $29,550/月。这就是一个路由层能帮你省下的钱。

OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。

常见问题

哪个服务商的缓存经济学最好?

DeepSeek 的绝对缓存读取价格最低(V4.1 Flash 非高峰 $0.003/1M)。Claude Fable 5.1 的百分比折扣最大(75%)。对大多数场景来说,答案取决于你选的基础模型。缓存折扣只有在未缓存模型满足质量要求时才有意义。

不在中国的团队应该用中国服务商吗?

DashScope(阿里云百炼)提供国际端点,支持美元计费。DeepSeek 的 API 全球可访问。两者都兼容 OpenAI 协议,切换只需要改 base URL 和 API key。主要权衡是延迟,从北美或欧洲请求中国基础设施会增加 100-200ms 往返时间。具体接入方式参见我们的 DashScope 指南和 DeepSeek 指南。

怎么处理 DeepSeek 的高峰/非高峰定价?

DeepSeek 在工作日高峰时段(北京时间)价格翻倍。如果你的场景时间灵活,把批量任务安排在非高峰窗口。TheRouter 的回退路由也能在 DeepSeek 高峰时段自动把流量切换到其他服务商,维持成本目标。更多模式参见我们的成本优化策略指南。

SiliconFlow 免费层能用于生产吗?

SiliconFlow 免费模型受 RPM 和 TPM 限制,按账户等级设定上限。适合原型开发、内部工具和低流量应用。对需要稳定吞吐的生产场景,建议升级到 SiliconFlow 付费计划或使用 DeepSeek V4.1 Flash 作为预算替代。限速细节参见我们的 SiliconFlow 指南。

TheRouter 怎么帮助优化成本?

TheRouter 将 OpenAI 兼容请求路由到已配置的服务商,支持服务商/模型级别的路由与回退。你定义一条回退链,优先尝试低价模型。如果某个服务商宕机或触发限速,流量自动切换到下一个服务商。结果是你始终拿到最便宜的可用模型,不需要人工干预。入门配置参见快速开始。

为什么输出 token 总是比输入贵?

所有服务商的输出 token 价格都是输入的 2-5 倍,因为生成计算量远大于提示词处理。这让输出密集型场景(长文生成、代码编写)在前沿模型上的花费不成比例地高。对这类场景,优先考虑闪速层模型,只有在质量确实不够时再升级到前沿。


定价数据检索于 2026 年 9 月 15 日。价格经常变化,做购买决定前请核对官方定价页面。所有价格以美元每百万 token 计,除非另有说明。DashScope/DeepSeek 人民币价格按近似市场汇率折算。

帮助与联系