2026 年主流 LLM API 服务商对比:OpenAI、Anthropic、Google、DeepSeek、DashScope 与 SiliconFlow
2026 年六大主流 LLM API 服务商实用对比:OpenAI、Anthropic、Google Gemini、DeepSeek、DashScope(百炼)和 SiliconFlow。我们从旗舰模型、定价、速率限制、OpenAI SDK 兼容性、区域部署等维度展开分析。
最快的答案:需要最广泛的生态和工具集成选 OpenAI,需要长上下文推理或扩展思考选 Anthropic,需要多模态和托管 Agent 选 Google Gemini,需要极致性价比的推理能力选 DeepSeek,需要国内部署和 Qwen 全家桶选 DashScope(百炼),需要免费额度和开源模型一站式访问选 SiliconFlow。 2026 年的难点不是找到一个服务商,而是搞清楚你选的服务商在速率限制、价格阶梯和故障模式上到底怎么运作。
OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。
数据来源:OpenAI API Pricing,检索于 2026-07-28;Anthropic Claude Pricing,检索于 2026-07-28;Google Gemini API Pricing,检索于 2026-07-28;DeepSeek Models & Pricing,检索于 2026-07-28;百炼模型定价,检索于 2026-07-28;SiliconFlow Pricing,检索于 2026-07-28。
一览表——服务商对比
| 服务商 | 旗舰模型 | 输入 / 输出(每百万 Token) | 上下文窗口 | 兼容 OpenAI SDK | 速率限制方式 | 适合场景 |
|---|---|---|---|---|---|---|
| OpenAI | GPT-5.6 Sol | $5.00 / $30.00 | 272K+(支持长上下文) | 原生 | RPM/TPM/RPD 分层 | 生态最广,工具调用,编程 Agent |
| Anthropic | Claude Opus 4.8 | $5.00 / $25.00 | 200K–1M | 通过 base_url | RPM/ITPM/OTPM 分层 | 扩展思考、长上下文、安全优先 |
| Gemini 3.6 Flash | $1.50 / $7.50 | 1M+ | 通过 base_url | RPM/TPM 按项目 | 多模态、托管 Agent、Google Cloud | |
| DeepSeek | V4-Flash | $0.14 / $0.28 | 1M | 原生(另支持 Anthropic 格式) | 并发数限制(2,500) | 极致低成本推理和编程 |
| DashScope | Qwen3.7-Max | ¥6 / ¥18(限时折扣) | 1M | OpenAI 兼容端点 | RPM/TPM 按模型 | 国内部署、Qwen 全家桶、阶梯计费 |
| SiliconFlow | 多厂商(200+ 模型) | 从 $0.00 到 $15.00 不等 | 取决于模型 | 原生 | 分层速率限制 | 免费额度、开源模型、按量付费 |
提示: 价格截至 2026 年 7 月。促销价可能调整。DashScope 标价为人民币,其他为美元。正式采用前请核实服务商官方定价页面。
OpenAI——生态系统的默认选择
OpenAI 仍然是需要最广泛模型目录、最深工具集成和最多第三方 SDK 支持的团队的首选。
模型层级(2026 年 7 月):
| 模型 | 输入 | 输出 | 上下文 | 备注 |
|---|---|---|---|---|
| GPT-5.6 Sol | $5.00 | $30.00 | 272K+ | 旗舰,支持长上下文 |
| GPT-5.6 Terra | $2.50 | $15.00 | 272K+ | 中端 |
| GPT-5.6 Luna | $1.00 | $6.00 | 272K+ | 高性价比 |
| GPT-5.4-mini | $0.75 | $4.50 | 标准 | 快速、实惠 |
| GPT-5.4-nano | $0.20 | $1.25 | 标准 | 超低价 |
| o3 | $2.00 | $8.00 | 标准 | 推理模型 |
| o4-mini | $1.10 | $4.40 | 标准 | 轻量推理 |
优势: 原生 Prompt Caching(缓存命中输入打一折)、Batch API(半价)、Responses API 内置工具调用、Codex 编程 Agent、10 个区域数据驻留。
局限: 速率限制按层分级,触顶前不易感知。Spend Limit(硬性 429 错误)和普通 Rate Limit 是两套机制。最新模型(GPT-5.6)定价偏高——Luna($1/$6)是多数生产负载的甜点。
适合选 OpenAI 的场景: 需要最广泛的工具生态、团队已经在用 OpenAI SDK、或者需要特定区域的数据驻留。
来源:OpenAI API Pricing,检索于 2026-07-28。
Anthropic——扩展思考与安全
Anthropic 的 Claude API 占据了独特定位:同级别最好的扩展思考能力、出色的编程基准测试成绩和企业级安全控制。
模型层级(2026 年 7 月):
| 模型 | 输入 | 输出 | 上下文 | 备注 |
|---|---|---|---|---|
| Claude Opus 4.8 | $5.00 | $25.00 | 200K(扩展思考可达 1M) | 前沿推理 |
| Claude Sonnet 5 | $2.00 | $10.00 | 200K | 限时价至 2026 年 8 月底(常规价 $3/$15) |
| Claude Haiku 4 | $1.00 | $5.00 | 200K | 快速、低成本 |
优势: 扩展思考模式(基于预算,最多 128K 思考 Token)、Prompt Caching(缓存命中打一折)、Effort 控制(auto/low/high)、Claude Code 编程 Agent。
局限: 速率限制分层(RPM/ITPM/OTPM)且提升需要消费历史。没有原生 Batch API——用 Prompt Caching 来降本。Sonnet 5 限时价($2/$10)8 月 31 日后恢复为 $3/$15。
适合选 Anthropic 的场景: 工作负载受益于扩展思考(复杂推理、多步分析)、需要强安全保障、或编程 Agent 在 Claude 基准上表现更好。
来源:Anthropic Claude API Pricing,检索于 2026-07-28;Claude Pricing — cloudzero.com,检索于 2026-07-28。
Google Gemini——多模态与托管 Agent
Google 的 Gemini API 在多模态能力、托管 Agent 编排和 Google Cloud 深度集成方面表现突出。
模型层级(2026 年 7 月):
| 模型 | 输入 | 输出 | 上下文 | 备注 |
|---|---|---|---|---|
| Gemini 3.6 Flash | $1.50 | $7.50 | 1M+ | 最新 Flash,输出价比 3.5 Flash 低 17% |
| Gemini 3.1 Pro Preview | $1.00 | $6.00 | 200K | Preview 定价 |
| Gemini 2.5 Pro | $0.625 | $5.00 | 1M+ | 成熟、高性价比 |
优势: 原生多模态(文本、图像、视频、音频输入)、托管 Agent API 支持后台执行和 MCP、3.5 Flash 的 Computer Use 能力、实验阶段免费额度充足、Vertex AI 企业部署。
局限: 文档和定价页面有重定向问题。托管 Agent 功能相对较新。速率限制按项目而非按模型。
适合选 Google 的场景: 多模态工作负载(视觉、音频、视频)、需要托管 Agent 编排、基础设施已在 Google Cloud 上。
来源:Gemini API Pricing,检索于 2026-07-28;felloai.com Gemini Pricing,检索于 2026-07-28。
DeepSeek——极致低成本推理
DeepSeek 在 2025 年打破了定价底线,并在 2026 年中继续保持这一定位。V4 系列模型以极低的成本提供推理级性能。
模型层级(2026 年 7 月):
| 模型 | 输入(缓存未命中) | 输入(缓存命中) | 输出 | 上下文 | 备注 |
|---|---|---|---|---|---|
| DeepSeek V4-Flash | $0.14 | $0.0028 | $0.28 | 1M | 默认开启思考模式,2,500 并发 |
| DeepSeek V4-Pro | $0.435 | $0.003625 | $0.87 | 1M | 更强能力,500 并发 |
优势: 目前最便宜的推理级 API。缓存命中比未命中便宜 98%。同时支持 OpenAI 和 Anthropic API 格式。思考模式默认开启。FIM 补全支持代码场景。两个模型都有 1M 上下文。
局限: 用并发数而非 RPM/TPM 限速(Flash 2,500、Pro 500)。突发流量下限制可能偏紧。企业控制能力有限(无数据驻留、审计面有限)。高峰期偶有可用性问题。
适合选 DeepSeek 的场景: 成本是第一优先级,工作负载以推理或编程为主,能接受基于并发数的限流。
来源:DeepSeek Models & Pricing,检索于 2026-07-28。
DashScope(百炼)——Qwen 全家桶
阿里云百炼(DashScope)是 Qwen 模型家族的主要 API 平台,同时托管 GLM、Kimi、MiniMax 等第三方模型。它是国内部署的首选。
核心定价(2026 年 7 月,北京区域):
| 模型 | 输入 | 输出 | 上下文 | 备注 |
|---|---|---|---|---|
| Qwen3.7-Max | ¥6/百万(限时折扣,原价 ¥12) | ¥18/百万(限时折扣,原价 ¥36) | 1M | 旗舰,支持思考和非思考模式 |
| Qwen3-Max | ¥2.5/百万(≤32K) | ¥10/百万(≤32K) | 256K | 阶梯计费 |
| Qwen3.7-Flash | ¥0.6/百万 | ¥1.2/百万 | 1M | 高性价比 |
优势: 完整的 Qwen 模型栈(Max、Plus、Turbo、Flash、Coder、VL、Audio)、OpenAI 兼容端点(dashscope.aliyuncs.com/compatible-mode/v1)、上下文越短单价越低的阶梯计费、上下文缓存(显式 + 隐式)、Batch API 半价、多区域部署(北京、新加坡、弗吉尼亚、法兰克福、东京)。
局限: 海外定价是国内的 1.4–1.8 倍。阶梯计费增加了复杂性。速率限制按模型分配且并非全部公开文档。大规模模型下线潮正在汇聚到 2026 年 10 月 10 日——选择模型 ID 前请查看百炼模型生命周期总览。
适合选 DashScope 的场景: 需要国内部署、使用 Qwen 模型家族、或在短上下文工作负载上受益于阶梯计费。
来源:百炼模型定价,检索于 2026-07-28。
SiliconFlow——免费额度与开源模型一站式访问
SiliconFlow 将 200 多个开源和商用模型聚合在一个 OpenAI 兼容 API 背后,并为较小模型提供免费额度。
价格要点(2026 年 7 月):
| 模型 | 输入 | 输出 | 上下文 | 备注 |
|---|---|---|---|---|
| DeepSeek V4-Flash(经 SF) | $0.13 | $0.28 | 1M | 输入比直连稍便宜 |
| DeepSeek V4-Pro(经 SF) | $1.50 | $3.135 | 1M | 比直连有加价 |
| Kimi K3 | $3.00 | $15.00 | 1M | 月之暗面最新推理模型 |
| GLM-5.2 | $1.30 | $4.09 | 1M | 智谱旗舰 |
| Qwen3.6-27B | $0.30 | $3.20 | 262K | 开源 Qwen |
| 多个小模型 | $0.00 | $0.00 | 各异 | 永久免费 |
优势: 免费模型可用于原型开发和轻量使用、多厂商广泛模型目录、注册即送 $1 额度、一个 API Key 覆盖多个模型家族、默认 OpenAI 兼容。
局限: 部分模型比直连服务商有加价。免费层速率限制对生产不够。不是模型厂商——你支付的是推理基础设施费用。服务商专属功能(扩展思考、Prompt Caching)可能无法完全暴露。
适合选 SiliconFlow 的场景: 想用一个 API Key 访问多个开源模型、需要免费额度做原型、或想在不同模型间对比而不必在每家注册账号。
来源:SiliconFlow Pricing,检索于 2026-07-28。
定价决策矩阵
下表将常见工作负载映射到推荐服务商:
| 工作负载 | 预算优先级 | 推荐服务商 | 原因 |
|---|---|---|---|
| 通用对话/助手 | 中等 | OpenAI(GPT-5.6 Luna)或 Anthropic(Haiku 4) | 生态广、成本低 |
| 复杂推理 | 质量优先 | Anthropic(Opus 4.8 扩展思考)或 OpenAI(o3) | 推理基准最好 |
| 成本敏感的推理 | 成本优先 | DeepSeek V4-Flash | $0.14/$0.28,比替代方案便宜 10–35 倍 |
| 国内部署 | 合规优先 | DashScope(Qwen3.7-Max) | 原生国内托管,人民币计费 |
| 多模态(视觉/音频) | 功能优先 | Google Gemini 3.6 Flash | 原生多模态,价格有竞争力 |
| 原型/评估 | 免费或接近免费 | SiliconFlow 免费模型或 DeepSeek V4-Flash | $0 起步 |
| 编程 Agent | 质量 + 成本 | Anthropic(Sonnet 5)或 DeepSeek V4-Pro | SWE-bench 顶级成绩 |
速率限制——隐藏的约束
价格吸引眼球,但速率限制才决定一个服务商能否真正承载你的流量模式。
| 服务商 | 限制模型 | 免费/低层 | 付费/高层 | 备注 |
|---|---|---|---|---|
| OpenAI | RPM + TPM + RPD 分层 | 按模型不同 | Tier 5:最高 10K RPM | Spend Limit 触发的硬 429 和普通 Rate Limit 是两回事 |
| Anthropic | RPM + ITPM + OTPM 分层 | Tier 1:较低 | Tier 4:较高 | 提升需要消费历史 |
| RPM + TPM 按项目 | 免费层充裕 | Vertex AI 扩容 | 按项目而非按模型 | |
| DeepSeek | 并发数 | — | 2,500(Flash)/ 500(Pro) | 无 RPM/TPM,是并发请求上限 |
| DashScope | RPM + TPM 按模型 | 取决于模型 | 付费层更高 | 并非全部公开文档 |
| SiliconFlow | 分层 | 免费:有限 | 付费:更高 | 按模型不同 |
深入了解请参阅我们的 2026 年 AI API 速率限制对比。
OpenAI SDK 兼容性
一个关键的实操问题:能否用 openai Python/Node SDK 通过 base_url 覆盖来调用每个服务商?
| 服务商 | 支持 OpenAI SDK? | base_url | 鉴权 | 注意事项 |
|---|---|---|---|---|
| OpenAI | 原生 | https://api.openai.com/v1 | OPENAI_API_KEY | — |
| Anthropic | 需代理/网关 | 不直接支持——API 格式不同 | ANTHROPIC_API_KEY | 需适配器或网关 |
| 需代理/网关 | 不直接支持——API 格式不同 | Google OAuth / API Key | 需适配器或网关 | |
| DeepSeek | 支持 | https://api.deepseek.com | DEEPSEEK_API_KEY | 另支持 Anthropic 格式 |
| DashScope | 支持 | https://dashscope.aliyuncs.com/compatible-mode/v1 | DASHSCOPE_API_KEY | 部分功能需百炼专有 Header |
| SiliconFlow | 支持 | https://api.siliconflow.cn/v1 | SILICONFLOW_API_KEY | 服务商专属功能可能无法暴露 |
对于已在使用 OpenAI SDK 的团队,DeepSeek、DashScope 和 SiliconFlow 提供最低摩擦的迁移路径。Anthropic 和 Google 需要专用 SDK 或路由网关。
逐步迁移指南请参阅 OpenAI 迁移到 TheRouter 指南。
网关如何改变服务商选择
我们构建 TheRouter 是为了解决一个具体问题:切换服务商不应该要求你重写应用。TheRouter 通过配置的服务商路由 OpenAI 兼容请求,并在产品路径支持的情况下提供服务商/模型路由和回退。
网关带来的:
- 单一端点: 一个
base_url、一个 API Key,背后是多个服务商 - 回退: 如果服务商 A 返回 429 或 5xx,路由到服务商 B——在配置和测试过的回退路径上
- 统一计费: 一张账单代替六个服务商的后台
网关做不到的:
- 保证每个服务商的每个模型都可用(我们不做这个声明)
- 消除服务商自身的速率限制(上游限制仍然存在)
- 让每个服务商的专属功能表现一致(扩展思考、Prompt Caching、托管 Agent 是服务商各自的能力)
网关对比是独立话题——请参阅 2026 年统一 LLM API 网关对比,包含 OpenRouter、LiteLLM、Portkey、Cloudflare AI Gateway 和 TheRouter 的正面对比。
跨供应商比较 API 价格时,统一到美元每百万 token口径,并区分输入与输出。多数供应商的输出 token 价是输入的 2–5 倍,所以"补全长度大" 的负载与"检索为主"的负载在同样的标称单价下成本会差很多。
- 统一货币(USD)——发表日按汇率折算并标注。
- 区分输入/输出——永远不要给单一"混合价"。
- 每行引到供应商自己的价格页 + 抓取日期。
- 注明长上下文阶梯价——长上下文常常单独跳一档。
未涵盖的服务商
本对比聚焦于与 TheRouter 用户最相关的六家服务商。值得一提但未展开的:
- xAI(Grok): 详见我们的 Grok 4.5 API 集成指南。推理能力强,定价偏高(Grok 4.3 为 $5/$15)。
- Mistral: 在欧洲部署上有竞争力,但对我们关注国内场景的用户相关性较低。
- 火山引擎(Ark): 详见 火山引擎 Ark 与百炼对比。字节跳动的平台,提供豆包/Seed 系列模型。
- Meta(Llama): 开源模型通过 SiliconFlow、Fireworks 等推理服务商提供,而非 Meta 自有 API。
常见问题
问:哪家服务商总体最便宜? DeepSeek V4-Flash,每百万 Token 仅 $0.14/$0.28。输入价格比 GPT-5.6 Luna 便宜 7 倍,比 GPT-5.6 Sol 便宜 35 倍。对于非推理工作负载,SiliconFlow 的永久免费模型零成本。
问:可以同时使用多个服务商吗? 可以。多数生产团队使用 2–3 家服务商。像 TheRouter 这样的网关通过提供单一端点加路由和回退来简化多服务商使用——前提是这些路由路径已为你需要的具体模型配置和测试过。
问:哪家速率限制最宽松? DeepSeek 的并发模型(V4-Flash 2,500 并发请求)对高吞吐批量场景非常友好。OpenAI 和 Anthropic 按 RPM/TPM 限制并需要通过消费历史升级层级。Google 的按项目限制对实验比较宽裕。
问:数据驻留和合规性如何? OpenAI 提供 10 个区域的数据驻留。DashScope 是唯一原生提供国内部署的服务商。Anthropic 和 Google 提供特定合规承诺的企业协议。DeepSeek 和 SiliconFlow 的合规面相对有限。
问:Prompt Caching 折扣怎么比? OpenAI:缓存命中输入打一折。Anthropic:打一折。DeepSeek:打 2%(V4-Flash 缓存命中 $0.0028/M)。DashScope:显式缓存打一折,隐式缓存也可用。SiliconFlow:取决于模型。