全部文章

2026 年主流 LLM API 服务商对比:OpenAI、Anthropic、Google、DeepSeek、DashScope 与 SiliconFlow

2026 年六大主流 LLM API 服务商实用对比:OpenAI、Anthropic、Google Gemini、DeepSeek、DashScope(百炼)和 SiliconFlow。我们从旗舰模型、定价、速率限制、OpenAI SDK 兼容性、区域部署等维度展开分析。

· updated 2026-07-28· TheRouter

最快的答案:需要最广泛的生态和工具集成选 OpenAI,需要长上下文推理或扩展思考选 Anthropic,需要多模态和托管 Agent 选 Google Gemini,需要极致性价比的推理能力选 DeepSeek,需要国内部署和 Qwen 全家桶选 DashScope(百炼),需要免费额度和开源模型一站式访问选 SiliconFlow。 2026 年的难点不是找到一个服务商,而是搞清楚你选的服务商在速率限制、价格阶梯和故障模式上到底怎么运作。

OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completionsmessagesmodel, 并返回 OpenAI 形式的流式响应。

数据来源:OpenAI API Pricing,检索于 2026-07-28;Anthropic Claude Pricing,检索于 2026-07-28;Google Gemini API Pricing,检索于 2026-07-28;DeepSeek Models & Pricing,检索于 2026-07-28;百炼模型定价,检索于 2026-07-28;SiliconFlow Pricing,检索于 2026-07-28。

一览表——服务商对比

服务商旗舰模型输入 / 输出(每百万 Token)上下文窗口兼容 OpenAI SDK速率限制方式适合场景
OpenAIGPT-5.6 Sol$5.00 / $30.00272K+(支持长上下文)原生RPM/TPM/RPD 分层生态最广,工具调用,编程 Agent
AnthropicClaude Opus 4.8$5.00 / $25.00200K–1M通过 base_urlRPM/ITPM/OTPM 分层扩展思考、长上下文、安全优先
GoogleGemini 3.6 Flash$1.50 / $7.501M+通过 base_urlRPM/TPM 按项目多模态、托管 Agent、Google Cloud
DeepSeekV4-Flash$0.14 / $0.281M原生(另支持 Anthropic 格式)并发数限制(2,500)极致低成本推理和编程
DashScopeQwen3.7-Max¥6 / ¥18(限时折扣)1MOpenAI 兼容端点RPM/TPM 按模型国内部署、Qwen 全家桶、阶梯计费
SiliconFlow多厂商(200+ 模型)从 $0.00 到 $15.00 不等取决于模型原生分层速率限制免费额度、开源模型、按量付费

提示: 价格截至 2026 年 7 月。促销价可能调整。DashScope 标价为人民币,其他为美元。正式采用前请核实服务商官方定价页面。

OpenAI——生态系统的默认选择

OpenAI 仍然是需要最广泛模型目录、最深工具集成和最多第三方 SDK 支持的团队的首选。

模型层级(2026 年 7 月):

模型输入输出上下文备注
GPT-5.6 Sol$5.00$30.00272K+旗舰,支持长上下文
GPT-5.6 Terra$2.50$15.00272K+中端
GPT-5.6 Luna$1.00$6.00272K+高性价比
GPT-5.4-mini$0.75$4.50标准快速、实惠
GPT-5.4-nano$0.20$1.25标准超低价
o3$2.00$8.00标准推理模型
o4-mini$1.10$4.40标准轻量推理

优势: 原生 Prompt Caching(缓存命中输入打一折)、Batch API(半价)、Responses API 内置工具调用、Codex 编程 Agent、10 个区域数据驻留。

局限: 速率限制按层分级,触顶前不易感知。Spend Limit(硬性 429 错误)和普通 Rate Limit 是两套机制。最新模型(GPT-5.6)定价偏高——Luna($1/$6)是多数生产负载的甜点。

适合选 OpenAI 的场景: 需要最广泛的工具生态、团队已经在用 OpenAI SDK、或者需要特定区域的数据驻留。

来源:OpenAI API Pricing,检索于 2026-07-28。

Anthropic——扩展思考与安全

Anthropic 的 Claude API 占据了独特定位:同级别最好的扩展思考能力、出色的编程基准测试成绩和企业级安全控制。

模型层级(2026 年 7 月):

模型输入输出上下文备注
Claude Opus 4.8$5.00$25.00200K(扩展思考可达 1M)前沿推理
Claude Sonnet 5$2.00$10.00200K限时价至 2026 年 8 月底(常规价 $3/$15)
Claude Haiku 4$1.00$5.00200K快速、低成本

优势: 扩展思考模式(基于预算,最多 128K 思考 Token)、Prompt Caching(缓存命中打一折)、Effort 控制(auto/low/high)、Claude Code 编程 Agent。

局限: 速率限制分层(RPM/ITPM/OTPM)且提升需要消费历史。没有原生 Batch API——用 Prompt Caching 来降本。Sonnet 5 限时价($2/$10)8 月 31 日后恢复为 $3/$15。

适合选 Anthropic 的场景: 工作负载受益于扩展思考(复杂推理、多步分析)、需要强安全保障、或编程 Agent 在 Claude 基准上表现更好。

来源:Anthropic Claude API Pricing,检索于 2026-07-28;Claude Pricing — cloudzero.com,检索于 2026-07-28。

Google Gemini——多模态与托管 Agent

Google 的 Gemini API 在多模态能力、托管 Agent 编排和 Google Cloud 深度集成方面表现突出。

模型层级(2026 年 7 月):

模型输入输出上下文备注
Gemini 3.6 Flash$1.50$7.501M+最新 Flash,输出价比 3.5 Flash 低 17%
Gemini 3.1 Pro Preview$1.00$6.00200KPreview 定价
Gemini 2.5 Pro$0.625$5.001M+成熟、高性价比

优势: 原生多模态(文本、图像、视频、音频输入)、托管 Agent API 支持后台执行和 MCP、3.5 Flash 的 Computer Use 能力、实验阶段免费额度充足、Vertex AI 企业部署。

局限: 文档和定价页面有重定向问题。托管 Agent 功能相对较新。速率限制按项目而非按模型。

适合选 Google 的场景: 多模态工作负载(视觉、音频、视频)、需要托管 Agent 编排、基础设施已在 Google Cloud 上。

来源:Gemini API Pricing,检索于 2026-07-28;felloai.com Gemini Pricing,检索于 2026-07-28。

DeepSeek——极致低成本推理

DeepSeek 在 2025 年打破了定价底线,并在 2026 年中继续保持这一定位。V4 系列模型以极低的成本提供推理级性能。

模型层级(2026 年 7 月):

模型输入(缓存未命中)输入(缓存命中)输出上下文备注
DeepSeek V4-Flash$0.14$0.0028$0.281M默认开启思考模式,2,500 并发
DeepSeek V4-Pro$0.435$0.003625$0.871M更强能力,500 并发

优势: 目前最便宜的推理级 API。缓存命中比未命中便宜 98%。同时支持 OpenAI 和 Anthropic API 格式。思考模式默认开启。FIM 补全支持代码场景。两个模型都有 1M 上下文。

局限: 用并发数而非 RPM/TPM 限速(Flash 2,500、Pro 500)。突发流量下限制可能偏紧。企业控制能力有限(无数据驻留、审计面有限)。高峰期偶有可用性问题。

适合选 DeepSeek 的场景: 成本是第一优先级,工作负载以推理或编程为主,能接受基于并发数的限流。

来源:DeepSeek Models & Pricing,检索于 2026-07-28。

DashScope(百炼)——Qwen 全家桶

阿里云百炼(DashScope)是 Qwen 模型家族的主要 API 平台,同时托管 GLM、Kimi、MiniMax 等第三方模型。它是国内部署的首选。

核心定价(2026 年 7 月,北京区域):

模型输入输出上下文备注
Qwen3.7-Max¥6/百万(限时折扣,原价 ¥12)¥18/百万(限时折扣,原价 ¥36)1M旗舰,支持思考和非思考模式
Qwen3-Max¥2.5/百万(≤32K)¥10/百万(≤32K)256K阶梯计费
Qwen3.7-Flash¥0.6/百万¥1.2/百万1M高性价比

优势: 完整的 Qwen 模型栈(Max、Plus、Turbo、Flash、Coder、VL、Audio)、OpenAI 兼容端点(dashscope.aliyuncs.com/compatible-mode/v1)、上下文越短单价越低的阶梯计费、上下文缓存(显式 + 隐式)、Batch API 半价、多区域部署(北京、新加坡、弗吉尼亚、法兰克福、东京)。

局限: 海外定价是国内的 1.4–1.8 倍。阶梯计费增加了复杂性。速率限制按模型分配且并非全部公开文档。大规模模型下线潮正在汇聚到 2026 年 10 月 10 日——选择模型 ID 前请查看百炼模型生命周期总览

适合选 DashScope 的场景: 需要国内部署、使用 Qwen 模型家族、或在短上下文工作负载上受益于阶梯计费。

来源:百炼模型定价,检索于 2026-07-28。

SiliconFlow——免费额度与开源模型一站式访问

SiliconFlow 将 200 多个开源和商用模型聚合在一个 OpenAI 兼容 API 背后,并为较小模型提供免费额度。

价格要点(2026 年 7 月):

模型输入输出上下文备注
DeepSeek V4-Flash(经 SF)$0.13$0.281M输入比直连稍便宜
DeepSeek V4-Pro(经 SF)$1.50$3.1351M比直连有加价
Kimi K3$3.00$15.001M月之暗面最新推理模型
GLM-5.2$1.30$4.091M智谱旗舰
Qwen3.6-27B$0.30$3.20262K开源 Qwen
多个小模型$0.00$0.00各异永久免费

优势: 免费模型可用于原型开发和轻量使用、多厂商广泛模型目录、注册即送 $1 额度、一个 API Key 覆盖多个模型家族、默认 OpenAI 兼容。

局限: 部分模型比直连服务商有加价。免费层速率限制对生产不够。不是模型厂商——你支付的是推理基础设施费用。服务商专属功能(扩展思考、Prompt Caching)可能无法完全暴露。

适合选 SiliconFlow 的场景: 想用一个 API Key 访问多个开源模型、需要免费额度做原型、或想在不同模型间对比而不必在每家注册账号。

来源:SiliconFlow Pricing,检索于 2026-07-28。

定价决策矩阵

下表将常见工作负载映射到推荐服务商:

工作负载预算优先级推荐服务商原因
通用对话/助手中等OpenAI(GPT-5.6 Luna)或 Anthropic(Haiku 4)生态广、成本低
复杂推理质量优先Anthropic(Opus 4.8 扩展思考)或 OpenAI(o3)推理基准最好
成本敏感的推理成本优先DeepSeek V4-Flash$0.14/$0.28,比替代方案便宜 10–35 倍
国内部署合规优先DashScope(Qwen3.7-Max)原生国内托管,人民币计费
多模态(视觉/音频)功能优先Google Gemini 3.6 Flash原生多模态,价格有竞争力
原型/评估免费或接近免费SiliconFlow 免费模型或 DeepSeek V4-Flash$0 起步
编程 Agent质量 + 成本Anthropic(Sonnet 5)或 DeepSeek V4-ProSWE-bench 顶级成绩

速率限制——隐藏的约束

价格吸引眼球,但速率限制才决定一个服务商能否真正承载你的流量模式。

服务商限制模型免费/低层付费/高层备注
OpenAIRPM + TPM + RPD 分层按模型不同Tier 5:最高 10K RPMSpend Limit 触发的硬 429 和普通 Rate Limit 是两回事
AnthropicRPM + ITPM + OTPM 分层Tier 1:较低Tier 4:较高提升需要消费历史
GoogleRPM + TPM 按项目免费层充裕Vertex AI 扩容按项目而非按模型
DeepSeek并发数2,500(Flash)/ 500(Pro)无 RPM/TPM,是并发请求上限
DashScopeRPM + TPM 按模型取决于模型付费层更高并非全部公开文档
SiliconFlow分层免费:有限付费:更高按模型不同

深入了解请参阅我们的 2026 年 AI API 速率限制对比

OpenAI SDK 兼容性

一个关键的实操问题:能否用 openai Python/Node SDK 通过 base_url 覆盖来调用每个服务商?

服务商支持 OpenAI SDK?base_url鉴权注意事项
OpenAI原生https://api.openai.com/v1OPENAI_API_KEY
Anthropic需代理/网关不直接支持——API 格式不同ANTHROPIC_API_KEY需适配器或网关
Google需代理/网关不直接支持——API 格式不同Google OAuth / API Key需适配器或网关
DeepSeek支持https://api.deepseek.comDEEPSEEK_API_KEY另支持 Anthropic 格式
DashScope支持https://dashscope.aliyuncs.com/compatible-mode/v1DASHSCOPE_API_KEY部分功能需百炼专有 Header
SiliconFlow支持https://api.siliconflow.cn/v1SILICONFLOW_API_KEY服务商专属功能可能无法暴露

对于已在使用 OpenAI SDK 的团队,DeepSeek、DashScope 和 SiliconFlow 提供最低摩擦的迁移路径。Anthropic 和 Google 需要专用 SDK 或路由网关。

逐步迁移指南请参阅 OpenAI 迁移到 TheRouter 指南

网关如何改变服务商选择

我们构建 TheRouter 是为了解决一个具体问题:切换服务商不应该要求你重写应用。TheRouter 通过配置的服务商路由 OpenAI 兼容请求,并在产品路径支持的情况下提供服务商/模型路由和回退。

网关带来的:

  • 单一端点: 一个 base_url、一个 API Key,背后是多个服务商
  • 回退: 如果服务商 A 返回 429 或 5xx,路由到服务商 B——在配置和测试过的回退路径上
  • 统一计费: 一张账单代替六个服务商的后台

网关做不到的:

  • 保证每个服务商的每个模型都可用(我们不做这个声明)
  • 消除服务商自身的速率限制(上游限制仍然存在)
  • 让每个服务商的专属功能表现一致(扩展思考、Prompt Caching、托管 Agent 是服务商各自的能力)

网关对比是独立话题——请参阅 2026 年统一 LLM API 网关对比,包含 OpenRouter、LiteLLM、Portkey、Cloudflare AI Gateway 和 TheRouter 的正面对比。

跨供应商比较 API 价格时,统一到美元每百万 token口径,并区分输入输出。多数供应商的输出 token 价是输入的 2–5 倍,所以"补全长度大" 的负载与"检索为主"的负载在同样的标称单价下成本会差很多。

  • 统一货币(USD)——发表日按汇率折算并标注。
  • 区分输入/输出——永远不要给单一"混合价"。
  • 每行引到供应商自己的价格页 + 抓取日期。
  • 注明长上下文阶梯价——长上下文常常单独跳一档。

未涵盖的服务商

本对比聚焦于与 TheRouter 用户最相关的六家服务商。值得一提但未展开的:

  • xAI(Grok): 详见我们的 Grok 4.5 API 集成指南。推理能力强,定价偏高(Grok 4.3 为 $5/$15)。
  • Mistral: 在欧洲部署上有竞争力,但对我们关注国内场景的用户相关性较低。
  • 火山引擎(Ark): 详见 火山引擎 Ark 与百炼对比。字节跳动的平台,提供豆包/Seed 系列模型。
  • Meta(Llama): 开源模型通过 SiliconFlow、Fireworks 等推理服务商提供,而非 Meta 自有 API。

常见问题

问:哪家服务商总体最便宜? DeepSeek V4-Flash,每百万 Token 仅 $0.14/$0.28。输入价格比 GPT-5.6 Luna 便宜 7 倍,比 GPT-5.6 Sol 便宜 35 倍。对于非推理工作负载,SiliconFlow 的永久免费模型零成本。

问:可以同时使用多个服务商吗? 可以。多数生产团队使用 2–3 家服务商。像 TheRouter 这样的网关通过提供单一端点加路由和回退来简化多服务商使用——前提是这些路由路径已为你需要的具体模型配置和测试过。

问:哪家速率限制最宽松? DeepSeek 的并发模型(V4-Flash 2,500 并发请求)对高吞吐批量场景非常友好。OpenAI 和 Anthropic 按 RPM/TPM 限制并需要通过消费历史升级层级。Google 的按项目限制对实验比较宽裕。

问:数据驻留和合规性如何? OpenAI 提供 10 个区域的数据驻留。DashScope 是唯一原生提供国内部署的服务商。Anthropic 和 Google 提供特定合规承诺的企业协议。DeepSeek 和 SiliconFlow 的合规面相对有限。

问:Prompt Caching 折扣怎么比? OpenAI:缓存命中输入打一折。Anthropic:打一折。DeepSeek:打 2%(V4-Flash 缓存命中 $0.0028/M)。DashScope:显式缓存打一折,隐式缓存也可用。SiliconFlow:取决于模型。

客服支持