2026 下半年中国 LLM API 服务商对比:DashScope、DeepSeek、Kimi、智谱、火山方舟与 SiliconFlow
2026 下半年六大中国 LLM API 服务商实操对比:DashScope(百炼)、DeepSeek、Moonshot(Kimi)、智谱(Z.ai)、火山方舟(Volcengine Ark)、SiliconFlow。覆盖旗舰模型、调价后最新定价、OpenAI SDK 兼容性、速率限制、模型生命周期风险,以及各家适用场景。
最快的结论。想用通义千问全家桶加第三方托管、同时满足中国区合规,选 DashScope;追求推理类任务性价比、8 月 16 日调价后仍然最便宜,选 DeepSeek;需要 1M 上下文的长链路编程 Agent 且预算充足,选 Kimi K3;想要开源自部署 743B 大模型,选智谱 GLM-5.3;已在字节生态内,选火山方舟 Seed 2.1;预算有限、想一把钥匙试多家开源模型,选 SiliconFlow。 下半年每一家都做了动作,这篇文章整理截至今天的全景。
OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。
跨供应商比较 API 价格时,统一到美元每百万 token口径,并区分输入与输出。多数供应商的输出 token 价是输入的 2–5 倍,所以"补全长度大" 的负载与"检索为主"的负载在同样的标称单价下成本会差很多。
- 统一货币(USD)——发表日按汇率折算并标注。
- 区分输入/输出——永远不要给单一"混合价"。
- 每行引到供应商自己的价格页 + 抓取日期。
- 注明长上下文阶梯价——长上下文常常单独跳一档。
数据来源. DashScope 模型价格,2026-08-24 获取;DeepSeek Models & Pricing,2026-08-24 获取;Kimi K3 Pricing,2026-08-24 获取;SiliconFlow Pricing,2026-08-24 获取;GLM-5.3 规格,2026-08-24 获取;火山方舟模型价格,2026-08-24 获取。
为什么要写一篇下半年的新对比
上半年的 LLM 服务商对比写于 7 月底。此后每一家中国服务商都做了改变游戏规则的事情。
- DashScope 上线了 Qwen3.8-Max(每百万 token 输入 ¥12、输出 ¥36),把第三方模型托管扩展到了 DeepSeek、Kimi K3 和 GLM,同时公告了 10 月 10 日下线潮,一次性退役 30 多个旧模型 ID。
- DeepSeek 在 8 月 13 日发布 V4-Pro GA,并在 8 月 16 日引入峰时/谷时计费,这在中国 LLM 服务商里是第一次。
- Moonshot 推出 Kimi K3,定价 $3/$15 每百万 token,配备 1M 上下文,定位为高端编程与推理旗舰。
- 智谱 在 8 月 14 日发布了 743B 参数的 GLM-5.3 开源模型,继续走开放权重路线,同时保留 Z.ai 订阅制。
- 火山方舟 发布了豆包 Seed 2.1 的 Pro 和 Turbo 两档,以及持续迭代的 Seed-Evolving 模型。
- SiliconFlow 成为开源模型的首选聚合平台,DeepSeek V4-Flash 的托管价格只要 $0.13/$0.28 每百万 token。
今天选中国 LLM API 服务商,这篇文章就是决策依据。
速览对比表
| 服务商 | 端点 | OpenAI SDK 兼容 | 旗舰模型 | 输入/输出(每百万 token) | 上下文 | 生命周期风险 |
|---|---|---|---|---|---|---|
| DashScope(百炼) | dashscope.aliyuncs.com | 是(兼容模式) | qwen3.8-max | ¥12 / ¥36 | 1M | 中等(10 月 10 日下线潮) |
| DeepSeek | api.deepseek.com | 是 | deepseek-v4-pro | $0.66 / $1.98(谷时) | 1M | 低 |
| Moonshot(Kimi) | api.moonshot.cn | 是 | kimi-k3 | $3.00 / $15.00 | 1M | 低 |
| 智谱(Z.ai) | open.bigmodel.cn | 部分 | GLM-5.3 | 待公布(5.2: $1.40 / $4.40) | 1M | 低 |
| 火山方舟 | ark.cn-beijing.volces.com | 是(兼容模式) | doubao-seed-2.1-pro | ¥6 / ¥30 | 256K | 低 |
| SiliconFlow | api.siliconflow.cn | 是 | 聚合(V4-Flash、K3、GLM-5.2) | 因模型而异(V4-Flash: $0.13 / $0.28) | 因模型而异 | 低 |
所有价格于 2026-08-24 获取。DeepSeek 有峰时/谷时价格差。DashScope 价格为北京区域人民币报价。SiliconFlow 为美元报价。
DashScope(百炼):千问全家桶加第三方模型托管
DashScope 是阿里云的模型推理平台,既是通义千问系列的主要阵地,也悄悄变成了中国 LLM 聚合商,一个 API Key 就能调 DeepSeek、Kimi K3 和 GLM。
旗舰模型,2026 年 8 月
- qwen3.8-max 输入 ¥12 / 输出 ¥36 每百万 token,1M 上下文,支持思考与非思考模式,Batch 调用半价,上下文缓存另计
- qwen3.7-max 同价位,目前限时五折(实际 ¥6/¥18)
- qwen3.7-plus 输入 ¥2 / 输出 ¥8(256K 上下文),限时八折
下半年的变化
- Qwen3.8-Max 上线,与 3.7-Max 同价,增加了多模态和更长上下文
- 第三方模型托管范围扩大,DeepSeek V4-Flash/Pro、Kimi K3、GLM 都能通过同一个 DashScope 端点调用
- 10 月 10 日下线潮将退役 30 多个旧模型 ID,包括 qwen-turbo、qwen-vl-plus、qwen-audio-turbo 和早期 Qwen3 快照
OpenAI SDK 兼容性 完全支持 base_url + api_key 替换。兼容端点为 dashscope.aliyuncs.com/compatible-mode/v1。速率限制按账号等级分层,未按模型公开文档化。
适合谁 想要千问全家桶加第三方模型、一张发票结算、中国区合规部署(北京/上海/深圳),以及最大的免费试用额度(每模型 100 万 token,90 天有效期)。
需要留意 10 月 10 日下线潮需要提前迁移。如果你用了任何 qwen-turbo、qwen-vl、qwen-audio 的模型 ID,现在就该看我们的10 月 DashScope 下线迁移指南。
数据来源. DashScope 模型价格,2026-08-24 获取;DashScope 模型下线,2026-08-24 获取。
DeepSeek:推理性价比之王,峰谷计费
DeepSeek 在推理类任务上仍然是成本最低的选择。V4 代产品分两档发布,并且在中国 LLM 服务商中首创了峰时/谷时定价。
旗舰模型,2026 年 8 月
- deepseek-v4-pro 谷时 $0.66 输入 / $1.98 输出每百万 token,峰时翻倍。缓存命中 $0.022(谷时)。1M 上下文,384K 最大输出。支持 Responses API 和 Anthropic API。
- deepseek-v4-flash 谷时 $0.22 输入 / $0.66 输出每百万 token。并发上限 2,500(Pro 为 500)。
下半年的变化
- V4-Pro 在 8 月 13 日正式 GA,取代 V3.2 成为推荐旗舰
- 8 月 16 日调价引入峰谷计费。峰时为 UTC 01:00-04:00 和 06:00-10:00(周一至周五),其余时段为谷时,峰时价格翻倍
- Responses API 随 V4-Pro GA 一起发布,与 OpenAI 的后 Assistants API 接口对齐
- V4-Pro 缓存命中降至谷时 $0.022 每百万 token
OpenAI SDK 兼容性 完全直接替换。DeepSeek 同时提供 Anthropic 格式端点 api.deepseek.com/anthropic。
适合谁 大量推理和编程任务、对成本敏感的团队。谷时 V4-Flash $0.22/$0.66 的性价比很难被超越。能把批量任务排到谷时段的团队省一半钱。
需要留意 峰时价格翻倍。如果你的流量集中在 UTC 01:00-04:00 和 06:00-10:00(对应北京时间 09:00-12:00 和 14:00-18:00),账单会明显上涨。V4-Pro 500 并发上限对高吞吐管线来说偏紧。
数据来源. DeepSeek Models & Pricing,2026-08-24 获取。
Moonshot(Kimi):1M 上下文的高端推理
Moonshot 的 Kimi K3 是这份榜单上最贵的模型,定位为高端编程与推理 Agent。
旗舰模型,2026 年 8 月
- kimi-k3 $3.00 输入 / $15.00 输出每百万 token。缓存命中 $0.30。1M 上下文。始终启用推理,可配置推理力度(low/high/max)。支持 tool calling、JSON mode 和 structured output。
下半年的变化
- Kimi K3 发布,在长链路编程(SWE-bench Verified、Codeforces)和 1M 上下文 Agent 任务上跑出了行业领先的基准分
- K3 上架了 DashScope 和 SiliconFlow 第三方托管
- 新增推理力度配置(
low/high/max),允许在轻量任务上用质量换成本
OpenAI SDK 兼容性 完全支持 base_url 替换,端点为 api.moonshot.cn/v1。支持 tool_choice 约束和动态加载工具(K3 专属功能)。
适合谁 长上下文编程 Agent、复杂多步推理任务,以及一次模型调用能替代多次廉价调用的场景。$15 每百万 token 的输出价格意味着只有任务复杂度足够高时才划算。
需要留意 K3 输出价格是 DeepSeek V4-Pro 谷时的 7.5 倍,是 DashScope Qwen3.8-Max 的约 2.5 倍(按汇率折算)。日常补全任务用更便宜的模型就够了。
数据来源. Kimi K3 Pricing,2026-08-24 获取;Kimi K3 Quickstart,2026-08-24 获取。
智谱(Z.ai):开源 GLM 加编程订阅
智谱走的是双轨路线。一边是开源模型(HuggingFace、SiliconFlow、DashScope 可用),另一边是 Z.ai 的付费 API 和编程订阅。
旗舰模型,2026 年 8 月
- GLM-5.3 743B 参数模型,8 月 14 日发布,HuggingFace 开源。BigModel/Z.ai API 定价截至本文撰写时尚未公布。GLM-5.2 可作为定价参考,Z.ai API $1.40 输入 / $4.40 输出每百万 token,SiliconFlow $1.30 / $4.09。
- GLM-5.2 $1.40 输入 / $4.40 输出每百万 token(Z.ai)。1M 上下文。缓存命中 $0.26。SiliconFlow 和 DashScope 也有托管。
下半年的变化
- GLM-5.3 以 743B 开源模型形式发布,长链路编程基准提升
- Z.ai 编程订阅重新定价为 $18/$72/$160 每月三档
- GLM-5.3 API 定价在 BigModel 尚未公布,SiliconFlow 和 DashScope 的托管预计后续跟进
OpenAI SDK 兼容性 部分兼容。Z.ai 的 API 端点 open.bigmodel.cn/api/paas/v4 接受 OpenAI 格式的 chat completion 请求,但部分功能(网页搜索、知识检索)使用智谱专有参数。
适合谁 想要开源模型自部署(在自己的 GPU 上跑 GLM-5.3)或者用 Z.ai 编程订阅来辅助开发的团队。开源路线意味着可以零 token 费用运行。
需要留意 GLM-5.3 的 API 定价还没公布。BigModel 的定价页面是客户端渲染的,程序化抓取困难。SiliconFlow 上 GLM-5.2 的价格($1.30/$4.09)比直接走 Z.ai 略低。
数据来源. GLM-5.3 规格,2026-08-24 获取;GLM 定价,2026-08-24 获取;SiliconFlow Pricing,2026-08-24 获取。
火山方舟:字节生态和豆包 Seed 2.1
火山方舟是字节跳动的模型推理平台,是豆包(Seed)系列的大本营,同时也在扩充第三方模型目录。
旗舰模型,2026 年 8 月
- doubao-seed-2.1-pro 输入 ¥6 / 输出 ¥30 每百万 token。旗舰推理模型。
- doubao-seed-2.1-turbo 输入 ¥3 / 输出 ¥15 每百万 token。更低延迟,更低成本。
- doubao-seed-evolving 输入 ¥6 / 输出 ¥30 每百万 token。持续迭代模型,主打幻觉降低。
下半年的变化
- Seed 2.1 发布 Pro 和 Turbo 两档,取代 Seed 2.0 成为推荐旗舰
- Seed-Evolving 作为持续更新模型发布,滚动接收改进而不换版本号
- 第三方模型托管扩展(DeepSeek、千问模型可通过方舟调用)
OpenAI SDK 兼容性 支持,端点为 ark.cn-beijing.volces.com/api/v3,接受 OpenAI 格式请求。需要火山引擎账号并在控制台创建端点。
适合谁 已在字节跳动基础设施(抖音、飞书、火山引擎云)上运行的团队。Seed-Evolving 对于想要持续改进而不手动切版本的生产场景很有意思。
需要留意 火山引擎文档部分是客户端渲染的,自动化发现比较困难。定价按模型分开,没有统一的平台级公开价格表。区域可用性主要是中国大陆。
数据来源. 火山方舟模型价格,2026-08-24 获取;Huoshan Token API Pricing,2026-08-24 获取。
SiliconFlow:开源模型聚合器加免费额度
SiliconFlow 把开源和第三方模型聚合到一个 OpenAI 兼容端点上。它本身不做模型开发,靠价格和广度取胜。
主要模型和定价,2026 年 8 月
| 模型 | 输入/输出(每百万 token) | 上下文 |
|---|---|---|
| DeepSeek V4-Flash | $0.13 / $0.28 | 1M |
| DeepSeek V4-Pro | $1.50 / $3.14 | 1M |
| Kimi K3 | $3.00 / $15.00 | 1M |
| GLM-5.2 | $1.30 / $4.09 | 1M |
| Kimi K2.5 | $0.45 / $2.25 | 262K |
| Qwen3.6-27B | $0.30 / $3.20 | 262K |
下半年的变化
- 上架了 Kimi K3 和 DeepSeek V4-Pro/Flash
- 注册送 $1 免费额度,部分开源模型(如 Qwen3.5-9B)几乎零成本
- 社区定价往往比直接调服务商 API 便宜 5-15%
OpenAI SDK 兼容性 完全直接替换,端点为 api.siliconflow.cn/v1。标准 API Key 认证。
适合谁 预算有限、想一个 API Key 试多家中国模型的团队。免费额度和低门槛让 SiliconFlow 非常适合原型验证和模型评估。也可以作为路由场景中的备用目标。
需要留意 SiliconFlow 是转售商,模型可用性取决于上游合作。模型可用性取决于上游合作。免费层的每模型 RPM 限制比较严格。SLA 保障不如第一方服务商。
数据来源. SiliconFlow Pricing,2026-08-24 获取。
决策矩阵:按场景选服务商
| 场景 | 推荐服务商 | 理由 |
|---|---|---|
| 大量推理(控成本) | DeepSeek V4-Flash(谷时) | $0.22/$0.66 每百万 token,把批量任务排到谷时 |
| 高端编程 Agent | Kimi K3 或 DeepSeek V4-Pro | K3 追求极致质量,V4-Pro 输出成本低 3 倍 |
| 中国区合规 + 千问生态 | DashScope | 北京/上海部署,模型目录最全 |
| 开源自部署 | 智谱 GLM-5.3 | 743B 开放权重,在自己的 GPU 上跑 |
| 字节生态 | 火山方舟 | Seed 2.1 + 飞书/抖音集成路径 |
| 原型验证 + 模型评估 | SiliconFlow | 免费额度,一把钥匙多家模型 |
| 多模型容灾 | TheRouter + 任意组合 | 通过模型容灾在多家服务商间调度 |
TheRouter 路由说明
TheRouter 将 OpenAI 兼容的请求路由到已配置的服务商,前提是相应的产品路径已在线支持。对于中国服务商,这意味着你可以把 DashScope、DeepSeek、Moonshot 或 SiliconFlow 配置为路由目标,并利用模型容灾根据可用性、延迟或成本在它们之间切换流量。火山方舟和智谱 BigModel 通过各自的 OpenAI 兼容端点接入。
我们不会声称上面列出的所有模型始终可以通过 TheRouter 访问。请查看线上模型页面和服务商页面了解当前路由支持情况。
常见问题
推理任务哪家最便宜?
DeepSeek V4-Flash 谷时价格 $0.22/$0.66 每百万 token,截至 2026 年 8 月是最低的。DashScope 的 Qwen3.7-Max 限时五折后(¥6/¥18)也很有竞争力,但折扣结束时间未公布。
能不能用一个 API Key 调多家中国模型?
DashScope 和 SiliconFlow 都支持单 Key 多模型。DashScope 托管了千问 + DeepSeek + Kimi + GLM。SiliconFlow 托管了开源和部分闭源模型。火山方舟也有第三方模型,但需要按模型在控制台创建端点。
10 月 10 日会发生什么?
DashScope 退役 30 多个旧模型 ID,包括 qwen-turbo、qwen-vl-plus、qwen-audio-turbo 和早期快照。API 调用已退役 ID 将返回错误。详情见我们的迁移指南。
DeepSeek 峰时真的贵一倍吗?
是的。峰时段(UTC 01:00-04:00 和 06:00-10:00,工作日)所有 V4 模型价格翻倍。对于亚洲团队,这正好覆盖上午的办公时间段(北京时间 09:00-12:00 和 14:00-18:00)。调度策略见我们的 DeepSeek 调价指南。
本对比反映 2026 年 8 月 24 日的定价与模型可用性。价格随时可能变化,做采购决策前请核对上方链接的官方定价页面。
相关文章
- 2026 LLM API 服务商对比(上半年)
- 火山方舟 vs DashScope 对比
- SiliconFlow vs DashScope 对比
- DashScope Qwen3.7 系列完整指南
- DeepSeek V4-Pro GA 定价指南
- Kimi K3 API 集成指南
- 智谱 GLM API 完整指南