← 全部文章

Qwen3.8-Max vs DeepSeek V4 Pro:中国旗舰大模型 API 对比与路由选型

Qwen3.8-Max 和 DeepSeek V4 Pro 是 2026 年 8 月两个最强的中国旗舰大模型 API。本文从架构、定价、上下文窗口、多模态能力、推理模式等维度逐项对比,帮助路由运营者做出选型决策。

· updated 2026-08-11· TheRouter

2026 年 8 月,中国大模型 API 的第一梯队里站着两个名字。阿里的 Qwen3.8-Max 和 DeepSeek 的 V4 Pro,都是万亿参数级 MoE 模型,都有百万 token 上下文,都兼容 OpenAI SDK,都可以通过百炼(DashScope)调用。如果你只用一个,问题是选哪个。如果你想两个都用,问题是怎么路由。

我们在自己的路由层跑过这两个模型的实际请求,整理了官方规格和定价,写出这篇对比,给需要做选型的运营者参考。

OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。

总览对比

维度Qwen3.8-MaxDeepSeek V4 Pro
参数量约 2.4T(MoE,具体配置未公开)约 1.6T 总参数 / 49B 激活(MoE)
上下文窗口100 万 token100 万 token
最大输出16K token(默认)384K token
多模态文本 + 图片 + 视频输入仅文本
思考模式混合(按请求开关)混合(默认开启)
百炼输入价格(每百万 token)¥12(约 $1.65)¥4(约 $0.55)
百炼输出价格(每百万 token)¥36(约 $4.95)¥12(约 $1.65)
DeepSeek 直连输入价格仅通过百炼$0.435/1M
DeepSeek 直连输出价格仅通过百炼$0.87/1M
缓存命中折扣支持上下文缓存$0.003625/1M(缓存命中)
并发限制未公开500 RPM
API 格式OpenAI、Anthropic、DashScopeOpenAI、Anthropic
适合场景多模态任务、视觉分析、中文优先场景深度推理、成本敏感的纯文本、长输出任务

一句话说完差别。需要处理图片或视频,选 Qwen3.8-Max;工作负载全是文本且在意成本,选 DeepSeek V4 Pro。

架构差异

两个模型都用了稀疏 MoE 架构,走的路却不一样。

Qwen3.8-Max 是阿里最大的模型,2026 年 7 月 19 日发布,8 月 3 日上线百炼。总参数量约 2.4 万亿,但阿里没有公开 MoE 的具体配置,专家数量、每个 token 激活多少参数、路由策略,都不知道。已知信息是它原生接受文本、图片和视频输入,支持百万 token 上下文,混合推理模式可以按请求切换。

DeepSeek V4 Pro 于 2026 年 4 月 24 日以预览版上线,7 月中旬正式 GA 并推出峰谷定价。总参数 1.6 万亿,每个 token 激活 49 亿参数。这是一个明确公开的数字。它只接受文本,支持百万 token 上下文,默认开启思考模式(可以按请求关掉)。

实际影响很明确。Qwen3.8-Max 的总参数更多,并且天然支持多模态输入。DeepSeek V4 Pro 的激活参数更小,推理速度更快,每 token 成本更低。

定价细节

定价是路由运营者做选型时权重最大的一个维度。

百炼定价

两个模型都可以通过 DashScope 的 OpenAI 兼容接口调用。价格以人民币计,单位是每百万 token。

模型输入(每百万 token)输出(每百万 token)缓存折扣
qwen3.8-max¥12(约 $1.65)¥36(约 $4.95)支持上下文缓存
deepseek-v4-pro(百炼托管)¥4(约 $0.55)¥12(约 $1.65)未公开

DeepSeek 直连 API 定价

DeepSeek V4 Pro 也可以通过 DeepSeek 自己的 API(https://api.deepseek.com)访问。

模型输入(缓存未命中)输入(缓存命中)输出
deepseek-v4-pro$0.435/1M$0.003625/1M$0.87/1M

DeepSeek 直连 API 用美元计价,折合下来和百炼的人民币价格处于同一区间。缓存命中折扣极其夸张,$0.003625 每百万输入 token 对于重复提示的场景几乎等于免费。

给路由运营者的建议。 如果你已经在通过百炼路由 Qwen 系列,加一个 DeepSeek V4 Pro 不需要额外集成。如果追求极致低成本,DeepSeek 直连 API 的缓存命中价格很难被打败。

注意,DeepSeek 已经宣布计划涨价,官方说法是"预计有显著增幅"。新价格落地后我们会更新本文。

跨供应商比较 API 价格时,统一到美元每百万 token口径,并区分输入与输出。多数供应商的输出 token 价是输入的 2–5 倍,所以"补全长度大" 的负载与"检索为主"的负载在同样的标称单价下成本会差很多。

  • 统一货币(USD)——发表日按汇率折算并标注。
  • 区分输入/输出——永远不要给单一"混合价"。
  • 每行引到供应商自己的价格页 + 抓取日期。
  • 注明长上下文阶梯价——长上下文常常单独跳一档。

上下文窗口与输出上限

两个模型都支持百万 token 上下文窗口,在上下文长度排行榜的顶端和 Gemini 2.5 Pro 并列。

输出上限是一个明显的差异点。

  • Qwen3.8-Max 默认最大输出 16K token,阿里没有公开显著扩展的方法。
  • DeepSeek V4 Pro 最大输出 384K token,是 Qwen3.8-Max 默认值的二十倍以上。

如果你的任务需要生成长文档、大段代码或展开的推理链条,DeepSeek V4 Pro 有明确的优势。如果你的输出基本在 16K token 以内(大部分对话、问答和分析任务都是),这个限制就不构成问题。

多模态能力

这是 Qwen3.8-Max 最大的差异化优势。

Qwen3.8-Max 原生接受文本、图片和视频输入。你可以在 content 数组里用标准 OpenAI 视觉格式(type: "image_url")传入图片 URL 或 base64 编码的图片。视频输入遵循同样的格式。这意味着你可以在一个模型调用里完成截图分析、图文文档处理或者视频帧理解。

DeepSeek V4 Pro 只接受文本。没有图片输入,没有视频输入。如果你的流水线需要视觉能力,就得用另一个模型。

# Qwen3.8-Max 视觉请求(通过百炼 OpenAI 兼容接口)
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DASHSCOPE_KEY",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "这张图里是什么?"},
            {"type": "image_url", "image_url": {"url": "https://example.com/photo.jpg"}}
        ]
    }],
)

DeepSeek V4 Pro 的调用方式一样,换掉 base_url 和 model 就行,但 content 只能传文本。

推理与思考模式

两个模型都支持混合推理,能在快速无思考回复和慢速思维链推理之间切换。

Qwen3.8-Max 默认不开启思考模式。你通过 extra_body 参数设置 enable_thinking: true 来启用,模型会在最终回答前先产出一段思维链。采样参数(temperature 0-2、top_p、penalties)和标准用法一致。

DeepSeek V4 Pro 默认开启思考模式。每个请求都会产出思维链推理,除非你显式关掉。思考 token 会计入输出 token 的计费。

这个默认值的差异直接影响路由成本。如果你的工作负载不需要推理,DeepSeek V4 Pro 会默认消耗思考 token,除非你每次请求都加上关闭参数。Qwen3.8-Max 是手动开启制,不需要推理的流量默认就是低成本。

API 接入方式

两个模型都支持 OpenAI chat completions 格式,意味着任何基于 OpenAI SDK 编写的代码只需要换一个 base_url 就能跑起来。

Qwen3.8-Max 接入路径

  • 百炼 OpenAI 兼容接口 https://dashscope.aliyuncs.com/compatible-mode/v1,模型 ID qwen3.8-max
  • 百炼 Anthropic 兼容接口 /apps/anthropic 路径
  • 区域节点 北京、新加坡、东京、法兰克福、弗吉尼亚,每个区域有独立的 workspace 级 URL
  • 没有独立的 Qwen API Qwen3.8-Max 只通过百炼(阿里云模型服务平台)提供

DeepSeek V4 Pro 接入路径

  • DeepSeek 直连 API(OpenAI 兼容) https://api.deepseek.com,模型 ID deepseek-v4-pro
  • DeepSeek Anthropic 兼容接口 https://api.deepseek.com/anthropic
  • 百炼托管 在百炼上以相同模型 ID deepseek-v4-pro 使用
  • 第三方平台 在 OpenRouter、Together AI 等平台上也能访问

DeepSeek V4 Pro 的接入路径更多。如果你的路由架构看重供应商冗余,DeepSeek 给了你更多的后备选项。

基准测试参考

以下是来自 Artificial Analysis 的独立基准数据(2026 年 8 月检索)。

  • Qwen3.8-Max 智能指数得分 53,所有被追踪模型中排名前五,比 Kimi K3(57)低四分。
  • DeepSeek V4 Pro 在推理类基准上表现突出。社区测试显示 V4 Pro 在复杂多步推理和 Agent 任务上有明显优势。

厂商自报的基准数据要谨慎对待,我们引用它们是为了提供背景信息。在我们自己的路由层实测中,两个模型处理复杂提示都很稳。Qwen3.8-Max 在中文任务和多模态分析上表现特别好,DeepSeek V4 Pro 在代码生成和结构化推理上一直很稳定。

选型决策指南

选 Qwen3.8-Max,如果

  • 工作负载涉及图片或视频输入(视觉分析、文档处理、截图理解)
  • 主要面向中文用户
  • 希望思考模式是手动开启的,而非默认
  • 已经在使用百炼,想留在阿里云生态内
  • 需要区域节点选择(新加坡、东京、法兰克福、弗吉尼亚)

选 DeepSeek V4 Pro,如果

  • 工作负载全是纯文本,成本是第一考量
  • 需要大量输出(单次响应最多 384K token)
  • 想要供应商冗余,多条接入路径(DeepSeek 直连、百炼、OpenRouter)
  • 主要任务是复杂推理和代码生成
  • 想用极低的缓存命中价格($0.003625/1M 输入 token)处理重复提示

两个都用,如果

  • 多模态请求路由到 Qwen3.8-Max,纯文本请求路由到 DeepSeek V4 Pro
  • 想做基于成本的路由,大输出量任务走 DeepSeek,短回答任务走任意一个
  • 需要容灾链路,一个供应商出问题时流量自动切换到另一个

路由中国旗舰模型

同时运行两个模型的运营者,路由逻辑可以直接映射到上面的差异。

  1. 基于能力的路由 任何包含图片或视频内容的请求走 Qwen3.8-Max。纯文本请求可以根据成本或质量偏好走任意一个。
  2. 基于成本的路由 纯文本场景下,DeepSeek V4 Pro 的直连 API 输出价格大约是百炼上 Qwen3.8-Max 的三分之一。
  3. 容灾路由 DeepSeek API 被限流或不可用时,流量切到百炼上的 Qwen3.8-Max,反过来也一样。两边用的都是 OpenAI 兼容格式,切换只需要改 base_url 和 model。

TheRouter 通过配置的提供商路由 OpenAI 兼容请求,所以你可以把两个模型都设为提供商目标,按内容类型、成本阈值或可用性定义路由规则。

值得关注的变化

几件可能改变这个对比结果的事情。

  • DeepSeek 涨价 DeepSeek 宣布了即将到来的涨价。涨价落地后,相对 Qwen3.8-Max 的成本优势可能缩小甚至消失。
  • Qwen3.8-Max 开源权重 阿里说 Qwen3.8-Max 的开源权重会来,但没有公布日期、许可证和模型卡。如果权重以 Apache 2.0 发布,自建部署就成了一个选项。
  • V4 Pro 的 Responses API 支持 DeepSeek 目前只对 V4 Flash 提供 Responses API 支持,V4 Pro 的支持计划在 2026 年 8 月推出。这会为 Agent 工作流增加一个新的 API 界面。

信息来源

本文涉及的模型

帮助与联系