← 全部文章

DeepSeek V4.1 Flash 与 Qwen3.8-Max 跨级对比:DashScope 路由运营商的速度与深度之选

DeepSeek V4.1 Flash 每个输入 token 只激活 8B 参数,DashScope 输入价格 ¥1/百万。Qwen3.8-Max 拥有 2.4T 参数,原生支持视频理解。两者共享同一个 DashScope OpenAI 兼容端点。我们从架构、定价、基准测试和多模态能力四个方面进行对比,帮助路由运营商判断何时该选哪一个。

· updated 2026-10-05· TheRouter

DashScope 上现在同时跑着两个很不一样的模型。DeepSeek V4.1 Flash 在 2026 年 9 月 10 日上线,是一个 flash 级别的模型,却在所有已测基准上超过了上一代旗舰 V4 Pro。Qwen3.8-Max 在 8 月 3 日上线,2.4 万亿参数,独立评测综合得分排在中文模型前列,多模态覆盖面最广。

两者用同一个 base_url,同一个 API key,只需要换 model 字段。但它们在价格、能力和适用场景上的差距大到可以同时放进路由配置里各司其职。选错了,要么在简单任务上多花十几倍的钱,要么在需要深度推理的场景里拿到打了折扣的结果。

我们对比了架构、DashScope 和 DeepSeek 直连 API 的定价、BenchLM 独立评测数据、多模态范围,以及实际的路由建议。

OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。

核心对比表

维度DeepSeek V4.1 FlashQwen3.8-Max
总参数552B(含视觉 763B)2.4T(稀疏 MoE)
激活参数输入 8B / 输出 16B约 95B
架构因果编码器-解码器 MoE稀疏 MoE
上下文窗口100 万 token100 万 token
最大输出384K token131K token
多模态输入文本 + 图像文本 + 图像 + 视频
思考模式支持(默认开启)支持(可切换)
DashScope 输入价格¥1/百万¥12/百万
DashScope 输出价格¥2/百万¥36/百万
DeepSeek 直连(非高峰输入)$0.15/百万不适用
DeepSeek 直连(非高峰输出)$0.60/百万不适用
BenchLM 综合得分64.6572.12
开源协议MITApache 2.0
上线日期2026-09-102026-08-03

一句话概括差距,V4.1 Flash 在 DashScope 上输入便宜约 12 倍、输出便宜约 18 倍,在代码智能体基准上领先,最大输出长度接近 Qwen3.8-Max 的 3 倍。Qwen3.8-Max 独立评测综合分更高,原生支持视频输入,多模态基准全面领先,智能体协作评测覆盖更广。价格差距大到值得在同一套路由配置里同时使用两者。

架构对比

DeepSeek V4.1 Flash

V4.1 Flash 采用**因果编码器-解码器(CED)**架构,40 层 Transformer 分成前 20 层因果编码器和后 20 层解码器。解码器的全局 KV 缓存从编码器最终隐藏状态一次投影而来,不逐层重新计算。结果是输入处理阶段(prefill)只激活 8B 参数,输出生成阶段(decode)激活 16B 参数。

MoE 层使用 384 个路由专家,每个 token 激活 6 个,外加 1 个共享专家。模型还包含 196B 参数的 Engram 条件记忆,通过 token 级别查找稀疏访问。压缩稀疏注意力 2(CSA2)为每个注意力层分配三种静态模式之一(完整、重索引、复用),配合 E2M1 格式的 FP4 KV 缓存,将每个 token 的 KV 缓存占用降至约 890 字节。

对 API 用户而言,这意味着长输入的首 token 延迟更低,缓存命中价格极低(DeepSeek 直连 API 非高峰 $0.003/百万),并发限制 2,500 RPM。

Qwen3.8-Max

Qwen3.8-Max 是一个 2.4 万亿参数的稀疏 MoE 模型,每个 token 大约激活 95B 参数。阿里巴巴没有公布具体的专家数量和路由机制,但模型定位为 DashScope 旗舰。

模型原生支持文本、图像和视频输入,支持函数调用、结构化输出、网络搜索集成和上下文缓存(隐式和显式)。100 万 token 上下文窗口支持最多 991K 输入(思考模式下 983K),131K 输出,思考模式另有 262K 的推理预算。

核心取舍就在激活参数的量级上。Qwen3.8-Max 每个 token 激活的参数量大约是 V4.1 Flash 解码阶段的 6 倍,prefill 阶段的 12 倍。更多的激活参数带来更高的综合基准得分,也带来 12-18 倍的价格差距。

定价对比

DashScope(两者均可用)

DeepSeek V4.1 FlashQwen3.8-Max倍率
输入¥1/百万¥12/百万12x
输出¥2/百万¥36/百万18x
隐式缓存命中¥0.2/百万¥1.2/百万6x
批处理(五折)¥0.5 / ¥1¥6 / ¥1812x

Qwen3.8-Max 国际定价 $2.00/百万输入、$6.00/百万输出(阿里云国际站),隐式缓存读取 $0.25/百万。

DeepSeek 直连 API(仅 V4.1 Flash)

非高峰高峰
输入(缓存未命中)$0.15/百万$0.30/百万
输入(缓存命中)$0.003/百万$0.006/百万
输出$0.60/百万$1.20/百万

高峰时段为 UTC 01:00-04:00 和 06:00-10:00,周一至周五(中国法定节假日除外)。

每次请求成本示例

以 10,000 输入 token + 2,000 输出 token 的典型请求为例(DashScope 计价)。

V4.1 FlashQwen3.8-Max
输入费用¥0.01¥0.12
输出费用¥0.004¥0.072
合计¥0.014¥0.192
节省93%基准线

一次 Qwen3.8-Max 请求的花费大约是 V4.1 Flash 的 14 倍。对于大流量场景,把简单任务路由到 Flash、复杂任务留给 Max,成本可以下降 80-90%。

基准测试对比

BenchLM(独立评测聚合平台,最近更新于 2026 年 10 月 2 日)提供了最全面的跨模型对比数据。以下数据来自它的 head-to-head 页面,部分基准只有一个模型有成绩,用厂商报告数据补充。

V4.1 Flash 领先的基准

基准V4.1 FlashQwen3.8-Max类别
Terminal-Bench 2.190.6%86.6%智能体 / 代码
Terminal-Bench 2.1 (Vals)74.5%67.4%智能体
DeepSWE v1.174.2%56.6%代码
NL2Repo65.4%55.9%代码
AutomationBench54.8%27.3%智能体
HLE w/ tools63.9%56.2%智能体

V4.1 Flash 在代码智能体类基准上全面领先。AutomationBench 的差距最大(54.8% 对 27.3%),Terminal-Bench、DeepSWE 和 NL2Repo 都衡量的是现实世界的软件工程和代码智能体能力,V4.1 Flash 在每一项上都占优。

Qwen3.8-Max 领先的基准

基准V4.1 FlashQwen3.8-Max类别
Agents' Last Exam31.8%52.4%智能体
GPQA Diamond90.9%92.6%知识
HLE36.8%43.6%知识
BabyVision w/ Python89.6%91.3%多模态
OpenHarmony Bench60.3%60.8%代码

Qwen3.8-Max 在知识密集型基准(GPQA、HLE)、智能体协作任务(Agents' Last Exam)和多模态评测上领先。多模态方面的差距尤其明显,MMMU-Pro 82.3%、MathVision w/ Python 97.7%、Video-MME 90.4%、CharXiv 93.5%、OSWorld-Verified 86.1% 这些基准只有 Qwen3.8-Max 有成绩。

BenchLM 分类得分

类别V4.1 FlashQwen3.8-Max
综合64.6572.12
智能体61.1(#20/119)65.2(#14/119)
代码58.8(#23/144)55.4(#30/144)
知识64.9(#25/171)66.1(#23/171)
多模态74.5(1 个可排名)88.4(#5/49)

规律很明确。V4.1 Flash 在代码类领先,智能体类各有强项,多模态和知识类综合分明显落后。Qwen3.8-Max 更高的综合分(72.12 对 64.65)主要由更广的基准覆盖面(60 项有分 vs V4.1 Flash 的 26 项)和多模态优势带动。

两个模型共同被评测的基准只有 14 项。Qwen3.8-Max 另有 46 项 V4.1 Flash 尚未被评测的基准,这会拉高覆盖面加权后的综合分。

来源 BenchLM head-to-head(2026-10-05 检索)、Flowtivity V4.1 Flash benchmarks(2026-10-05 检索)、Qwen3.8-Max 博客(2026-10-05 检索)。

多模态能力

这是两个模型之间最清晰的分界线。

DeepSeek V4.1 Flash 支持文本和图像输入,视觉编码器 DeepSeek-ViT 使用 2D 旋转位置编码,与语言模型一起从头训练。不支持音频或视频。

Qwen3.8-Max 支持文本、图像和视频输入。图像理解内建在 2.4T MoE 里,视频理解接受视频 URL 或帧序列。在 BenchLM 的多模态评测中排名第 5/49,OCR(OmniDocBench 1.5 92.1%)、图表理解(CharXiv 93.5%)、视频理解(Video-MME 90.4%)和数学视觉(MathVision w/ Python 97.7%)都有突出表现。

如果你的场景涉及视频分析、大规模文档 OCR 或需要同时处理图像和视频的多模态推理,Qwen3.8-Max 是唯一选项。如果只需要处理文本或文本加图像,V4.1 Flash 在图像理解上同样胜任,成本只是 Max 的一个零头。

输出长度与长生成任务

V4.1 Flash 的最大输出为 384K token,是 DashScope 上已公布的最高输出上限,接近 Qwen3.8-Max 131K 上限的 3 倍。

对于需要生成超长输出的任务(完整代码库、综合分析报告、多文件脚手架),V4.1 Flash 的输出上限是一个实际优势。智能体循环中累积多轮工具输出的场景也受益于更大的输出预算。

Qwen3.8-Max 的 131K 输出在行业中已属宽裕,但开启思考模式时 262K 的推理预算可能会占用大部分输出容量,留给最终答案的空间有限。

速度与吞吐

OpenRouter 的独立测量数据(2026-10-05 检索自搜索摘要)显示 V4.1 Flash 中位输出速度为 99.0 token/秒,Qwen3.8-Max 为 30.0 token/秒。Artificial Analysis 报告 V4.1 Flash 输出速度 206 token/秒,首 token 延迟 1.09 秒。

速度差距与架构差异一致。V4.1 Flash 每个 token 激活 8-16B 参数,Qwen3.8-Max 激活约 95B。激活参数多 3 倍以上,推理延迟大致也是 3 倍。

DeepSeek 直连 API 上 V4.1 Flash 的并发限制为 2,500 RPM,DashScope 上 Qwen3.8-Max 的限制为 2M TPM / 15K RPM。

路由建议

选 DeepSeek V4.1 Flash 的场景

  • 代码智能体任务。V4.1 Flash 在 Terminal-Bench、DeepSWE、AutomationBench、NL2Repo、CyberGym 上全面领先。
  • 成本敏感型场景。在 DashScope 上比 Qwen3.8-Max 便宜 12-18 倍,大规模调用时节省极为可观。
  • 需要超长输出。384K 最大输出是 Qwen3.8-Max 的近 3 倍。
  • 延迟要求高。中位吞吐快约 3 倍,交互式场景体验更好。
  • 缓存密集型工作流(智能体循环、带固定前缀的 RAG)可以利用 DeepSeek 直连 API $0.003/百万的缓存命中价格。
  • 需要第二条提供商链路。V4.1 Flash 同时运行在 DashScope 和 DeepSeek 直连 API 上,一个端点有问题时可以切换。

选 Qwen3.8-Max 的场景

  • 需要视频理解。V4.1 Flash 不支持视频输入。
  • 多模态深度要求高。文档 OCR、图表分析、医学影像或任何 Qwen3.8-Max 多模态排名 #5/49 能转化为更好输出的场景。
  • 知识密集型推理(研究生级别问答、研究综合、复杂领域问题),GPQA Diamond 92.6%、HLE 43.6% 优于 V4.1 Flash。
  • 智能体协作任务,需要广泛的工具编排、网络搜索集成或多智能体协调(Agents' Last Exam 52.4% 对 31.8%)。
  • 监管或生态对齐要求在单个 DashScope 账户上使用 Qwen 模型系列。

在路由层同时使用两者

12-18 倍的价格差距让跨级路由成为混合负载场景下最划算的方案。把代码、生成密集型和延迟敏感型任务路由到 V4.1 Flash,把多模态、知识密集型和视频任务路由到 Qwen3.8-Max。

两者共享同一个 DashScope base_url,路由配置只需要换 model 参数。

# TheRouter 跨级路由配置
- provider: dashscope
  model: deepseek-v4-flash        # V4.1 Flash — 代码、快、便宜
  priority: 1
- provider: dashscope
  model: qwen3.8-max              # 旗舰 — 多模态、推理
  priority: 2

代码智能体场景可以再加一条 DeepSeek 直连 API 作为第二提供商链路。

# 代码智能体 fallback 链
- provider: deepseek
  model: deepseek-flash           # 直连 API — 非高峰更便宜
  priority: 1
- provider: dashscope
  model: deepseek-v4-flash        # DashScope fallback
  priority: 2
- provider: dashscope
  model: qwen3.8-max              # 最终 fallback — 旗舰
  priority: 3

常见问题

两个模型可以用同一个 DashScope API key 吗?

可以。两者都使用 https://dashscope.aliyuncs.com/compatible-mode/v1,同一个 API key,只改 model 参数即可。V4.1 Flash 用 deepseek-v4-flash,Qwen3.8-Max 用 qwen3.8-max。

V4.1 Flash 基准成绩超过 V4 Pro,还算 flash 级别吗?

DeepSeek 自己把它定位为 flash 模型(替代 V4 Flash),定价也在 flash 级别($0.15-$0.30/百万输入)。但它的基准成绩确实全面超过了 V4 Pro。命名反映的是定价层级和架构谱系,并非能力上限。从路由角度看,它在质量上与定价高 10-20 倍的模型直接竞争。

代码任务选哪个?

V4.1 Flash 在所有共同评测的代码基准上领先,Terminal-Bench 2.1(90.6% 对 86.6%)、DeepSWE v1.1(74.2% 对 56.6%)、NL2Repo(65.4% 对 55.9%)。Codeforces 评级 3471。Qwen3.8-Max 在一些 V4.1 Flash 尚未被评测的代码基准上有不错的成绩(SWE-bench Pro 67.7%、FrontierSWE 73.5%)。基于现有数据,代码智能体任务优先选 V4.1 Flash。

哪个模型支持视频输入?

只有 Qwen3.8-Max。V4.1 Flash 支持文本和图像,但不支持视频。如果视频理解是刚需,Qwen3.8-Max 是唯一选项。

简单任务路由到 V4.1 Flash 能省多少钱?

假设一个工作负载把 80% 的请求路由到 V4.1 Flash、20% 路由到 Qwen3.8-Max(对比全部跑在 Max 上),Flash 部分可以节省约 93%。以每月处理 1 亿 token 计算(8000 万 Flash + 2000 万 Max),月费从约 ¥4,800(全部 Max)降至约 ¥1,120(混合路由)。实际节省取决于你的输入输出 token 比。

V4.1 Flash 支持函数调用和结构化输出吗?

支持。V4.1 Flash 支持 JSON 输出、工具调用、Responses API、Anthropic API 格式、聊天前缀补全(beta)和 FIM 补全(beta,仅非思考模式)。Qwen3.8-Max 同样通过 DashScope 端点支持函数调用和结构化输出。

DashScope 上的上下文缓存怎么比?

两个模型都支持 DashScope 的隐式上下文缓存。V4.1 Flash 的缓存命中价格 ¥0.2/百万,Qwen3.8-Max 为 ¥1.2/百万。在 DeepSeek 直连 API 上,V4.1 Flash 的缓存命中低至 $0.003/百万(非高峰),这是主流 LLM API 提供商中最低的缓存命中价格。

来源

帮助与联系