← 全部文章

DeepSeek V4.1 Flash 对比 Qwen3.8-Flash-Next:DashScope 闪电层两大模型路由选型指南

DeepSeek V4.1 Flash 和 Qwen3.8-Flash-Next 是 DashScope 上两款主流闪电层模型。本文从架构、定价、基准测试、多模态支持和路由策略五个维度进行对比,帮助运营方选择合适的 flash 模型或在两者之间配置智能路由。

· updated 2026-09-15· TheRouter

DashScope 的 OpenAI 兼容端点上现在同时跑着两款闪电层模型。DeepSeek V4.1 Flash 于 2026 年 9 月 10 日上线,Qwen3.8-Flash-Next 于 8 月 26 日发布。两者共享相同的 base_url,使用同一把阿里云 API Key 调用,账单走同一个阿里云账户。对运营方来说,切换模型只需要改一个 model 字段,而选哪个才值得改,是这篇文章要回答的问题。

我们从架构、定价(DeepSeek 直连 API 和 DashScope 两条线)、独立评测机构的基准数据、以及实际路由场景四个方面做了对比。

OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。

对比总览

维度DeepSeek V4.1 FlashQwen3.8-Flash-Next
总参数量552B 骨干(含视觉 763B)125B(含视觉 176B)
激活参数量输入 8B / 输出 16B每 token 6B
架构因果编码器-解码器 MoE混合注意力 MoE(QSA + Gated DeltaNet)
上下文窗口1M tokens1M tokens
最大输出384K tokens未公开
多模态文本 + 图片(从预训练阶段原生支持)文本 + 图片 + 音频 + 视频
思考模式支持(默认开启,可切换)支持(混合模式,可切换)
DeepSeek 直连 API(低峰 输入/1M)$0.15不适用
DeepSeek 直连 API(低峰 输出/1M)$0.60不适用
DashScope(输入/百万 Token)¥1(约 $0.14)¥1.1(约 $0.15)
DashScope(输出/百万 Token)¥2(约 $0.28)¥3.4(约 $0.47)
缓存命中价(DeepSeek 直连)$0.003/1M(低峰)不适用
KV Cache 占用约 890 字节/token(较 V4 Flash 缩小 4 倍)标准
许可证MITQwen Community License 1.0
发布日期2026-09-102026-08-26

一句话总结。V4.1 Flash 的输出 token 单价更低、最大输出长度有 384K 的文档保证、KV Cache 压缩最激进、在 Agent 编码类基准测试上领先。Flash-Next 支持更多输入模态(除图片外还能处理音频和视频)、输入 token 价格在 DashScope 上略低、用远小于 V4.1 Flash 的参数量达到了接近的推理能力。

架构拆解

DeepSeek V4.1 Flash

V4.1 Flash 的核心创新是 因果编码器-解码器(CED) 架构。模型的 40 层 Transformer 分成前后两半,20 层因果编码器处理输入,20 层解码器负责生成。解码器的全局 KV Cache 从编码器最终隐藏状态做一次投影后,在所有解码层之间复用,不再逐层独立计算和存储。这就是为什么 prefill 阶段只激活 8B 参数、decode 阶段只激活 16B 参数。

在 CED 之上还叠加了 Compressed Sparse Attention 2(CSA2)。每个注意力层被分配到 Full、Reindex 或 Reuse 三种静态模式之一,层与层之间共享 KV 数据和稀疏注意力索引,而不是各自从头计算。最终 KV Cache 的占用压缩到约 890 字节/token,DeepSeek 称这比 V4 Flash 小 4 倍,比 DeepSeek V1 小 437 倍。

FP4 量化(E2M1 格式,每 16 通道一个 E4M3 缩放因子)再进一步压缩存储,无需单独的量化步骤。

模型还包含 196B 参数的 Engram 条件记忆(按 token 稀疏查找,不是每次前向传播全量加载)、DSpark 推测解码、以及从零训练的 DeepSeek-ViT 视觉编码器。

Qwen3.8-Flash-Next

Flash-Next 走了另一条路。它是 125B 参数的 MoE 模型,每 token 激活 6B 参数,加上 51B 的视觉编码器,总计 176B。架构层面引入了 混合注意力机制,将标准 Transformer 注意力与 QSA(Query-Shared Attention) 和 Gated DeltaNet 线性注意力变体结合,在长上下文推理时减少内存消耗。

在多模态方面,Flash-Next 支持文本、图片、音频和视频输入,覆盖面比 V4.1 Flash 的文本+图片更广。

总参数量只有 V4.1 Flash 的约 1/6,Flash-Next 用注意力机制的架构创新换取了效率。V4.1 Flash 靠编码器-解码器拆分和 CSA2 压缩 KV Cache,Flash-Next 靠混合注意力模式避免逐层存储完整的 KV 状态。

定价明细

DeepSeek 直连 API(仅 V4.1 Flash)

低峰高峰
输入(缓存未命中)$0.15/1M$0.30/1M
输入(缓存命中)$0.003/1M$0.006/1M
输出$0.60/1M$1.20/1M

高峰时段为工作日 UTC 01:00 到 04:00 和 06:00 到 10:00,其余时间均为低峰,周末全天低峰。能把工作负载调度到低峰窗口的运营方,拿到的是各大厂商闪电层里最低的单价。

缓存命中率在这里极其关键。$0.003/1M 意味着,一个长系统提示和工具输出在多轮对话中反复出现的 Agent 工作流,输入成本可以降到标价的零头。

DashScope(两款模型)

DeepSeek V4.1 FlashQwen3.8-Flash-Next
输入¥1/百万 Token(约 $0.14)¥1.1/百万 Token(约 $0.15)
输出¥2/百万 Token(约 $0.28)¥3.4/百万 Token(约 $0.47)
隐式缓存命中¥0.2/百万 Token(约 $0.028)¥0.11/百万 Token(约 $0.015)

在 DashScope 上,V4.1 Flash 的输出单价优势明显,¥2 对 ¥3.4,差了 41%。输入单价几乎一样。对于输出密集型工作负载(代码生成、长回答、Agent 推理链),V4.1 Flash 即使只走 DashScope 这条线,成本也更低。

Flash-Next 的隐式缓存命中单价更低(¥0.11 对 ¥0.2),所以如果你的工作流大量复用上下文前缀,单请求成本差距会收窄。但在大多数场景下,输出 token 的价格差才是决定总成本的主要因素。

基准测试对比

独立评测机构 llm-stats.com 的正面对比数据显示(2026 年 9 月 15 日查阅),在两款模型共同报告的 5 项基准测试中,V4.1 Flash 赢了 3 项,Flash-Next 赢了 2 项。

基准测试V4.1 FlashFlash-Next胜出
DeepSWE v1.1(Agent 编码)74.2落后V4.1 Flash
Humanity's Last Exam更高更低V4.1 Flash
NL2Repo更高更低V4.1 Flash
Agents' Last Exam更低更高Flash-Next
GPQA(研究生级问答)更低更高Flash-Next

V4.1 Flash 还报告了 Codeforces Rating 3471(同场对比模型中最高)、Terminal-Bench 2.1 得分 90.6、CyberGym 得分 88.1。这些数据来自 DeepSeek 技术报告,尚未在统一评测套件上独立复现。

Flash-Next 在阿里云官方口径下"能力对齐 Qwen3.7-Plus",在编码和 Agent 协作任务上表现突出,用 6B 的激活参数量做到了这个水平,效率很高。

从现有数据看到的规律是,V4.1 Flash 在 Agent 编码和工具调用任务上领先,Flash-Next 在推理和通用知识任务上有竞争力,考虑到激活参数量差了近 3 倍,后者的效率表现相当突出。

多模态能力

两款模型都处理文本和图片输入,差别在覆盖面。

DeepSeek V4.1 Flash 通过原生的 DeepSeek-ViT 视觉编码器支持文本和图片输入,该编码器从预训练阶段就与语言模型联合训练。不支持音频或视频输入。

Qwen3.8-Flash-Next 支持文本、图片、音频和视频输入。这让它成为 DashScope 闪电层中唯一能处理音频片段或视频帧的选项。

如果你的工作流只涉及文本和偶尔的图片,两者都能胜任。如果你需要处理音频转录、视频帧分析、或者同时结合四种模态的推理,Flash-Next 是这个层级唯一的选择。

上下文窗口与输出限制

两款模型都支持 1M token 的上下文窗口。实际差异在输出上限。

V4.1 Flash 记录了 384K 的最大输出,是闪电层模型中已公布的最高输出上限,足以在单次请求中生成完整的代码库或长文档。

Qwen3.8-Flash-Next 没有公开过最大输出 token 数。实际使用中,DashScope 的默认 max_tokens 会生效,有效上限可能低于 V4.1 Flash 的文档值。

对于需要超长输出的工作负载(整文件生成、综合分析报告、多文件代码生成),V4.1 Flash 的 384K 输出上限提供了一个 Flash-Next 目前无法匹配的确定性保证。

速度与吞吐

V4.1 Flash 的非对称激活(输入 8B / 输出 16B)直接转化为 prefill 阶段的推理速度优势。处理长 prompt 时激活的参数量只有 decode 阶段的一半,意味着 prompt 密集型工作负载可以获得更快的 time-to-first-token。

DeepSeek 直连 API 的并发上限为 2,500 RPM,是 V4 Pro(500 RPM)的 5 倍。DashScope 上两款模型的速率限制遵循阿里云的层级体系,未按模型公开具体数值。

Flash-Next 的 6B 激活参数量理论上也能带来快速推理,但阿里云没有发布 Flash-Next 的吞吐量基准数据(tokens/秒),无法做直接的速度对比。

对延迟敏感的应用来说,DeepSeek 直连 API 凭借 2,500 RPM 并发上限和低峰定价,提供了最可预测的吞吐表现。

选型指南

选 DeepSeek V4.1 Flash

  • 工作负载以 纯文本或文本+图片 为主,需要闪电层最低的输出单价
  • 需要 超长输出(文档保证最高 384K tokens)
  • Agent 编码 是主要场景,V4.1 Flash 在 Terminal-Bench、DeepSWE、CyberGym 上领先
  • 能把工作负载调度到 低峰时段,成本减半
  • KV Cache 经济性 很重要,890 字节/token 的占用让缓存密集型 Agent 循环的成本大幅降低
  • 需要 DeepSeek 直连 API 作为 DashScope 之外的备选路径

选 Qwen3.8-Flash-Next

  • 工作负载需要处理 音频或视频输入
  • 研究生级推理和通用知识 质量比编码性能更重要
  • 希望所有模型调用走 同一个 DashScope 账户,不额外管理 DeepSeek API Key
  • 特定前缀复用模式下,隐式缓存命中价 ¥0.11/百万 Token 更划算
  • 要与路由配置中的其他 Qwen 模型保持 生态一致性

两者并行,通过 TheRouter 路由

把 V4.1 Flash 设为文本/图片工作负载和编码任务的主路由,把 Flash-Next 设为音频/视频输入场景或 DeepSeek 直连 API 出现延迟升高时的回退。两款模型在 DashScope 上共享同一个 OpenAI 兼容端点,路由配置只需要换 model 参数,无需改 base_url。

# TheRouter 回退配置:DashScope 闪电层
- provider: dashscope
  model: deepseek-v4-flash        # 路由到 V4.1 Flash
  priority: 1
- provider: dashscope
  model: qwen3.8-flash-next       # 回退到 Flash-Next
  priority: 2

常见问题

两款模型是不是用同一个 DashScope API 端点?

是的。都用 https://dashscope.aliyuncs.com/compatible-mode/v1,同一把 API Key。唯一的区别是 model 参数的值。

V4.1 Flash 能不能走 DeepSeek 直连 API 而不走 DashScope?

可以。V4.1 Flash 在 https://api.deepseek.com 上可用,模型名为 deepseek-flash。直连 API 有高峰/低峰差价和 2,500 RPM 并发上限。Qwen3.8-Flash-Next 无法通过 DeepSeek API 调用。

编码任务选哪个更好?

V4.1 Flash 在已公布的 Agent 编码基准测试上领先(DeepSWE v1.1、Terminal-Bench 2.1、Codeforces Rating 3471)。Flash-Next 有竞争力但在这些评测上分数较低。纯编码工作负载选 V4.1 Flash。

哪个模型能处理更多输入类型?

Flash-Next 支持文本、图片、音频和视频。V4.1 Flash 只支持文本和图片。如果你的管线涉及音频或视频输入,Flash-Next 是这个层级唯一的选择。

KV Cache 经济性怎么比?

V4.1 Flash 报告了 890 字节/token 的 KV Cache 占用,比 V4 Flash 小 4 倍,直接转化为 DeepSeek 直连 API 上更低的缓存命中价(低峰 $0.003/1M)。但在 DashScope 上,Flash-Next 的隐式缓存命中价反而更低(¥0.11 对 ¥0.2),所以具体哪个更省钱取决于你走哪条 API 线路和前缀复用率。

两款模型都支持 function calling 和工具调用吗?

都支持。通过 DashScope 端点都能使用 OpenAI 兼容的 function calling。V4.1 Flash 还通过 DeepSeek 直连 API 额外支持 JSON 输出和 Responses API。

参考来源

帮助与联系