DeepSeek V4.1 Flash 对比 Qwen3.8-Flash-Next:DashScope 闪电层两大模型路由选型指南
DeepSeek V4.1 Flash 和 Qwen3.8-Flash-Next 是 DashScope 上两款主流闪电层模型。本文从架构、定价、基准测试、多模态支持和路由策略五个维度进行对比,帮助运营方选择合适的 flash 模型或在两者之间配置智能路由。
DashScope 的 OpenAI 兼容端点上现在同时跑着两款闪电层模型。DeepSeek V4.1 Flash 于 2026 年 9 月 10 日上线,Qwen3.8-Flash-Next 于 8 月 26 日发布。两者共享相同的 base_url,使用同一把阿里云 API Key 调用,账单走同一个阿里云账户。对运营方来说,切换模型只需要改一个 model 字段,而选哪个才值得改,是这篇文章要回答的问题。
我们从架构、定价(DeepSeek 直连 API 和 DashScope 两条线)、独立评测机构的基准数据、以及实际路由场景四个方面做了对比。
OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。
对比总览
| 维度 | DeepSeek V4.1 Flash | Qwen3.8-Flash-Next |
|---|---|---|
| 总参数量 | 552B 骨干(含视觉 763B) | 125B(含视觉 176B) |
| 激活参数量 | 输入 8B / 输出 16B | 每 token 6B |
| 架构 | 因果编码器-解码器 MoE | 混合注意力 MoE(QSA + Gated DeltaNet) |
| 上下文窗口 | 1M tokens | 1M tokens |
| 最大输出 | 384K tokens | 未公开 |
| 多模态 | 文本 + 图片(从预训练阶段原生支持) | 文本 + 图片 + 音频 + 视频 |
| 思考模式 | 支持(默认开启,可切换) | 支持(混合模式,可切换) |
| DeepSeek 直连 API(低峰 输入/1M) | $0.15 | 不适用 |
| DeepSeek 直连 API(低峰 输出/1M) | $0.60 | 不适用 |
| DashScope(输入/百万 Token) | ¥1(约 $0.14) | ¥1.1(约 $0.15) |
| DashScope(输出/百万 Token) | ¥2(约 $0.28) | ¥3.4(约 $0.47) |
| 缓存命中价(DeepSeek 直连) | $0.003/1M(低峰) | 不适用 |
| KV Cache 占用 | 约 890 字节/token(较 V4 Flash 缩小 4 倍) | 标准 |
| 许可证 | MIT | Qwen Community License 1.0 |
| 发布日期 | 2026-09-10 | 2026-08-26 |
一句话总结。V4.1 Flash 的输出 token 单价更低、最大输出长度有 384K 的文档保证、KV Cache 压缩最激进、在 Agent 编码类基准测试上领先。Flash-Next 支持更多输入模态(除图片外还能处理音频和视频)、输入 token 价格在 DashScope 上略低、用远小于 V4.1 Flash 的参数量达到了接近的推理能力。
架构拆解
DeepSeek V4.1 Flash
V4.1 Flash 的核心创新是 因果编码器-解码器(CED) 架构。模型的 40 层 Transformer 分成前后两半,20 层因果编码器处理输入,20 层解码器负责生成。解码器的全局 KV Cache 从编码器最终隐藏状态做一次投影后,在所有解码层之间复用,不再逐层独立计算和存储。这就是为什么 prefill 阶段只激活 8B 参数、decode 阶段只激活 16B 参数。
在 CED 之上还叠加了 Compressed Sparse Attention 2(CSA2)。每个注意力层被分配到 Full、Reindex 或 Reuse 三种静态模式之一,层与层之间共享 KV 数据和稀疏注意力索引,而不是各自从头计算。最终 KV Cache 的占用压缩到约 890 字节/token,DeepSeek 称这比 V4 Flash 小 4 倍,比 DeepSeek V1 小 437 倍。
FP4 量化(E2M1 格式,每 16 通道一个 E4M3 缩放因子)再进一步压缩存储,无需单独的量化步骤。
模型还包含 196B 参数的 Engram 条件记忆(按 token 稀疏查找,不是每次前向传播全量加载)、DSpark 推测解码、以及从零训练的 DeepSeek-ViT 视觉编码器。
Qwen3.8-Flash-Next
Flash-Next 走了另一条路。它是 125B 参数的 MoE 模型,每 token 激活 6B 参数,加上 51B 的视觉编码器,总计 176B。架构层面引入了 混合注意力机制,将标准 Transformer 注意力与 QSA(Query-Shared Attention) 和 Gated DeltaNet 线性注意力变体结合,在长上下文推理时减少内存消耗。
在多模态方面,Flash-Next 支持文本、图片、音频和视频输入,覆盖面比 V4.1 Flash 的文本+图片更广。
总参数量只有 V4.1 Flash 的约 1/6,Flash-Next 用注意力机制的架构创新换取了效率。V4.1 Flash 靠编码器-解码器拆分和 CSA2 压缩 KV Cache,Flash-Next 靠混合注意力模式避免逐层存储完整的 KV 状态。
定价明细
DeepSeek 直连 API(仅 V4.1 Flash)
| 低峰 | 高峰 | |
|---|---|---|
| 输入(缓存未命中) | $0.15/1M | $0.30/1M |
| 输入(缓存命中) | $0.003/1M | $0.006/1M |
| 输出 | $0.60/1M | $1.20/1M |
高峰时段为工作日 UTC 01:00 到 04:00 和 06:00 到 10:00,其余时间均为低峰,周末全天低峰。能把工作负载调度到低峰窗口的运营方,拿到的是各大厂商闪电层里最低的单价。
缓存命中率在这里极其关键。$0.003/1M 意味着,一个长系统提示和工具输出在多轮对话中反复出现的 Agent 工作流,输入成本可以降到标价的零头。
DashScope(两款模型)
| DeepSeek V4.1 Flash | Qwen3.8-Flash-Next | |
|---|---|---|
| 输入 | ¥1/百万 Token(约 $0.14) | ¥1.1/百万 Token(约 $0.15) |
| 输出 | ¥2/百万 Token(约 $0.28) | ¥3.4/百万 Token(约 $0.47) |
| 隐式缓存命中 | ¥0.2/百万 Token(约 $0.028) | ¥0.11/百万 Token(约 $0.015) |
在 DashScope 上,V4.1 Flash 的输出单价优势明显,¥2 对 ¥3.4,差了 41%。输入单价几乎一样。对于输出密集型工作负载(代码生成、长回答、Agent 推理链),V4.1 Flash 即使只走 DashScope 这条线,成本也更低。
Flash-Next 的隐式缓存命中单价更低(¥0.11 对 ¥0.2),所以如果你的工作流大量复用上下文前缀,单请求成本差距会收窄。但在大多数场景下,输出 token 的价格差才是决定总成本的主要因素。
基准测试对比
独立评测机构 llm-stats.com 的正面对比数据显示(2026 年 9 月 15 日查阅),在两款模型共同报告的 5 项基准测试中,V4.1 Flash 赢了 3 项,Flash-Next 赢了 2 项。
| 基准测试 | V4.1 Flash | Flash-Next | 胜出 |
|---|---|---|---|
| DeepSWE v1.1(Agent 编码) | 74.2 | 落后 | V4.1 Flash |
| Humanity's Last Exam | 更高 | 更低 | V4.1 Flash |
| NL2Repo | 更高 | 更低 | V4.1 Flash |
| Agents' Last Exam | 更低 | 更高 | Flash-Next |
| GPQA(研究生级问答) | 更低 | 更高 | Flash-Next |
V4.1 Flash 还报告了 Codeforces Rating 3471(同场对比模型中最高)、Terminal-Bench 2.1 得分 90.6、CyberGym 得分 88.1。这些数据来自 DeepSeek 技术报告,尚未在统一评测套件上独立复现。
Flash-Next 在阿里云官方口径下"能力对齐 Qwen3.7-Plus",在编码和 Agent 协作任务上表现突出,用 6B 的激活参数量做到了这个水平,效率很高。
从现有数据看到的规律是,V4.1 Flash 在 Agent 编码和工具调用任务上领先,Flash-Next 在推理和通用知识任务上有竞争力,考虑到激活参数量差了近 3 倍,后者的效率表现相当突出。
多模态能力
两款模型都处理文本和图片输入,差别在覆盖面。
DeepSeek V4.1 Flash 通过原生的 DeepSeek-ViT 视觉编码器支持文本和图片输入,该编码器从预训练阶段就与语言模型联合训练。不支持音频或视频输入。
Qwen3.8-Flash-Next 支持文本、图片、音频和视频输入。这让它成为 DashScope 闪电层中唯一能处理音频片段或视频帧的选项。
如果你的工作流只涉及文本和偶尔的图片,两者都能胜任。如果你需要处理音频转录、视频帧分析、或者同时结合四种模态的推理,Flash-Next 是这个层级唯一的选择。
上下文窗口与输出限制
两款模型都支持 1M token 的上下文窗口。实际差异在输出上限。
V4.1 Flash 记录了 384K 的最大输出,是闪电层模型中已公布的最高输出上限,足以在单次请求中生成完整的代码库或长文档。
Qwen3.8-Flash-Next 没有公开过最大输出 token 数。实际使用中,DashScope 的默认 max_tokens 会生效,有效上限可能低于 V4.1 Flash 的文档值。
对于需要超长输出的工作负载(整文件生成、综合分析报告、多文件代码生成),V4.1 Flash 的 384K 输出上限提供了一个 Flash-Next 目前无法匹配的确定性保证。
速度与吞吐
V4.1 Flash 的非对称激活(输入 8B / 输出 16B)直接转化为 prefill 阶段的推理速度优势。处理长 prompt 时激活的参数量只有 decode 阶段的一半,意味着 prompt 密集型工作负载可以获得更快的 time-to-first-token。
DeepSeek 直连 API 的并发上限为 2,500 RPM,是 V4 Pro(500 RPM)的 5 倍。DashScope 上两款模型的速率限制遵循阿里云的层级体系,未按模型公开具体数值。
Flash-Next 的 6B 激活参数量理论上也能带来快速推理,但阿里云没有发布 Flash-Next 的吞吐量基准数据(tokens/秒),无法做直接的速度对比。
对延迟敏感的应用来说,DeepSeek 直连 API 凭借 2,500 RPM 并发上限和低峰定价,提供了最可预测的吞吐表现。
选型指南
选 DeepSeek V4.1 Flash
- 工作负载以 纯文本或文本+图片 为主,需要闪电层最低的输出单价
- 需要 超长输出(文档保证最高 384K tokens)
- Agent 编码 是主要场景,V4.1 Flash 在 Terminal-Bench、DeepSWE、CyberGym 上领先
- 能把工作负载调度到 低峰时段,成本减半
- KV Cache 经济性 很重要,890 字节/token 的占用让缓存密集型 Agent 循环的成本大幅降低
- 需要 DeepSeek 直连 API 作为 DashScope 之外的备选路径
选 Qwen3.8-Flash-Next
- 工作负载需要处理 音频或视频输入
- 研究生级推理和通用知识 质量比编码性能更重要
- 希望所有模型调用走 同一个 DashScope 账户,不额外管理 DeepSeek API Key
- 特定前缀复用模式下,隐式缓存命中价 ¥0.11/百万 Token 更划算
- 要与路由配置中的其他 Qwen 模型保持 生态一致性
两者并行,通过 TheRouter 路由
把 V4.1 Flash 设为文本/图片工作负载和编码任务的主路由,把 Flash-Next 设为音频/视频输入场景或 DeepSeek 直连 API 出现延迟升高时的回退。两款模型在 DashScope 上共享同一个 OpenAI 兼容端点,路由配置只需要换 model 参数,无需改 base_url。
# TheRouter 回退配置:DashScope 闪电层
- provider: dashscope
model: deepseek-v4-flash # 路由到 V4.1 Flash
priority: 1
- provider: dashscope
model: qwen3.8-flash-next # 回退到 Flash-Next
priority: 2
常见问题
两款模型是不是用同一个 DashScope API 端点?
是的。都用 https://dashscope.aliyuncs.com/compatible-mode/v1,同一把 API Key。唯一的区别是 model 参数的值。
V4.1 Flash 能不能走 DeepSeek 直连 API 而不走 DashScope?
可以。V4.1 Flash 在 https://api.deepseek.com 上可用,模型名为 deepseek-flash。直连 API 有高峰/低峰差价和 2,500 RPM 并发上限。Qwen3.8-Flash-Next 无法通过 DeepSeek API 调用。
编码任务选哪个更好?
V4.1 Flash 在已公布的 Agent 编码基准测试上领先(DeepSWE v1.1、Terminal-Bench 2.1、Codeforces Rating 3471)。Flash-Next 有竞争力但在这些评测上分数较低。纯编码工作负载选 V4.1 Flash。
哪个模型能处理更多输入类型?
Flash-Next 支持文本、图片、音频和视频。V4.1 Flash 只支持文本和图片。如果你的管线涉及音频或视频输入,Flash-Next 是这个层级唯一的选择。
KV Cache 经济性怎么比?
V4.1 Flash 报告了 890 字节/token 的 KV Cache 占用,比 V4 Flash 小 4 倍,直接转化为 DeepSeek 直连 API 上更低的缓存命中价(低峰 $0.003/1M)。但在 DashScope 上,Flash-Next 的隐式缓存命中价反而更低(¥0.11 对 ¥0.2),所以具体哪个更省钱取决于你走哪条 API 线路和前缀复用率。
两款模型都支持 function calling 和工具调用吗?
都支持。通过 DashScope 端点都能使用 OpenAI 兼容的 function calling。V4.1 Flash 还通过 DeepSeek 直连 API 额外支持 JSON 输出和 Responses API。
参考来源
- DeepSeek V4.1 Flash 发布公告 api-docs.deepseek.com/news/news260910(2026-09-15 查阅)
- DeepSeek API 定价 api-docs.deepseek.com/quick_start/pricing(2026-09-15 查阅)
- DashScope 模型定价 help.aliyun.com/zh/model-studio/model-pricing(2026-09-15 查阅)
- V4.1 Flash 架构详解 mindstudio.ai/blog/deepseek-v4-1-flash-specs-architecture(2026-09-15 查阅)
- llm-stats.com 正面对比 llm-stats.com/models/compare/deepseek-v4.1-flash-vs-qwen3.8-flash-next(2026-09-15 查阅)
- Qwen3.8-Flash-Next 发布公告 qwen.ai/blog?id=qwen3.8-flash-next(2026-09-15 查阅)
- DashScope DeepSeek V4 Flash 模型页面 help.aliyun.com/en/model-studio/deepseek-v4-flash(2026-09-15 查阅)