← 全部文章

Flash 模型三方对决:DeepSeek V4.1 Flash vs Qwen3.8 Flash vs GLM-5.3 Flash

三款 Flash 级模型在四周内相继发布——DeepSeek V4.1 Flash、Qwen3.8 Flash 和 GLM-5.3 Flash——均提供百万级上下文、低于每百万 Token 1 美元的定价和推理能力。我们从架构、价格、视觉能力、编程质量和吞吐量五个维度对比,帮你选出最适合的 Flash 模型。

· TheRouter

2026 年 8 月到 9 月,三款 Flash 级模型在四周内先后上线:DeepSeek V4.1 Flash、Qwen3.8 Flash 和 GLM-5.3 Flash。三者都给到百万 Token 上下文、推理能力,以及每百万输出 Token 不到 1 美元的价格。对于跑批量分类、摘要、编程辅助、文档提取这类成本敏感负载的团队来说,问题已经不是"哪家有 Flash 模型",而是"哪个 Flash 模型最适合我的场景"。

我们把三款模型摆在一起做了对比。

一览表

维度DeepSeek V4.1 FlashQwen3.8 FlashGLM-5.3 Flash
供应商DeepSeekDashScope(百炼)Z.AI(智谱)
架构552B MoE,8–16B 激活稠密(参数量未公开)320B MoE,18B 激活
上下文窗口100 万 Token100 万 Token100 万 Token
最大输出384K Token131K Token131K Token
输入价格(低峰)$0.15 / 百万 Token$0.162 / 百万 Token$0.162 / 百万 Token
输出价格(低峰)$0.60 / 百万 Token$0.508 / 百万 Token$0.54 / 百万 Token
缓存命中$0.003 / 百万DashScope 上下文缓存$0.03 / 百万
视觉输入原生支持仅文本(VL 变体另行调用)原生支持
思维模式支持(默认开启,可切换)支持支持(始终开启)
工具调用支持支持支持
JSON 输出支持支持支持
开源权重MIT 协议开源开源
推理力度控制不支持不支持支持 reasoning_effort
OpenAI 兼容是是(通过 DashScope)是(通过 BigModel)

来源:DeepSeek API 定价、DashScope 模型定价、Together.ai GLM-5.3-Flash、OpenRouter GLM-5.3-Flash。

架构:三条不同的"快"路径

DeepSeek V4.1 Flash 是 552B 参数的混合专家模型,每次前向传播激活约 8–16B 参数。DeepSeek 称其 KV Cache 仅占同等质量稠密模型 HBM 的 1/4、SSD 的 1/8。2026 年 9 月的 V4.1 更新新增了原生视觉能力,并替换了旧版 V4 Flash——调用 deepseek-flash 或已废弃的 deepseek-v4-flash 都会路由到 V4.1 Flash。

Qwen3.8 Flash 走的是另一条路。阿里未公开完整参数量,将其定位为 3.8 代的成本/延迟入门选项。2026 年 8 月底上线,百万 Token 上下文,纯文本输入,通过 DashScope 的 OpenAI 兼容端点提供服务。多模态需要切到单独的 Qwen3.8 VL Flash 变体。

GLM-5.3 Flash 来自 Z.AI(智谱),320B MoE、18B 激活参数,结合稀疏注意力和线性注意力机制。2026 年 8 月 31 日上线,天生支持多模态——文本和图片输入同一个 model ID 搞定。推理始终开启,不能关闭,但暴露了 reasoning_effort 参数来调节推理深度。

价格对比

三款模型在同一价位带竞争,但细节差异在规模化时会体现。

DeepSeek V4.1 Flash

DeepSeek 采用高峰/低峰定价。高峰时段为工作日 UTC 01:00–04:00 和 06:00–10:00(不含中国法定假日),其余时间均为低峰,包括整个周末。

时段输入(未命中缓存)输入(命中缓存)输出
低峰$0.15 / 百万$0.003 / 百万$0.60 / 百万
高峰$0.30 / 百万$0.006 / 百万$1.20 / 百万

亮点是缓存命中价:$0.003 / 百万 Token,重复上下文块几乎不花钱。

Qwen3.8 Flash

DashScope 对 Qwen3.8 Flash 采用统一费率:

组件价格
输入$0.162 / 百万 Token
输出$0.508 / 百万 Token

DashScope 还支持上下文缓存(显式和隐式),缓存命中价格约为标准输入的 10%。

GLM-5.3 Flash

Z.AI 通过 BigModel 的官方定价:

组件价格
输入$0.162 / 百万 Token
输出$0.54 / 百万 Token
缓存命中$0.03 / 百万 Token

通过 OpenRouter 调用 GLM-5.3 Flash,价格约为 $0.075 / 百万输入、$0.25 / 百万输出——大约是直连价格的一半。

典型负载成本对比

假设每天处理 1000 万输入 Token 和 200 万输出 Token(低峰费率):

模型每日输入成本每日输出成本每日总计
DeepSeek V4.1 Flash$1.50$1.20$2.70
Qwen3.8 Flash$1.62$1.02$2.64
GLM-5.3 Flash$1.62$1.08$2.70

在这个量级,三者成本几乎一样。差异在边际:DeepSeek 的缓存命中价最低(适合前缀重复率高的场景),Qwen3.8 Flash 输出单价最便宜,DeepSeek 高峰时段价格翻倍(北京工作时间的负载要留意)。

视觉与多模态能力

这一项是三款模型分化最明显的地方。

DeepSeek V4.1 Flash:V4.1 更新新增原生视觉支持,可以在 content 数组里混合传入图片 URL 或 base64 编码的图片和文本。

Qwen3.8 Flash:纯文本。如果需要多模态输入,需要切换到 Qwen3.8 VL Flash 变体或 Qwen3.8 Max。意味着混合负载需要在路由配置里多管一个 model ID。

GLM-5.3 Flash:发布时即支持多模态,用标准 OpenAI 消息格式传入 image_url 内容块即可,不需要单独的视觉变体。

结论:如果你的管线同时处理文本和图片输入,DeepSeek V4.1 Flash 和 GLM-5.3 Flash 省去了管理第二个 model ID 的麻烦。Qwen3.8 Flash 需要把视觉请求路由到另一个模型。

编程质量

三款模型都瞄准了编程辅助场景,但基准测试表现有差异。

DeepSeek V4.1 Flash 延续了 V4 系列强劲的编程实力。V4 Flash 在 HumanEval 和 SWE-bench 上表现出色,V4.1 Flash 在此基础上加了视觉能力。

Qwen3.8 Flash 定位偏通用工作马,编程专长放在了 Coder 变体(qwen3-coder、qwen3-coder-plus)上。Flash 能写代码、能解释代码,但不是 3.8 系列的编程旗舰。

GLM-5.3 Flash 受益于 Z.AI 在编程基准上的大力投入。完整版 GLM-5.3 在发布时登顶 SWE-bench Pro,Flash 版本在 Flash 价位保留了大部分能力。社区反馈称其在实际编程任务上可比 Claude Opus 4.8,但成本只有后者的约 5%。

结论:纯编程负载选 GLM-5.3 Flash 或 DeepSeek V4.1 Flash。Qwen3.8 Flash 能用,但编程不是它在自家产品线中的长板。

上下文窗口与 KV Cache 效率

三款模型都标称百万 Token 上下文,但实现细节不同。

DeepSeek V4.1 Flash 声称 KV Cache 效率最高:HBM 占用仅同等稠密模型的 1/4、SSD 仅 1/8。对于自部署(MIT 开源),这意味着更少的 GPU 就能跑长上下文负载。384K Token 的最大输出也是三者中最高的。

Qwen3.8 Flash 和 GLM-5.3 Flash 输出上限均为 131K Token。大多数生产场景够用,但如果需要生成超长输出(大型代码文件、完整文档翻译),DeepSeek 的 384K 上限多出不少余量。

选型矩阵

选 DeepSeek V4.1 Flash,如果你:

  • 需要最高的最大输出长度(384K Token)
  • 有大量前缀重复,想要 $0.003 / 百万的缓存命中价
  • 负载主要跑在低峰时段(周末、UTC 晚间)
  • 想要 MIT 协议的开源权重做自部署,KV Cache 开销最小
  • 需要在同一个 model ID 里处理视觉 + 文本

选 Qwen3.8 Flash,如果你:

  • 已经在用 DashScope,想集中在一个账单里
  • 负载纯文本(不需要视觉)
  • 想要最低的输出 Token 单价($0.508 / 百万)
  • 需要接入更广的 Qwen 生态(VL、Coder、Max 变体)
  • 偏好无高峰/低峰波动的统一定价

选 GLM-5.3 Flash,如果你:

  • 想要原生视觉 + 文本 + 推理力度控制集于一身
  • 编程质量是 Flash 级的首要考量
  • 偏好始终开启推理,不需要手动管理思维模式
  • 想通过 OpenRouter 以 $0.075/$0.25 / 百万的价格调用——约为直连价格的一半
  • 看重开源权重 + 强基准表现

TheRouter 配置:Flash 层路由

你可以把三款 Flash 模型配成一个成本优化路由组。根据输入模态、成本目标或供应商偏好做路由:

from openai import OpenAI

# 指向你的 TheRouter 实例
client = OpenAI(
    api_key="YOUR_THEROUTER_KEY",
    base_url="https://api.therouter.ai/v1",
)

# TheRouter 路由到最便宜的可用 Flash 模型
response = client.chat.completions.create(
    model="deepseek/deepseek-v4-flash",  # 或 qwen/qwen3.8-flash, zai/glm-5.3-flash
    messages=[
        {"role": "user", "content": "用三句话解释 CAP 定理。"}
    ],
)

print(response.choices[0].message.content)

视觉负载可以在 DeepSeek V4.1 Flash 和 GLM-5.3 Flash 之间配 fallback——两者都原生接受图片输入。当一个供应商出现延迟峰值或宕机时,请求自动路由到另一个。

常见问题

Q:这些模型真的和更贵的旗舰模型一样好吗? 不是。Flash 级模型用一部分推理深度换取速度和成本。需要前沿推理能力(复杂多步数学、新颖研究)时,用 Pro/Max 级别。Flash 模型擅长批量处理、编程辅助、文档提取和对延迟敏感的场景。

Q:在这些模型之间切换需要改代码吗? 不需要。三者都暴露 OpenAI 兼容 API。改 base_url 和 model 参数就行。如果通过 TheRouter 路由,在路由层切换即可,不碰应用代码。

Q:哪个模型吞吐量最高? 吞吐量随供应商负载和时间段变化。DeepSeek V4.1 Flash 低峰时段通常表现强劲。GLM-5.3 Flash 的线性注意力机制在长上下文推理时效率高。Qwen3.8 Flash 的吞吐取决于 DashScope 的基础设施负载。建议用你自己的实际负载做基准测试,不要依赖厂商报告的数字。

Q:这些模型支持 Anthropic API 格式吗? DeepSeek V4.1 Flash 原生支持 Anthropic 消息格式,端点为 https://api.deepseek.com/anthropic。Qwen3.8 Flash 和 GLM-5.3 Flash 通过各自供应商仅支持 OpenAI 格式。

Q:可以自部署吗? 三者均已发布开源权重。DeepSeek V4.1 Flash 使用 MIT 协议,商业自部署最为宽松。具体使用请查看各模型的许可条款。


定价和规格于 2026 年 9 月 23 日核实。模型能力和定价可能变动——请查看官方供应商文档获取最新信息。

本文涉及的模型

帮助与联系