Flash 模型三方对决:DeepSeek V4.1 Flash vs Qwen3.8 Flash vs GLM-5.3 Flash
三款 Flash 级模型在四周内相继发布——DeepSeek V4.1 Flash、Qwen3.8 Flash 和 GLM-5.3 Flash——均提供百万级上下文、低于每百万 Token 1 美元的定价和推理能力。我们从架构、价格、视觉能力、编程质量和吞吐量五个维度对比,帮你选出最适合的 Flash 模型。
2026 年 8 月到 9 月,三款 Flash 级模型在四周内先后上线:DeepSeek V4.1 Flash、Qwen3.8 Flash 和 GLM-5.3 Flash。三者都给到百万 Token 上下文、推理能力,以及每百万输出 Token 不到 1 美元的价格。对于跑批量分类、摘要、编程辅助、文档提取这类成本敏感负载的团队来说,问题已经不是"哪家有 Flash 模型",而是"哪个 Flash 模型最适合我的场景"。
我们把三款模型摆在一起做了对比。
一览表
| 维度 | DeepSeek V4.1 Flash | Qwen3.8 Flash | GLM-5.3 Flash |
|---|---|---|---|
| 供应商 | DeepSeek | DashScope(百炼) | Z.AI(智谱) |
| 架构 | 552B MoE,8–16B 激活 | 稠密(参数量未公开) | 320B MoE,18B 激活 |
| 上下文窗口 | 100 万 Token | 100 万 Token | 100 万 Token |
| 最大输出 | 384K Token | 131K Token | 131K Token |
| 输入价格(低峰) | $0.15 / 百万 Token | $0.162 / 百万 Token | $0.162 / 百万 Token |
| 输出价格(低峰) | $0.60 / 百万 Token | $0.508 / 百万 Token | $0.54 / 百万 Token |
| 缓存命中 | $0.003 / 百万 | DashScope 上下文缓存 | $0.03 / 百万 |
| 视觉输入 | 原生支持 | 仅文本(VL 变体另行调用) | 原生支持 |
| 思维模式 | 支持(默认开启,可切换) | 支持 | 支持(始终开启) |
| 工具调用 | 支持 | 支持 | 支持 |
| JSON 输出 | 支持 | 支持 | 支持 |
| 开源权重 | MIT 协议 | 开源 | 开源 |
| 推理力度控制 | 不支持 | 不支持 | 支持 reasoning_effort |
| OpenAI 兼容 | 是 | 是(通过 DashScope) | 是(通过 BigModel) |
来源:DeepSeek API 定价、DashScope 模型定价、Together.ai GLM-5.3-Flash、OpenRouter GLM-5.3-Flash。
架构:三条不同的"快"路径
DeepSeek V4.1 Flash 是 552B 参数的混合专家模型,每次前向传播激活约 8–16B 参数。DeepSeek 称其 KV Cache 仅占同等质量稠密模型 HBM 的 1/4、SSD 的 1/8。2026 年 9 月的 V4.1 更新新增了原生视觉能力,并替换了旧版 V4 Flash——调用 deepseek-flash 或已废弃的 deepseek-v4-flash 都会路由到 V4.1 Flash。
Qwen3.8 Flash 走的是另一条路。阿里未公开完整参数量,将其定位为 3.8 代的成本/延迟入门选项。2026 年 8 月底上线,百万 Token 上下文,纯文本输入,通过 DashScope 的 OpenAI 兼容端点提供服务。多模态需要切到单独的 Qwen3.8 VL Flash 变体。
GLM-5.3 Flash 来自 Z.AI(智谱),320B MoE、18B 激活参数,结合稀疏注意力和线性注意力机制。2026 年 8 月 31 日上线,天生支持多模态——文本和图片输入同一个 model ID 搞定。推理始终开启,不能关闭,但暴露了 reasoning_effort 参数来调节推理深度。
价格对比
三款模型在同一价位带竞争,但细节差异在规模化时会体现。
DeepSeek V4.1 Flash
DeepSeek 采用高峰/低峰定价。高峰时段为工作日 UTC 01:00–04:00 和 06:00–10:00(不含中国法定假日),其余时间均为低峰,包括整个周末。
| 时段 | 输入(未命中缓存) | 输入(命中缓存) | 输出 |
|---|---|---|---|
| 低峰 | $0.15 / 百万 | $0.003 / 百万 | $0.60 / 百万 |
| 高峰 | $0.30 / 百万 | $0.006 / 百万 | $1.20 / 百万 |
亮点是缓存命中价:$0.003 / 百万 Token,重复上下文块几乎不花钱。
Qwen3.8 Flash
DashScope 对 Qwen3.8 Flash 采用统一费率:
| 组件 | 价格 |
|---|---|
| 输入 | $0.162 / 百万 Token |
| 输出 | $0.508 / 百万 Token |
DashScope 还支持上下文缓存(显式和隐式),缓存命中价格约为标准输入的 10%。
GLM-5.3 Flash
Z.AI 通过 BigModel 的官方定价:
| 组件 | 价格 |
|---|---|
| 输入 | $0.162 / 百万 Token |
| 输出 | $0.54 / 百万 Token |
| 缓存命中 | $0.03 / 百万 Token |
通过 OpenRouter 调用 GLM-5.3 Flash,价格约为 $0.075 / 百万输入、$0.25 / 百万输出——大约是直连价格的一半。
典型负载成本对比
假设每天处理 1000 万输入 Token 和 200 万输出 Token(低峰费率):
| 模型 | 每日输入成本 | 每日输出成本 | 每日总计 |
|---|---|---|---|
| DeepSeek V4.1 Flash | $1.50 | $1.20 | $2.70 |
| Qwen3.8 Flash | $1.62 | $1.02 | $2.64 |
| GLM-5.3 Flash | $1.62 | $1.08 | $2.70 |
在这个量级,三者成本几乎一样。差异在边际:DeepSeek 的缓存命中价最低(适合前缀重复率高的场景),Qwen3.8 Flash 输出单价最便宜,DeepSeek 高峰时段价格翻倍(北京工作时间的负载要留意)。
视觉与多模态能力
这一项是三款模型分化最明显的地方。
DeepSeek V4.1 Flash:V4.1 更新新增原生视觉支持,可以在 content 数组里混合传入图片 URL 或 base64 编码的图片和文本。
Qwen3.8 Flash:纯文本。如果需要多模态输入,需要切换到 Qwen3.8 VL Flash 变体或 Qwen3.8 Max。意味着混合负载需要在路由配置里多管一个 model ID。
GLM-5.3 Flash:发布时即支持多模态,用标准 OpenAI 消息格式传入 image_url 内容块即可,不需要单独的视觉变体。
结论:如果你的管线同时处理文本和图片输入,DeepSeek V4.1 Flash 和 GLM-5.3 Flash 省去了管理第二个 model ID 的麻烦。Qwen3.8 Flash 需要把视觉请求路由到另一个模型。
编程质量
三款模型都瞄准了编程辅助场景,但基准测试表现有差异。
DeepSeek V4.1 Flash 延续了 V4 系列强劲的编程实力。V4 Flash 在 HumanEval 和 SWE-bench 上表现出色,V4.1 Flash 在此基础上加了视觉能力。
Qwen3.8 Flash 定位偏通用工作马,编程专长放在了 Coder 变体(qwen3-coder、qwen3-coder-plus)上。Flash 能写代码、能解释代码,但不是 3.8 系列的编程旗舰。
GLM-5.3 Flash 受益于 Z.AI 在编程基准上的大力投入。完整版 GLM-5.3 在发布时登顶 SWE-bench Pro,Flash 版本在 Flash 价位保留了大部分能力。社区反馈称其在实际编程任务上可比 Claude Opus 4.8,但成本只有后者的约 5%。
结论:纯编程负载选 GLM-5.3 Flash 或 DeepSeek V4.1 Flash。Qwen3.8 Flash 能用,但编程不是它在自家产品线中的长板。
上下文窗口与 KV Cache 效率
三款模型都标称百万 Token 上下文,但实现细节不同。
DeepSeek V4.1 Flash 声称 KV Cache 效率最高:HBM 占用仅同等稠密模型的 1/4、SSD 仅 1/8。对于自部署(MIT 开源),这意味着更少的 GPU 就能跑长上下文负载。384K Token 的最大输出也是三者中最高的。
Qwen3.8 Flash 和 GLM-5.3 Flash 输出上限均为 131K Token。大多数生产场景够用,但如果需要生成超长输出(大型代码文件、完整文档翻译),DeepSeek 的 384K 上限多出不少余量。
选型矩阵
选 DeepSeek V4.1 Flash,如果你:
- 需要最高的最大输出长度(384K Token)
- 有大量前缀重复,想要 $0.003 / 百万的缓存命中价
- 负载主要跑在低峰时段(周末、UTC 晚间)
- 想要 MIT 协议的开源权重做自部署,KV Cache 开销最小
- 需要在同一个 model ID 里处理视觉 + 文本
选 Qwen3.8 Flash,如果你:
- 已经在用 DashScope,想集中在一个账单里
- 负载纯文本(不需要视觉)
- 想要最低的输出 Token 单价($0.508 / 百万)
- 需要接入更广的 Qwen 生态(VL、Coder、Max 变体)
- 偏好无高峰/低峰波动的统一定价
选 GLM-5.3 Flash,如果你:
- 想要原生视觉 + 文本 + 推理力度控制集于一身
- 编程质量是 Flash 级的首要考量
- 偏好始终开启推理,不需要手动管理思维模式
- 想通过 OpenRouter 以 $0.075/$0.25 / 百万的价格调用——约为直连价格的一半
- 看重开源权重 + 强基准表现
TheRouter 配置:Flash 层路由
你可以把三款 Flash 模型配成一个成本优化路由组。根据输入模态、成本目标或供应商偏好做路由:
from openai import OpenAI
# 指向你的 TheRouter 实例
client = OpenAI(
api_key="YOUR_THEROUTER_KEY",
base_url="https://api.therouter.ai/v1",
)
# TheRouter 路由到最便宜的可用 Flash 模型
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash", # 或 qwen/qwen3.8-flash, zai/glm-5.3-flash
messages=[
{"role": "user", "content": "用三句话解释 CAP 定理。"}
],
)
print(response.choices[0].message.content)
视觉负载可以在 DeepSeek V4.1 Flash 和 GLM-5.3 Flash 之间配 fallback——两者都原生接受图片输入。当一个供应商出现延迟峰值或宕机时,请求自动路由到另一个。
常见问题
Q:这些模型真的和更贵的旗舰模型一样好吗? 不是。Flash 级模型用一部分推理深度换取速度和成本。需要前沿推理能力(复杂多步数学、新颖研究)时,用 Pro/Max 级别。Flash 模型擅长批量处理、编程辅助、文档提取和对延迟敏感的场景。
Q:在这些模型之间切换需要改代码吗?
不需要。三者都暴露 OpenAI 兼容 API。改 base_url 和 model 参数就行。如果通过 TheRouter 路由,在路由层切换即可,不碰应用代码。
Q:哪个模型吞吐量最高? 吞吐量随供应商负载和时间段变化。DeepSeek V4.1 Flash 低峰时段通常表现强劲。GLM-5.3 Flash 的线性注意力机制在长上下文推理时效率高。Qwen3.8 Flash 的吞吐取决于 DashScope 的基础设施负载。建议用你自己的实际负载做基准测试,不要依赖厂商报告的数字。
Q:这些模型支持 Anthropic API 格式吗?
DeepSeek V4.1 Flash 原生支持 Anthropic 消息格式,端点为 https://api.deepseek.com/anthropic。Qwen3.8 Flash 和 GLM-5.3 Flash 通过各自供应商仅支持 OpenAI 格式。
Q:可以自部署吗? 三者均已发布开源权重。DeepSeek V4.1 Flash 使用 MIT 协议,商业自部署最为宽松。具体使用请查看各模型的许可条款。
定价和规格于 2026 年 9 月 23 日核实。模型能力和定价可能变动——请查看官方供应商文档获取最新信息。