GLM-5.3-Flash vs GLM-5.3:API 路由中速度和成本何时胜过原始性能
GLM-5.3-Flash 采用 320B MoE 架构,每个 token 仅激活 18B 参数,定价 $0.15/$0.50 每百万 token,比 GLM-5.3 的 $1.40/$4.40 便宜近 10 倍。本文对比两款模型的架构、性能、定价,帮你决定何时路由到哪个模型。
2026 年 8 月 26 日,GLM-5.3-Flash 正式发布,结束了它以 "Ox Alpha" 身份在 OpenRouter 上匿名运行六天的经历。这是一个 320B 参数的混合专家模型,每次前向传播只激活 18B 参数,原生支持多模态输入(文本、图片、视频),定价大约是 GLM-5.3 的十分之一。两个模型都来自智谱 AI(Z.ai),共享 1M token 上下文窗口和 128K 最大输出,并且都暴露 OpenAI 兼容的聊天补全接口。
路由选择的逻辑很直接。GLM-5.3 是旗舰编程和网络安全模型,专为长周期 Agent 任务优化。GLM-5.3-Flash 是高效替代方案,基于混合稀疏加线性注意力架构,注意力计算量降低 3 倍,KV 缓存缩小 4.4 倍。对于运行 API 路由的团队,决策取决于工作负载形态、token 预算,以及性能差距是否对你的任务真正有影响。
提示 GLM-5.3-Flash 和 GLM-5.3 目前均未列入 TheRouter 的模型目录。GLM-5.3 已于 8 月 17 日上架百炼(DashScope),模型 ID 为
ZHIPU/GLM-5.3。GLM-5.3-Flash 目前可通过 Z.ai API 和 OpenRouter 访问。当前路由可用性请查看 Zhipu 供应商页面。
一览表
| 属性 | GLM-5.3-Flash | GLM-5.3 |
|---|---|---|
| 架构 | 320B MoE,18B 激活 | 753B 稠密(估算) |
| 注意力机制 | 混合稀疏 + 线性 | 标准 |
| 上下文窗口 | 1M tokens | 1M tokens |
| 最大输出 | 128K tokens | 128K tokens |
| 输入模态 | 文本、图片、视频 | 文本 |
| 输入价格(每百万 token) | $0.15(促销 $0.075) | $1.40 |
| 输出价格(每百万 token) | $0.50(促销 $0.25) | $4.40 |
| 缓存输入价格 | $0.03(促销 $0.015) | $0.26 |
| 许可证 | MIT,开放权重 | 开放权重(待发布) |
| 推理努力级别 | Low / High / Max | Low / High / Max |
| 工具调用 | 支持 | 支持 |
| 百炼可用性 | 暂未上架 | ZHIPU/GLM-5.3 |
OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。
架构差异:稠密旗舰与稀疏 MoE
GLM-5.3 是稠密模型(根据智谱发表的架构论文估算约 753B 参数),为复杂软件工程、终端操作和网络安全任务构建。它在 GLM-5.2 的基础上扩展了后训练流程,引入更多样化的长周期任务和额外的强化学习计算。
GLM-5.3-Flash 走了一条完全不同的路线。它是 GLM-5 系列中第一个采用混合专家架构的模型,320B 总参数但每次前向传播只激活 18B。智谱将其与混合稀疏加线性注意力机制结合,自称这是第一个同时使用两种技术的开源前沿模型。实际效果是,相同上下文长度下,注意力计算减少 3.01 倍,KV 缓存缩小 4.44 倍。
在 1M token 的上下文长度下,KV 缓存是最大的显存开销。4.4 倍的缩减意味着 Flash 在长上下文工作负载上所需的硬件显著更少,这正是价格差异的来源。
另一个架构差异在于模态。GLM-5.3-Flash 原生支持多模态输入,接受文本、图片和视频。视觉能力直接嵌入编程回路,模型可以观察渲染后的界面并据此迭代。GLM-5.3 只接受文本输入。
性能对比
以下所有数据来自智谱发布的模型卡片,是厂商自报数据,未经独立验证。
| 评测 | GLM-5.3-Flash | GLM-5.3 | GLM-5.2 |
|---|---|---|---|
| Terminal-Bench 2.1 | 84.3 | — | 81.0 |
| DeepSWE v1.1 | 63.4 | 66.9 | 46.2 |
| Agents' Last Exam | 26.3 | — | 20.4 |
| AutomationBench | 48.8 | 48.2 | 26.2 |
| HLE w/ Tools | 55.3 | — | 54.7 |
| GDPval-AA v2 (Elo) | 1773 | — | 1504 |
数据里有个值得注意的现象。在多项评测中,GLM-5.3-Flash 以少得多的计算量匹配甚至超过了 GLM-5.3。AutomationBench 上 Flash 拿到 48.8,GLM-5.3 是 48.2。旗舰模型的明确优势在 DeepSWE v1.1 上体现得最清楚,66.9 对 63.4。
Ox Alpha 匿名运行期间的独立数据提供了额外参考。社区在 113 个任务上运行 DeepSWE,单次尝试解决率 58.4%。和智谱官方 63.4 的差距来自测试框架配置,智谱使用 mini-swe-agent 框架,6 小时超时和 400K 上下文,比社区测试更宽松。
匿名运行期间用户反馈有一个一致的规律。在真实 Agent 框架中配合工具和终端使用的人,评价远高于直接对话聊天的人。
定价对比
价格差异是最核心的路由信号。
| 渠道 | Flash 输入 | Flash 输出 | GLM-5.3 输入 | GLM-5.3 输出 |
|---|---|---|---|---|
| Z.ai API(原价) | $0.15 | $0.50 | $1.40 | $4.40 |
| Z.ai API(促销,截至 9 月 9 日) | $0.075 | $0.25 | $1.40 | $4.40 |
| OpenRouter | $0.075 | $0.25 | $1.40 | $4.40 |
| 百炼(DashScope) | 暂未上架 | 暂未上架 | 已上架 | 已上架 |
按原价计算,GLM-5.3-Flash 的输入 token 成本是 GLM-5.3 的 10.7%,输出 token 成本是 11.4%。促销期间(截至 2026 年 9 月 9 日),差距进一步拉大,Flash 输入只有 GLM-5.3 的 5.4%。
一个典型的 100K token Agent 任务(50K 输入,50K 输出)成本对比如下。
| 模型 | 输入成本 | 输出成本 | 合计 |
|---|---|---|---|
| GLM-5.3 | $0.070 | $0.220 | $0.290 |
| GLM-5.3-Flash(原价) | $0.0075 | $0.025 | $0.0325 |
| GLM-5.3-Flash(促销) | $0.00375 | $0.0125 | $0.01625 |
原价下成本降低 8.9 倍,促销期间降低 17.8 倍。在规模化运行时,这些数字直接决定一个工作负载是否经济可行。
缓存输入定价也遵循同样的模式。GLM-5.3-Flash 缓存输入 $0.03/M(促销 $0.015)对比 GLM-5.3 的 $0.26/M,大系统提示或重复文档分析这类缓存密集型工作负载受益更大。
路由决策框架
Flash 和标准版之间的路由决策不只是质量问题,而是成本、质量和模态三者的权衡。
选择 GLM-5.3 的场景
- 编程准确性高于一切。 GLM-5.3 在 DeepSWE v1.1 上得分 66.9,Flash 是 63.4。对于生产代码库,3 分的任务完成率差距会直接影响结果的场景,旗舰模型值得 10 倍的溢价。
- 已经在百炼上运行。 GLM-5.3 以
ZHIPU/GLM-5.3的 ID 上架了阿里云百炼。Flash 还没有上架。如果你的基础设施通过百炼路由,GLM-5.3 目前是 5.3 系列的唯一选项。 - 网络安全工作负载需要最高性能。 智谱明确定位 GLM-5.3 用于漏洞发现和白盒代码审计。后训练包含了专门的网络安全任务环境。
选择 GLM-5.3-Flash 的场景
- 规模化运行下成本敏感。 每个 100K token 任务 $0.0325 对比 $0.29,Flash 让高并发 Agent 工作负载便宜 8.9 倍。批量处理、自动化测试或持续代码审查,这个差距决定了工作流是否可行。
- 需要多模态输入。 Flash 接受图片和视频以及文本。如果工作流涉及 UI 截图、渲染输出或视觉验证,它是 GLM-5.3 系列中唯一的选择。
- 想要今天就拿到开放权重。 Flash 权重以 MIT 许可发布在 Hugging Face 上,首日即支持 SGLang、vLLM、TokenSpeed 和 KTransformers。GLM-5.3 的开源权重仍在安全审查中。
- Agent 工作流只需要 "够好" 的质量。 AutomationBench 上 Flash 实际上略超旗舰(48.8 对 48.2)。对于自动化和工具调用密集型 Agent 工作流,效率模型没有任何损失。
按质量成本分层同时路由两个模型
对于运行模型路由的团队,最实用的模式是按工作负载层级路由。
from openai import OpenAI
# Z.ai API 端点
client = OpenAI(
api_key="your-zai-api-key",
base_url="https://api.z.ai/v1",
)
def route_glm(task_type: str, budget_sensitive: bool = True):
"""根据工作负载在 GLM-5.3 和 GLM-5.3-Flash 之间路由。"""
if task_type in ("security_audit", "complex_refactor") and not budget_sensitive:
return "glm-5.3"
return "glm-5.3-flash"
# Flash 用于高并发任务
response = client.chat.completions.create(
model=route_glm("code_review"),
messages=[{"role": "user", "content": "审查这个 PR..."}],
)
# 标准版用于关键安全工作
response = client.chat.completions.create(
model=route_glm("security_audit", budget_sensitive=False),
messages=[{"role": "user", "content": "审计这个代码库的漏洞..."}],
)
这种模式让你默认使用 Flash 处理绝大多数请求,只在任务需要最高编程准确性且成本是次要考虑时升级到 GLM-5.3。
上下文窗口和长文档处理
两个模型都支持 1M token 上下文窗口和 128K 最大输出,所以上下文长度本身不构成差异。真正的区别在于显存效率。
GLM-5.3-Flash 的混合注意力架构在相同上下文长度下将 KV 缓存缩小 4.44 倍。实际意义是,Flash 在显著更少的 GPU 显存上就能处理 1M token 的上下文,这也是自部署场景强烈倾向 Flash 的原因。
Ox Alpha 匿名运行期间,needle-retrieval 测试在大约 934K token 处保持有效,确认百万 token 窗口是真正可用的,不只是参数页面上的标注。
对于 API 消费者,显存优势直接转化为更低的供应商成本(也就是 10 倍的价格差距),以及在超长上下文下可能更快的首 token 响应时间。
可用性和集成
| 平台 | GLM-5.3-Flash | GLM-5.3 |
|---|---|---|
| Z.ai API | 已上线 | 已上线 |
| OpenRouter | z-ai/glm-5.3-flash | z-ai/glm-5.3 |
| 百炼(DashScope) | 暂未上架 | ZHIPU/GLM-5.3(8 月 17 日) |
| Hugging Face(自部署) | MIT,zai-org/GLM-5.3-Flash | 待发布 |
| 推理框架 | SGLang、vLLM、TokenSpeed、KTransformers | SGLang、vLLM |
两个模型都暴露标准的 OpenAI 兼容聊天补全接口。如果你的应用已经在调用 GLM-5.2 或任何 OpenAI 格式 API,切换到任一 5.3 变体只需要改模型 ID,如果直接使用 Z.ai 的 Flash 还需要验证 API 密钥。
Flash 的促销价格($0.075/$0.25)持续到 2026 年 9 月 9 日午夜(北京时间)。之后恢复原价 $0.15/$0.50。OpenRouter 当前的价格和促销价完全一致。
跨供应商参考:Flash 层级对比
GLM-5.3-Flash 加入了中国模型供应商 Flash/轻量级层级的阵营。以下是它在更广泛格局中的位置。
| 模型 | 供应商 | 输入(每百万) | 输出(每百万) | 激活参数 | 上下文 |
|---|---|---|---|---|---|
| GLM-5.3-Flash | Z.ai | $0.15(促销 $0.075) | $0.50(促销 $0.25) | 18B | 1M |
| DeepSeek V4 Flash | DeepSeek | $0.10 | $0.30 | 13B | 1M |
| Qwen3.7-Flash | 百炼 | 免费(有限) | 免费(有限) | — | 1M |
| GLM-4.7-Flash | Z.ai | 免费 | 免费 | — | 200K |
GLM-5.3-Flash 的价格高于 DeepSeek V4 Flash,但提供多模态输入和更大的激活参数量。Qwen3.7-Flash 和 GLM-4.7-Flash 是免费层级模型,能力特征有所不同。
对于管理多供应商配置的路由运营者来说,Flash 层级是大部分生产流量的归宿。GLM-5.3-Flash 的加入扩展了可用于成本敏感路由的高效模型集合。
常见问题
GLM-5.3-Flash 真的比 GLM-5.3 便宜 10 倍? 按原价是的。输入 token $0.15/M 对比 $1.40/M(GLM-5.3 的 10.7%),输出 token $0.50/M 对比 $4.40/M(11.4%)。促销期间(截至 2026 年 9 月 9 日)差距约 20 倍。
可以自部署 GLM-5.3-Flash 吗?
可以。权重以 MIT 许可发布在 Hugging Face(zai-org/GLM-5.3-Flash),首日支持 SGLang、vLLM、TokenSpeed 和 KTransformers。它是 320B 参数的 MoE 模型,需要数据中心级硬件。
GLM-5.3-Flash 支持工具调用吗? 支持。GLM-5.3-Flash 和 GLM-5.3 都通过标准 OpenAI 兼容的函数调用接口支持工具调用和结构化输出。
免费的 Ox Alpha 定价去哪了?
匿名免费窗口在 8 月 26 日揭晓身份时结束。stealth/ox-alpha 的 slug 已从 OpenRouter 移除。基于免费端点构建的应用现在需要使用新模型 ID(z-ai/glm-5.3-flash)并准备好预算。
GLM-5.3-Flash 上架百炼了吗?
截至 2026 年 8 月 27 日尚未上架。GLM-5.3(标准版)自 8 月 17 日以 ZHIPU/GLM-5.3 上架百炼。Flash 在百炼的上架时间尚未公布。
引用来源
- Z.ai 定价页面 https://docs.z.ai/guides/overview/pricing(检索于 2026-08-27)
- Z.ai GLM-5.3 发布博客 https://z.ai/blog/glm-5.3(检索于 2026-08-27)
- BigModel 模型概览 https://docs.bigmodel.cn/cn/guide/start/model-overview(检索于 2026-08-27)
- CellCog GLM-5.3-Flash 分析 https://cellcog.ai/blog/glm-5-3-flash/(检索于 2026-08-27)
- OpenRouter GLM-5.3-Flash 列表 https://openrouter.ai/z-ai/glm-5.3-flash(检索于 2026-08-27)
- Hugging Face GLM-5.3-Flash 权重 https://huggingface.co/zai-org/GLM-5.3-Flash(检索于 2026-08-27)
- 百炼模型上下架 https://help.aliyun.com/zh/model-studio/newly-released-models(检索于 2026-08-27)