GLM-5.3: Zhipu's Open-Source Flagship with 1M Context — API Integration and Routing Guide
TheRouter 的 GLM-5.3 代路由指南涵盖基准背景、从 GLM-5.2 的迁移、与 Z.AI 和 DashScope 的 API 集成,以及如何在多模型策略中定位 GLM-5.3 和 Flash。
Z.AI GLM-5.3-Flash — the cost tier of the 5.3 generation. Documented by the vendor under its VLM section: text parameters match GLM-5.3 and it additionally accepts image_url content blocks, so it is multimodal on input. Reasoning is always on.
GLM-5.3-Flash 是 Z.AI 第 5.3 代的低成本档。它与 GLM-5.3 旗舰共享 1M token 上下文和始终开启的推理,并额外支持 image_url 输入——使其成为 GLM-5.x 系列中首个同时接受视觉与文本的模型——而 token 成本约为 GLM-5.3 的九分之一。厂商将其记录在 VLM 节而非独立页面中,其文本参数据称与 GLM-5.3 完全一致。
Flash 与旗舰之间的路由判断取决于三个因素:图像输入、token 成本和延迟。当请求包含图像时,GLM-5.3-Flash 是正确的路由选择——它是 GLM-5.3 代唯一支持 image_url 内容块的文本生成模型。对于纯文本任务,当不需要旗舰的峰值代码性能时,它是预算选项。在 TheRouter 上,输入 $0.162/M、输出 $0.54/M,GLM-5.3-Flash 是目录中性价比较高的 1M 上下文多模态模型之一。
与 GLM-5.3 一样,Flash 变体要求推理始终开启。thinking.type: "disabled" 路径已被移除;此前关闭 thinking 的应用必须先切换到 reasoning_effort: "low",再调用这两个模型中的任一个。三个努力级别——low、high、max——在两条路由上均可用,TheRouter 在 supported_parameters 列表中暴露 reasoning_effort,可直接透传。
reasoning_effort: "low" 配合 Flash 的更低价格,在相同努力级别下提供比 GLM-5.3 旗舰更便宜、更快的路径thinking.type: "disabled" 的调用方——GLM-5.3-Flash 与 GLM-5.3 一样无法关闭推理;始终为推理 token 预留预算,并使用 reasoning_effort: "low" 降低开销Z.AI 在 VLM 节中将 GLM-5.3-Flash 的文本参数描述为与 GLM-5.3 一致,并额外支持 image_url 输入。上下文为 1M token,推理始终开启(努力级别:low/high/max)。未提取到单独的 Flash 价格页面。
TheRouter 通过 OpenAI Chat Completion 接口暴露 zai/glm-5.3-flash,具备 1M 上下文、131,072 最大完成 token、文本+图像输入、文本输出、tools、tool_choice、response_format 和 reasoning_effort。定价为输入 $0.162/M、输出 $0.54/M。
| 类型 | 费率 |
|---|---|
| 输入 | $0.162 每百万 Tokens |
| 输出 | $0.540 每百万 Tokens |
| 上下文窗口 | 100 万 tokendocs.z.ai ↗ | 已核实 |
| 最大输出 token 数 | TheRouter 当前路由为 131,072 tokentherouter.ai ↗ | 已核实 |
| 模态 | 文本 + 图像输入,文本输出(支持视觉)docs.z.ai ↗ | 已核实 |
| 图像输入 | 支持 image_url 内容块;记录在 Z.AI VLM 节中docs.z.ai ↗ | 已核实 |
| 推理 | 始终开启;thinking.type 固定为 enabled。三个努力级别:low(轻量)、high(增强)、max(深度,默认值)。不支持关闭。docs.z.ai ↗ | 已核实 |
| TheRouter 定价 | 输入 $0.162/M token;输出 $0.54/M tokentherouter.ai ↗ | 已核实 |
| 与 GLM-5.3 旗舰的成本对比 | 输入约便宜 8.6 倍,输出约便宜 8.1 倍therouter.ai ↗ | 已核实 |
| API 能力 | 函数调用、流式输出、结构化输出、推理努力控制、image_url 视觉输入docs.z.ai ↗ | 已核实 |
| 代系 | GLM-5.3 代;文本参数与 GLM-5.3 旗舰一致;记录在 VLM 节docs.z.ai ↗ | 已核实 |
| 训练数据截止 | 未公开披露 | 未知 |
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
DeepSWE v1.1 (GLM-5.3 flagship, generation reference) Z.AI 模型页面上 GLM-5.3 旗舰的厂商报告分数。尚未发布 Flash 的独立分数;本行仅供代系背景参考,不应视为 Flash 分数。 | 66.9 | docs.z.ai ↗ | |
Z.ai Code Bench Max (GLM-5.3 flagship, generation reference) Z.AI 文档中 GLM-5.3 旗舰的厂商报告分数,较 GLM-5.2 提升 50%。尚未发布 Flash 的独立分数。 | 34.5%% | docs.z.ai ↗ | |
CyberGym vulnerability discovery (GLM-5.3 flagship, generation reference) Z.AI 文档中 GLM-5.3 旗舰在漏洞发现任务上的厂商报告分数。仅供代系背景参考,尚未发布 Flash 的独立分数。 | 84.5%% | docs.z.ai ↗ |
所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。
curl https://api.therouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -d '{
"model": "zai/glm-5.3-flash",
"messages": [
{"role": "user", "content": "Summarize the key points from this input."}
]
}'GLM-5.3-Flash 接受与文本并列的 image_url 内容块。可在用户消息 content 数组中以 URL 或 base64 data URI 形式传递图像。
curl https://api.therouter.ai/v1/chat/completions \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "zai/glm-5.3-flash",
"reasoning_effort": "low",
"messages": [
{
"role": "user",
"content": [
{"type": "image_url", "image_url": {"url": "https://example.com/diagram.png"}},
{"type": "text", "text": "Describe the architecture shown in this diagram."}
]
}
],
"max_tokens": 800
}'TheRouter 的 GLM-5.3 代路由指南涵盖基准背景、从 GLM-5.2 的迁移、与 Z.AI 和 DashScope 的 API 集成,以及如何在多模型策略中定位 GLM-5.3 和 Flash。
GLM-5.3-Flash 增加了 image_url 视觉输入——使其成为多模态输入模型——每 token 成本约比 GLM-5.3 旗舰低 8-9 倍。文本参数和 1M 上下文据称与旗舰相同。旗舰为纯文本,拥有更高的代码基准分数;Flash 是同代中的预算版和支持视觉的路由。
不可以。与 GLM-5.3 一样,Flash 变体要求推理始终开启。thinking.type: "disabled" 参数已被移除。如果你此前关闭了 thinking,请在更新模型 ID 前切换到 reasoning_effort: "low"——这是可用的最低开销推理模式。
该路由已在 TheRouter 目录中激活并上线,因此技术上可用于生产。但目前尚未发布 GLM-5.3-Flash 视觉能力的独立基准数据。大规模管道落地前,请在代表性输入上验证图像理解质量。
两者都是支持 image_url 输入的大上下文、低成本多模态 Flash 档模型。GLM-5.3-Flash 以输入 $0.162/M、输出 $0.54/M 的价格具有竞争力。关键差异在于始终开启的推理及可选努力级别,这是 Gemini Flash 没有以同样方式暴露的功能。选择时应综合考虑生态系统适配性、你任务类型的独立视觉基准,以及推理开销是否可接受为延迟权衡。
| 来源 | URL | 采集于 | |
|---|---|---|---|
| 上下文窗口 | docs.z.ai ↗ | 2026-09-18 | 已核实 |
| 最大输出 token 数 | therouter.ai ↗ | 2026-09-18 | 已核实 |
| 模态 | docs.z.ai ↗ | 2026-09-18 | 已核实 |
| 图像输入 | docs.z.ai ↗ | 2026-09-18 | 已核实 |
| 推理 | docs.z.ai ↗ | 2026-09-18 | 已核实 |
| TheRouter 定价 | therouter.ai ↗ | 2026-09-18 | 已核实 |
| 与 GLM-5.3 旗舰的成本对比 | therouter.ai ↗ | 2026-09-18 | 已核实 |
| API 能力 | docs.z.ai ↗ | 2026-09-18 | 已核实 |
| 代系 | docs.z.ai ↗ | 2026-09-18 | 已核实 |
| 训练数据截止 | — | — | 未知 |
| DeepSWE v1.1 (GLM-5.3 flagship, generation reference) | docs.z.ai ↗ | 2026-09-18 | 已核实 |
| Z.ai Code Bench Max (GLM-5.3 flagship, generation reference) | docs.z.ai ↗ | 2026-09-18 | 已核实 |
| CyberGym vulnerability discovery (GLM-5.3 flagship, generation reference) | docs.z.ai ↗ | 2026-09-18 | 已核实 |
| GLM-5.3: Zhipu's Open-Source Flagship with 1M Context — API Integration and Routing Guide | TheRouter Blog ↗ | 2026-09-18 | 已核实 |
| GLM-5.3-Flash 与 GLM-5.3 有什么不同? | docs.z.ai ↗ | 2026-09-18 | 待核实 |
| GLM-5.3-Flash 可以关闭推理吗? | docs.z.ai ↗ | 2026-09-18 | 待核实 |
| GLM-5.3-Flash 适合用于生产视觉管道吗? | therouter.ai ↗ | 2026-09-18 | 待核实 |
| GLM-5.3-Flash 与 Google Gemini Flash 在多模态任务上如何比较? | therouter.ai ↗ | 2026-09-18 | 待核实 |