返回模型列表

GLM-5.3-Flash

zaizai/glm-5.3-flash

Z.AI GLM-5.3-Flash — the cost tier of the 5.3 generation. Documented by the vendor under its VLM section: text parameters match GLM-5.3 and it additionally accepts image_url content blocks, so it is multimodal on input. Reasoning is always on.

GLM-5.3-Flash 是 Z.AI 第 5.3 代的低成本档。它与 GLM-5.3 旗舰共享 1M token 上下文和始终开启的推理,并额外支持 image_url 输入——使其成为 GLM-5.x 系列中首个同时接受视觉与文本的模型——而 token 成本约为 GLM-5.3 的九分之一。厂商将其记录在 VLM 节而非独立页面中,其文本参数据称与 GLM-5.3 完全一致。

Flash 与旗舰之间的路由判断取决于三个因素:图像输入、token 成本和延迟。当请求包含图像时,GLM-5.3-Flash 是正确的路由选择——它是 GLM-5.3 代唯一支持 image_url 内容块的文本生成模型。对于纯文本任务,当不需要旗舰的峰值代码性能时,它是预算选项。在 TheRouter 上,输入 $0.162/M、输出 $0.54/M,GLM-5.3-Flash 是目录中性价比较高的 1M 上下文多模态模型之一。

与 GLM-5.3 一样,Flash 变体要求推理始终开启。thinking.type: "disabled" 路径已被移除;此前关闭 thinking 的应用必须先切换到 reasoning_effort: "low",再调用这两个模型中的任一个。三个努力级别——low、high、max——在两条路由上均可用,TheRouter 在 supported_parameters 列表中暴露 reasoning_effort,可直接透传。

适合使用
  • GLM-5.3 代中需要视觉感知的工作流:文档截图、图表理解、含图像上下文的编程、UI 转代码等需要 image_url 块的任务,而 GLM-5.3 纯文本路由无法满足
  • 高并发文本任务,GLM-5.3-Flash 约 9 倍的 token 成本优势是决定因素——批量摘要、分类、提取,以及不需要旗舰顶级代码基准分数的轻量 Agent 循环
  • 延迟敏感的推理任务,reasoning_effort: "low" 配合 Flash 的更低价格,在相同努力级别下提供比 GLM-5.3 旗舰更便宜、更快的路径
  • 在单个 1M 上下文窗口中结合图像解析与文本推理的多模态 Agent 管道——Flash 路由可避免对中等复杂视觉输入进行单独的视觉模型跳转
不适合使用
  • 需要最高代码或 Agentic 基准性能时——GLM-5.3 旗舰在 Terminal Bench 3.0、DeepSWE 和 CyberGym 上的后训练优势不保证在 Flash 上同样体现;高风险工程任务应使用旗舰
  • 需要 thinking.type: "disabled" 的调用方——GLM-5.3-Flash 与 GLM-5.3 一样无法关闭推理;始终为推理 token 预留预算,并使用 reasoning_effort: "low" 降低开销
  • 对图像质量要求严苛的生产视觉管道——目前没有 Flash 视觉路径的独立基准数据;大规模落地前应在代表性输入上验证图像理解质量

供应商自营与 TheRouter 服务形态的差异

供应商自己运营时

Z.AI 在 VLM 节中将 GLM-5.3-Flash 的文本参数描述为与 GLM-5.3 一致,并额外支持 image_url 输入。上下文为 1M token,推理始终开启(努力级别:low/high/max)。未提取到单独的 Flash 价格页面。

在 TheRouter 上

TheRouter 通过 OpenAI Chat Completion 接口暴露 zai/glm-5.3-flash,具备 1M 上下文、131,072 最大完成 token、文本+图像输入、文本输出、tools、tool_choice、response_format 和 reasoning_effort。定价为输入 $0.162/M、输出 $0.54/M。

上下文长度
1M
最大输出
131K
输入价格每百万 tokens
$0.162每百万 Tokens
输出价格每百万 tokens
$0.540每百万 Tokens

模态能力

文本图像文本

能力

视觉理解

价格明细

类型费率
输入$0.162 每百万 Tokens
输出$0.540 每百万 Tokens

支持参数

temperaturemax_tokenstop_ptoolstool_choiceresponse_formatstopreasoning_effort

模型规格

上下文窗口100 万 tokendocs.z.ai已核实
最大输出 token 数TheRouter 当前路由为 131,072 tokentherouter.ai已核实
模态文本 + 图像输入,文本输出(支持视觉)docs.z.ai已核实
图像输入支持 image_url 内容块;记录在 Z.AI VLM 节中docs.z.ai已核实
推理始终开启;thinking.type 固定为 enabled。三个努力级别:low(轻量)、high(增强)、max(深度,默认值)。不支持关闭。docs.z.ai已核实
TheRouter 定价输入 $0.162/M token;输出 $0.54/M tokentherouter.ai已核实
与 GLM-5.3 旗舰的成本对比输入约便宜 8.6 倍,输出约便宜 8.1 倍therouter.ai已核实
API 能力函数调用、流式输出、结构化输出、推理努力控制、image_url 视觉输入docs.z.ai已核实
代系GLM-5.3 代;文本参数与 GLM-5.3 旗舰一致;记录在 VLM 节docs.z.ai已核实
训练数据截止未公开披露未知

基准成绩

BenchmarkDistributionScoreSource
DeepSWE v1.1 (GLM-5.3 flagship, generation reference)
Z.AI 模型页面上 GLM-5.3 旗舰的厂商报告分数。尚未发布 Flash 的独立分数;本行仅供代系背景参考,不应视为 Flash 分数。
66.9docs.z.ai
Z.ai Code Bench Max (GLM-5.3 flagship, generation reference)
Z.AI 文档中 GLM-5.3 旗舰的厂商报告分数,较 GLM-5.2 提升 50%。尚未发布 Flash 的独立分数。
34.5%%docs.z.ai
CyberGym vulnerability discovery (GLM-5.3 flagship, generation reference)
Z.AI 文档中 GLM-5.3 旗舰在漏洞发现任务上的厂商报告分数。仅供代系背景参考,尚未发布 Flash 的独立分数。
84.5%%docs.z.ai

API 使用示例

所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "zai/glm-5.3-flash",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

API 使用指南

完整 API 参考 →

视觉 + 文本 Chat

GLM-5.3-Flash 接受与文本并列的 image_url 内容块。可在用户消息 content 数组中以 URL 或 base64 data URI 形式传递图像。

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zai/glm-5.3-flash",
    "reasoning_effort": "low",
    "messages": [
      {
        "role": "user",
        "content": [
          {"type": "image_url", "image_url": {"url": "https://example.com/diagram.png"}},
          {"type": "text", "text": "Describe the architecture shown in this diagram."}
        ]
      }
    ],
    "max_tokens": 800
  }'

zai 其他模型

同类模型

跨供应商的相似能力档位

动态与变更

2026-08-19

GLM-5.3: Zhipu's Open-Source Flagship with 1M Context — API Integration and Routing Guide

TheRouter 的 GLM-5.3 代路由指南涵盖基准背景、从 GLM-5.2 的迁移、与 Z.AI 和 DashScope 的 API 集成,以及如何在多模型策略中定位 GLM-5.3 和 Flash。

TheRouter 编辑重写TheRouter Blog

常见问题

GLM-5.3-Flash 与 GLM-5.3 有什么不同?

GLM-5.3-Flash 增加了 image_url 视觉输入——使其成为多模态输入模型——每 token 成本约比 GLM-5.3 旗舰低 8-9 倍。文本参数和 1M 上下文据称与旗舰相同。旗舰为纯文本,拥有更高的代码基准分数;Flash 是同代中的预算版和支持视觉的路由。

GLM-5.3-Flash 可以关闭推理吗?

不可以。与 GLM-5.3 一样,Flash 变体要求推理始终开启。thinking.type: "disabled" 参数已被移除。如果你此前关闭了 thinking,请在更新模型 ID 前切换到 reasoning_effort: "low"——这是可用的最低开销推理模式。

GLM-5.3-Flash 适合用于生产视觉管道吗?

该路由已在 TheRouter 目录中激活并上线,因此技术上可用于生产。但目前尚未发布 GLM-5.3-Flash 视觉能力的独立基准数据。大规模管道落地前,请在代表性输入上验证图像理解质量。

GLM-5.3-Flash 与 Google Gemini Flash 在多模态任务上如何比较?

两者都是支持 image_url 输入的大上下文、低成本多模态 Flash 档模型。GLM-5.3-Flash 以输入 $0.162/M、输出 $0.54/M 的价格具有竞争力。关键差异在于始终开启的推理及可选努力级别,这是 Gemini Flash 没有以同样方式暴露的功能。选择时应综合考虑生态系统适配性、你任务类型的独立视觉基准,以及推理开销是否可接受为延迟权衡。

事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
上下文窗口docs.z.ai2026-09-18已核实
最大输出 token 数therouter.ai2026-09-18已核实
模态docs.z.ai2026-09-18已核实
图像输入docs.z.ai2026-09-18已核实
推理docs.z.ai2026-09-18已核实
TheRouter 定价therouter.ai2026-09-18已核实
与 GLM-5.3 旗舰的成本对比therouter.ai2026-09-18已核实
API 能力docs.z.ai2026-09-18已核实
代系docs.z.ai2026-09-18已核实
训练数据截止未知
DeepSWE v1.1 (GLM-5.3 flagship, generation reference)docs.z.ai2026-09-18已核实
Z.ai Code Bench Max (GLM-5.3 flagship, generation reference)docs.z.ai2026-09-18已核实
CyberGym vulnerability discovery (GLM-5.3 flagship, generation reference)docs.z.ai2026-09-18已核实
GLM-5.3: Zhipu's Open-Source Flagship with 1M Context — API Integration and Routing GuideTheRouter Blog2026-09-18已核实
GLM-5.3-Flash 与 GLM-5.3 有什么不同?docs.z.ai2026-09-18待核实
GLM-5.3-Flash 可以关闭推理吗?docs.z.ai2026-09-18待核实
GLM-5.3-Flash 适合用于生产视觉管道吗?therouter.ai2026-09-18待核实
GLM-5.3-Flash 与 Google Gemini Flash 在多模态任务上如何比较?therouter.ai2026-09-18待核实
客服支持