GLM-5.3-FlashX API 集成指南:200 Tokens/s 多模态速度,适配低延迟路由场景
GLM-5.3-FlashX 是 Z.ai GLM-5.3-Flash 的高速推理版本,最高可达 200 tokens/s,架构同为 320B MoE(18B 激活),1M 上下文窗口,原生多模态输入。本指南涵盖 API 接入、定价(Z.ai 上 $0.37/$1.25 每百万 token)、DashScope 可用性,以及如何在延迟敏感场景中路由 FlashX。
GLM-5.3-FlashX 是 Z.ai 为 GLM-5.3-Flash 推出的高速推理版本,2026 年 9 月 21 日上线 DashScope。它与 Flash 共享同一套 320B 参数的混合专家(MoE)架构,每个 token 激活 18B 参数,同样拥有 1M token 上下文窗口和原生多模态输入能力(文本、图片、视频、文件)。两者的区别在于推理速度。Z.ai 宣称 FlashX 最高可达 200 tokens/s,而 Artificial Analysis 测得 Flash 标准版大约在 50 tok/s 左右。
速度的代价是价格。FlashX 每 token 的费用大约是 Flash 的 2.5 倍。对于通过 API 网关进行路由的团队来说,需要判断速度提升能否在交互式编程代理、实时截图分析、多步 agent 循环等延迟敏感场景中带来足够的价值回报。
提示: GLM-5.3-FlashX 尚未纳入 TheRouter 模型目录。目前可通过 Z.ai 直连 API(
glm-5.3-flashx)、DashScope(ZHIPU/GLM-5.3-FlashX)和 OpenRouter(z-ai/glm-5.3-flashx)访问。请查看 Zhipu 供应商页面 了解最新路由状态。
速览表
| 规格 | GLM-5.3-FlashX | GLM-5.3-Flash |
|---|---|---|
| 架构 | 320B MoE,18B 激活 | 320B MoE,18B 激活 |
| 上下文窗口 | 1M tokens | 1M tokens |
| 最大输出 | 128K tokens | 128K tokens |
| 推理速度 | 最高 200 tok/s(官方数据) | ~50 tok/s(Artificial Analysis) |
| 输入模态 | 文本、图片、视频、文件 | 文本、图片、视频、文件 |
| Z.ai 输入价格 | $0.37 / 1M tokens | $0.15 / 1M tokens |
| Z.ai 输出价格 | $1.25 / 1M tokens | $0.50 / 1M tokens |
| Z.ai 缓存读取 | $0.075 / 1M tokens | $0.035 / 1M tokens |
| 推理模式 | 始终开启 | 始终开启 |
| DashScope 模型 ID | ZHIPU/GLM-5.3-FlashX | ZHIPU/GLM-5.3-Flash |
FlashX 是什么,不是什么
FlashX 与 GLM-5.3-Flash 使用相同的模型权重,区别在于推理基础设施做了吞吐优化。Z.ai 将它定位为 Flash 系列中的"速度优先"选项。两者共享混合稀疏+线性注意力架构,相比稠密版 GLM-5.3,注意力计算量降低 3 倍,KV 缓存减少 4.4 倍。
FlashX 并非独立训练的新模型。在相同 prompt 和参数下,输出质量与 Flash 基本一致。200 tok/s 是 Z.ai 公布的峰值数据,并非独立测试结果,实际吞吐取决于 prompt 长度、并发负载和输出长度。
API 接入方式
Z.ai 直连 API
Z.ai 平台提供 OpenAI 兼容接口。
from openai import OpenAI
client = OpenAI(
api_key="YOUR_ZAI_API_KEY",
base_url="https://api.z.ai/api/paas/v4",
)
response = client.chat.completions.create(
model="glm-5.3-flashx",
messages=[{"role": "user", "content": "解释稀疏注意力和线性注意力的区别。"}],
stream=True,
)
for chunk in response:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
DashScope(阿里云百炼)
FlashX 于 2026 年 9 月 21 日上线 DashScope,模型 ID 为 ZHIPU/GLM-5.3-FlashX。DashScope 提供 OpenAI 兼容接口,支持多区域部署。
from openai import OpenAI
import os
client = OpenAI(
api_key=os.getenv("DASHSCOPE_API_KEY"),
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="ZHIPU/GLM-5.3-FlashX",
messages=[{"role": "user", "content": "分析这张截图,描述页面布局。"}],
stream=True,
)
for chunk in response:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
DashScope 覆盖的区域包括华北 2(北京)、美国(弗吉尼亚)、德国(法兰克福)、新加坡和中国香港。每个模型提供 100 万 token 免费额度供初始测试。
OpenRouter
OpenRouter 以 z-ai/glm-5.3-flashx 模型 ID 提供 FlashX。
curl -X POST https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "z-ai/glm-5.3-flashx",
"messages": [{"role": "user", "content": "Hello!"}]
}'
定价对比
FlashX 每 token 费用约为 Flash 的 2.5 倍,这个溢价是否合理取决于具体的工作负载模式。
| 供应商 | 模型 | 输入 / 1M | 输出 / 1M | 缓存读取 / 1M |
|---|---|---|---|---|
| Z.ai | glm-5.3-flashx | $0.37 | $1.25 | $0.075 |
| Z.ai | glm-5.3-flash | $0.15 | $0.50 | $0.035 |
| DashScope | ZHIPU/GLM-5.3-FlashX | 按区域定价 | 按区域定价 | — |
| OpenRouter | z-ai/glm-5.3-flashx | $0.0352 | $0.50 | — |
以一个典型请求(1,000 token 输入 / 300 token 输出)为例。
- Flash 每次请求约 $0.00030
- FlashX 每次请求约 $0.00075
假设每天 10 万次请求,差额大约在 $45/天。关键问题在于 4 倍的推理加速能否在用户等待时间、超时错误减少、agent 循环效率提升等方面带来超过 $45/天的价值。
多模态输入
Flash 和 FlashX 共享相同的原生多模态能力。模型通过 OpenAI 兼容格式中的 image_url 内容块接收图片。
response = client.chat.completions.create(
model="glm-5.3-flashx",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "这张截图使用了什么 UI 框架?"},
{"type": "image_url", "image_url": {"url": "https://example.com/screenshot.png"}},
],
}],
)
Z.ai 文档显示还支持视频和文件输入,具体格式和大小限制可以参考官方 API 文档确认。
能力矩阵
FlashX 继承了 GLM-5.3-Flash 的全部能力。
- 推理(始终开启),FlashX 的推理模式通过
thinking.type: "enabled"永久启用,无法关闭。推荐设置为reasoning_effort: max,同时设置thinking.clear_thinking: false。 - 函数调用,支持多步工具调用序列。Z.ai 建议在流式请求中启用
tool_stream: true。 - 结构化输出,支持 JSON 响应格式,方便系统集成。
- 上下文缓存,自动缓存读取,费率更低。Z.ai 上缓存读取价格为 $0.075/1M tokens(标准输入为 $0.37)。
- 网络搜索,以工具形式提供服务端网络搜索,按成功调用计费(Z.ai 上约 $0.01/次)。
Z.ai 文档推荐的参数配置是 temperature: 1、top_p: 0.95、reasoning_effort: max。
路由决策框架
GLM-5.3 系列分三个层级,以下是 API 路由的决策参考。
适合路由到 FlashX 的场景
- 交互式编程代理,每次往返都会产生用户可感知的延迟
- 开发工作流中的实时截图分析
- 多步 agent 循环,总耗时比单次 token 成本更重要
- 面向用户的流式响应场景,感知速度直接影响体验
适合路由到 Flash 的场景
- 批量处理,延迟不是瓶颈
- 后台任务(文档处理、代码审查),结果异步消费
- 高频调用场景,2.5 倍的成本差距影响显著
- 同等模型质量下追求更低成本的任务
适合路由到 GLM-5.3(稠密旗舰版)的场景
- 需要最高推理质量(网络安全、复杂软件工程)
- 任务价值足以支撑 $1.40/$4.40 每百万 token 的定价
- 长链路 agent 工作流,每一步的质量会产生累积影响
TheRouter 配置思路
当 TheRouter 将 GLM-5.3-FlashX 纳入模型目录后,可以配置面向延迟优化的路由层级。TheRouter 将 OpenAI 兼容请求路由到已配置的供应商,配置思路如下。
- 主路由,GLM-5.3-FlashX 处理延迟敏感请求
- 降级,FlashX 不可用或被限流时切换到 GLM-5.3-Flash
- 成本降级,预算紧张时进一步切换到 Qwen3.8-Flash 或 DeepSeek V4.1 Flash
三个模型都暴露 OpenAI 兼容的 Chat Completions 接口,切换时只需更改模型 ID。TheRouter 的统一 API 处理供应商层面的认证和端点差异。
同类速度优化模型对比
FlashX 处于多模态模型的速度优化梯队,供参考。
| 模型 | 厂商宣称速度 | 输入 / 1M | 输出 / 1M | 上下文 |
|---|---|---|---|---|
| GLM-5.3-FlashX | 200 tok/s | $0.37 | $1.25 | 1M |
| GLM-5.3-Flash | ~50 tok/s (AA) | $0.15 | $0.50 | 1M |
| Qwen3.8-Flash | — | ~$0.10 | ~$0.30 | 1M |
| DeepSeek V4.1 Flash | — | $0.10 | $0.30 | 128K |
FlashX 的速度优势在交互式工作流中最为明显,因为此时模型推理往往是整个链路的瓶颈。对于批量或离线处理,2.5 倍的价格溢价通常难以收回成本。
常见问题
GLM-5.3-FlashX 和 GLM-5.3-Flash 是不同的模型吗?
不是。FlashX 使用与 Flash 相同的 320B MoE 架构和 18B 激活参数,权重也完全一致。区别在于推理基础设施做了吞吐优化,每 token 单价也相应更高。
FlashX 能关闭推理模式吗?
不能。Flash 和 FlashX 的推理模式都是始终开启的。thinking.type 参数仅支持 enabled。Z.ai 推荐使用 reasoning_effort: max 并设置 thinking.clear_thinking: false。
200 tok/s 的数据有独立验证吗?
截至发稿时没有。200 tok/s 来自 Z.ai 官方文档。Artificial Analysis 测得 GLM-5.3-Flash 约 50 tok/s,GLM-5.3(稠密版)约 66 tok/s,但 FlashX 的独立测试结果尚未发布。
GLM-5.3-FlashX 包含在 GLM Coding Plan 中吗?
目前不包含。Z.ai 文档明确指出"GLM-5.3-FlashX is not yet available on the plan"。Flash 在 Coding Plan 中可用,配额是 GLM-5.3 的 3 倍。
FlashX 支持 Responses API 吗?
DashScope 的 Responses API 目前仅支持 glm-5.2 和 glm-5.3(稠密版),不支持 Flash/FlashX 变体。FlashX 通过 Chat Completions API 使用。
DashScope 支持哪些区域的 FlashX?
DashScope 通过 OpenAI 兼容接口在华北 2(北京)、美国(弗吉尼亚)、德国(法兰克福)、新加坡和中国香港提供 GLM 模型服务。
数据来源:Z.ai GLM-5.3-Flash/FlashX 文档(2026-10-04 获取)、OpenRouter GLM-5.3-FlashX(2026-10-04 获取)、DashScope GLM 集成指南(2026-10-04 获取)、china-llm.com FlashX 定价(2026-09-21 审核)、Artificial Analysis GLM-5.3 基准测试(2026-10-04 获取)。