GLM-5.1-HighSpeed:400 TPS 旗舰改变路由团队的延迟决策

智谱 AI 的 GLM-5.1-highspeed 基于 TileRT 推理引擎实现每秒 400 tokens 的稳定输出,同等旗舰能力下吞吐量大幅提升,直接重塑实时 agent 和编程工作流的 provider routing 决策。

发布于 来源 智谱 AI / BigModel

归档条目:由 AI 根据所引信源辅助生成,发布时未经逐篇审阅。责任编辑:Joe Werner。

简洁编辑风格图示,展示速度基准箭头与 routing 决策分支以及最小化代码元素

当一家模型厂商在保持旗舰能力不变的前提下,推出高吞吐量变体时,routing 层面的核心问题就从「这个模型够好吗」变成了「400 tokens/s 的推理速度,会不会成为首要的路由判断维度」。智谱 AI 于 2026 年 5 月底上线的 GLM-5.1-highspeed — 目前已在 BigModel 平台与阿里云 DashScope 上线 — 正是迫使 AI 工程团队重新评估延迟策略的关键信号。

发生了什么

智谱 AI 于 2026 年 5 月下旬发布了 GLM-5.1-highspeed,这是 GLM-5.1 的高吞吐生产级 API 变体,核心技术驱动是自研的 TileRT 推理引擎。核心数据:每秒稳定输出 400 tokens,约为 Gemini 3.5 Flash 等同级旗舰模型常见吞吐量(约 200 tokens/s)的两倍。

主要规格:

  • 输出速度:400 tokens/s(稳定生产吞吐,非峰值突发)
  • 上下文窗口:200K tokens
  • 最大输出长度:128K tokens,适合大规模代码生成和长文档处理
  • 深度思考模式:可选;声称在同一速度层级下可用
  • 流式输出:原生支持 SSE streaming
  • SDK 兼容性:通过 Zhipu zai Python SDK 和 Java SDK 访问;BigModel 提供 OpenAI-compatible API 接口

该模型目前面向企业用户开放(BigModel 平台 bigmodel.cn / api.z.ai)。同时,GLM-5.1 已被列入阿里云 DashScope 三方模型目录,model ID 为 glm-5.1——这意味着已有 DashScope 接入的团队,无需新增 Zhipu 独立账号,即可通过既有 OpenAI-compatible 端点路由到 GLM 模型家族。

TileRT 的技术路径是:编译期静态化计算图为持久化 Engine Kernel、通过寄存器和 L2 Cache 进行算子间数据直传(绕过 Global Memory 写入)、将计算/IO/通信分解为 tile 级微任务以消除宿主端调度和算子间同步开销,最终在多卡场景下实现角色专化并行。

对 AI 工程团队意味着什么

速度成为一级 routing 维度。 多数路由策略目前只在成本、质量和可用性上做决策,推理速度通常被视为 provider SLA 问题而非路由变量。GLM-5.1-highspeed 正在改变这一假设。400 TPS 下,典型的 1,000 tokens 响应约 2.5 秒内完成,相比旗舰模型普遍的 5–7 秒快了一倍以上。对于流式应用、实时 coding agent 或高并发交互场景,这个差距具有实际运营意义。

长上下文速度对 agent loop 至关重要。 编程 agent 任务通常需要每次调用传入 50K–100K token 上下文。更高的吞吐量意味着 agent loop 延迟等比下降——在同等输出量下,400 TPS 的完成时间约为 200 TPS 的一半。对于运行并行 agent worker 或有 SLA 要求的团队,这是可量化的运营杠杆。

DashScope 集成简化多 provider routing。 2026 年 5 月,DashScope 三方模型目录扩展至:Qwen3.7-Max、Qwen3.6-Plus/Flash、DeepSeek V4 Pro/Flash、Kimi K2.6、MiniMax M2.7、MiMo-V2.5-Pro 以及 GLM-5.1 —— 均可通过单一 base URL https://dashscope.aliyuncs.com/compatible-mode/v1 和单一 API Key 访问。与分别管理 5–6 个 provider 凭证相比,统一路由大幅降低了运维复杂度。

MCP tool calling 支持。 GLM-5.1-highspeed 原生支持 Model Context Protocol(MCP)工具集成,这是 Claude Code、Cursor 等 coding agent 的标准接入路径。无需额外适配层,即可将该模型用作 MCP-compatible agent 工作流的后端。

Router/Operator 视角

速度分层的 routing 策略。 如果你的路由层目前只在成本和质量上分层,考虑增加速度维度:

  1. 实时/流式用户面调用 → 路由至高 TPS 模型(如 GLM-5.1-highspeed 等高吞吐选项)
  2. 异步批处理/深度推理调用 → 路由至质量优先模型,无速度约束
  3. 成本敏感的大量级工作流 → 路由至 flash/mini 层

GLM-5.1-highspeed 适配第一层,适合需要旗舰级质量同时对响应延迟有要求的场景。

中国区团队的 DashScope 统一路由。 若你已在通过 DashScope 管理国内模型访问,当前 DashScope 目录对主流国内旗舰模型的覆盖已相当完整,可在单一 provider 配置下实现多模型 routing 和 fallback,无需为每家厂商单独管理账号。

企业准入限制。 GLM-5.1-highspeed 目前处于企业准入阶段,通用可用时间表尚未公布。如需在生产环境评估,建议尽早在 BigModel 平台申请企业权限。基础 GLM-5.1 模型公开可用,适用于非速度敏感的工作负载。

路由团队决策清单:

  • 你的路由策略是否已包含速度维度?如未包含,先量化实时用户面延迟需求,再决定是否引入高 TPS 模型
  • 确认目标区域的 DashScope 可用性:GLM-5.1 已在 DashScope CN(北京)目录上线;在制定跨区域路由策略前,需确认美国/新加坡/欧洲 DashScope 端点是否同样暴露该模型
  • 测试思考模式下的实际 TPS:智谱声称深度思考模式下保持 400 TPS,但建议在你的任务分布上实测 thinking 模式与标准模式的吞吐差异
  • 企业准入门槛:若需要高速版本(非基础 GLM-5.1),需通过 BigModel 企业渠道申请
  • 监控定价:智谱尚未公开 GLM-5.1-highspeed 与 GLM-5.1 是否有独立定价;在将其纳入大量级路由槽位之前,务必确认实际费率

TheRouter 用户的观察与行动建议

对于通过 TheRouter 将请求路由到 OpenAI-compatible 后端的团队,目前最实际的集成路径是 DashScope:将 DashScope 配置为一个 provider,目标模型设为 glm-5.1,即可在不新增独立 Zhipu 凭证的前提下接入 GLM 模型家族。该模式与 SiliconFlow 接入指南 所描述的国内 OpenAI-compatible 端点统一路由思路一致,适合在单一 provider 配置下覆盖多个国内模型。

待 GLM-5.1-highspeed 正式开放通用访问后,在 400 TPS 的吞吐保证下,它将成为实时会话、高并发 agent 部署,以及任何对首 token 延迟和总响应时间有直接要求的工作流的有效 routing 选项。

本文涉及的模型

编辑风格图形,展示将大型代码工程注入单个 1M token 上下文窗口的过程,带有 routing 分支指示符

GLM-5.2 OpenRouter 接入指南:TPS 基准、定价对比与 Coding Agent Routing 配置

GLM-5.2 已在 OpenRouter(z-ai/glm-5.2)及其他 12 家服务商上线。Artificial Analysis 实测最快输出速度达 266 t/s(Baseten),最低价格 $0.72/1M tokens(GMI FP8)。凭借经验证的 Solid 1M token 无损上下文与 128K 最大输出,GLM-5.2 在 FrontierSWE 上与 Claude Opus 4.8 差距仅 1%,是长程 coding agent routing 的顶级开放权重选项。

来源 Zhipu AI / BigModel
帮助与联系