GLM-5.2 OpenRouter 接入指南:TPS 基准、定价对比与 Coding Agent Routing 配置

GLM-5.2 已在 OpenRouter(z-ai/glm-5.2)及其他 12 家服务商上线。Artificial Analysis 实测最快输出速度达 266 t/s(Baseten),最低价格 $0.72/1M tokens(GMI FP8)。凭借经验证的 Solid 1M token 无损上下文与 128K 最大输出,GLM-5.2 在 FrontierSWE 上与 Claude Opus 4.8 差距仅 1%,是长程 coding agent routing 的顶级开放权重选项。

TheRouter Newsroom来源 Zhipu AI / BigModel
编辑风格图形,展示将大型代码工程注入单个 1M token 上下文窗口的过程,带有 routing 分支指示符

终结大多数长程 coding agent 会话的瓶颈,往往不是模型质量,而是上下文耗尽。模型在第 3 轮能写出优质代码,却在第 47 轮因架构决策、接口契约、目录规范已从活跃上下文中滑落而产生错误输出。GLM-5.2 是智谱 AI 的新旗舰模型,其核心主张直击这一失败点:经验证的无损 1M token 上下文窗口,专门针对多轮 coding agent 工作负载训练——而不是仅为营销目的扩展窗口。

发生了什么

智谱 AI 发布 GLM-5.2 作为新旗舰文本模型,接替 GLM-5.1-highspeed。目前已在以下渠道上线:

  • BigModel APIopen.bigmodel.cn/api/paas/v4/),模型 ID:glm-5.2
  • 阿里云 DashScope 三方模型目录,模型 ID:glm-5.2

核心规格:

属性GLM-5.2
上下文窗口1,000,000 tokens(验证无损)
最大输出 tokens128,000
思考模式支持(多级,reasoning_effort 参数)
Function calling支持
上下文缓存支持
结构化输出支持(JSON 模式)
MCP支持
流式输出支持(SSE)

该模型在正式发布前已向 GLM Coding Plan 企业用户开放抢先体验。基准测试表现:在 FrontierSWE(长程软件工程任务)上,GLM-5.2 比 Claude Opus 4.8 落后约 1%,同时超越 GPT-5.5(约 1%)和 Claude Opus 4.7(约 11%)。在难度更高的 SWE-Marathon 上,与 Opus 4.8 差距约 13%。在由全球百万开发者参与盲测的 Code Arena 前端评估系统上,GLM-5.2 在全球可用模型中排名第一。

智谱官方展示了一次单次 coding agent 会话处理超过 85 万(850K)tokens 的实测记录——在一次连续长程任务中完成了多端应用的完整设计、前后端实现、测试和部署交付。

对 AI 工程团队意味着什么

Solid 1M 与名义上的 1M 截然不同。 目前多个前沿模型宣称支持 1M token 上下文,但实际性能往往在超过 200K–300K token 后明显退化:模型"读"了早期上下文,却在决策时表现得像已经遗忘。智谱对 GLM-5.2 的明确承诺是"Solid 1M"——无损保留能力,并在真实工程工作负载上专项训练。850K token 实测演示是可操作的数据点,而非合成基准。对于曾遭遇长程 agent 会话上下文退化的团队,这一阈值主张直接决定该模型能否进入长程 routing 层。

128K 最大输出支持一次性交付大型产物。 GLM-5.1-highspeed 已有 128K 最大输出;GLM-5.2 继承这一能力,并与 1M 上下文结合。实际效果:模型可以读取完整项目仓库(200K–400K tokens),然后在单次推理调用中输出 100K+ token 的实现产物——前端代码、API 层、测试、配置——一气呵成。这与最大输出受限于 8K 或 32K 的模型有本质区别,后者需要拆分策略和多次往返。

FrontierSWE 量级性能现已开放访问。 GLM-5.2 是 FrontierSWE 榜单上排名最高的开放模型,与 Opus 4.8 差距在 1% 以内。对于以 Opus 4.8 作为长程编码质量上限的团队,GLM-5.2 在不同价格层级上提供了可行的开放模型替代方案——可通过现有的 DashScope 或 BigModel API 接入路由。

DashScope 发行扩展了访问范围,无需新凭据。 已通过阿里云 DashScope 路由国产模型的团队,可将 glm-5.2 加入 routing 策略,使用完全相同的 OpenAI 兼容 base URL 和 API key。这与 Qwen3.7-Max、DeepSeek V4、Kimi K2、MiMo-V2.5-Pro 的单端点访问模式相同——接入 GLM-5.2 无需新的供应商注册流程。

Router/Operator 视角分析

在路由策略中设计长程层。 当前大多数路由表沿三个维度优化:成本(flash 与 full 模型)、速度(高吞吐变体)、可用性(主备 fallback)。缺失的第四维度是会话跨度——routing 目标能否在 100K+ token 上下文的多轮 agent 行为中保持一致性。

考虑以下四层结构:

  1. 短交互任务(< 32K 上下文,实时):Flash/mini 模型,优化速度与成本
  2. 单轮长输出(< 200K 上下文,单次生成):支持高输出限制的前沿模型
  3. 长程 agent 会话(> 300K 上下文,多轮):具备经验证 solid-context 能力的模型——GLM-5.2 现在是这一层的候选,可与 Gemini 3.5 Pro 和 Opus 4.8 并列评估
  4. Fallback / 可靠性层:各层主力不可用时的备用 provider

若你当前将所有 coding agent 任务不加区分地路由到同一个前沿模型,很可能存在双重错配:短任务为 4K 轮次的交互支付旗舰定价,而长任务默默遭遇上下文退化却没有 fallover 机制。

上下文缓存改变了长会话的成本算法。 GLM-5.2 支持上下文缓存——当你在每轮 agent 调用开始时都加载同一个 200K token 代码库时,这一特性至关重要。没有缓存,10 轮 agent 会话将产生 200 万 token 的冗余前缀处理成本。有缓存,前缀仅计算一次后复用。评估 GLM-5.2 用于长程路由的团队,应在比较原始每 token 定价之前,将缓存命中率纳入成本模型。

思考模式提供了推理力度的调节杆。 GLM-5.2 暴露 reasoning_effort 参数(取值:lowmediummax,需配合 thinking.type: "enabled")。这与 Anthropic 扩展思考和 Qwen 思考模式采用相同模式——让路由层按单次调用调整推理深度,而不是切换到独立模型。对于需要进行规划决策的 agentic 框架,这很关键:探索性文件读取可设低推理力度,架构决策设最高力度,全程使用同一模型端点。

TheRouter 用户应当关注什么

GLM-5.2 现已通过 DashScope 的 OpenAI-compatible API 可达——与 TheRouter 已支持国产模型的访问路径相同。使用 TheRouter 进行国产 AI provider 路由的团队,可通过以下方式评估 GLM-5.2:

  • 将完整项目仓库加载到上下文中(目标 100K–400K tokens)
  • 在单个 prompt 中下达多步重构或跨文件架构任务
  • 在第 5、10、20 轮对比上下文一致性与当前长程模型的表现

关注 BigModel 模型文档 获取定价详情和 DashScope 上架确认——发布时价格尚未公开。与 GLM-5.1-highspeed 类似,预计将采用与旗舰 Opus/GPT-5.5 同级的企业定价,DashScope 渠道可能提供批量折扣。

本文涉及的模型

客服支持