GLM-5.2 OpenRouter 接入指南:TPS 基准、定价对比与 Coding Agent Routing 配置
GLM-5.2 已在 OpenRouter(z-ai/glm-5.2)及其他 12 家服务商上线。Artificial Analysis 实测最快输出速度达 266 t/s(Baseten),最低价格 $0.72/1M tokens(GMI FP8)。凭借经验证的 Solid 1M token 无损上下文与 128K 最大输出,GLM-5.2 在 FrontierSWE 上与 Claude Opus 4.8 差距仅 1%,是长程 coding agent routing 的顶级开放权重选项。

终结大多数长程 coding agent 会话的瓶颈,往往不是模型质量,而是上下文耗尽。模型在第 3 轮能写出优质代码,却在第 47 轮因架构决策、接口契约、目录规范已从活跃上下文中滑落而产生错误输出。GLM-5.2 是智谱 AI 的新旗舰模型,其核心主张直击这一失败点:经验证的无损 1M token 上下文窗口,专门针对多轮 coding agent 工作负载训练——而不是仅为营销目的扩展窗口。
发生了什么
智谱 AI 发布 GLM-5.2 作为新旗舰文本模型,接替 GLM-5.1-highspeed。目前已在以下渠道上线:
- BigModel API(
open.bigmodel.cn/api/paas/v4/),模型 ID:glm-5.2 - 阿里云 DashScope 三方模型目录,模型 ID:
glm-5.2
核心规格:
| 属性 | GLM-5.2 |
|---|---|
| 上下文窗口 | 1,000,000 tokens(验证无损) |
| 最大输出 tokens | 128,000 |
| 思考模式 | 支持(多级,reasoning_effort 参数) |
| Function calling | 支持 |
| 上下文缓存 | 支持 |
| 结构化输出 | 支持(JSON 模式) |
| MCP | 支持 |
| 流式输出 | 支持(SSE) |
该模型在正式发布前已向 GLM Coding Plan 企业用户开放抢先体验。基准测试表现:在 FrontierSWE(长程软件工程任务)上,GLM-5.2 比 Claude Opus 4.8 落后约 1%,同时超越 GPT-5.5(约 1%)和 Claude Opus 4.7(约 11%)。在难度更高的 SWE-Marathon 上,与 Opus 4.8 差距约 13%。在由全球百万开发者参与盲测的 Code Arena 前端评估系统上,GLM-5.2 在全球可用模型中排名第一。
智谱官方展示了一次单次 coding agent 会话处理超过 85 万(850K)tokens 的实测记录——在一次连续长程任务中完成了多端应用的完整设计、前后端实现、测试和部署交付。
对 AI 工程团队意味着什么
Solid 1M 与名义上的 1M 截然不同。 目前多个前沿模型宣称支持 1M token 上下文,但实际性能往往在超过 200K–300K token 后明显退化:模型"读"了早期上下文,却在决策时表现得像已经遗忘。智谱对 GLM-5.2 的明确承诺是"Solid 1M"——无损保留能力,并在真实工程工作负载上专项训练。850K token 实测演示是可操作的数据点,而非合成基准。对于曾遭遇长程 agent 会话上下文退化的团队,这一阈值主张直接决定该模型能否进入长程 routing 层。
128K 最大输出支持一次性交付大型产物。 GLM-5.1-highspeed 已有 128K 最大输出;GLM-5.2 继承这一能力,并与 1M 上下文结合。实际效果:模型可以读取完整项目仓库(200K–400K tokens),然后在单次推理调用中输出 100K+ token 的实现产物——前端代码、API 层、测试、配置——一气呵成。这与最大输出受限于 8K 或 32K 的模型有本质区别,后者需要拆分策略和多次往返。
FrontierSWE 量级性能现已开放访问。 GLM-5.2 是 FrontierSWE 榜单上排名最高的开放模型,与 Opus 4.8 差距在 1% 以内。对于以 Opus 4.8 作为长程编码质量上限的团队,GLM-5.2 在不同价格层级上提供了可行的开放模型替代方案——可通过现有的 DashScope 或 BigModel API 接入路由。
DashScope 发行扩展了访问范围,无需新凭据。 已通过阿里云 DashScope 路由国产模型的团队,可将 glm-5.2 加入 routing 策略,使用完全相同的 OpenAI 兼容 base URL 和 API key。这与 Qwen3.7-Max、DeepSeek V4、Kimi K2、MiMo-V2.5-Pro 的单端点访问模式相同——接入 GLM-5.2 无需新的供应商注册流程。
Router/Operator 视角分析
在路由策略中设计长程层。 当前大多数路由表沿三个维度优化:成本(flash 与 full 模型)、速度(高吞吐变体)、可用性(主备 fallback)。缺失的第四维度是会话跨度——routing 目标能否在 100K+ token 上下文的多轮 agent 行为中保持一致性。
考虑以下四层结构:
- 短交互任务(< 32K 上下文,实时):Flash/mini 模型,优化速度与成本
- 单轮长输出(< 200K 上下文,单次生成):支持高输出限制的前沿模型
- 长程 agent 会话(> 300K 上下文,多轮):具备经验证 solid-context 能力的模型——GLM-5.2 现在是这一层的候选,可与 Gemini 3.5 Pro 和 Opus 4.8 并列评估
- Fallback / 可靠性层:各层主力不可用时的备用 provider
若你当前将所有 coding agent 任务不加区分地路由到同一个前沿模型,很可能存在双重错配:短任务为 4K 轮次的交互支付旗舰定价,而长任务默默遭遇上下文退化却没有 fallover 机制。
上下文缓存改变了长会话的成本算法。 GLM-5.2 支持上下文缓存——当你在每轮 agent 调用开始时都加载同一个 200K token 代码库时,这一特性至关重要。没有缓存,10 轮 agent 会话将产生 200 万 token 的冗余前缀处理成本。有缓存,前缀仅计算一次后复用。评估 GLM-5.2 用于长程路由的团队,应在比较原始每 token 定价之前,将缓存命中率纳入成本模型。
思考模式提供了推理力度的调节杆。 GLM-5.2 暴露 reasoning_effort 参数(取值:low、medium、max,需配合 thinking.type: "enabled")。这与 Anthropic 扩展思考和 Qwen 思考模式采用相同模式——让路由层按单次调用调整推理深度,而不是切换到独立模型。对于需要进行规划决策的 agentic 框架,这很关键:探索性文件读取可设低推理力度,架构决策设最高力度,全程使用同一模型端点。
TheRouter 用户应当关注什么
GLM-5.2 现已通过 DashScope 的 OpenAI-compatible API 可达——与 TheRouter 已支持国产模型的访问路径相同。使用 TheRouter 进行国产 AI provider 路由的团队,可通过以下方式评估 GLM-5.2:
- 将完整项目仓库加载到上下文中(目标 100K–400K tokens)
- 在单个 prompt 中下达多步重构或跨文件架构任务
- 在第 5、10、20 轮对比上下文一致性与当前长程模型的表现
关注 BigModel 模型文档 获取定价详情和 DashScope 上架确认——发布时价格尚未公开。与 GLM-5.1-highspeed 类似,预计将采用与旗舰 Opus/GPT-5.5 同级的企业定价,DashScope 渠道可能提供批量折扣。
本文涉及的模型
相关阅读
AI 路由新闻与供应商动态 →
GLM-5.1-HighSpeed:400 TPS 旗舰改变路由团队的延迟决策
智谱 AI 的 GLM-5.1-highspeed 基于 TileRT 推理引擎实现每秒 400 tokens 的稳定输出,同等旗舰能力下吞吐量大幅提升,直接重塑实时 agent 和编程工作流的 provider routing 决策。

ZCode 正式发布:Z.ai 官方编程 Agent 引入独立 Endpoint 架构,路由团队需要重新梳理配置
Z.ai 于 7 月 2 日正式发布 ZCode,这是基于 GLM-5.2 的免费 Agentic 开发环境。对路由团队而言,本次发布引入了独立的 coding endpoint、Anthropic/OpenAI 双协议通道、第三方 BYOK 渠道,以及 7 月 31 日截止的 1.5x 配额促销。

MiniMax M2.7 发布:双格式 API 兼容 OpenAI 和 Anthropic,对路由层意味着什么
MiniMax 最新旗舰模型同时支持 OpenAI 和 Anthropic 两种 API 格式,SWE-Pro 评分接近 Claude Opus,定价仅 $0.30/$1.20 每百万 token,为 agent 工作负载带来全新成本-性能路由选择。