GLM-5.3: новый open-source флагман Zhipu с контекстом 1M — руководство по API и routing
GLM-5.3 — сильнейшая open-weights модель Zhipu для кодинга, построенная на той же базе, что и GLM-5.2, с расширенным post-training. В этом руководстве — API, интеграция через DashScope, reasoning-effort уровни, pricing, контекст бенчмарков и routing рядом с другими frontier-моделями.
GLM-5.3 — новейшая open-source флагманская модель Zhipu AI, выпущенная 14 августа 2026 года. Она использует ту же базовую модель, что и GLM-5.2. Все улучшения получены за счёт расширенного post-training: больше сред исполнения, более разнообразные long-horizon задачи и дополнительный reinforcement-learning compute. Z.ai называет GLM-5.3 сильнейшей open-weights моделью для кодинга, с особенно заметным прогрессом в agentic engineering и обнаружении уязвимостей.
Для API-разработчиков GLM-5.3 доступна через Z.ai API и GLM Coding Plan. 18 августа модель появилась на Aliyun DashScope с model ID ZHIPU/GLM-5.3. Open weights ожидаются примерно через две недели после запуска, пока идёт safety review.
Замечание: GLM-5.3 пока не добавлена в каталог моделей TheRouter. Как только route будет подтверждён, модель станет доступна через единый API TheRouter. Сейчас GLM-5.3 можно вызывать напрямую через Z.ai или DashScope. Текущий статус route — на странице провайдера Zhipu.
Что изменилось от GLM-5.2 к GLM-5.3
Архитектура и базовая модель остались прежними. Z.ai расширила post-training pipeline, добавив задачи, воспроизводящие многодневную инженерную работу: диагностика bottleneck в training pipeline, ревью кодовых баз и внутренней документации, запуск экспериментов, реализация оптимизаций и доказательство end-to-end ускорения без потери корректности.
Post-training система использует SAO reinforcement-learning подход и open-source фреймворк slime с исполняемыми task-средами. Research-агенты генерируют задачи, judge-агенты проверяют решаемость, verifier-ы валидируют результаты через oracle, no-op и unsolved состояния.
Основные улучшения по отчётам Z.ai (vendor-reported, без независимого воспроизведения):
| Benchmark | GLM-5.2 | GLM-5.3 | Изменение |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6 | 28.3 | +515% relative |
| DeepSWE v1.1 | 46.2 | 66.9 | +45% relative |
| SWE-Marathon v1.1 | 19.4 | 42.5 | +119% relative |
| AutomationBench | 26.2 | 48.2 | +84% relative |
| CyberGym | 77.2% | 84.5% | +9.4% relative |
| Z.ai Code Bench (Max) | 23.4% | 34.5% | +47% relative |
Наибольший рост — на long-horizon бенчмарках. При этом в собственной таблице Z.ai, GPT-5.6 Sol набирает 34.6 на Terminal-Bench 3.0, Claude Fable 5 — 33.7, оба выше GLM-5.3 (28.3). На DeepSWE v1.1 GLM-5.3 с 66.9 уступает GPT-5.6 Sol (72.7) и Fable 5 (69.7).
Характерная деталь — эффективность: на Z.ai Code Bench (Max effort) GLM-5.3 расходует примерно 75,000 output tokens на задачу против 96,000 у GLM-5.2. Снижение на 22% при росте task completion rate на 47%.
API-интеграция: Z.ai напрямую
GLM-5.3 использует OpenAI-совместимый chat completions endpoint. Установите OpenAI SDK и укажите Z.ai base URL:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_ZAI_KEY",
base_url="https://api.z.ai/v1",
)
response = client.chat.completions.create(
model="glm-5.3",
messages=[{"role": "user", "content": "Explain the SAO reinforcement-learning approach."}],
)
print(response.choices[0].message.content)
Reasoning-effort уровни
GLM-5.3 поддерживает три уровня reasoning effort: low, high и max. По умолчанию — max, Z.ai рекомендует его для coding-задач.
response = client.chat.completions.create(
model="glm-5.3",
messages=[{"role": "user", "content": "Refactor this module for better testability."}],
extra_body={"reasoning_effort": "high"},
)
low — когда важнее latency и стоимость. max — для сложных задач на уровне целого репозитория.
Breaking change: thinking нельзя отключить
В отличие от GLM-5.2, GLM-5.3 не принимает thinking.type: "disabled". Такой запрос завершится ошибкой. Если ваше приложение отключает thinking при вызове GLM, нужно переключить на thinking.type: "enabled" с указанием reasoning_effort, и только потом менять model ID.
Для части production-приложений GLM-5.3 — это полноценная миграция, а не замена одного model ID на другой.
API-интеграция: DashScope
GLM-5.3 доступна на Aliyun DashScope (Bailian) с 18 августа 2026, model ID — ZHIPU/GLM-5.3. DashScope предоставляет OpenAI-compatible endpoint:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DASHSCOPE_KEY",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="ZHIPU/GLM-5.3",
messages=[{"role": "user", "content": "Analyze this codebase for security vulnerabilities."}],
)
DashScope описывает GLM-5.3 как модель с поддержкой text generation и deep thinking, 1M контекстом, поставляемую напрямую Zhipu.
DashScope vs Z.ai
| Параметр | Z.ai напрямую | DashScope |
|---|---|---|
| Model ID | glm-5.3 | ZHIPU/GLM-5.3 |
| Base URL | https://api.z.ai/v1 | https://dashscope.aliyuncs.com/compatible-mode/v1 |
| Оплата | Z.ai account (USD) | Aliyun account (RMB) |
| Context cache | GLM Coding Plan 1M route | DashScope implicit/explicit cache |
| Другие модели | Только GLM-семейство | 200+ моделей от разных провайдеров |
| Регион | Международный | Mainland China + международные регионы |
Команды, уже работающие на DashScope, могут добавить GLM-5.3 без нового аккаунта. Международным разработчикам Z.ai direct path экономит регистрацию на Aliyun.
Pricing
На момент публикации Z.ai не выпустила отдельный прайс для GLM-5.3. Страница pricing заканчивается на GLM-5.2.
Z.ai API (GLM-5.2, для ориентира): $1.40 за миллион input tokens, $4.40 за миллион output tokens, $0.26 cached.
GLM Coding Plan: Lite — $18/мес, Pro — $80/мес, Max — $168/мес. Все тарифы включают GLM-5.3.
DashScope pricing (GLM-5.3): По данным агрегаторов, ZHIPU/GLM-5.3 на DashScope стоит примерно ¥8 за миллион input tokens и ¥28 за миллион output tokens.
Сравнение с конкурентами:
| Модель | Input (за MTok) | Output (за MTok) |
|---|---|---|
| GLM-5.2 (Z.ai) | $1.40 | $4.40 |
| GLM-5.3 (DashScope, оценка) | ~$1.10 (¥8) | ~$3.85 (¥28) |
| DeepSeek V4-Pro | $1.00 (off-peak) / $2.00 (peak) | $4.00 (off-peak) / $8.00 (peak) |
| Claude Opus 4.8 | $15.00 | $75.00 |
| Qwen3.8-Max | ~$1.65 (¥12) | ~$4.95 (¥36) |
GLM-5.3 через DashScope — в конкурентном среднем сегменте среди китайских frontier-моделей, значительно дешевле западных frontier-моделей для coding-agent workloads.
Cybersecurity capabilities
Наиболее отличительная черта GLM-5.3 — возможности в области кибербезопасности. Z.ai отмечает, что эти способности развивались быстрее ожидаемого в процессе post-training. Модель научилась рассуждать через несколько стадий exploitation и формировать цельные планы exploitation chains.
Z.ai сообщает о сотрудничестве с security-командами в Китае, по результатам которого найдено 2,436 уязвимостей в 269 проектах, из них 1,097 классифицированы как critical или high severity. Публичный disclosure ledger доступен на cvd.z.ai.
На CyberGym (обнаружение и валидация уязвимостей) GLM-5.3 набирает 84.5%, немного опережая GPT-5.6 Sol (83.6%). На ExploitBench — 54.4%, вдвое больше GLM-5.2 (24.4%), но ниже GPT-5.6 Sol (76.5%).
Для операторов, маршрутизирующих coding-agent workloads, GLM-5.3 может работать как эффективный vulnerability scanner в code-review pipeline, особенно в cost-sensitive сценариях.
Routing GLM-5.3 с другими моделями
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
GLM-5.3 органично вписывается в multi-model routing как cost-effective coding-agent backbone с сильной long-horizon производительностью.
Когда использовать GLM-5.3:
- Long-horizon coding задачи с выгодой от сниженного token consumption
- Security-ориентированный code review и vulnerability scanning
- Budget-conscious coding-agent deployments ($1–4/MTok вместо $15–75/MTok)
- Инфраструктура на DashScope, где добавлять нового провайдера нежелательно
Когда маршрутизировать на альтернативы:
- Максимальная глубина exploit-chain reasoning критична (GPT-5.6 Sol лидирует на ExploitBench)
- На момент запуска нужен vision input (GLM-5.3 text-only)
- Независимая верификация бенчмарков — жёсткое требование
- Нужны open weights для local deployment прямо сейчас (weights pending)
Пример fallback chain для coding-agent workloads:
Primary: GLM-5.3 (cost-effective, сильный на DeepSWE/Terminal-Bench)
Fallback 1: DeepSeek V4-Pro (похожий ценовой диапазон, более широкий охват бенчмарков)
Fallback 2: Claude Opus 4.8 (максимальная надёжность, максимальная стоимость)
TheRouter поддерживает fallback routing на уровне провайдера. Когда GLM-5.3 появится в каталоге моделей, её можно будет настроить как primary или fallback через стандартную конфигурацию routing.
Миграция с GLM-5.2
Если вы уже вызываете GLM-5.2 через Z.ai API:
- Обновите model ID с
glm-5.2наglm-5.3. - Уберите
thinking.type: "disabled". GLM-5.3 требует thinking enabled. Установитеthinking.type: "enabled"и укажитеreasoning_effort. - Начните тестирование с
higheffort, сравните latency и cost с вашим GLM-5.2 baseline, потом переходите наmax. - Отслеживайте token usage. GLM-5.3 должна потреблять меньше output tokens на эквивалентных задачах.
Если используете DashScope (ZHIPU/GLM-5.2), обновите model ID на ZHIPU/GLM-5.3 и внесите те же изменения в thinking-параметры.
Статус open weights
Z.ai обещает выпустить weights GLM-5.3 примерно через две недели после запуска 14 августа, после завершения safety evaluation и hardening. На данный момент checkpoint, model card и лицензия не опубликованы.
GLM-5.2 распространялась под MIT license, но это не означает автоматического применения к GLM-5.3. Не планируйте local deployment или self-hosted routing до публикации weights, лицензии и serving recipe.
После релиза weights GLM-5.3 может появиться на SiliconFlow и других провайдерах open-weight моделей, расширяя варианты routing.
Совместимость с coding-агентами
GLM-5.3 работает с основными coding-agent фреймворками:
- ZCode — нативная agentic IDE от Z.ai, полная поддержка
- Claude Code — использует суффикс
glm-5.3[1m]с compaction window в 1,000,000 tokens - OpenCode — совместим через OpenAI-compatible endpoint
1M context window при сниженном token consumption на задачу делает GLM-5.3 особенно подходящей для coding-агентов, работающих с большими кодовыми базами, где context management — основной фактор расходов.
Итог
GLM-5.3 — существенный post-training upgrade над GLM-5.2, демонстрирующий, что scaled reinforcement learning в разнообразных средах может давать заметный рост capabilities без нового pretraining цикла. Для API-операторов это cost-effective coding-agent модель с сильной long-horizon производительностью, доступная сейчас через Z.ai и DashScope.
Модель пока отсутствует в routing-каталоге TheRouter. Актуальный статус — на странице провайдера Zhipu и странице модели GLM-5.2.
Полезные ссылки: