← Все статьи

GLM-5.3: новый open-source флагман Zhipu с контекстом 1M — руководство по API и routing

GLM-5.3 — сильнейшая open-weights модель Zhipu для кодинга, построенная на той же базе, что и GLM-5.2, с расширенным post-training. В этом руководстве — API, интеграция через DashScope, reasoning-effort уровни, pricing, контекст бенчмарков и routing рядом с другими frontier-моделями.

· TheRouter

GLM-5.3 — новейшая open-source флагманская модель Zhipu AI, выпущенная 14 августа 2026 года. Она использует ту же базовую модель, что и GLM-5.2. Все улучшения получены за счёт расширенного post-training: больше сред исполнения, более разнообразные long-horizon задачи и дополнительный reinforcement-learning compute. Z.ai называет GLM-5.3 сильнейшей open-weights моделью для кодинга, с особенно заметным прогрессом в agentic engineering и обнаружении уязвимостей.

Для API-разработчиков GLM-5.3 доступна через Z.ai API и GLM Coding Plan. 18 августа модель появилась на Aliyun DashScope с model ID ZHIPU/GLM-5.3. Open weights ожидаются примерно через две недели после запуска, пока идёт safety review.

Замечание: GLM-5.3 пока не добавлена в каталог моделей TheRouter. Как только route будет подтверждён, модель станет доступна через единый API TheRouter. Сейчас GLM-5.3 можно вызывать напрямую через Z.ai или DashScope. Текущий статус route — на странице провайдера Zhipu.

Что изменилось от GLM-5.2 к GLM-5.3

Архитектура и базовая модель остались прежними. Z.ai расширила post-training pipeline, добавив задачи, воспроизводящие многодневную инженерную работу: диагностика bottleneck в training pipeline, ревью кодовых баз и внутренней документации, запуск экспериментов, реализация оптимизаций и доказательство end-to-end ускорения без потери корректности.

Post-training система использует SAO reinforcement-learning подход и open-source фреймворк slime с исполняемыми task-средами. Research-агенты генерируют задачи, judge-агенты проверяют решаемость, verifier-ы валидируют результаты через oracle, no-op и unsolved состояния.

Основные улучшения по отчётам Z.ai (vendor-reported, без независимого воспроизведения):

BenchmarkGLM-5.2GLM-5.3Изменение
Terminal-Bench 3.04.628.3+515% relative
DeepSWE v1.146.266.9+45% relative
SWE-Marathon v1.119.442.5+119% relative
AutomationBench26.248.2+84% relative
CyberGym77.2%84.5%+9.4% relative
Z.ai Code Bench (Max)23.4%34.5%+47% relative

Наибольший рост — на long-horizon бенчмарках. При этом в собственной таблице Z.ai, GPT-5.6 Sol набирает 34.6 на Terminal-Bench 3.0, Claude Fable 5 — 33.7, оба выше GLM-5.3 (28.3). На DeepSWE v1.1 GLM-5.3 с 66.9 уступает GPT-5.6 Sol (72.7) и Fable 5 (69.7).

Характерная деталь — эффективность: на Z.ai Code Bench (Max effort) GLM-5.3 расходует примерно 75,000 output tokens на задачу против 96,000 у GLM-5.2. Снижение на 22% при росте task completion rate на 47%.

API-интеграция: Z.ai напрямую

GLM-5.3 использует OpenAI-совместимый chat completions endpoint. Установите OpenAI SDK и укажите Z.ai base URL:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_ZAI_KEY",
    base_url="https://api.z.ai/v1",
)

response = client.chat.completions.create(
    model="glm-5.3",
    messages=[{"role": "user", "content": "Explain the SAO reinforcement-learning approach."}],
)

print(response.choices[0].message.content)

Reasoning-effort уровни

GLM-5.3 поддерживает три уровня reasoning effort: low, high и max. По умолчанию — max, Z.ai рекомендует его для coding-задач.

response = client.chat.completions.create(
    model="glm-5.3",
    messages=[{"role": "user", "content": "Refactor this module for better testability."}],
    extra_body={"reasoning_effort": "high"},
)

low — когда важнее latency и стоимость. max — для сложных задач на уровне целого репозитория.

Breaking change: thinking нельзя отключить

В отличие от GLM-5.2, GLM-5.3 не принимает thinking.type: "disabled". Такой запрос завершится ошибкой. Если ваше приложение отключает thinking при вызове GLM, нужно переключить на thinking.type: "enabled" с указанием reasoning_effort, и только потом менять model ID.

Для части production-приложений GLM-5.3 — это полноценная миграция, а не замена одного model ID на другой.

API-интеграция: DashScope

GLM-5.3 доступна на Aliyun DashScope (Bailian) с 18 августа 2026, model ID — ZHIPU/GLM-5.3. DashScope предоставляет OpenAI-compatible endpoint:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DASHSCOPE_KEY",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)

response = client.chat.completions.create(
    model="ZHIPU/GLM-5.3",
    messages=[{"role": "user", "content": "Analyze this codebase for security vulnerabilities."}],
)

DashScope описывает GLM-5.3 как модель с поддержкой text generation и deep thinking, 1M контекстом, поставляемую напрямую Zhipu.

DashScope vs Z.ai

ПараметрZ.ai напрямуюDashScope
Model IDglm-5.3ZHIPU/GLM-5.3
Base URLhttps://api.z.ai/v1https://dashscope.aliyuncs.com/compatible-mode/v1
ОплатаZ.ai account (USD)Aliyun account (RMB)
Context cacheGLM Coding Plan 1M routeDashScope implicit/explicit cache
Другие моделиТолько GLM-семейство200+ моделей от разных провайдеров
РегионМеждународныйMainland China + международные регионы

Команды, уже работающие на DashScope, могут добавить GLM-5.3 без нового аккаунта. Международным разработчикам Z.ai direct path экономит регистрацию на Aliyun.

Pricing

На момент публикации Z.ai не выпустила отдельный прайс для GLM-5.3. Страница pricing заканчивается на GLM-5.2.

Z.ai API (GLM-5.2, для ориентира): $1.40 за миллион input tokens, $4.40 за миллион output tokens, $0.26 cached.

GLM Coding Plan: Lite — $18/мес, Pro — $80/мес, Max — $168/мес. Все тарифы включают GLM-5.3.

DashScope pricing (GLM-5.3): По данным агрегаторов, ZHIPU/GLM-5.3 на DashScope стоит примерно ¥8 за миллион input tokens и ¥28 за миллион output tokens.

Сравнение с конкурентами:

МодельInput (за MTok)Output (за MTok)
GLM-5.2 (Z.ai)$1.40$4.40
GLM-5.3 (DashScope, оценка)~$1.10 (¥8)~$3.85 (¥28)
DeepSeek V4-Pro$1.00 (off-peak) / $2.00 (peak)$4.00 (off-peak) / $8.00 (peak)
Claude Opus 4.8$15.00$75.00
Qwen3.8-Max~$1.65 (¥12)~$4.95 (¥36)

GLM-5.3 через DashScope — в конкурентном среднем сегменте среди китайских frontier-моделей, значительно дешевле западных frontier-моделей для coding-agent workloads.

Cybersecurity capabilities

Наиболее отличительная черта GLM-5.3 — возможности в области кибербезопасности. Z.ai отмечает, что эти способности развивались быстрее ожидаемого в процессе post-training. Модель научилась рассуждать через несколько стадий exploitation и формировать цельные планы exploitation chains.

Z.ai сообщает о сотрудничестве с security-командами в Китае, по результатам которого найдено 2,436 уязвимостей в 269 проектах, из них 1,097 классифицированы как critical или high severity. Публичный disclosure ledger доступен на cvd.z.ai.

На CyberGym (обнаружение и валидация уязвимостей) GLM-5.3 набирает 84.5%, немного опережая GPT-5.6 Sol (83.6%). На ExploitBench — 54.4%, вдвое больше GLM-5.2 (24.4%), но ниже GPT-5.6 Sol (76.5%).

Для операторов, маршрутизирующих coding-agent workloads, GLM-5.3 может работать как эффективный vulnerability scanner в code-review pipeline, особенно в cost-sensitive сценариях.

Routing GLM-5.3 с другими моделями

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

GLM-5.3 органично вписывается в multi-model routing как cost-effective coding-agent backbone с сильной long-horizon производительностью.

Когда использовать GLM-5.3:

  • Long-horizon coding задачи с выгодой от сниженного token consumption
  • Security-ориентированный code review и vulnerability scanning
  • Budget-conscious coding-agent deployments ($1–4/MTok вместо $15–75/MTok)
  • Инфраструктура на DashScope, где добавлять нового провайдера нежелательно

Когда маршрутизировать на альтернативы:

  • Максимальная глубина exploit-chain reasoning критична (GPT-5.6 Sol лидирует на ExploitBench)
  • На момент запуска нужен vision input (GLM-5.3 text-only)
  • Независимая верификация бенчмарков — жёсткое требование
  • Нужны open weights для local deployment прямо сейчас (weights pending)

Пример fallback chain для coding-agent workloads:

Primary: GLM-5.3 (cost-effective, сильный на DeepSWE/Terminal-Bench)
Fallback 1: DeepSeek V4-Pro (похожий ценовой диапазон, более широкий охват бенчмарков)
Fallback 2: Claude Opus 4.8 (максимальная надёжность, максимальная стоимость)

TheRouter поддерживает fallback routing на уровне провайдера. Когда GLM-5.3 появится в каталоге моделей, её можно будет настроить как primary или fallback через стандартную конфигурацию routing.

Миграция с GLM-5.2

Если вы уже вызываете GLM-5.2 через Z.ai API:

  1. Обновите model ID с glm-5.2 на glm-5.3.
  2. Уберите thinking.type: "disabled". GLM-5.3 требует thinking enabled. Установите thinking.type: "enabled" и укажите reasoning_effort.
  3. Начните тестирование с high effort, сравните latency и cost с вашим GLM-5.2 baseline, потом переходите на max.
  4. Отслеживайте token usage. GLM-5.3 должна потреблять меньше output tokens на эквивалентных задачах.

Если используете DashScope (ZHIPU/GLM-5.2), обновите model ID на ZHIPU/GLM-5.3 и внесите те же изменения в thinking-параметры.

Статус open weights

Z.ai обещает выпустить weights GLM-5.3 примерно через две недели после запуска 14 августа, после завершения safety evaluation и hardening. На данный момент checkpoint, model card и лицензия не опубликованы.

GLM-5.2 распространялась под MIT license, но это не означает автоматического применения к GLM-5.3. Не планируйте local deployment или self-hosted routing до публикации weights, лицензии и serving recipe.

После релиза weights GLM-5.3 может появиться на SiliconFlow и других провайдерах open-weight моделей, расширяя варианты routing.

Совместимость с coding-агентами

GLM-5.3 работает с основными coding-agent фреймворками:

  • ZCode — нативная agentic IDE от Z.ai, полная поддержка
  • Claude Code — использует суффикс glm-5.3[1m] с compaction window в 1,000,000 tokens
  • OpenCode — совместим через OpenAI-compatible endpoint

1M context window при сниженном token consumption на задачу делает GLM-5.3 особенно подходящей для coding-агентов, работающих с большими кодовыми базами, где context management — основной фактор расходов.

Итог

GLM-5.3 — существенный post-training upgrade над GLM-5.2, демонстрирующий, что scaled reinforcement learning в разнообразных средах может давать заметный рост capabilities без нового pretraining цикла. Для API-операторов это cost-effective coding-agent модель с сильной long-horizon производительностью, доступная сейчас через Z.ai и DashScope.

Модель пока отсутствует в routing-каталоге TheRouter. Актуальный статус — на странице провайдера Zhipu и странице модели GLM-5.2.

Полезные ссылки:

Модели, упомянутые в статье

Помощь и контакты