GLM-5.2 на OpenRouter: бенчмарки TPS, цены провайдеров и routing для coding-агентов
GLM-5.2 combines a verified 1M-token context, 128K max output, and strong coding-agent benchmarks. Routing teams should evaluate latency, pricing, provider fit, and long-horizon workloads.

Причиной, обрывающей большинство долгосрочных сессий coding-агента, является не качество модели — а исчерпание контекста. Модель пишет хороший код на третьем шаге и генерирует ошибочный на сорок седьмом, потому что архитектурные решения, интерфейсные контракты и соглашения о каталогах уже выпали из активного контекстного окна. GLM-5.2 — новый флагман Zhipu AI — построен вокруг одного утверждения, которое напрямую влияет на этот сценарий отказа: верифицированное без потерь 1M-токенное контекстное окно, обученное специально для многоходовых рабочих нагрузок coding-агентов — а не просто расширенное ради маркетинга.
Что произошло
Zhipu AI выпустила GLM-5.2 как новую флагманскую текстовую модель, преемника GLM-5.1-highspeed. Модель уже доступна через:
- BigModel API (
open.bigmodel.cn/api/paas/v4/), ID модели:glm-5.2 - Alibaba Cloud DashScope, каталог сторонних моделей, ID:
glm-5.2
Основные характеристики:
| Параметр | GLM-5.2 |
|---|---|
| Контекстное окно | 1 000 000 токенов (верифицировано без потерь) |
| Максимальный вывод | 128 000 токенов |
| Режим мышления | Да (несколько уровней, параметр reasoning_effort) |
| Function calling | Да |
| Кэширование контекста | Да |
| Структурированный вывод | Да (JSON mode) |
| MCP | Да |
| Потоковый вывод | Да (SSE) |
До общего релиза модель была открыта корпоративным пользователям GLM Coding Plan. Бенчмарки: на FrontierSWE (долгосрочные задачи по разработке ПО) GLM-5.2 уступает Claude Opus 4.8 примерно на 1%, при этом превосходит GPT-5.5 (~на 1%) и Claude Opus 4.7 (~на 11%). На более сложном SWE-Marathon отставание от Opus 4.8 составляет ~13%. В системе слепого тестирования Code Arena с участием миллионов разработчиков по всему миру GLM-5.2 занял первое место среди всех глобально доступных моделей.
В ходе публичной демонстрации одна сессия coding-агента обработала свыше 850 000 токенов — завершив полный цикл разработки многоплатформенного приложения (проектирование, фронтенд, бэкенд, тесты, деплой) в рамках одного непрерывного агентного прогона.
Почему это важно для AI engineering-команд
Solid 1M — не то же самое, что номинальный 1M. Ряд фронтирных моделей уже заявляют о 1M-токенном контексте, однако производительность реально деградирует за пределами 200–300K токенов: модель «читает» ранний контекст, но принимает решения так, будто забыла его. Конкретное утверждение Zhipu по GLM-5.2 — «Solid 1M»: без потерь, обученный на реальных инженерных задачах. Демонстрация в 850K токенов — это операционная точка данных, а не синтетический бенчмарк. Для команд, которые уже сталкивались с тихой деградацией контекста в долгих агентных прогонах, это ключевое утверждение, определяющее место модели в routing-политике.
128K токенов вывода позволяют deliver крупные артефакты за один вызов. GLM-5.1-highspeed уже имел 128K вывода; GLM-5.2 сохраняет этот лимит и совмещает его с 1M контекстом. Практический итог: модель может прочитать полный репозиторий проекта (200–400K токенов) и в одном инференс-вызове сгенерировать 100K+ токенов — фронтенд, API-слой, тесты, конфиги — за один проход. Это архитектурно иной режим работы по сравнению с моделями, ограниченными 8K или 32K вывода, которые требуют стратегий декомпозиции и многократных итераций.
FrontierSWE-уровень производительности теперь в открытом доступе. GLM-5.2 — наиболее высоко оцененная открытая модель на FrontierSWE, с разрывом в 1% от Opus 4.8. Для команд, использующих Opus 4.8 как верхнюю планку качества для долгого кодирования, GLM-5.2 предлагает жизнеспособную открытую альтернативу на другом ценовом уровне — через существующий доступ к DashScope или BigModel API.
Дистрибуция через DashScope расширяет доступ без новых credentials. Команды, уже направляющие запросы к отечественным китайским моделям через Alibaba Cloud DashScope, могут добавить glm-5.2 в свою routing-политику через тот же OpenAI-совместимый base URL и API-ключ. Это та же схема единой точки входа, что и для Qwen3.7-Max, DeepSeek V4, Kimi K2 и MiMo-V2.5-Pro — подключение GLM-5.2 не требует нового онбординга у нового вендора.
Router/operator-аналитика
Добавьте долгосрочный tier в routing-политику. Большинство routing-таблиц сегодня оптимизированы по трём осям: стоимость (flash vs. full-модели), скорость (высокопроизводительные варианты), доступность (основной provider + fallback). Четвёртая ось, которой часто не хватает — длина горизонта: способен ли routing-таргет поддерживать когерентное многоходовое поведение агента на контекстах 100K+ токенов.
Четырёхуровневая структура, учитывающая это измерение:
- Короткие интерактивные задачи (< 32K контекст, реальное время): Flash/mini-модели для скорости и стоимости
- Разовые длинные выводы (< 200K контекст, single-shot): Фронтирные модели с высоким лимитом вывода
- Долгосрочные агентные сессии (> 300K контекст, многоходовые): Модели с верифицированным solid-context — GLM-5.2 теперь является кандидатом здесь наряду с Gemini 3.5 Pro и Opus 4.8
- Fallback / reliability-слой: Резервные provider для каждого уровня при деградации основного
Если вы сейчас направляете все задачи coding-агента к одной фронтирной модели вне зависимости от длины сессии, вероятно, у вас двойное рассогласование: переплата за флагман на коротких 4K-поворотных сессиях и незаметная деградация контекста на длинных — без какого-либо fallover.
Кэширование контекста меняет экономику долгих сессий. GLM-5.2 поддерживает context caching — критически важную функцию, когда один и тот же 200K-токенный кодовый репозиторий загружается в начале каждого хода агента. Без кэширования 10-ходовая агентная сессия над таким репо стоит 2M входных токенов в избыточной обработке префикса. С кэшированием префикс вычисляется один раз и переиспользуется. Команды, оценивающие GLM-5.2 для долгосрочного routing, должны учитывать hit rate кэша в своей стоимостной модели до сравнения с незакэшированными альтернативами по сырой цене за токен.
Режим мышления добавляет рычаг настройки интенсивности рассуждений. GLM-5.2 предоставляет параметр reasoning_effort (значения: low, medium, max, вместе с thinking.type: "enabled"). Это тот же паттерн, что и в Anthropic extended thinking и Qwen thinking mode — routing-слой может эскалировать глубину рассуждений на уровне одного вызова, не переключаясь на отдельную модель. Для agentic-фреймворков, принимающих решения о планировании, это существенно: низкая интенсивность рассуждений для разведывательного чтения файлов, максимальная — для архитектурных решений, всё на одном endpoint.
На что обратить внимание пользователям TheRouter
GLM-5.2 теперь доступен через OpenAI-совместимый API DashScope — тот же путь доступа, который уже используется для отечественных моделей в TheRouter. Команды, использующие TheRouter для routing китайских AI provider, могут протестировать GLM-5.2 следующим образом:
- Загрузите полный репозиторий проекта в контекст (цель — 100–400K токенов)
- Сформулируйте в одном prompt многошаговую задачу рефакторинга или кросс-файловой архитектуры
- Сравните когерентность контекста на 5-м, 10-м и 20-м шагах с вашей текущей долгосрочной моделью
Следите за документацией BigModel — детали ценообразования и подтверждение листинга на DashScope на момент релиза не опубликованы. По аналогии с GLM-5.1-highspeed ожидается корпоративный прайс на уровне Opus/GPT-5.5 с возможными объёмными скидками через DashScope.
Модели, упомянутые в статье
Похожие материалы
Новости AI-роутинга и провайдеров →
GLM-5.1-HighSpeed: как 400 TPS от Zhipu меняет логику latency-routing
Zhipu AI запустила GLM-5.1-highspeed: 400 ток/с через TileRT, 200K контекст, поддержка MCP. Доступна через DashScope. Изменяет routing-логику для realtime-запросов.

Запуск ZCode: официальный coding agent от Z.ai вводит новую архитектуру endpoint, которую команды маршрутизации обязаны переосмыслить
Z.ai официально запустила ZCode 2 июля — бесплатную среду agentic-разработки на базе GLM-5.2. Для команд маршрутизации запуск вводит отдельный coding endpoint, двойные каналы Anthropic/OpenAI, BYOK через сторонние каналы и промо 1.5x квоты, действующее до 31 июля.

Kimi K2.6 API: цены ¥1.10/¥6.50/¥27 за 1M токенов для coding agents
Kimi K2.6 API стоит ¥1.10 за cache-hit input, ¥6.50 за cache-miss input и ¥27 за output на 1M токенов; доступны KVV-проверка, 256K context и OpenAI-compatible routing для coding agents.