GLM-5.1-HighSpeed: как 400 TPS от Zhipu меняет логику latency-routing
Zhipu AI запустила GLM-5.1-highspeed: 400 ток/с через TileRT, 200K контекст, поддержка MCP. Доступна через DashScope. Изменяет routing-логику для realtime-запросов.
Архивный материал, подготовленный с помощью ИИ по указанному источнику и опубликованный без индивидуальной проверки. Ответственный редактор: Joe Werner.

Когда провайдер выпускает высокопроизводительный вариант флагмана без потери качества, вопрос routing меняется: не «достаточно ли хороша эта модель», а «становится ли скорость вывода в 400 токенов в секунду основным критерием маршрутизации». Именно такой выбор перед командами ставит GLM-5.1-highspeed от Zhipu AI — модель, запущенная в конце мая 2026 года на платформе BigModel и каталоге Alibaba Cloud DashScope.
Что произошло
Zhipu AI представила GLM-5.1-highspeed — production-вариант GLM-5.1 на базе собственного движка TileRT. Ключевые параметры:
- Скорость вывода: 400 токенов/с (стабильный production-уровень, не пиковый показатель)
- Контекстное окно: 200K токенов
- Максимальная длина вывода: 128K токенов — для массовой генерации кода и обработки длинных документов
- Режим глубокого мышления: опционально; доступен на той же скоростной ступени
- Потоковый вывод: нативная поддержка SSE streaming
- Совместимость SDK: доступ через Python SDK
zaiи Java SDK от Zhipu; OpenAI-compatible API через BigModel
Модель открыта для enterprise-клиентов на платформе BigModel (bigmodel.cn / api.z.ai). Параллельно GLM-5.1 появился в каталоге сторонних моделей Alibaba Cloud DashScope с идентификатором glm-5.1 — команды с уже подключённым DashScope могут маршрутизировать запросы к GLM без отдельного аккаунта Zhipu, через тот же OpenAI-compatible endpoint, что используется для Qwen.
Технически TileRT устраняет задержки через: статическую компиляцию графа вычислений в персистентные Engine Kernels, прямую передачу промежуточных данных через регистры и L2-кэш (без записи в Global Memory), декомпозицию задач на tile-микрозадачи, а также специализацию GPU-ролей в многокарточных конфигурациях. В совокупности эти оптимизации позволяют достичь 400 TPS без жертвования качеством ответов: по заявлению Zhipu, это стабильный production-уровень производительности, а не пиковый показатель бенчмарка.
Почему это важно для AI-команд
Скорость как самостоятельное измерение routing. Большинство политик маршрутизации сегодня оптимизируются по стоимости, качеству и доступности. Скорость вывода обычно — это SLA провайдера, а не routing-переменная. GLM-5.1-highspeed меняет это допущение. При 400 TPS типичный ответ в 1000 токенов генерируется за ~2,5 секунды — в 2–3 раза быстрее, чем у обычных флагманов. Для потоковых приложений, realtime-агентов и высоконагруженных сессий это реальное операционное преимущество.
Длинный контекст + скорость = меньше latency в agent loop. Многие coding-agent задачи передают 50K–100K токенов контекста за вызов. При вдвое большем throughput цикл агента завершается примерно вдвое быстрее: 60K-токенный вывод при 200 TPS занимает ~5 минут, при 400 TPS — ~2,5 минуты. Для параллельных worker-пулов и SLA-задач это количественно измеримый выигрыш.
DashScope как единая точка доступа. В мае 2026 года DashScope охватывает: Qwen3.7-Max, Qwen3.6-Plus/Flash, DeepSeek V4 Pro/Flash, Kimi K2.6, MiniMax M2.7, MiMo-V2.5-Pro и теперь GLM-5.1 — всё через единый base URL https://dashscope.aliyuncs.com/compatible-mode/v1 и один API-ключ. Управлять пятью-шестью отдельными провайдерами значительно сложнее, чем единым DashScope-конфигом в gateway.
Поддержка MCP tool calling. GLM-5.1-highspeed нативно поддерживает интеграцию с Model Context Protocol (MCP) — стандартный путь подключения для Claude Code, Cursor и других coding-агентов. Адаптерного слоя не требуется.
Позиционирование в ростере DashScope. Цена GLM-5.1 на DashScope публично не объявлялась, но сам факт появления модели в каталоге сторонних провайдеров Alibaba значим: команды, уже подключенные к DashScope, могут добавить GLM-5.1 в существующий routing через изменение только имени модели. Это означает: никакой регистрации, никаких дополнительных API-ключей, никаких отдельных endpoint-настроек.
Взгляд router/operator-команды
Скоростная сегментация routing-политики. Если ваш routing сейчас делит потоки только по стоимости и качеству, добавьте третий уровень — по скорости:
- Realtime / потоковые пользовательские вызовы → высокопроизводительная модель (GLM-5.1-highspeed и аналоги)
- Асинхронные batch / глубокие reasoning-задачи → quality-first модель без ограничений по скорости
- Высокообъёмные cost-sensitive workloads → flash/mini-уровень
GLM-5.1-highspeed подходит для первого уровня — там, где нужен флагманский уровень при минимальной latency.
Единый DashScope-routing для China-regional команд. Если вы уже управляете доступом к внутренним провайдерам через DashScope, текущее покрытие каталога позволяет реализовать multi-model routing и fallback в рамках одного провайдера — без разрозненных учётных записей.
Enterprise-доступ пока ограничен. GLM-5.1-highspeed находится на стадии enterprise-rollout; сроки общего доступа не объявлены. Базовый GLM-5.1 публично доступен. Если highspeed-вариант нужен в production — подавайте заявку через BigModel заранее.
Чеклист для routing-команд:
- Включает ли ваша routing-политика измерение скорости? Если нет — оцените задержки realtime-запросов, прежде чем добавлять высокопроизводительную модель.
- Проверьте доступность DashScope по вашему региону: GLM-5.1 подтверждён для DashScope CN (Пекин); уточните доступность на US/Singapore/EU-эндпоинтах до фиксации routing-политики.
- Протестируйте TPS в режиме мышления: Zhipu декларирует 400 TPS при включённом thinking mode, но рекомендуется верифицировать это на вашем task-distribution.
- Enterprise-барьер: для highspeed-варианта нужна заявка через корпоративный канал BigModel.
- Уточните ценообразование: отдельный тариф для GLM-5.1-highspeed официально не опубликован — выясните реальные ставки до включения в volume-routing.
- Оцените размер контекстного окна: 200K токенов покрывает большинство coding-agent-задач, но для сверхдлинных документов или продолжительных сессий сравните с альтернативами в вашем ростере (Kimi K2.6 предлагает 256K токенов контекста).
Что стоит отслеживать пользователям TheRouter
Для команд, маршрутизирующих запросы через TheRouter к OpenAI-compatible backend, практический путь интеграции сегодня — DashScope: добавьте его как provider, укажите target-модель glm-5.1, и вы получите доступ к семейству GLM без отдельных credentials Zhipu. Этот подход аналогичен схеме из руководства по SiliconFlow, где единый отечественный OpenAI-compatible endpoint объединяет несколько модельных семейств под одним provider-конфигом.
Для fallback-сценариев GLM-5.1-highspeed особенно интересен: если ваш первичный провайдер (например, Claude Opus) возвращает rate-limit-ошибку или превышает quota, fallback на GLM-5.1-highspeed даёт модель флагманского уровня без заметной потери качества, а скорость ответа при этом не ухудшится. Это редкое сочетание для флагманского тира в router-архитектуре.
Когда GLM-5.1-highspeed выйдет в общий доступ, 400 TPS сделают его весомым вариантом для realtime-сессий, высоконагруженных agent-деплойментов и любых workloads, где первый токен и общее время ответа напрямую влияют на UX или тайминг downstream-агентов.
Модели, упомянутые в статье
Похожие материалы
Новости AI-роутинга и провайдеров →
GLM-5.2 на OpenRouter: бенчмарки TPS, цены провайдеров и routing для coding-агентов
GLM-5.2 combines a verified 1M-token context, 128K max output, and strong coding-agent benchmarks. Routing teams should evaluate latency, pricing, provider fit, and long-horizon workloads.

Kimi K2.6 API: цены ¥1.10/¥6.50/¥27 за 1M токенов для coding agents
Kimi K2.6 API стоит ¥1.10 за cache-hit input, ¥6.50 за cache-miss input и ¥27 за output на 1M токенов; доступны KVV-проверка, 256K context и OpenAI-compatible routing для coding agents.

OpenAI Ultrafast mode routing: у GPT-5.6 Sol появился preview-tier быстрее Standard до 14 раз
OpenAI Ultrafast mode routing добавляет для GPT-5.6 Sol limited-preview tier до 14 раз быстрее Standard, поэтому операторам gateway нужно отделить latency-critical traffic от cost-sensitive fallback lanes.