GLM-5.1-HighSpeed: как 400 TPS от Zhipu меняет логику latency-routing

Zhipu AI запустила GLM-5.1-highspeed: 400 ток/с через TileRT, 200K контекст, поддержка MCP. Доступна через DashScope. Изменяет routing-логику для realtime-запросов.

Опубликовано источник Zhipu AI / BigModel

Архивный материал, подготовленный с помощью ИИ по указанному источнику и опубликованный без индивидуальной проверки. Ответственный редактор: Joe Werner.

Редакционная графика: стрелка бенчмарка скорости с ветвями routing-решений и минимальными элементами кода
Машинный перевод с английского оригинала — читать оригинал

Когда провайдер выпускает высокопроизводительный вариант флагмана без потери качества, вопрос routing меняется: не «достаточно ли хороша эта модель», а «становится ли скорость вывода в 400 токенов в секунду основным критерием маршрутизации». Именно такой выбор перед командами ставит GLM-5.1-highspeed от Zhipu AI — модель, запущенная в конце мая 2026 года на платформе BigModel и каталоге Alibaba Cloud DashScope.

Что произошло

Zhipu AI представила GLM-5.1-highspeed — production-вариант GLM-5.1 на базе собственного движка TileRT. Ключевые параметры:

  • Скорость вывода: 400 токенов/с (стабильный production-уровень, не пиковый показатель)
  • Контекстное окно: 200K токенов
  • Максимальная длина вывода: 128K токенов — для массовой генерации кода и обработки длинных документов
  • Режим глубокого мышления: опционально; доступен на той же скоростной ступени
  • Потоковый вывод: нативная поддержка SSE streaming
  • Совместимость SDK: доступ через Python SDK zai и Java SDK от Zhipu; OpenAI-compatible API через BigModel

Модель открыта для enterprise-клиентов на платформе BigModel (bigmodel.cn / api.z.ai). Параллельно GLM-5.1 появился в каталоге сторонних моделей Alibaba Cloud DashScope с идентификатором glm-5.1 — команды с уже подключённым DashScope могут маршрутизировать запросы к GLM без отдельного аккаунта Zhipu, через тот же OpenAI-compatible endpoint, что используется для Qwen.

Технически TileRT устраняет задержки через: статическую компиляцию графа вычислений в персистентные Engine Kernels, прямую передачу промежуточных данных через регистры и L2-кэш (без записи в Global Memory), декомпозицию задач на tile-микрозадачи, а также специализацию GPU-ролей в многокарточных конфигурациях. В совокупности эти оптимизации позволяют достичь 400 TPS без жертвования качеством ответов: по заявлению Zhipu, это стабильный production-уровень производительности, а не пиковый показатель бенчмарка.

Почему это важно для AI-команд

Скорость как самостоятельное измерение routing. Большинство политик маршрутизации сегодня оптимизируются по стоимости, качеству и доступности. Скорость вывода обычно — это SLA провайдера, а не routing-переменная. GLM-5.1-highspeed меняет это допущение. При 400 TPS типичный ответ в 1000 токенов генерируется за ~2,5 секунды — в 2–3 раза быстрее, чем у обычных флагманов. Для потоковых приложений, realtime-агентов и высоконагруженных сессий это реальное операционное преимущество.

Длинный контекст + скорость = меньше latency в agent loop. Многие coding-agent задачи передают 50K–100K токенов контекста за вызов. При вдвое большем throughput цикл агента завершается примерно вдвое быстрее: 60K-токенный вывод при 200 TPS занимает ~5 минут, при 400 TPS — ~2,5 минуты. Для параллельных worker-пулов и SLA-задач это количественно измеримый выигрыш.

DashScope как единая точка доступа. В мае 2026 года DashScope охватывает: Qwen3.7-Max, Qwen3.6-Plus/Flash, DeepSeek V4 Pro/Flash, Kimi K2.6, MiniMax M2.7, MiMo-V2.5-Pro и теперь GLM-5.1 — всё через единый base URL https://dashscope.aliyuncs.com/compatible-mode/v1 и один API-ключ. Управлять пятью-шестью отдельными провайдерами значительно сложнее, чем единым DashScope-конфигом в gateway.

Поддержка MCP tool calling. GLM-5.1-highspeed нативно поддерживает интеграцию с Model Context Protocol (MCP) — стандартный путь подключения для Claude Code, Cursor и других coding-агентов. Адаптерного слоя не требуется.

Позиционирование в ростере DashScope. Цена GLM-5.1 на DashScope публично не объявлялась, но сам факт появления модели в каталоге сторонних провайдеров Alibaba значим: команды, уже подключенные к DashScope, могут добавить GLM-5.1 в существующий routing через изменение только имени модели. Это означает: никакой регистрации, никаких дополнительных API-ключей, никаких отдельных endpoint-настроек.

Взгляд router/operator-команды

Скоростная сегментация routing-политики. Если ваш routing сейчас делит потоки только по стоимости и качеству, добавьте третий уровень — по скорости:

  1. Realtime / потоковые пользовательские вызовы → высокопроизводительная модель (GLM-5.1-highspeed и аналоги)
  2. Асинхронные batch / глубокие reasoning-задачи → quality-first модель без ограничений по скорости
  3. Высокообъёмные cost-sensitive workloads → flash/mini-уровень

GLM-5.1-highspeed подходит для первого уровня — там, где нужен флагманский уровень при минимальной latency.

Единый DashScope-routing для China-regional команд. Если вы уже управляете доступом к внутренним провайдерам через DashScope, текущее покрытие каталога позволяет реализовать multi-model routing и fallback в рамках одного провайдера — без разрозненных учётных записей.

Enterprise-доступ пока ограничен. GLM-5.1-highspeed находится на стадии enterprise-rollout; сроки общего доступа не объявлены. Базовый GLM-5.1 публично доступен. Если highspeed-вариант нужен в production — подавайте заявку через BigModel заранее.

Чеклист для routing-команд:

  • Включает ли ваша routing-политика измерение скорости? Если нет — оцените задержки realtime-запросов, прежде чем добавлять высокопроизводительную модель.
  • Проверьте доступность DashScope по вашему региону: GLM-5.1 подтверждён для DashScope CN (Пекин); уточните доступность на US/Singapore/EU-эндпоинтах до фиксации routing-политики.
  • Протестируйте TPS в режиме мышления: Zhipu декларирует 400 TPS при включённом thinking mode, но рекомендуется верифицировать это на вашем task-distribution.
  • Enterprise-барьер: для highspeed-варианта нужна заявка через корпоративный канал BigModel.
  • Уточните ценообразование: отдельный тариф для GLM-5.1-highspeed официально не опубликован — выясните реальные ставки до включения в volume-routing.
  • Оцените размер контекстного окна: 200K токенов покрывает большинство coding-agent-задач, но для сверхдлинных документов или продолжительных сессий сравните с альтернативами в вашем ростере (Kimi K2.6 предлагает 256K токенов контекста).

Что стоит отслеживать пользователям TheRouter

Для команд, маршрутизирующих запросы через TheRouter к OpenAI-compatible backend, практический путь интеграции сегодня — DashScope: добавьте его как provider, укажите target-модель glm-5.1, и вы получите доступ к семейству GLM без отдельных credentials Zhipu. Этот подход аналогичен схеме из руководства по SiliconFlow, где единый отечественный OpenAI-compatible endpoint объединяет несколько модельных семейств под одним provider-конфигом.

Для fallback-сценариев GLM-5.1-highspeed особенно интересен: если ваш первичный провайдер (например, Claude Opus) возвращает rate-limit-ошибку или превышает quota, fallback на GLM-5.1-highspeed даёт модель флагманского уровня без заметной потери качества, а скорость ответа при этом не ухудшится. Это редкое сочетание для флагманского тира в router-архитектуре.

Когда GLM-5.1-highspeed выйдет в общий доступ, 400 TPS сделают его весомым вариантом для realtime-сессий, высоконагруженных agent-деплойментов и любых workloads, где первый токен и общее время ответа напрямую влияют на UX или тайминг downstream-агентов.

Модели, упомянутые в статье

Помощь и контакты