← Все статьи

GLM-5.3-FlashX API: руководство по интеграции мультимодальной модели со скоростью 200 токенов/с

GLM-5.3-FlashX — ускоренный вариант GLM-5.3-Flash от Z.ai с заявленной скоростью до 200 токенов/с. Та же архитектура 320B MoE (18B активных), контекст 1M токенов, нативный мультимодальный ввод. В этом руководстве — API-доступ, цены ($0.37/$1.25 за 1M токенов на Z.ai), DashScope и маршрутизация FlashX для задач с критичной латентностью.

· TheRouter

GLM-5.3-FlashX — скоростной вариант GLM-5.3-Flash от Z.ai, появившийся на DashScope 21 сентября 2026 года. Модель построена на той же архитектуре Mixture-of-Experts с 320B параметрами и 18B активными на каждый токен, поддерживает контекстное окно в 1M токенов и нативный мультимодальный ввод (текст, изображения, видео, файлы). Разница в скорости инференса: Z.ai заявляет до 200 токенов/с для FlashX, тогда как стандартный Flash показывает около 50 tok/s по данным Artificial Analysis.

За скорость приходится платить. FlashX стоит примерно в 2.5 раза дороже Flash за токен. Для команд, использующих API-шлюз для маршрутизации, вопрос в том, оправдывает ли прирост скорости эту наценку в задачах с критичной латентностью — интерактивные coding-агенты, анализ скриншотов в реальном времени, многошаговые agent-циклы, где каждый round-trip добавляет ощутимую задержку.

Примечание: GLM-5.3-FlashX пока не включён в каталог моделей TheRouter. Модель доступна через API Z.ai (glm-5.3-flashx), DashScope (ZHIPU/GLM-5.3-FlashX) и OpenRouter (z-ai/glm-5.3-flashx). Актуальный статус маршрутов — на странице провайдера Zhipu.

Обзор: FlashX и Flash

ПараметрGLM-5.3-FlashXGLM-5.3-Flash
Архитектура320B MoE, 18B активных320B MoE, 18B активных
Контекст1M токенов1M токенов
Макс. выход128K токенов128K токенов
Скорость инференсаДо 200 tok/s (данные вендора)~50 tok/s (Artificial Analysis)
Модальности вводаТекст, изображения, видео, файлыТекст, изображения, видео, файлы
Цена ввода (Z.ai)$0.37 / 1M токенов$0.15 / 1M токенов
Цена вывода (Z.ai)$1.25 / 1M токенов$0.50 / 1M токенов
Кэш-чтение (Z.ai)$0.075 / 1M токенов$0.035 / 1M токенов
ReasoningВсегда включёнВсегда включён
DashScope model IDZHIPU/GLM-5.3-FlashXZHIPU/GLM-5.3-Flash

Что такое FlashX и чем он не является

FlashX — тот же набор весов, что и GLM-5.3-Flash, с оптимизированной инфраструктурой инференса для повышенной пропускной способности. Z.ai позиционирует его как «speed-focused» вариант в линейке Flash. Обе модели используют гибридную архитектуру sparse + linear attention, которая снижает вычисления внимания в 3 раза и KV-кэш в 4.4 раза по сравнению с плотным GLM-5.3.

FlashX не является отдельно обученной моделью. При одинаковых prompt и параметрах качество ответов должно совпадать с Flash. Цифра 200 tok/s — заявленный Z.ai пик, а не результат независимого тестирования. Фактическая пропускная способность зависит от длины prompt, конкурентной нагрузки и объёма вывода.

API-доступ: три маршрута

Z.ai Direct API

Z.ai предоставляет OpenAI-совместимый endpoint:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_ZAI_API_KEY",
    base_url="https://api.z.ai/api/paas/v4",
)

response = client.chat.completions.create(
    model="glm-5.3-flashx",
    messages=[{"role": "user", "content": "Объясни разницу между sparse и linear attention."}],
    stream=True,
)

for chunk in response:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

DashScope (Alibaba Cloud Model Studio)

FlashX появился на DashScope 21 сентября 2026 года под model ID ZHIPU/GLM-5.3-FlashX. DashScope предлагает OpenAI-совместимый endpoint с мультирегиональным развёртыванием:

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)

response = client.chat.completions.create(
    model="ZHIPU/GLM-5.3-FlashX",
    messages=[{"role": "user", "content": "Проанализируй этот скриншот и опиши layout."}],
    stream=True,
)

for chunk in response:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Регионы DashScope: Китай (Пекин), США (Вирджиния), Германия (Франкфурт), Сингапур и Гонконг. Каждая модель включает 1 миллион бесплатных токенов для начального тестирования.

OpenRouter

OpenRouter обслуживает FlashX под model ID z-ai/glm-5.3-flashx:

curl -X POST https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "z-ai/glm-5.3-flashx",
  "messages": [{"role": "user", "content": "Hello!"}]
}'

Цены: наценка 2.5x за скорость

FlashX обходится примерно в 2.5 раза дороже Flash за токен. Оправданность этой наценки зависит от характера нагрузки.

ПровайдерМодельВвод / 1MВывод / 1MКэш-чтение / 1M
Z.aiglm-5.3-flashx$0.37$1.25$0.075
Z.aiglm-5.3-flash$0.15$0.50$0.035
DashScopeZHIPU/GLM-5.3-FlashXЗависит от регионаЗависит от региона—
OpenRouterz-ai/glm-5.3-flashx$0.0352$0.50—

Для типичного запроса в 1 000 токенов ввода / 300 токенов вывода:

  • Flash — около $0.00030 за запрос
  • FlashX — около $0.00075 за запрос

При 100 000 запросов в день разница составит примерно $45/день. Ключевой вопрос — даёт ли четырёхкратное ускорение инференса экономию, превышающую $45/день, за счёт сокращения ожидания пользователей, уменьшения timeout-ошибок и более быстрых agent-циклов.

Мультимодальный ввод: изображения, видео и файлы

Flash и FlashX разделяют одни и те же нативные мультимодальные возможности. Модель принимает изображения через блоки image_url в OpenAI-совместимом формате:

response = client.chat.completions.create(
    model="glm-5.3-flashx",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Какой UI-фреймворк использован на этом скриншоте?"},
            {"type": "image_url", "image_url": {"url": "https://example.com/screenshot.png"}},
        ],
    }],
)

По документации Z.ai также поддерживается ввод видео и файлов. Конкретные форматы и ограничения по размеру лучше проверять в официальной документации API.

Возможности: reasoning, tool use и structured output

FlashX наследует весь набор возможностей GLM-5.3-Flash:

  • Reasoning (всегда включён): параметр thinking.type поддерживает только значение enabled, отключить нельзя. Рекомендуемые настройки — reasoning_effort: max и thinking.clear_thinking: false.
  • Function calling: поддерживаются многошаговые цепочки вызовов инструментов. Z.ai рекомендует включать tool_stream: true для streaming-запросов с tool calls.
  • Structured output: поддерживается JSON-формат ответов для интеграции с внешними системами.
  • Context caching: автоматическое кэш-чтение по сниженной цене. На Z.ai кэшированный ввод стоит $0.075/1M токенов (вместо $0.37 за обычный ввод).
  • Web search: серверный инструмент веб-поиска, оплата за успешный вызов (~$0.01/вызов на Z.ai).

Рекомендованные параметры из документации Z.ai: temperature: 1, top_p: 0.95, reasoning_effort: max.

Когда маршрутизировать на FlashX, Flash или GLM-5.3

Семейство GLM-5.3 включает три уровня. Ниже — фреймворк принятия решений для API-маршрутизации.

Маршрутизировать на FlashX, когда:

  • Интерактивные coding-агенты, где каждый round-trip добавляет заметную задержку
  • Анализ скриншотов в реальном времени в dev-воркфлоу
  • Многошаговые agent-циклы, где общее wall-clock время важнее цены за токен
  • Streaming-ответы в пользовательских приложениях, где воспринимаемая скорость влияет на вовлечённость

Маршрутизировать на Flash, когда:

  • Пакетная обработка, где латентность не является узким местом
  • Фоновые задачи (обработка документов, code review), результаты которых потребляются асинхронно
  • Высоконагруженные сценарии, где разница в 2.5x ощутима для бюджета
  • Задачи, где то же качество модели нужно при меньших затратах

Маршрутизировать на GLM-5.3 (плотный flagship), когда:

  • Требуется максимальное качество reasoning (кибербезопасность, сложная разработка)
  • Ценность задачи оправдывает $1.40/$4.40 за 1M токенов
  • Долгие agent-воркфлоу, где качество каждого шага накапливается

Конфигурация TheRouter: FlashX с fallback на Flash

Когда TheRouter добавит GLM-5.3-FlashX в каталог, можно будет настроить routing-уровень с оптимизацией по латентности. TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров:

  1. Основной: GLM-5.3-FlashX для запросов, чувствительных к латентности
  2. Fallback: GLM-5.3-Flash при недоступности FlashX или rate-limiting
  3. Cost fallback: Qwen3.8-Flash или DeepSeek V4.1 Flash для бюджетных запросов

Все три модели предоставляют OpenAI-совместимые Chat Completions endpoint, переключение требует только замены model ID. Унифицированный API TheRouter обрабатывает различия в аутентификации и URL на уровне провайдеров.

FlashX в контексте конкурентов

FlashX конкурирует в сегменте скоростных мультимодальных моделей. Для сравнения:

МодельЗаявленная скоростьВвод / 1MВывод / 1MКонтекст
GLM-5.3-FlashX200 tok/s$0.37$1.251M
GLM-5.3-Flash~50 tok/s (AA)$0.15$0.501M
Qwen3.8-Flash—~$0.10~$0.301M
DeepSeek V4.1 Flash—$0.10$0.30128K

Преимущество FlashX в скорости наиболее ощутимо в интерактивных workflow, где инференс модели — узкое место. Для пакетной или офлайн-обработки наценка 2.5x обычно себя не окупает.

FAQ

GLM-5.3-FlashX — это другая модель по сравнению с GLM-5.3-Flash?

Нет. FlashX использует ту же архитектуру 320B MoE с 18B активными параметрами и идентичные веса. Разница в инфраструктуре инференса — FlashX оптимизирован под более высокую пропускную способность при более высокой цене за токен.

Можно ли отключить reasoning в FlashX?

Нет. Reasoning всегда включён в обеих моделях — Flash и FlashX. Параметр thinking.type поддерживает только enabled. Z.ai рекомендует reasoning_effort: max и thinking.clear_thinking: false.

Подтверждена ли скорость 200 tok/s независимо?

На момент публикации — нет. Цифра 200 tok/s взята из документации Z.ai. Artificial Analysis измеряет GLM-5.3-Flash на уровне ~50 tok/s, а GLM-5.3 (плотную версию) — на ~66 tok/s, но независимые бенчмарки FlashX пока не опубликованы.

Доступен ли GLM-5.3-FlashX в GLM Coding Plan?

Пока нет. В документации Z.ai сказано, что «GLM-5.3-FlashX is not yet available on the plan». Flash доступен в Coding Plan с квотой, втрое превышающей квоту GLM-5.3.

Поддерживает ли FlashX Responses API?

Responses API на DashScope поддерживает только glm-5.2 и glm-5.3 (плотная версия), но не варианты Flash/FlashX. FlashX работает через Chat Completions API.

Какие регионы DashScope поддерживают FlashX?

DashScope обслуживает GLM-модели через OpenAI-совместимый endpoint в регионах Китай (Пекин), США (Вирджиния), Германия (Франкфурт), Сингапур и Гонконг.


Источники: Документация Z.ai GLM-5.3-Flash/FlashX (получено 2026-10-04), OpenRouter GLM-5.3-FlashX (получено 2026-10-04), DashScope — руководство по интеграции GLM (получено 2026-10-04), china-llm.com — цены FlashX (проверено 2026-09-21), Artificial Analysis — бенчмарки GLM-5.3 (получено 2026-10-04).

Помощь и контакты