GLM-5.3-FlashX API: руководство по интеграции мультимодальной модели со скоростью 200 токенов/с
GLM-5.3-FlashX — ускоренный вариант GLM-5.3-Flash от Z.ai с заявленной скоростью до 200 токенов/с. Та же архитектура 320B MoE (18B активных), контекст 1M токенов, нативный мультимодальный ввод. В этом руководстве — API-доступ, цены ($0.37/$1.25 за 1M токенов на Z.ai), DashScope и маршрутизация FlashX для задач с критичной латентностью.
GLM-5.3-FlashX — скоростной вариант GLM-5.3-Flash от Z.ai, появившийся на DashScope 21 сентября 2026 года. Модель построена на той же архитектуре Mixture-of-Experts с 320B параметрами и 18B активными на каждый токен, поддерживает контекстное окно в 1M токенов и нативный мультимодальный ввод (текст, изображения, видео, файлы). Разница в скорости инференса: Z.ai заявляет до 200 токенов/с для FlashX, тогда как стандартный Flash показывает около 50 tok/s по данным Artificial Analysis.
За скорость приходится платить. FlashX стоит примерно в 2.5 раза дороже Flash за токен. Для команд, использующих API-шлюз для маршрутизации, вопрос в том, оправдывает ли прирост скорости эту наценку в задачах с критичной латентностью — интерактивные coding-агенты, анализ скриншотов в реальном времени, многошаговые agent-циклы, где каждый round-trip добавляет ощутимую задержку.
Примечание: GLM-5.3-FlashX пока не включён в каталог моделей TheRouter. Модель доступна через API Z.ai (
glm-5.3-flashx), DashScope (ZHIPU/GLM-5.3-FlashX) и OpenRouter (z-ai/glm-5.3-flashx). Актуальный статус маршрутов — на странице провайдера Zhipu.
Обзор: FlashX и Flash
| Параметр | GLM-5.3-FlashX | GLM-5.3-Flash |
|---|---|---|
| Архитектура | 320B MoE, 18B активных | 320B MoE, 18B активных |
| Контекст | 1M токенов | 1M токенов |
| Макс. выход | 128K токенов | 128K токенов |
| Скорость инференса | До 200 tok/s (данные вендора) | ~50 tok/s (Artificial Analysis) |
| Модальности ввода | Текст, изображения, видео, файлы | Текст, изображения, видео, файлы |
| Цена ввода (Z.ai) | $0.37 / 1M токенов | $0.15 / 1M токенов |
| Цена вывода (Z.ai) | $1.25 / 1M токенов | $0.50 / 1M токенов |
| Кэш-чтение (Z.ai) | $0.075 / 1M токенов | $0.035 / 1M токенов |
| Reasoning | Всегда включён | Всегда включён |
| DashScope model ID | ZHIPU/GLM-5.3-FlashX | ZHIPU/GLM-5.3-Flash |
Что такое FlashX и чем он не является
FlashX — тот же набор весов, что и GLM-5.3-Flash, с оптимизированной инфраструктурой инференса для повышенной пропускной способности. Z.ai позиционирует его как «speed-focused» вариант в линейке Flash. Обе модели используют гибридную архитектуру sparse + linear attention, которая снижает вычисления внимания в 3 раза и KV-кэш в 4.4 раза по сравнению с плотным GLM-5.3.
FlashX не является отдельно обученной моделью. При одинаковых prompt и параметрах качество ответов должно совпадать с Flash. Цифра 200 tok/s — заявленный Z.ai пик, а не результат независимого тестирования. Фактическая пропускная способность зависит от длины prompt, конкурентной нагрузки и объёма вывода.
API-доступ: три маршрута
Z.ai Direct API
Z.ai предоставляет OpenAI-совместимый endpoint:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_ZAI_API_KEY",
base_url="https://api.z.ai/api/paas/v4",
)
response = client.chat.completions.create(
model="glm-5.3-flashx",
messages=[{"role": "user", "content": "Объясни разницу между sparse и linear attention."}],
stream=True,
)
for chunk in response:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
DashScope (Alibaba Cloud Model Studio)
FlashX появился на DashScope 21 сентября 2026 года под model ID ZHIPU/GLM-5.3-FlashX. DashScope предлагает OpenAI-совместимый endpoint с мультирегиональным развёртыванием:
from openai import OpenAI
import os
client = OpenAI(
api_key=os.getenv("DASHSCOPE_API_KEY"),
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="ZHIPU/GLM-5.3-FlashX",
messages=[{"role": "user", "content": "Проанализируй этот скриншот и опиши layout."}],
stream=True,
)
for chunk in response:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
Регионы DashScope: Китай (Пекин), США (Вирджиния), Германия (Франкфурт), Сингапур и Гонконг. Каждая модель включает 1 миллион бесплатных токенов для начального тестирования.
OpenRouter
OpenRouter обслуживает FlashX под model ID z-ai/glm-5.3-flashx:
curl -X POST https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "z-ai/glm-5.3-flashx",
"messages": [{"role": "user", "content": "Hello!"}]
}'
Цены: наценка 2.5x за скорость
FlashX обходится примерно в 2.5 раза дороже Flash за токен. Оправданность этой наценки зависит от характера нагрузки.
| Провайдер | Модель | Ввод / 1M | Вывод / 1M | Кэш-чтение / 1M |
|---|---|---|---|---|
| Z.ai | glm-5.3-flashx | $0.37 | $1.25 | $0.075 |
| Z.ai | glm-5.3-flash | $0.15 | $0.50 | $0.035 |
| DashScope | ZHIPU/GLM-5.3-FlashX | Зависит от региона | Зависит от региона | — |
| OpenRouter | z-ai/glm-5.3-flashx | $0.0352 | $0.50 | — |
Для типичного запроса в 1 000 токенов ввода / 300 токенов вывода:
- Flash — около $0.00030 за запрос
- FlashX — около $0.00075 за запрос
При 100 000 запросов в день разница составит примерно $45/день. Ключевой вопрос — даёт ли четырёхкратное ускорение инференса экономию, превышающую $45/день, за счёт сокращения ожидания пользователей, уменьшения timeout-ошибок и более быстрых agent-циклов.
Мультимодальный ввод: изображения, видео и файлы
Flash и FlashX разделяют одни и те же нативные мультимодальные возможности. Модель принимает изображения через блоки image_url в OpenAI-совместимом формате:
response = client.chat.completions.create(
model="glm-5.3-flashx",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Какой UI-фреймворк использован на этом скриншоте?"},
{"type": "image_url", "image_url": {"url": "https://example.com/screenshot.png"}},
],
}],
)
По документации Z.ai также поддерживается ввод видео и файлов. Конкретные форматы и ограничения по размеру лучше проверять в официальной документации API.
Возможности: reasoning, tool use и structured output
FlashX наследует весь набор возможностей GLM-5.3-Flash:
- Reasoning (всегда включён): параметр
thinking.typeподдерживает только значениеenabled, отключить нельзя. Рекомендуемые настройки —reasoning_effort: maxиthinking.clear_thinking: false. - Function calling: поддерживаются многошаговые цепочки вызовов инструментов. Z.ai рекомендует включать
tool_stream: trueдля streaming-запросов с tool calls. - Structured output: поддерживается JSON-формат ответов для интеграции с внешними системами.
- Context caching: автоматическое кэш-чтение по сниженной цене. На Z.ai кэшированный ввод стоит $0.075/1M токенов (вместо $0.37 за обычный ввод).
- Web search: серверный инструмент веб-поиска, оплата за успешный вызов (~$0.01/вызов на Z.ai).
Рекомендованные параметры из документации Z.ai: temperature: 1, top_p: 0.95, reasoning_effort: max.
Когда маршрутизировать на FlashX, Flash или GLM-5.3
Семейство GLM-5.3 включает три уровня. Ниже — фреймворк принятия решений для API-маршрутизации.
Маршрутизировать на FlashX, когда:
- Интерактивные coding-агенты, где каждый round-trip добавляет заметную задержку
- Анализ скриншотов в реальном времени в dev-воркфлоу
- Многошаговые agent-циклы, где общее wall-clock время важнее цены за токен
- Streaming-ответы в пользовательских приложениях, где воспринимаемая скорость влияет на вовлечённость
Маршрутизировать на Flash, когда:
- Пакетная обработка, где латентность не является узким местом
- Фоновые задачи (обработка документов, code review), результаты которых потребляются асинхронно
- Высоконагруженные сценарии, где разница в 2.5x ощутима для бюджета
- Задачи, где то же качество модели нужно при меньших затратах
Маршрутизировать на GLM-5.3 (плотный flagship), когда:
- Требуется максимальное качество reasoning (кибербезопасность, сложная разработка)
- Ценность задачи оправдывает $1.40/$4.40 за 1M токенов
- Долгие agent-воркфлоу, где качество каждого шага накапливается
Конфигурация TheRouter: FlashX с fallback на Flash
Когда TheRouter добавит GLM-5.3-FlashX в каталог, можно будет настроить routing-уровень с оптимизацией по латентности. TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров:
- Основной: GLM-5.3-FlashX для запросов, чувствительных к латентности
- Fallback: GLM-5.3-Flash при недоступности FlashX или rate-limiting
- Cost fallback: Qwen3.8-Flash или DeepSeek V4.1 Flash для бюджетных запросов
Все три модели предоставляют OpenAI-совместимые Chat Completions endpoint, переключение требует только замены model ID. Унифицированный API TheRouter обрабатывает различия в аутентификации и URL на уровне провайдеров.
FlashX в контексте конкурентов
FlashX конкурирует в сегменте скоростных мультимодальных моделей. Для сравнения:
| Модель | Заявленная скорость | Ввод / 1M | Вывод / 1M | Контекст |
|---|---|---|---|---|
| GLM-5.3-FlashX | 200 tok/s | $0.37 | $1.25 | 1M |
| GLM-5.3-Flash | ~50 tok/s (AA) | $0.15 | $0.50 | 1M |
| Qwen3.8-Flash | — | ~$0.10 | ~$0.30 | 1M |
| DeepSeek V4.1 Flash | — | $0.10 | $0.30 | 128K |
Преимущество FlashX в скорости наиболее ощутимо в интерактивных workflow, где инференс модели — узкое место. Для пакетной или офлайн-обработки наценка 2.5x обычно себя не окупает.
FAQ
GLM-5.3-FlashX — это другая модель по сравнению с GLM-5.3-Flash?
Нет. FlashX использует ту же архитектуру 320B MoE с 18B активными параметрами и идентичные веса. Разница в инфраструктуре инференса — FlashX оптимизирован под более высокую пропускную способность при более высокой цене за токен.
Можно ли отключить reasoning в FlashX?
Нет. Reasoning всегда включён в обеих моделях — Flash и FlashX. Параметр thinking.type поддерживает только enabled. Z.ai рекомендует reasoning_effort: max и thinking.clear_thinking: false.
Подтверждена ли скорость 200 tok/s независимо?
На момент публикации — нет. Цифра 200 tok/s взята из документации Z.ai. Artificial Analysis измеряет GLM-5.3-Flash на уровне ~50 tok/s, а GLM-5.3 (плотную версию) — на ~66 tok/s, но независимые бенчмарки FlashX пока не опубликованы.
Доступен ли GLM-5.3-FlashX в GLM Coding Plan?
Пока нет. В документации Z.ai сказано, что «GLM-5.3-FlashX is not yet available on the plan». Flash доступен в Coding Plan с квотой, втрое превышающей квоту GLM-5.3.
Поддерживает ли FlashX Responses API?
Responses API на DashScope поддерживает только glm-5.2 и glm-5.3 (плотная версия), но не варианты Flash/FlashX. FlashX работает через Chat Completions API.
Какие регионы DashScope поддерживают FlashX?
DashScope обслуживает GLM-модели через OpenAI-совместимый endpoint в регионах Китай (Пекин), США (Вирджиния), Германия (Франкфурт), Сингапур и Гонконг.
Источники: Документация Z.ai GLM-5.3-Flash/FlashX (получено 2026-10-04), OpenRouter GLM-5.3-FlashX (получено 2026-10-04), DashScope — руководство по интеграции GLM (получено 2026-10-04), china-llm.com — цены FlashX (проверено 2026-09-21), Artificial Analysis — бенчмарки GLM-5.3 (получено 2026-10-04).