GLM-5.3-Flash vs GLM-5.3: когда скорость и стоимость важнее максимальной производительности при API-маршрутизации
GLM-5.3-Flash — модель на 320B параметров с архитектурой MoE, где активны только 18B параметров на токен. Цена — $0.15/$0.50 за миллион токенов, примерно в 10 раз дешевле GLM-5.3 ($1.40/$4.40). Сравниваем архитектуру, бенчмарки, цены и сценарии маршрутизации.
GLM-5.3-Flash вышла 26 августа 2026 года, завершив шестидневный анонимный запуск под именем «Ox Alpha» на OpenRouter. Это mixture-of-experts модель с 320B параметров, из которых на каждый токен активируются только 18B. Она нативно мультимодальна (текст, изображения, видео на вход) и стоит примерно в десять раз дешевле GLM-5.3. Обе модели от Z.ai (Zhipu AI), обе поддерживают контекстное окно 1M токенов и максимальный вывод 128K, и обе предоставляют OpenAI-совместимые API.
Вопрос маршрутизации прост. GLM-5.3 — флагманская модель для кодинга и кибербезопасности, оптимизированная для долгих агентских задач. GLM-5.3-Flash — эффективная альтернатива с гибридной sparse-plus-linear attention архитектурой, которая сокращает вычисления внимания в 3 раза, а размер KV-кеша — в 4.4 раза. Для команд с API-маршрутизатором решение сводится к форме рабочей нагрузки, бюджету на токены и тому, насколько разница в бенчмарках существенна для конкретных задач.
Примечание: Ни GLM-5.3-Flash, ни GLM-5.3 пока не добавлены в каталог моделей TheRouter. GLM-5.3 доступна на DashScope как
ZHIPU/GLM-5.3(с 17 августа). GLM-5.3-Flash доступна через Z.ai API и OpenRouter. Актуальные маршруты смотрите на странице провайдера Zhipu.
Сводная таблица
| Параметр | GLM-5.3-Flash | GLM-5.3 |
|---|---|---|
| Архитектура | 320B MoE, 18B активных | 753B dense (оценка) |
| Механизм внимания | Гибридный sparse + linear | Стандартный |
| Контекстное окно | 1M токенов | 1M токенов |
| Максимальный вывод | 128K токенов | 128K токенов |
| Входные модальности | Текст, изображения, видео | Текст |
| Цена входа (за 1M токенов) | $0.15 ($0.075 промо) | $1.40 |
| Цена выхода (за 1M токенов) | $0.50 ($0.25 промо) | $4.40 |
| Цена кешированного входа | $0.03 ($0.015 промо) | $0.26 |
| Лицензия | MIT, открытые веса | Открытые веса (ожидаются) |
| Уровни reasoning effort | Low / High / Max | Low / High / Max |
| Вызов инструментов | Да | Да |
| Доступность на DashScope | Пока нет | ZHIPU/GLM-5.3 |
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
Архитектура: Dense-флагман против Sparse MoE
GLM-5.3 — dense-модель (оценочно 753B параметров) для сложных задач в области разработки ПО, работы с терминалом и кибербезопасности. Она построена на базе GLM-5.2 с расширенным post-training по более разнообразным долгосрочным задачам и дополнительным RL-обучением.
GLM-5.3-Flash использует принципиально другой подход. Это первая модель в серии GLM-5 с архитектурой mixture-of-experts: 320B параметров, но только 18B активных на каждый forward pass. Z.ai сочетает это с гибридным sparse-plus-linear attention механизмом. По их данным, это первая open-source frontier модель с такой комбинацией. Конкретные цифры: вычисления внимания сокращаются в 3.01 раза, KV-кеш уменьшается в 4.44 раза по сравнению с GLM-5.3 при том же контексте.
На 1M токенов контекста KV-кеш — основная статья расходов памяти. Уменьшение в 4.4 раза означает, что Flash может обрабатывать длинноконтекстные задачи на значительно меньшем количестве GPU, откуда и разница в цене.
Ещё одно архитектурное отличие — модальность. GLM-5.3-Flash нативно мультимодальна: принимает текст, изображения и видео. Визуальные возможности встроены в цикл кодирования — модель может наблюдать за отрисованными интерфейсами и итерировать на основе увиденного. GLM-5.3 работает только с текстом.
Сравнение бенчмарков
Все данные ниже — из официальной model card Z.ai. Это результаты от вендора, не проверенные независимо.
| Бенчмарк | GLM-5.3-Flash | GLM-5.3 | GLM-5.2 |
|---|---|---|---|
| Terminal-Bench 2.1 | 84.3 | — | 81.0 |
| DeepSWE v1.1 | 63.4 | 66.9 | 46.2 |
| Agents' Last Exam | 26.3 | — | 20.4 |
| AutomationBench | 48.8 | 48.2 | 26.2 |
| HLE w/ Tools | 55.3 | — | 54.7 |
| GDPval-AA v2 (Elo) | 1773 | — | 1504 |
В данных есть интересная закономерность. На нескольких бенчмарках GLM-5.3-Flash при значительно меньших вычислениях соответствует или превосходит GLM-5.3. На AutomationBench Flash набирает 48.8 против 48.2 у флагмана. Самое явное преимущество флагмана — на DeepSWE v1.1: 66.9 против 63.4.
Независимые данные из периода анонимного запуска добавляют контекст. За шесть дней, пока Ox Alpha работал на OpenRouter, сообщество провело DeepSWE-оценку на 113 задачах — 58.4% решено с одной попытки. Разница с официальными 63.4 объясняется настройками тестового окружения: Z.ai использовала mini-swe-agent harness с 6-часовым таймаутом и 400K контекстом.
Отзывы пользователей за период анонимного запуска показали устойчивую закономерность: те, кто использовал модель в реальных агентских фреймворках с инструментами и терминалом, оценивали её значительно выше тех, кто просто общался в чате.
Сравнение цен
Разница в стоимости — главный сигнал для маршрутизации.
| Канал | Flash вход | Flash выход | GLM-5.3 вход | GLM-5.3 выход |
|---|---|---|---|---|
| Z.ai API (базовая) | $0.15 | $0.50 | $1.40 | $4.40 |
| Z.ai API (промо, до 9 сентября) | $0.075 | $0.25 | $1.40 | $4.40 |
| OpenRouter | $0.075 | $0.25 | $1.40 | $4.40 |
| DashScope (Aliyun) | Пока нет | Пока нет | Доступна | Доступна |
По базовой цене входные токены GLM-5.3-Flash стоят 10.7% от цены GLM-5.3, выходные — 11.4%. Во время промо-периода (до 9 сентября 2026) разрыв ещё больше: Flash-вход — 5.4% от стоимости GLM-5.3.
Стоимость типичной агентской задачи на 100K токенов (50K вход, 50K выход):
| Модель | Стоимость входа | Стоимость выхода | Итого |
|---|---|---|---|
| GLM-5.3 | $0.070 | $0.220 | $0.290 |
| GLM-5.3-Flash (базовая) | $0.0075 | $0.025 | $0.0325 |
| GLM-5.3-Flash (промо) | $0.00375 | $0.0125 | $0.01625 |
Снижение в 8.9 раза по базовой цене и в 17.8 раза во время промо. В масштабе эти цифры определяют, экономически ли жизнеспособна рабочая нагрузка.
Фреймворк маршрутизации
Выбирайте GLM-5.3 когда
- Максимальная точность кодирования важнее стоимости. GLM-5.3 набирает 66.9 на DeepSWE v1.1 против 63.4 у Flash. Для production-кодовых баз, где 3 балла разницы влияют на результат, флагман стоит 10-кратной наценки.
- Вы уже на DashScope. GLM-5.3 доступна как
ZHIPU/GLM-5.3на Aliyun DashScope. Flash там пока нет. - Нагрузки кибербезопасности требуют пиковой производительности. Z.ai позиционирует GLM-5.3 для поиска уязвимостей и аудита кода. Post-training включает специализированные среды для задач кибербезопасности.
Выбирайте GLM-5.3-Flash когда
- Стоимость за задачу критична в масштабе. $0.0325 за задачу на 100K токенов против $0.29. Для batch-обработки, автотестирования или непрерывного code review Flash дешевле в 8.9 раза.
- Нужен мультимодальный вход. Flash принимает изображения и видео. Если рабочий процесс включает скриншоты UI или визуальную верификацию, это единственный вариант в семействе GLM-5.3.
- Нужны открытые веса уже сейчас. Flash-веса опубликованы под MIT на Hugging Face с поддержкой SGLang, vLLM, TokenSpeed и KTransformers с первого дня.
- «Достаточно хорошее» качество для агентских задач. На AutomationBench Flash слегка обходит флагман (48.8 vs 48.2).
Маршрутизация обеих моделей
from openai import OpenAI
client = OpenAI(
api_key="your-zai-api-key",
base_url="https://api.z.ai/v1",
)
def route_glm(task_type: str, budget_sensitive: bool = True):
"""Маршрутизация между GLM-5.3 и GLM-5.3-Flash."""
if task_type in ("security_audit", "complex_refactor") and not budget_sensitive:
return "glm-5.3"
return "glm-5.3-flash"
# Flash для массовых задач
response = client.chat.completions.create(
model=route_glm("code_review"),
messages=[{"role": "user", "content": "Review this pull request..."}],
)
# Стандартная модель для критичной безопасности
response = client.chat.completions.create(
model=route_glm("security_audit", budget_sensitive=False),
messages=[{"role": "user", "content": "Audit this codebase for vulnerabilities..."}],
)
Контекстное окно и работа с длинными документами
Обе модели поддерживают контекстное окно 1M токенов и 128K максимальный вывод. Разница в эффективности памяти.
GLM-5.3-Flash с гибридной архитектурой внимания уменьшает KV-кеш в 4.44 раза при том же контексте. На практике Flash обслуживает миллионотокенные контексты на значительно меньшем количестве GPU-памяти, поэтому self-hosted развёртывания выбирают Flash для длинноконтекстных задач.
Во время анонимного запуска Ox Alpha needle-retrieval тесты работали вплоть до ~934K токенов, подтверждая, что миллионотокенное окно реально функционирует.
Доступность и интеграция
| Платформа | GLM-5.3-Flash | GLM-5.3 |
|---|---|---|
| Z.ai API | Доступна | Доступна |
| OpenRouter | z-ai/glm-5.3-flash | z-ai/glm-5.3 |
| DashScope (Aliyun) | Пока нет | ZHIPU/GLM-5.3 (17 августа) |
| Hugging Face (self-host) | MIT, zai-org/GLM-5.3-Flash | Ожидается |
| Фреймворки | SGLang, vLLM, TokenSpeed, KTransformers | SGLang, vLLM |
Обе модели используют стандартный OpenAI-совместимый API. Переход с GLM-5.2 или любого OpenAI-формата требует только смены model ID.
Промо-цены на Flash ($0.075/$0.25) действуют до 9 сентября 2026 (24:00 UTC+8). После этого применяются базовые цены $0.15/$0.50.
Кросс-провайдерный контекст: сравнение Flash-моделей
| Модель | Провайдер | Вход (за 1M) | Выход (за 1M) | Активных параметров | Контекст |
|---|---|---|---|---|---|
| GLM-5.3-Flash | Z.ai | $0.15 ($0.075 промо) | $0.50 ($0.25 промо) | 18B | 1M |
| DeepSeek V4 Flash | DeepSeek | $0.10 | $0.30 | 13B | 1M |
| Qwen3.7-Flash | DashScope | Бесплатно (лимиты) | Бесплатно (лимиты) | — | 1M |
| GLM-4.7-Flash | Z.ai | Бесплатно | Бесплатно | — | 200K |
FAQ
GLM-5.3-Flash действительно в 10 раз дешевле GLM-5.3? По базовой цене — да. Входные токены $0.15/M против $1.40/M (10.7%), выходные $0.50/M против $4.40/M (11.4%). Во время промо (до 9 сентября 2026) разрыв около 20 раз.
Можно ли развернуть GLM-5.3-Flash самостоятельно?
Да. Веса опубликованы под MIT на Hugging Face (zai-org/GLM-5.3-Flash). Поддержка SGLang, vLLM, TokenSpeed, KTransformers с первого дня. Модель 320B MoE — нужно серверное оборудование.
GLM-5.3-Flash поддерживает tool calling? Да. Обе модели поддерживают вызов инструментов и structured output через стандартный OpenAI-совместимый интерфейс.
GLM-5.3-Flash есть на DashScope?
По состоянию на 27 августа 2026 — нет. GLM-5.3 (стандартная) доступна на DashScope как ZHIPU/GLM-5.3 с 17 августа.
Источники:
- Страница цен Z.ai: https://docs.z.ai/guides/overview/pricing (получено 2026-08-27)
- Блог Z.ai о GLM-5.3: https://z.ai/blog/glm-5.3 (получено 2026-08-27)
- Обзор моделей BigModel: https://docs.bigmodel.cn/cn/guide/start/model-overview (получено 2026-08-27)
- Анализ GLM-5.3-Flash от CellCog: https://cellcog.ai/blog/glm-5-3-flash/ (получено 2026-08-27)
- Листинг GLM-5.3-Flash на OpenRouter: https://openrouter.ai/z-ai/glm-5.3-flash (получено 2026-08-27)
- Веса GLM-5.3-Flash на Hugging Face: https://huggingface.co/zai-org/GLM-5.3-Flash (получено 2026-08-27)
- Новые модели DashScope: https://help.aliyun.com/zh/model-studio/newly-released-models (получено 2026-08-27)