← Все статьи

GLM-5.3-Flash vs GLM-5.3: когда скорость и стоимость важнее максимальной производительности при API-маршрутизации

GLM-5.3-Flash — модель на 320B параметров с архитектурой MoE, где активны только 18B параметров на токен. Цена — $0.15/$0.50 за миллион токенов, примерно в 10 раз дешевле GLM-5.3 ($1.40/$4.40). Сравниваем архитектуру, бенчмарки, цены и сценарии маршрутизации.

· TheRouter

GLM-5.3-Flash вышла 26 августа 2026 года, завершив шестидневный анонимный запуск под именем «Ox Alpha» на OpenRouter. Это mixture-of-experts модель с 320B параметров, из которых на каждый токен активируются только 18B. Она нативно мультимодальна (текст, изображения, видео на вход) и стоит примерно в десять раз дешевле GLM-5.3. Обе модели от Z.ai (Zhipu AI), обе поддерживают контекстное окно 1M токенов и максимальный вывод 128K, и обе предоставляют OpenAI-совместимые API.

Вопрос маршрутизации прост. GLM-5.3 — флагманская модель для кодинга и кибербезопасности, оптимизированная для долгих агентских задач. GLM-5.3-Flash — эффективная альтернатива с гибридной sparse-plus-linear attention архитектурой, которая сокращает вычисления внимания в 3 раза, а размер KV-кеша — в 4.4 раза. Для команд с API-маршрутизатором решение сводится к форме рабочей нагрузки, бюджету на токены и тому, насколько разница в бенчмарках существенна для конкретных задач.

Примечание: Ни GLM-5.3-Flash, ни GLM-5.3 пока не добавлены в каталог моделей TheRouter. GLM-5.3 доступна на DashScope как ZHIPU/GLM-5.3 (с 17 августа). GLM-5.3-Flash доступна через Z.ai API и OpenRouter. Актуальные маршруты смотрите на странице провайдера Zhipu.

Сводная таблица

ПараметрGLM-5.3-FlashGLM-5.3
Архитектура320B MoE, 18B активных753B dense (оценка)
Механизм вниманияГибридный sparse + linearСтандартный
Контекстное окно1M токенов1M токенов
Максимальный вывод128K токенов128K токенов
Входные модальностиТекст, изображения, видеоТекст
Цена входа (за 1M токенов)$0.15 ($0.075 промо)$1.40
Цена выхода (за 1M токенов)$0.50 ($0.25 промо)$4.40
Цена кешированного входа$0.03 ($0.015 промо)$0.26
ЛицензияMIT, открытые весаОткрытые веса (ожидаются)
Уровни reasoning effortLow / High / MaxLow / High / Max
Вызов инструментовДаДа
Доступность на DashScopeПока нетZHIPU/GLM-5.3

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Архитектура: Dense-флагман против Sparse MoE

GLM-5.3 — dense-модель (оценочно 753B параметров) для сложных задач в области разработки ПО, работы с терминалом и кибербезопасности. Она построена на базе GLM-5.2 с расширенным post-training по более разнообразным долгосрочным задачам и дополнительным RL-обучением.

GLM-5.3-Flash использует принципиально другой подход. Это первая модель в серии GLM-5 с архитектурой mixture-of-experts: 320B параметров, но только 18B активных на каждый forward pass. Z.ai сочетает это с гибридным sparse-plus-linear attention механизмом. По их данным, это первая open-source frontier модель с такой комбинацией. Конкретные цифры: вычисления внимания сокращаются в 3.01 раза, KV-кеш уменьшается в 4.44 раза по сравнению с GLM-5.3 при том же контексте.

На 1M токенов контекста KV-кеш — основная статья расходов памяти. Уменьшение в 4.4 раза означает, что Flash может обрабатывать длинноконтекстные задачи на значительно меньшем количестве GPU, откуда и разница в цене.

Ещё одно архитектурное отличие — модальность. GLM-5.3-Flash нативно мультимодальна: принимает текст, изображения и видео. Визуальные возможности встроены в цикл кодирования — модель может наблюдать за отрисованными интерфейсами и итерировать на основе увиденного. GLM-5.3 работает только с текстом.

Сравнение бенчмарков

Все данные ниже — из официальной model card Z.ai. Это результаты от вендора, не проверенные независимо.

БенчмаркGLM-5.3-FlashGLM-5.3GLM-5.2
Terminal-Bench 2.184.3—81.0
DeepSWE v1.163.466.946.2
Agents' Last Exam26.3—20.4
AutomationBench48.848.226.2
HLE w/ Tools55.3—54.7
GDPval-AA v2 (Elo)1773—1504

В данных есть интересная закономерность. На нескольких бенчмарках GLM-5.3-Flash при значительно меньших вычислениях соответствует или превосходит GLM-5.3. На AutomationBench Flash набирает 48.8 против 48.2 у флагмана. Самое явное преимущество флагмана — на DeepSWE v1.1: 66.9 против 63.4.

Независимые данные из периода анонимного запуска добавляют контекст. За шесть дней, пока Ox Alpha работал на OpenRouter, сообщество провело DeepSWE-оценку на 113 задачах — 58.4% решено с одной попытки. Разница с официальными 63.4 объясняется настройками тестового окружения: Z.ai использовала mini-swe-agent harness с 6-часовым таймаутом и 400K контекстом.

Отзывы пользователей за период анонимного запуска показали устойчивую закономерность: те, кто использовал модель в реальных агентских фреймворках с инструментами и терминалом, оценивали её значительно выше тех, кто просто общался в чате.

Сравнение цен

Разница в стоимости — главный сигнал для маршрутизации.

КаналFlash входFlash выходGLM-5.3 входGLM-5.3 выход
Z.ai API (базовая)$0.15$0.50$1.40$4.40
Z.ai API (промо, до 9 сентября)$0.075$0.25$1.40$4.40
OpenRouter$0.075$0.25$1.40$4.40
DashScope (Aliyun)Пока нетПока нетДоступнаДоступна

По базовой цене входные токены GLM-5.3-Flash стоят 10.7% от цены GLM-5.3, выходные — 11.4%. Во время промо-периода (до 9 сентября 2026) разрыв ещё больше: Flash-вход — 5.4% от стоимости GLM-5.3.

Стоимость типичной агентской задачи на 100K токенов (50K вход, 50K выход):

МодельСтоимость входаСтоимость выходаИтого
GLM-5.3$0.070$0.220$0.290
GLM-5.3-Flash (базовая)$0.0075$0.025$0.0325
GLM-5.3-Flash (промо)$0.00375$0.0125$0.01625

Снижение в 8.9 раза по базовой цене и в 17.8 раза во время промо. В масштабе эти цифры определяют, экономически ли жизнеспособна рабочая нагрузка.

Фреймворк маршрутизации

Выбирайте GLM-5.3 когда

  • Максимальная точность кодирования важнее стоимости. GLM-5.3 набирает 66.9 на DeepSWE v1.1 против 63.4 у Flash. Для production-кодовых баз, где 3 балла разницы влияют на результат, флагман стоит 10-кратной наценки.
  • Вы уже на DashScope. GLM-5.3 доступна как ZHIPU/GLM-5.3 на Aliyun DashScope. Flash там пока нет.
  • Нагрузки кибербезопасности требуют пиковой производительности. Z.ai позиционирует GLM-5.3 для поиска уязвимостей и аудита кода. Post-training включает специализированные среды для задач кибербезопасности.

Выбирайте GLM-5.3-Flash когда

  • Стоимость за задачу критична в масштабе. $0.0325 за задачу на 100K токенов против $0.29. Для batch-обработки, автотестирования или непрерывного code review Flash дешевле в 8.9 раза.
  • Нужен мультимодальный вход. Flash принимает изображения и видео. Если рабочий процесс включает скриншоты UI или визуальную верификацию, это единственный вариант в семействе GLM-5.3.
  • Нужны открытые веса уже сейчас. Flash-веса опубликованы под MIT на Hugging Face с поддержкой SGLang, vLLM, TokenSpeed и KTransformers с первого дня.
  • «Достаточно хорошее» качество для агентских задач. На AutomationBench Flash слегка обходит флагман (48.8 vs 48.2).

Маршрутизация обеих моделей

from openai import OpenAI

client = OpenAI(
    api_key="your-zai-api-key",
    base_url="https://api.z.ai/v1",
)

def route_glm(task_type: str, budget_sensitive: bool = True):
    """Маршрутизация между GLM-5.3 и GLM-5.3-Flash."""
    if task_type in ("security_audit", "complex_refactor") and not budget_sensitive:
        return "glm-5.3"
    return "glm-5.3-flash"

# Flash для массовых задач
response = client.chat.completions.create(
    model=route_glm("code_review"),
    messages=[{"role": "user", "content": "Review this pull request..."}],
)

# Стандартная модель для критичной безопасности
response = client.chat.completions.create(
    model=route_glm("security_audit", budget_sensitive=False),
    messages=[{"role": "user", "content": "Audit this codebase for vulnerabilities..."}],
)

Контекстное окно и работа с длинными документами

Обе модели поддерживают контекстное окно 1M токенов и 128K максимальный вывод. Разница в эффективности памяти.

GLM-5.3-Flash с гибридной архитектурой внимания уменьшает KV-кеш в 4.44 раза при том же контексте. На практике Flash обслуживает миллионотокенные контексты на значительно меньшем количестве GPU-памяти, поэтому self-hosted развёртывания выбирают Flash для длинноконтекстных задач.

Во время анонимного запуска Ox Alpha needle-retrieval тесты работали вплоть до ~934K токенов, подтверждая, что миллионотокенное окно реально функционирует.

Доступность и интеграция

ПлатформаGLM-5.3-FlashGLM-5.3
Z.ai APIДоступнаДоступна
OpenRouterz-ai/glm-5.3-flashz-ai/glm-5.3
DashScope (Aliyun)Пока нетZHIPU/GLM-5.3 (17 августа)
Hugging Face (self-host)MIT, zai-org/GLM-5.3-FlashОжидается
ФреймворкиSGLang, vLLM, TokenSpeed, KTransformersSGLang, vLLM

Обе модели используют стандартный OpenAI-совместимый API. Переход с GLM-5.2 или любого OpenAI-формата требует только смены model ID.

Промо-цены на Flash ($0.075/$0.25) действуют до 9 сентября 2026 (24:00 UTC+8). После этого применяются базовые цены $0.15/$0.50.

Кросс-провайдерный контекст: сравнение Flash-моделей

МодельПровайдерВход (за 1M)Выход (за 1M)Активных параметровКонтекст
GLM-5.3-FlashZ.ai$0.15 ($0.075 промо)$0.50 ($0.25 промо)18B1M
DeepSeek V4 FlashDeepSeek$0.10$0.3013B1M
Qwen3.7-FlashDashScopeБесплатно (лимиты)Бесплатно (лимиты)—1M
GLM-4.7-FlashZ.aiБесплатноБесплатно—200K

FAQ

GLM-5.3-Flash действительно в 10 раз дешевле GLM-5.3? По базовой цене — да. Входные токены $0.15/M против $1.40/M (10.7%), выходные $0.50/M против $4.40/M (11.4%). Во время промо (до 9 сентября 2026) разрыв около 20 раз.

Можно ли развернуть GLM-5.3-Flash самостоятельно? Да. Веса опубликованы под MIT на Hugging Face (zai-org/GLM-5.3-Flash). Поддержка SGLang, vLLM, TokenSpeed, KTransformers с первого дня. Модель 320B MoE — нужно серверное оборудование.

GLM-5.3-Flash поддерживает tool calling? Да. Обе модели поддерживают вызов инструментов и structured output через стандартный OpenAI-совместимый интерфейс.

GLM-5.3-Flash есть на DashScope? По состоянию на 27 августа 2026 — нет. GLM-5.3 (стандартная) доступна на DashScope как ZHIPU/GLM-5.3 с 17 августа.

Источники:

Помощь и контакты