Назад к моделям

GLM 4.7 Flash

zhipuzhipu/glm-4.7-flash

Zhipu AI GLM 4.7 Flash — free-tier lightweight model (30B total, 3B active MoE). Strong reasoning despite small active params. Rate-limited concurrency.

GLM-4.7-Flash — полностью бесплатная модель с открытыми весами из семейства GLM-4.7 от Zhipu AI. Архитектура Mixture-of-Experts (30B-A3B): 31B параметров суммарно, из которых активируется лишь ~3B на токен. Это обеспечивает производительность, сопоставимую с гораздо большими плотными моделями, при развёртывании на одной видеокарте RTX 4090. Контекстное окно — 200K токенов, максимальный объём генерации — 128K токенов.

Модель ориентирована на задачи программирования, агентных рабочих процессов и многошагового рассуждения. В неё введён режим Preserved Thinking — механизм сохранения внутренней цепочки рассуждений между ходами диалога, особенно полезный для долгих задач с инструментами (SWE-bench-стиль, τ²-Bench). На SWE-bench Verified модель набрала 59.2% — наивысший результат среди 30B-класса на момент выхода.

На TheRouter GLM-4.7-Flash доступен по цене $0 за миллион токенов (вход и выход) — идеальный вариант для команд, которым нужна мощная модель с открытыми весами без дополнительных затрат. Вариант FlashX (zhipu/glm-4.7-flashx) предлагает более высокую конкурентность за $0.12/$0.60 за миллион токенов для производственных нагрузок, исчерпывающих ограниченную конкурентность Flash.

Когда выбирать
  • • Агентные задачи программирования — исправление ошибок в стиле SWE-bench, редактирование нескольких файлов, терминальная автоматизация с точностью Verified 59.2%
  • • Многоходовые агентные конвейеры с сохранением рассуждений между ходами (τ²-Bench: 79.5%)
  • • Математические рассуждения без затрат — 91.6% на AIME 2025, сопоставимо с моделями-лидерами, бесплатно
  • • Локальное развёртывание на одном RTX 4090 — малый объём VRAM благодаря разреженной активации MoE
  • • Команды с ограниченным бюджетом (бесплатный уровень), которым нужна мощная модель для кода и рассуждений
Когда не выбирать
  • • Мультимодальные (визуальные) задачи — GLM-4.7-Flash только текст; для понимания изображений используйте zhipu/glm-4.6v-flash
  • • Высокопроизводительные производственные конвейеры с гарантированной конкурентностью — Flash имеет ограничения; используйте FlashX (zhipu/glm-4.7-flashx)
  • • Строгие требования к месту хранения данных или SLA — бесплатный уровень не имеет корпоративных гарантий; рассмотрите BYOK через TheRouter
  • • Задачи эмбеддинга или генерации изображений — только текстовая генерация; см. zhipu/embedding-3 или zhipu/cogview-4
Размер контекста
203K
Максимальный вывод
131K

Модальности

Текст→Текст

Разбивка цен

Данные о цене недоступны.

Поддерживаемые параметры

temperaturemax_tokenstop_ptoolstool_choiceresponse_formatstop

Характеристики

Архитектура30B-A3B Mixture-of-Experts (glm4_moe_lite); 31B параметров всего, ~3B активных на один проходhuggingface.co/zai-org/GLM-4.7-Flash ↗проверено
Контекстное окно200K токенов (202 752)docs.z.ai ↗проверено
Максимальный объём генерации128K токенов (131 072)docs.z.ai ↗проверено
Точность / тип тензораBF16 и F32huggingface.co/zai-org/GLM-4.7-Flash ↗проверено
ЛицензияMIThuggingface.co/zai-org/GLM-4.7-Flash ↗проверено
Поддерживаемые языкиАнглийский, китайскийhuggingface.co/zai-org/GLM-4.7-Flash ↗проверено
Поддерживаемые фреймворкиvLLM (main branch), SGLang (main branch), Hugging Face Transformers (main branch)huggingface.co/zai-org/GLM-4.7-Flash ↗проверено
Требования к VRAMОдин RTX 4090 (24 ГБ) — возможно благодаря разреженной активации MoEawesomeagents.ai ↗к проверке
Цена на TheRouter$0.00 / 1M входных токенов, $0.00 / 1M выходных токенов (бесплатный уровень)docs.z.ai ↗проверено

Бенчмарки

BenchmarkDistributionScoreSource
SWE-bench Verified
Temperature 0.7, top-p 1.0, max new tokens 16384
59.2%%huggingface.co/zai-org/GLM-4.7-Flash ↗
τ²-Bench (tau2-Bench)
Temperature 0, max new tokens 16384; режим Preserved Thinking включён
79.5%%huggingface.co/zai-org/GLM-4.7-Flash ↗
AIME 2025
Temperature 1.0, top-p 0.95, max new tokens 131072
91.6%%huggingface.co/zai-org/GLM-4.7-Flash ↗
GPQA-Diamond
Temperature 1.0, top-p 0.95, max new tokens 131072
75.2%%huggingface.co/zai-org/GLM-4.7-Flash ↗
LCB v6 (LiveCodeBench)
Temperature 1.0, top-p 0.95, max new tokens 131072
64.0huggingface.co/zai-org/GLM-4.7-Flash ↗
HLE (Humanity's Last Exam)
Temperature 1.0, top-p 0.95, max new tokens 131072
14.4%%huggingface.co/zai-org/GLM-4.7-Flash ↗
BrowseComp
Temperature 1.0, top-p 0.95, max new tokens 131072
42.8%%huggingface.co/zai-org/GLM-4.7-Flash ↗

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "zhipu/glm-4.7-flash",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

Базовый чат-запрос

GLM-4.7-Flash полностью совместима с OpenAI API. Замените имя модели и укажите baseURL на TheRouter — существующий код SDK будет работать без изменений.

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zhipu/glm-4.7-flash",
    "messages": [{"role": "user", "content": "Explain MoE architectures in one paragraph."}]
  }'

Ещё от zhipu

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2026-01-20

Zhipu AI выпускает GLM-4.7-Flash: лучшая агентная модель класса 30B без затрат

Zhipu AI запустила GLM-4.7-Flash — модель MoE 30B-A3B, установившую новый рекорд класса 30B на SWE-bench Verified (59.2%) и τ²-Bench (79.5%), полностью бесплатную через API Z.AI и работающую на одном RTX 4090.

переработано TheRoutermarktechpost.com ↗

Частые вопросы

GLM-4.7-Flash действительно бесплатна на TheRouter?

Да. GLM-4.7-Flash оценивается в $0.00 за миллион токенов (вход и выход) на TheRouter и напрямую в Z.AI API. Бесплатный уровень имеет ограниченную конкурентность; для производственных нагрузок с высокой пропускной способностью используйте zhipu/glm-4.7-flashx за $0.12/$0.60 за миллион токенов.

Что такое режим Preserved Thinking и когда его следует использовать?

Режим Preserved Thinking сохраняет внутреннюю цепочку рассуждений модели между ходами диалога. Z.AI рекомендует включать его для многоходовых агентных задач — таких как τ²-Bench и Terminal Bench 2 — где модели нужно помнить промежуточные результаты инструментов и решения из предыдущих ходов. Для однократных вопросов и ответов или простой генерации кода это не нужно.

Как GLM-4.7-Flash сравнивается с полным GLM-4.7?

GLM-4.7-Flash — облегчённый бесплатный вариант: 30B суммарно / 3B активных MoE, работает на одном RTX 4090, цена $0. Полный GLM-4.7 — флагман с 355B суммарно / 32B активных, более высокий ценовой уровень, более сильная абсолютная производительность. Оба имеют контекстное окно 200K и лимит вывода 128K.

Могу ли я запустить GLM-4.7-Flash локально на собственном GPU?

Да. Веса модели опубликованы на HuggingFace (zai-org/GLM-4.7-Flash) под лицензией MIT. Поддерживаются vLLM (main branch), SGLang (main branch) и Hugging Face Transformers (main branch). Разреженная активация MoE удерживает активный параметрический след на уровне ~3B, что помещается на одном RTX 4090 (24 ГБ).

В чём разница между GLM-4.7-Flash и GLM-4.7-FlashX?

Обе используют одну архитектуру 30B-A3B MoE. Flash — бесплатный вариант с ограниченным числом слотов конкурентности — подходит для разработки, прототипирования и малонагруженного производства. FlashX (zhipu/glm-4.7-flashx) — платный вариант за $0.12/$0.60 за миллион входных/выходных токенов, обеспечивающий более высокую пропускную способность для производственных нагрузок.

Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Архитектураhuggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09проверено
Контекстное окноdocs.z.ai ↗2026-06-09проверено
Максимальный объём генерацииdocs.z.ai ↗2026-06-09проверено
Точность / тип тензораhuggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09проверено
Лицензияhuggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09проверено
Поддерживаемые языкиhuggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09проверено
Поддерживаемые фреймворкиhuggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09проверено
Требования к VRAMawesomeagents.ai ↗2026-06-09к проверке
Цена на TheRouterdocs.z.ai ↗2026-06-09проверено
SWE-bench Verifiedhuggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09проверено
τ²-Bench (tau2-Bench)huggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09проверено
AIME 2025huggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09проверено
GPQA-Diamondhuggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09проверено
LCB v6 (LiveCodeBench)huggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09проверено
HLE (Humanity's Last Exam)huggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09проверено
BrowseComphuggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09проверено
Zhipu AI выпускает GLM-4.7-Flash: лучшая агентная модель класса 30B без затратmarktechpost.com ↗2026-06-09проверено
GLM-4.7-Flash действительно бесплатна на TheRouter?docs.z.ai ↗2026-06-09к проверке
Что такое режим Preserved Thinking и когда его следует использовать?docs.z.ai/guides/capabilities/thinking-mode ↗2026-06-09к проверке
Как GLM-4.7-Flash сравнивается с полным GLM-4.7?docs.z.ai ↗2026-06-09к проверке
Могу ли я запустить GLM-4.7-Flash локально на собственном GPU?huggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09к проверке
В чём разница между GLM-4.7-Flash и GLM-4.7-FlashX?docs.z.ai ↗2026-06-09к проверке
Помощь и контакты