Назад к моделям

GLM 4.7 Flash

zhipuzhipu/glm-4.7-flash

Гид по API

Базовый чат-запрос

GLM-4.7-Flash полностью совместима с OpenAI API. Замените имя модели и укажите baseURL на TheRouter — существующий код SDK будет работать без изменений.

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zhipu/glm-4.7-flash",
    "messages": [{"role": "user", "content": "Explain MoE architectures in one paragraph."}]
  }'

Вызов инструментов / функций

GLM-4.7-Flash поддерживает нативный вызов функций. В сочетании с контекстным окном 200K и режимом Preserved Thinking модель обрабатывает сложные многошаговые последовательности инструментов без потери промежуточного состояния.

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zhipu/glm-4.7-flash",
    "messages": [{"role": "user", "content": "What is the weather in Shanghai?"}],
    "tools": [{
      "type": "function",
      "function": {
        "name": "get_weather",
        "description": "Get current weather for a city",
        "parameters": {
          "type": "object",
          "properties": {"city": {"type": "string"}},
          "required": ["city"]
        }
      }
    }],
    "tool_choice": "auto"
  }'

Потоковая генерация

Включите потоковую генерацию для получения токенов по мере их создания — идеально для интерактивных помощников и чат-интерфейсов.

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zhipu/glm-4.7-flash",
    "stream": true,
    "messages": [{"role": "user", "content": "Write a bubble sort in TypeScript."}]
  }'

Локальное развёртывание

GLM-4.7-Flash работает на одном RTX 4090. Команды ниже запускают OpenAI-совместимый локальный сервер через vLLM; укажите BYOK base URL TheRouter на него для гибридной маршрутизации.

cURL
# Start local vLLM server (requires vLLM main branch)
vllm serve zai-org/GLM-4.7-Flash \
  --tensor-parallel-size 1 \
  --speculative-config.method mtp \
  --speculative-config.num_speculative_tokens 1 \
  --tool-call-parser glm47 \
  --reasoning-parser glm45 \
  --enable-auto-tool-choice \
  --served-model-name glm-4.7-flash

# Then call it like any OpenAI endpoint
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"glm-4.7-flash","messages":[{"role":"user","content":"Hello"}]}'
Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Архитектураhuggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09проверено
Контекстное окноdocs.z.ai ↗2026-06-09проверено
Максимальный объём генерацииdocs.z.ai ↗2026-06-09проверено
Точность / тип тензораhuggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09проверено
Лицензияhuggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09проверено
Поддерживаемые языкиhuggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09проверено
Поддерживаемые фреймворкиhuggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09проверено
Требования к VRAMawesomeagents.ai ↗2026-06-09к проверке
Цена на TheRouterdocs.z.ai ↗2026-06-09проверено
SWE-bench Verifiedhuggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09проверено
τ²-Bench (tau2-Bench)huggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09проверено
AIME 2025huggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09проверено
GPQA-Diamondhuggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09проверено
LCB v6 (LiveCodeBench)huggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09проверено
HLE (Humanity's Last Exam)huggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09проверено
BrowseComphuggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09проверено
Zhipu AI выпускает GLM-4.7-Flash: лучшая агентная модель класса 30B без затратmarktechpost.com ↗2026-06-09проверено
GLM-4.7-Flash действительно бесплатна на TheRouter?docs.z.ai ↗2026-06-09к проверке
Что такое режим Preserved Thinking и когда его следует использовать?docs.z.ai/guides/capabilities/thinking-mode ↗2026-06-09к проверке
Как GLM-4.7-Flash сравнивается с полным GLM-4.7?docs.z.ai ↗2026-06-09к проверке
Могу ли я запустить GLM-4.7-Flash локально на собственном GPU?huggingface.co/zai-org/GLM-4.7-Flash ↗2026-06-09к проверке
В чём разница между GLM-4.7-Flash и GLM-4.7-FlashX?docs.z.ai ↗2026-06-09к проверке
Помощь и контакты