Назад к моделям
GLM 4.7 Flash
zhipuzhipu/glm-4.7-flash
Гид по API
Базовый чат-запрос
GLM-4.7-Flash полностью совместима с OpenAI API. Замените имя модели и укажите baseURL на TheRouter — существующий код SDK будет работать без изменений.
cURL
curl https://api.therouter.ai/v1/chat/completions \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "zhipu/glm-4.7-flash",
"messages": [{"role": "user", "content": "Explain MoE architectures in one paragraph."}]
}'Вызов инструментов / функций
GLM-4.7-Flash поддерживает нативный вызов функций. В сочетании с контекстным окном 200K и режимом Preserved Thinking модель обрабатывает сложные многошаговые последовательности инструментов без потери промежуточного состояния.
cURL
curl https://api.therouter.ai/v1/chat/completions \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "zhipu/glm-4.7-flash",
"messages": [{"role": "user", "content": "What is the weather in Shanghai?"}],
"tools": [{
"type": "function",
"function": {
"name": "get_weather",
"description": "Get current weather for a city",
"parameters": {
"type": "object",
"properties": {"city": {"type": "string"}},
"required": ["city"]
}
}
}],
"tool_choice": "auto"
}'Потоковая генерация
Включите потоковую генерацию для получения токенов по мере их создания — идеально для интерактивных помощников и чат-интерфейсов.
cURL
curl https://api.therouter.ai/v1/chat/completions \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "zhipu/glm-4.7-flash",
"stream": true,
"messages": [{"role": "user", "content": "Write a bubble sort in TypeScript."}]
}'Локальное развёртывание
GLM-4.7-Flash работает на одном RTX 4090. Команды ниже запускают OpenAI-совместимый локальный сервер через vLLM; укажите BYOK base URL TheRouter на него для гибридной маршрутизации.
cURL
# Start local vLLM server (requires vLLM main branch)
vllm serve zai-org/GLM-4.7-Flash \
--tensor-parallel-size 1 \
--speculative-config.method mtp \
--speculative-config.num_speculative_tokens 1 \
--tool-call-parser glm47 \
--reasoning-parser glm45 \
--enable-auto-tool-choice \
--served-model-name glm-4.7-flash
# Then call it like any OpenAI endpoint
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"glm-4.7-flash","messages":[{"role":"user","content":"Hello"}]}'Реестр фактов — каждая утверждаемая величина имеет источник
| источник | URL | получено | |
|---|---|---|---|
| Архитектура | huggingface.co/zai-org/GLM-4.7-Flash ↗ | 2026-06-09 | проверено |
| Контекстное окно | docs.z.ai ↗ | 2026-06-09 | проверено |
| Максимальный объём генерации | docs.z.ai ↗ | 2026-06-09 | проверено |
| Точность / тип тензора | huggingface.co/zai-org/GLM-4.7-Flash ↗ | 2026-06-09 | проверено |
| Лицензия | huggingface.co/zai-org/GLM-4.7-Flash ↗ | 2026-06-09 | проверено |
| Поддерживаемые языки | huggingface.co/zai-org/GLM-4.7-Flash ↗ | 2026-06-09 | проверено |
| Поддерживаемые фреймворки | huggingface.co/zai-org/GLM-4.7-Flash ↗ | 2026-06-09 | проверено |
| Требования к VRAM | awesomeagents.ai ↗ | 2026-06-09 | к проверке |
| Цена на TheRouter | docs.z.ai ↗ | 2026-06-09 | проверено |
| SWE-bench Verified | huggingface.co/zai-org/GLM-4.7-Flash ↗ | 2026-06-09 | проверено |
| τ²-Bench (tau2-Bench) | huggingface.co/zai-org/GLM-4.7-Flash ↗ | 2026-06-09 | проверено |
| AIME 2025 | huggingface.co/zai-org/GLM-4.7-Flash ↗ | 2026-06-09 | проверено |
| GPQA-Diamond | huggingface.co/zai-org/GLM-4.7-Flash ↗ | 2026-06-09 | проверено |
| LCB v6 (LiveCodeBench) | huggingface.co/zai-org/GLM-4.7-Flash ↗ | 2026-06-09 | проверено |
| HLE (Humanity's Last Exam) | huggingface.co/zai-org/GLM-4.7-Flash ↗ | 2026-06-09 | проверено |
| BrowseComp | huggingface.co/zai-org/GLM-4.7-Flash ↗ | 2026-06-09 | проверено |
| Zhipu AI выпускает GLM-4.7-Flash: лучшая агентная модель класса 30B без затрат | marktechpost.com ↗ | 2026-06-09 | проверено |
| GLM-4.7-Flash действительно бесплатна на TheRouter? | docs.z.ai ↗ | 2026-06-09 | к проверке |
| Что такое режим Preserved Thinking и когда его следует использовать? | docs.z.ai/guides/capabilities/thinking-mode ↗ | 2026-06-09 | к проверке |
| Как GLM-4.7-Flash сравнивается с полным GLM-4.7? | docs.z.ai ↗ | 2026-06-09 | к проверке |
| Могу ли я запустить GLM-4.7-Flash локально на собственном GPU? | huggingface.co/zai-org/GLM-4.7-Flash ↗ | 2026-06-09 | к проверке |
| В чём разница между GLM-4.7-Flash и GLM-4.7-FlashX? | docs.z.ai ↗ | 2026-06-09 | к проверке |