Назад к моделям

GLM-4.6V-Flash — бесплатная облегчённая мультимодальная языковая модель от Zhipu AI (Z.ai), выпущенная 8 декабря 2025 года. Это 9B-параметрическая версия серии GLM-4.6V (вторая — 106B MoE флагман), оптимизированная для локального развёртывания и задач с малой задержкой. Обе модели разделяют контекстное окно 128K токенов, обученное на длинных мультимодальных последовательностях: один запрос позволяет обработать около 150 страниц плотного текста, 200 слайдов или один час видео. Веса открыто опубликованы на Hugging Face под семейством моделей THUDM / Z.ai.

Ключевое техническое нововведение GLM-4.6V-Flash — нативный мультимодальный Function Calling, первый в семействе GLM Vision. Традиционный подход преобразует изображения в текст перед передачей инструментам, теряя пространственную и цветовую информацию. GLM-4.6V-Flash передаёт изображения, скриншоты и страницы документов напрямую как входные данные инструментов и может потреблять визуальные выходы инструментов (графики, рендеры веб-страниц, сетки результатов поиска) в рамках одной цепочки рассуждений. Для операторов TheRouter это делает GLM-4.6V-Flash лучшим бесплатным выбором для агентных пайплайнов с обработкой изображений: модель принимает изображения, видео и PDF и отвечает текстом через стандартный OpenAI-совместимый эндпоинт /v1/chat/completions.

Когда выбирать
  • • Агентные пайплайны с мультимодальными данными без затрат: нативный Function Calling позволяет модели действовать по визуальным входным данным напрямую — скриншот → действие, чтение графика → вызов инструмента — без потерь при конвертации изображений в текст
  • • Анализ длинных документов и видео: контекстное окно 128K позволяет обработать ~150 страниц, 200 слайдов или один час видео в одном запросе — подходит для финансового анализа, суммаризации отчётов и обзора встреч без затрат на токены
  • • Конвертация скриншотов интерфейса в код: модель настроена на попиксельно точное воссоздание HTML/CSS/JS из скриншотов UI и поддерживает редактирование на естественном языке; бесплатный уровень устраняет стоимость каждого вызова в итеративных циклах разработки
  • • Визуальные задачи на китайском языке: GLM-4.6V-Flash обучена на двуязычных (китайско-английских) корпусах с хорошим охватом китайских документальных макетов, форм и визуального контента, характерных для корпоративных и государственных рабочих процессов
  • • Локальное и периферийное развёртывание: 9B плотная архитектура работает на одном потребительском GPU (протестировано с vLLM ≥ 0.12.0 и SGLang ≥ 0.5.6); идеально при ограничениях по хранению данных или задержкам, исключающих вызовы облачного API
Когда не выбирать
  • • Задачи на чистый текстовый вывод: по признанию самой команды, производительность в текстовых задачах QA уступает из-за приоритета визуального обучения; для чисто языковых нагрузок используйте zhipu/glm-4-flash или специализированную текстовую модель
  • • Точный подсчёт и детальная идентификация объектов: известные ограничения включают точность подсчёта и идентификацию конкретных людей — задачи с критической точностью следует направлять к модели без этих известных проблем или проверять постобработкой
  • • Высокообъёмные рабочие нагрузки с требованиями к SLA: бесплатный уровень не предполагает формального SLA; для критически важных бизнес-пайплайнов направляйте трафик на платные VLM (zhipu/glm-4.6v или zhipu/glm-4.6v-flashx)
  • • Генерация или редактирование изображений: GLM-4.6V-Flash — это мультимодальная языковая модель (текст + изображение → текст) и не генерирует изображения; для text-to-image задач используйте zhipu/cogview-4 или zhipu/cogview-3-flash
Размер контекста
131K
Максимальный вывод
16K

Модальности

ТекстИзображениеВидеоPDF→Текст

Возможности

Зрение

Разбивка цен

Данные о цене недоступны.

Поддерживаемые параметры

temperaturemax_tokenstop_ptoolstool_choicestop

Характеристики

Дата релиза2025-12-08huggingface.co ↗проверено
Количество параметров9B (плотная)huggingface.co ↗проверено
АрхитектураПлотный трансформер (семейство GLM-V); входит в серию GLM-4.6V вместе с 106B MoE флагманомhuggingface.co ↗проверено
Контекстное окно128K токенов (131 072) — обучена нативно при данной длинеdocs.z.ai ↗проверено
Максимум токенов на выходе16 384 токенаhuggingface.co ↗проверено
Входные модальностиТекст, изображение, видео, PDF (принимаются в одном запросе)docs.z.ai ↗проверено
Выходная модальностьТолько текст (без генерации изображений)docs.z.ai ↗проверено
СтоимостьБесплатно — $0 за токен (ввод и вывод) через TheRouter и платформу Z.aidocs.z.ai ↗проверено
Нативный Function CallingДа — первый в семействе GLM Vision; изображения и визуальные выходы инструментов передаются нативно без конвертации в текстhuggingface.co ↗проверено
Дата отсечения данныхНе раскрытонеизвестно
ЛицензияЛицензия GLM-4 Model License (Z.ai / THUDM) — открытые веса; коммерческое использование разрешено согласно условиям лицензииhuggingface.co ↗к проверке
Поддержка локального развёртыванияvLLM ≥ 0.12.0; SGLang ≥ 0.5.6 (предпочтительно для видеозадач); Transformers ≥ 5.0.0rc0huggingface.co ↗проверено
Рекомендуемые параметры декодированияtop_p=0.6, top_k=2, temperature=0.8, repetition_penalty=1.1, max_new_tokens=16384huggingface.co ↗проверено

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "zhipu/glm-4.6v-flash",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

Мультимодальный чат (вход: изображение / видео / PDF)

GLM-4.6V-Flash доступна через стандартный OpenAI-совместимый эндпоинт /v1/chat/completions на api.therouter.ai. Передавайте изображения как блоки контента image_url — точно так же, как при работе с GPT-4o. Модель принимает текст, изображения, видео и PDF в одном запросе. Function Calling работает через стандартные параметры tools / tool_choice — изображения и визуальные выходы инструментов обрабатываются нативно. API бесплатный; кредиты не расходуются.

cURL
# Image understanding — free via TheRouter
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zhipu/glm-4.6v-flash",
    "messages": [
      {
        "role": "user",
        "content": [
          {
            "type": "image_url",
            "image_url": { "url": "https://therouter.ai/assets/vision-sample.png" }
          },
          {
            "type": "text",
            "text": "Summarise the key trends shown in this chart."
          }
        ]
      }
    ],
    "max_tokens": 1024
  }'

Ещё от zhipu

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2025-12-08

Z.ai выпускает серию GLM-4.6V с нативным мультимодальным Function Calling

Zhipu AI (Z.ai) опубликовала серию GLM-4.6V с открытыми весами — 106B MoE флагман и 9B плотная GLM-4.6V-Flash — обе с контекстом 128K и нативным мультимодальным использованием инструментов. Версия Flash бесплатна через API и позиционируется для локального и низколатентного развёртывания.

переработано TheRouterhuggingface.co ↗

Частые вопросы

GLM-4.6V-Flash действительно бесплатна, или начнёт взиматься плата?

По состоянию на июнь 2026 года модель оценивается в $0 за токен (ввод и вывод) как на платформе Z.ai, так и через TheRouter. Ценообразование определяется Zhipu AI и может измениться; стандартные ограничения скорости и модерация контента применяются независимо от уровня. Следите за обновлениями на странице цен Z.ai.

В чём разница между GLM-4.6V-Flash и GLM-4.6V-FlashX?

Обе являются облегчёнными 9B-версиями серии GLM-4.6V. GLM-4.6V-Flash — бесплатная версия без формального SLA. GLM-4.6V-FlashX — платная версия (¥0,05/M входных токенов, ¥0,30/M выходных токенов по состоянию на июнь 2026) с гарантированной надёжностью, подходящей для производственных нагрузок. Выбирайте Flash для прототипирования и бесплатных пайплайнов; FlashX — когда нужна гарантированная доступность.

Чем нативный мультимодальный Function Calling отличается от стандартного использования инструментов?

При стандартном использовании инструментов LLM изображения необходимо описать текстом перед передачей в качестве аргументов — при этом теряется пространственная, цветовая и структурная информация. GLM-4.6V-Flash передаёт изображения, скриншоты и страницы документов напрямую как входные данные инструментов (через URL-ссылки) и может обрабатывать визуальные выходы инструментов — графики, рендеры веб-страниц или результаты поиска изображений — в рамках одной цепочки рассуждений. API-интерфейс идентичен стандартному вызову инструментов OpenAI; мультимодальные возможности прозрачно обеспечиваются моделью и уровнем Z.ai / TheRouter.

Сколько контента с длинным контекстом GLM-4.6V-Flash может обработать на практике?

Контекстное окно модели в 128K токенов обучено нативно (а не расширено постфактум), что означает сохранение связности на протяжении всего окна. Команда Z.ai сообщает о практических эквивалентах: ~150 страниц плотного текста, 200 слайдов или один час видео в одном проходе инференса — поскольку визуальные страницы кодируются визуальным энкодером в токены. Максимальный вывод ограничен 16 384 токенами на запрос.

Какие известные ограничения GLM-4.6V-Flash нужно учитывать в производственной среде?

Команда Z.ai явно признаёт следующее в карточке модели: (1) производительность в чисто текстовых задачах QA ниже, чем визуальные возможности, поскольку данный цикл обучения приоритизировал мультимодальные сценарии; (2) при сложных подсказках модель иногда может чрезмерно рассуждать или повторяться; (3) в некоторых случаях она повторяет ответ в конце текста; (4) точность подсчёта и идентификации конкретных людей остаётся несовершенной. Для бесплатных, не-SLA рабочих процессов это приемлемые компромиссы. Для производственных путей, где любой из этих факторов важен, тщательно проверяйте выходные данные или направляйте трафик к платной модели.

Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Дата релизаhuggingface.co ↗2026-06-09проверено
Количество параметровhuggingface.co ↗2026-06-09проверено
Архитектураhuggingface.co ↗2026-06-09проверено
Контекстное окноdocs.z.ai ↗2026-06-09проверено
Максимум токенов на выходеhuggingface.co ↗2026-06-09проверено
Входные модальностиdocs.z.ai ↗2026-06-09проверено
Выходная модальностьdocs.z.ai ↗2026-06-09проверено
Стоимостьdocs.z.ai ↗2026-06-09проверено
Нативный Function Callinghuggingface.co ↗2026-06-09проверено
Дата отсечения данных——неизвестно
Лицензияhuggingface.co ↗2026-06-09к проверке
Поддержка локального развёртыванияhuggingface.co ↗2026-06-09проверено
Рекомендуемые параметры декодированияhuggingface.co ↗2026-06-09проверено
Z.ai выпускает серию GLM-4.6V с нативным мультимодальным Function Callinghuggingface.co ↗2026-06-09проверено
Помощь и контакты