Назад к моделям

GLM OCR

zhipuzhipu/glm-ocr

Zhipu AI GLM OCR (0.9B) — document parser for PDF/image to structured Markdown text extraction.

GLM-OCR — мультимодальная OCR-модель с 0.9B параметров, выпущенная Z.AI (ранее Zhipu AI) 3 февраля 2026 года под лицензией MIT. Модель объединяет 0.4B CogViT visual encoder, предобученный на больших наборах пар изображение–текст, лёгкий кросс-модальный коннектор и 0.5B GLM language decoder. Она создавалась специально для понимания документов, а не является адаптацией universal VLM: на выходе — структурированный Markdown, JSON и LaTeX из PDF-сканов, изображений, таблиц, формул, кодовых блоков, печатей и рукописного текста.

С архитектурной точки зрения GLM-OCR использует Multi-Token Prediction (MTP): модель обучена предсказывать 10 токенов за шаг и достигает в среднем 5.2 токена за шаг на инференсе — это примерно на 50% выше throughput, чем у стандартного авторегрессивного декодирования. На системном уровне используется двухэтапный пайплайн: PP-DocLayout-V3 сначала анализирует разметку страницы и выделяет структурированные области, затем GLM-OCR параллельно их распознаёт. Это принципиально отличает модель от плоского поочерёдного чтения страниц и обеспечивает устойчивость к сложным макетам. На OmniDocBench V1.5 набирает 94.62 балла — №1 в общем зачёте среди всех моделей на момент выхода — при этом работает на видеокарте с объёмом VRAM всего от 4 ГБ.

Когда выбирать
  • • Цифровизация корпоративных документов — преобразование сканированных PDF, счетов-фактур и договоров в структурированный Markdown или JSON с сохранением таблиц, формул и многоколоночной вёрстки.
  • • Извлечение ключевой информации (KIE) — передача полного изображения документа с промптом-задачей для прямого извлечения нужных полей (даты, суммы, названия сущностей) в JSON без отдельного пайплайна.
  • • Высоконагруженные сервисы парсинга документов с критичными требованиями к стоимости и задержке — throughput 1.86 стр./сек для PDF и потребление менее 4 ГБ VRAM делают модель применимой для edge-деплоя и бюджетных API-маршрутов.
  • • RAG и пайплайны баз знаний, которым необходим чистый структурированный текст из документов со смешанной вёрсткой (отчёты, академические статьи, госформы) перед чанкингом и эмбеддингом.
Когда не выбирать
  • • Общий чат или следование инструкциям — GLM-OCR является OCR-моделью для извлечения данных, а не диалоговым ассистентом. Для диалогов используйте zhipu/glm-4 или аналогичные модели.
  • • Создание подписей к изображениям или VQA — выходные пути модели ориентированы на структуру документа, а не на свободное описание сцен. Используйте универсальную VLM.
Размер контекста
66K
Максимальный вывод
16K
Цена Входза 1M токенов
$0.0324за 1 млн токенов
Цена Выходза 1M токенов
$0.0324за 1 млн токенов

Модальности

ТекстИзображениеPDF→Текстocr

Возможности

OCRЗрение

Возможности генерации медиа

ocr
input_formats
  • png
  • jpg
  • jpeg
  • pdf

Разбивка цен

ТипСтавка
Вход$0.0324 за 1 млн токенов
Выход$0.0324 за 1 млн токенов

Поддерживаемые параметры

temperaturemax_tokenstop_presponse_formatstop

Характеристики

Дата релиза2026-02-03huggingface.co ↗проверено
ЛицензияMIThuggingface.co ↗проверено
Всего параметров0.9B (0.4B CogViT encoder + 0.5B GLM decoder)arxiv.org ↗проверено
Минимальный объём VRAM4 ГБpasqualepillitteri.it ↗к проверке
Throughput PDF (1 воркер)1.86 стр./секhuggingface.co ↗проверено
Throughput изображений (1 воркер)0.67 изобр./секhuggingface.co ↗проверено
Скорость декодирования MTPВ среднем 5.2 токена/шаг (обучено на 10)arxiv.org ↗проверено
Дата отсечения данныхНе раскрыто публичнонеизвестно

Бенчмарки

BenchmarkDistributionScoreSource
OmniDocBench V1.5
94.62scorehuggingface.co ↗

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "zhipu/glm-ocr",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

Парсинг документов (PDF / изображение → Markdown)

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zhipu/glm-ocr",
    "messages": [
      {
        "role": "user",
        "content": [
          {
            "type": "image_url",
            "image_url": { "url": "https://therouter.ai/assets/vision-sample.png" }
          },
          {
            "type": "text",
            "text": "Convert this document to structured Markdown. Preserve tables, headings, and list structure exactly."
          }
        ]
      }
    ]
  }'

Ещё от zhipu

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2026-03-15

Технический отчёт GLM-OCR опубликован на arXiv

Z.AI опубликовала полный технический отчёт (arXiv 2603.10910) с описанием архитектуры GLM-OCR: CogViT encoder, MTP-декодирование, двухэтапный пайплайн PP-DocLayout-V3 и путь задачи KIE. Отчёт включает результаты аблаций, показывающих прирост throughput ~50% от MTP по сравнению со стандартным авторегрессивным декодированием, а также первое место на OmniDocBench V1.5.

переработано TheRouterarxiv.org ↗

Частые вопросы

Справляется ли GLM-OCR с рукописным текстом и печатями?

Да. Модель специально оптимизирована для реальных бизнес-сценариев, включая рукописный текст, печати, документы с большим объёмом кода и сложными таблицами — не только чистые печатные страницы. Первое место на OmniDocBench V1.5 охватывает эти смешанные контент-бенчмарки.

переработано TheRouterhuggingface.co ↗
Что лучше использовать для парсинга документов: API напрямую или SDK GLM-OCR?

Z.AI рекомендует официальный SDK (github.com/zai-org/GLM-OCR) для задач парсинга документов, поскольку он интегрирует PP-DocLayout-V3 для предобработки макета, что повышает точность на сложных многоколоночных или многозонных документах. Прямой вызов API проще, но минует этап анализа макета — хорошо работает для одностраничных изображений или когда вы уже сами обрабатываете детекцию макета. Для задач KIE SDK пока не нужен — вызывайте модель напрямую с промптом для извлечения JSON.

переработано TheRouterhuggingface.co ↗
Можно ли запустить GLM-OCR локально, и каковы требования к оборудованию?

Да. GLM-OCR поставляется как open-weight модель с лицензией MIT (zai-org/GLM-OCR на HuggingFace) и поддерживает локальный деплой через vLLM, SGLang и Ollama. Минимальный заявленный объём VRAM — 4 ГБ, что делает её доступной на среднем потребительском GPU. Через TheRouter можно вызывать её без локальной установки с оплатой по токенам.

переработано TheRouterhuggingface.co ↗
Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Дата релизаhuggingface.co ↗2026-06-09проверено
Лицензияhuggingface.co ↗2026-06-09проверено
Всего параметровarxiv.org ↗2026-06-09проверено
Минимальный объём VRAMpasqualepillitteri.it ↗2026-06-09к проверке
Throughput PDF (1 воркер)huggingface.co ↗2026-06-09проверено
Throughput изображений (1 воркер)huggingface.co ↗2026-06-09проверено
Скорость декодирования MTParxiv.org ↗2026-06-09проверено
Дата отсечения данных——неизвестно
OmniDocBench V1.5huggingface.co ↗2026-06-09проверено
Технический отчёт GLM-OCR опубликован на arXivarxiv.org ↗2026-06-09проверено
Справляется ли GLM-OCR с рукописным текстом и печатями?huggingface.co ↗2026-06-09к проверке
Что лучше использовать для парсинга документов: API напрямую или SDK GLM-OCR?huggingface.co ↗2026-06-09к проверке
Можно ли запустить GLM-OCR локально, и каковы требования к оборудованию?huggingface.co ↗2026-06-09к проверке
Помощь и контакты