返回模型列表

GLM OCR

zhipuzhipu/glm-ocr

Zhipu AI GLM OCR (0.9B) — document parser for PDF/image to structured Markdown text extraction.

GLM-OCR 是 Z.AI(原智谱 AI)于 2026 年 2 月 3 日以 MIT 许可证发布的 0.9B 参数多模态 OCR 模型。它将在大规模图文数据上预训练的 0.4B CogViT 视觉编码器、轻量跨模态连接器与 0.5B GLM 语言解码器组合在一起。该模型专为文档理解而构建,而非将通用视觉语言模型改装用于 OCR:可从扫描 PDF、图片、表格、数学公式、代码块、印章和手写文本中生成结构化 Markdown、JSON 和 LaTeX 输出。

在架构层面,GLM-OCR 采用多 token 预测(MTP)——训练时每步预测 10 个 token,推理时平均每步生成 5.2 个 token——吞吐量比标准自回归解码提升约 50%。在系统层面,它遵循两阶段流程:首先由 PP-DocLayout-V3 分析页面布局并识别结构化区域,再由 GLM-OCR 对这些区域进行并行识别和结构化输出。这使其与逐行从左到右阅读页面的方式有本质差异,对复杂版式的鲁棒性更强。在 OmniDocBench V1.5 上,GLM-OCR 以 94.62 的分数在发布时综合排名第一,且可在仅 4 GB 显存的硬件上运行。

适合使用
  • • 企业文档数字化——将扫描 PDF、发票和合同转换为结构化 Markdown 或 JSON,同时保留表格、公式和多栏版面。
  • • 关键信息提取(KIE)——将完整文档图像与任务提示输入模型,直接以 JSON 形式提取特定字段(日期、金额、实体名称),无需独立管道。
  • • 对成本和延迟敏感的高并发文档解析服务——1.86 页/秒的 PDF 吞吐和不足 4 GB 的显存占用,使其适用于边缘部署和注重预算的 API 路由。
  • • RAG 和知识库管道——在分块和嵌入之前,需要从混合版式文档(报告、学术论文、政府表单)中提取干净的结构化文本。
不适合使用
  • • 通用对话或指令跟随——GLM-OCR 是 OCR 提取模型,而非对话助手。对话场景请使用 zhipu/glm-4 或同类模型。
  • • 自然语言图像描述或视觉问答——该模型的输出路径专为文档结构设计,不适用于自由形式的场景描述。请改用通用视觉语言模型。
上下文长度
66K
最大输出
16K
输入价格每百万 tokens
$0.0324每百万 Tokens
输出价格每百万 tokens
$0.0324每百万 Tokens

模态能力

文本图像PDF→文本ocr

能力

OCR视觉理解

媒体生成能力

ocr
input_formats
  • png
  • jpg
  • jpeg
  • pdf

价格明细

类型费率
输入$0.0324 每百万 Tokens
输出$0.0324 每百万 Tokens

支持参数

temperaturemax_tokenstop_presponse_formatstop

模型规格

发布日期2026-02-03huggingface.co ↗已核实
许可MIThuggingface.co ↗已核实
参数总量0.9B(0.4B CogViT 编码器 + 0.5B GLM 解码器)arxiv.org ↗已核实
最低显存要求4 GBpasqualepillitteri.it ↗待核实
PDF 吞吐(单并发)1.86 页/秒huggingface.co ↗已核实
图片吞吐(单并发)0.67 张/秒huggingface.co ↗已核实
MTP 解码速度平均 5.2 tokens/step(训练目标 10)arxiv.org ↗已核实
训练数据截止未公开披露未知

基准成绩

BenchmarkDistributionScoreSource
OmniDocBench V1.5
94.62scorehuggingface.co ↗

API 使用示例

所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "zhipu/glm-ocr",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

API 使用指南

完整 API 参考 →

文档解析(PDF / 图片 → Markdown)

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zhipu/glm-ocr",
    "messages": [
      {
        "role": "user",
        "content": [
          {
            "type": "image_url",
            "image_url": { "url": "https://therouter.ai/assets/vision-sample.png" }
          },
          {
            "type": "text",
            "text": "Convert this document to structured Markdown. Preserve tables, headings, and list structure exactly."
          }
        ]
      }
    ]
  }'

zhipu 其他模型

同类模型

跨供应商的相似能力档位

动态与变更

2026-03-15

GLM-OCR 技术报告发布于 arXiv

Z.AI 发布了完整技术报告(arXiv 2603.10910),详细介绍了 GLM-OCR 的架构:CogViT 编码器、MTP 解码、PP-DocLayout-V3 两阶段流程以及 KIE 任务路径。报告包含消融实验结果,显示 MTP 相比标准自回归解码吞吐量提升约 50%,以及 OmniDocBench V1.5 综合排名第一的成绩。

TheRouter 编辑重写arxiv.org ↗

常见问题

GLM-OCR 能处理手写文本和印章吗?

是的。该模型专门针对真实业务文档场景进行了优化,包括手写文本、印章、代码密集型文档和复杂表格版式,而不仅仅是干净的印刷页面。OmniDocBench V1.5 第一名涵盖了这些混合内容基准。

TheRouter 编辑重写huggingface.co ↗
文档解析应该直接调用 API 还是使用 GLM-OCR SDK?

Z.AI 推荐在文档解析任务中使用官方 SDK(github.com/zai-org/GLM-OCR),因为它集成了 PP-DocLayout-V3 进行版式预处理,从而提高在复杂多栏或多区域文档上的准确性。直接调用原始 API 端点更简单,但会跳过版式分析阶段——对于单页图像,或者你已经自行处理版式检测时效果良好。对于 KIE 任务,目前不需要 SDK;直接使用 JSON 提取 prompt 调用模型即可。

TheRouter 编辑重写huggingface.co ↗
GLM-OCR 可以在本地运行吗?硬件要求是什么?

可以。GLM-OCR 以 MIT 许可的开放权重模型(HuggingFace 上的 zai-org/GLM-OCR)发布,支持通过 vLLM、SGLang 和 Ollama 进行本地部署。最低显存要求为 4 GB,中端消费级 GPU 即可运行。通过 TheRouter,无需任何本地配置即可调用,按 token 计费。

TheRouter 编辑重写huggingface.co ↗
事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
发布日期huggingface.co ↗2026-06-09已核实
许可huggingface.co ↗2026-06-09已核实
参数总量arxiv.org ↗2026-06-09已核实
最低显存要求pasqualepillitteri.it ↗2026-06-09待核实
PDF 吞吐(单并发)huggingface.co ↗2026-06-09已核实
图片吞吐(单并发)huggingface.co ↗2026-06-09已核实
MTP 解码速度arxiv.org ↗2026-06-09已核实
训练数据截止——未知
OmniDocBench V1.5huggingface.co ↗2026-06-09已核实
GLM-OCR 技术报告发布于 arXivarxiv.org ↗2026-06-09已核实
GLM-OCR 能处理手写文本和印章吗?huggingface.co ↗2026-06-09待核实
文档解析应该直接调用 API 还是使用 GLM-OCR SDK?huggingface.co ↗2026-06-09待核实
GLM-OCR 可以在本地运行吗?硬件要求是什么?huggingface.co ↗2026-06-09待核实
帮助与联系