GLM-OCR 技术报告发布于 arXiv
Z.AI 发布了完整技术报告(arXiv 2603.10910),详细介绍了 GLM-OCR 的架构:CogViT 编码器、MTP 解码、PP-DocLayout-V3 两阶段流程以及 KIE 任务路径。报告包含消融实验结果,显示 MTP 相比标准自回归解码吞吐量提升约 50%,以及 OmniDocBench V1.5 综合排名第一的成绩。
Zhipu AI GLM OCR (0.9B) — document parser for PDF/image to structured Markdown text extraction.
GLM-OCR 是 Z.AI(原智谱 AI)于 2026 年 2 月 3 日以 MIT 许可证发布的 0.9B 参数多模态 OCR 模型。它将在大规模图文数据上预训练的 0.4B CogViT 视觉编码器、轻量跨模态连接器与 0.5B GLM 语言解码器组合在一起。该模型专为文档理解而构建,而非将通用视觉语言模型改装用于 OCR:可从扫描 PDF、图片、表格、数学公式、代码块、印章和手写文本中生成结构化 Markdown、JSON 和 LaTeX 输出。
在架构层面,GLM-OCR 采用多 token 预测(MTP)——训练时每步预测 10 个 token,推理时平均每步生成 5.2 个 token——吞吐量比标准自回归解码提升约 50%。在系统层面,它遵循两阶段流程:首先由 PP-DocLayout-V3 分析页面布局并识别结构化区域,再由 GLM-OCR 对这些区域进行并行识别和结构化输出。这使其与逐行从左到右阅读页面的方式有本质差异,对复杂版式的鲁棒性更强。在 OmniDocBench V1.5 上,GLM-OCR 以 94.62 的分数在发布时综合排名第一,且可在仅 4 GB 显存的硬件上运行。
| 类型 | 费率 |
|---|---|
| 输入 | $0.0324 每百万 Tokens |
| 输出 | $0.0324 每百万 Tokens |
| 发布日期 | 2026-02-03huggingface.co ↗ | 已核实 |
| 许可 | MIThuggingface.co ↗ | 已核实 |
| 参数总量 | 0.9B(0.4B CogViT 编码器 + 0.5B GLM 解码器)arxiv.org ↗ | 已核实 |
| 最低显存要求 | 4 GBpasqualepillitteri.it ↗ | 待核实 |
| PDF 吞吐(单并发) | 1.86 页/秒huggingface.co ↗ | 已核实 |
| 图片吞吐(单并发) | 0.67 张/秒huggingface.co ↗ | 已核实 |
| MTP 解码速度 | 平均 5.2 tokens/step(训练目标 10)arxiv.org ↗ | 已核实 |
| 训练数据截止 | 未公开披露 | 未知 |
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
OmniDocBench V1.5 | 94.62score | huggingface.co ↗ |
所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。
curl https://api.therouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -d '{
"model": "zhipu/glm-ocr",
"messages": [
{"role": "user", "content": "Summarize the key points from this input."}
]
}'curl https://api.therouter.ai/v1/chat/completions \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "zhipu/glm-ocr",
"messages": [
{
"role": "user",
"content": [
{
"type": "image_url",
"image_url": { "url": "https://therouter.ai/assets/vision-sample.png" }
},
{
"type": "text",
"text": "Convert this document to structured Markdown. Preserve tables, headings, and list structure exactly."
}
]
}
]
}'Z.AI 发布了完整技术报告(arXiv 2603.10910),详细介绍了 GLM-OCR 的架构:CogViT 编码器、MTP 解码、PP-DocLayout-V3 两阶段流程以及 KIE 任务路径。报告包含消融实验结果,显示 MTP 相比标准自回归解码吞吐量提升约 50%,以及 OmniDocBench V1.5 综合排名第一的成绩。
是的。该模型专门针对真实业务文档场景进行了优化,包括手写文本、印章、代码密集型文档和复杂表格版式,而不仅仅是干净的印刷页面。OmniDocBench V1.5 第一名涵盖了这些混合内容基准。
Z.AI 推荐在文档解析任务中使用官方 SDK(github.com/zai-org/GLM-OCR),因为它集成了 PP-DocLayout-V3 进行版式预处理,从而提高在复杂多栏或多区域文档上的准确性。直接调用原始 API 端点更简单,但会跳过版式分析阶段——对于单页图像,或者你已经自行处理版式检测时效果良好。对于 KIE 任务,目前不需要 SDK;直接使用 JSON 提取 prompt 调用模型即可。
可以。GLM-OCR 以 MIT 许可的开放权重模型(HuggingFace 上的 zai-org/GLM-OCR)发布,支持通过 vLLM、SGLang 和 Ollama 进行本地部署。最低显存要求为 4 GB,中端消费级 GPU 即可运行。通过 TheRouter,无需任何本地配置即可调用,按 token 计费。
| 来源 | URL | 采集于 | |
|---|---|---|---|
| 发布日期 | huggingface.co ↗ | 2026-06-09 | 已核实 |
| 许可 | huggingface.co ↗ | 2026-06-09 | 已核实 |
| 参数总量 | arxiv.org ↗ | 2026-06-09 | 已核实 |
| 最低显存要求 | pasqualepillitteri.it ↗ | 2026-06-09 | 待核实 |
| PDF 吞吐(单并发) | huggingface.co ↗ | 2026-06-09 | 已核实 |
| 图片吞吐(单并发) | huggingface.co ↗ | 2026-06-09 | 已核实 |
| MTP 解码速度 | arxiv.org ↗ | 2026-06-09 | 已核实 |
| 训练数据截止 | — | — | 未知 |
| OmniDocBench V1.5 | huggingface.co ↗ | 2026-06-09 | 已核实 |
| GLM-OCR 技术报告发布于 arXiv | arxiv.org ↗ | 2026-06-09 | 已核实 |
| GLM-OCR 能处理手写文本和印章吗? | huggingface.co ↗ | 2026-06-09 | 待核实 |
| 文档解析应该直接调用 API 还是使用 GLM-OCR SDK? | huggingface.co ↗ | 2026-06-09 | 待核实 |
| GLM-OCR 可以在本地运行吗?硬件要求是什么? | huggingface.co ↗ | 2026-06-09 | 待核实 |