Mistral OCR 4 新增结构化块提取与边界框:AI 团队的文档工作负载路由策略解读

Mistral OCR 4 为 PDF 与文档摄取管道带来了边界框、类型化块分类和逐字置信度分数。本文解析该版本对设计 RAG、agent 和文档路由工作流的工程团队意味着什么。

TheRouter Newsroom来源 Mistral AI
Mistral OCR 4 结构化文档 AI 管道示意图,展示块提取与路由流程

2026 年 6 月 23 日,Mistral 发布了 OCR 4。从标题上看,这次的亮点是边界框(bounding boxes)——这也是自 OCR 1 以来呼声最高的功能请求。但真正带来持久运营影响的,是结构化块提取对每次 LLM API 调用上游文档摄取层的重构。对于将文档工作负载路由到基础模型的团队而言,这一版本改变了语义分块决策、引用管道以及 endpoint 版本管理策略——这些变化从 benchmark 数字本身并不容易看出来。

发生了什么

Mistral OCR 4(mistral-ocr-4-0)现在是 mistral-ocr-latest 背后的模型。它支持从 PDF、DOCX、PPTX 及图像格式中提取内容,覆盖 170 种语言,并在前代产品所生成的纯文本基础上新增了三层结构化输出:

  • 边界框:每一页的块都附带左上角和右下角像素坐标。下游系统无需重新解析文档,即可精准高亮或遮盖特定区域。
  • 类型化块分类:每个块附带结构标签——text(正文)、title(标题)、list(列表)、table(表格)、image(图像)、equation(公式)、caption(图注)、code(代码)、references(参考文献)、aside_text(旁注)、header(页眉)、footer(页脚)、signature(签名)——按阅读顺序排列。通过在 OCR API 调用中设置 include_blocks=True 启用。
  • 内联置信度分数:按页和按词的置信度分数随提取内容一同返回。团队可对低置信度区域触发人工审核,而非将噪声内容直接传入生成步骤。

标准 API 访问定价为 $4/1000 页,Document AI(Studio 无代码路径)为 $5/1000 页。Batch API 享受 50% 折扣,标准费率降至 $2/1000 页,适合批量处理场景。

在 OlmOCRBench 上,OCR 4 得分 85.20,在所有测试系统中排名第一。另一项针对 600+ 份跨 12+ 种语言文档的人工评估中,标注员在大多数文档上更偏好 OCR 4 的输出,平均胜率为 72%。

为什么 AI 工程团队需要关注

影响并不主要体现在 OCR 准确率上——而在于结构化块输出对路由管道下游的解锁效果。

语义分块变为块原生操作。 此前的 OCR 输出是原始 Markdown 字符串,分块策略不得不依靠启发式方法(标题识别、分隔线、段落检测)重新解析。OCR 4 的块标签直接提供了相同的语义信号:title 块即节边界,table 块即检索单元,code 块需要差异化的 embedding 处理。团队不再需要维护一个与 OCR 输出"对抗"的二次分块层。

引用获得原生支持。 文档 AI 管道通常为 LLM 输出附加来源引用,但引用的可靠性取决于能否将生成内容映射回文档中的特定区域。边界框与块标签的结合,为 RAG 系统提供了上下文高亮和精准引用所需的坐标——对金融、法律及合规文档工作负载尤为重要。

置信度分数支持分层路由。 当某页置信度分数较低时,管道可将该页路由到更昂贵的 frontier 视觉模型做二次提取,或标记为人工审核队列,而不是将噪声内容直接传给 LLM。这是路由逻辑的天然插入点:OCR 4 处理主路径,frontier 模型处理异常路径。

mistral-ocr-latest 现已指向 OCR 4。 在 6 月 23 日之后使用 latest 别名的团队会自动获得新行为。include_blocks 参数默认为 False,基础文本提取调用向后兼容。但任何处理原始页 JSON 结构的管道,都应验证 OCR 4 返回的字段结构是否符合预期——启用 blocks 时,OCR 4 会在页对象上新增顶层字段。

支持自托管部署。 OCR 4 可在单容器中运行,适用于隔离网络或数据主权环境。对于有文档数据驻留要求的团队,自托管部署(企业客户通过 Mistral 获取)意味着 OCR 处理在组织自有基础设施内完成,内容不会在传递给云端 LLM API 之前离境。

Router/Operator 视角

对于在多模型或多 provider 之间路由文档提取工作负载的团队,OCR 4 清晰地定义了两层架构:

  1. 提取层:Mistral OCR 4 作为专用文档处理 endpoint。将所有 PDF 和结构化文档摄取路由到 mistral-ocr-4-0(或在验证 schema 变更后使用 mistral-ocr-latest)。对需要边界框或下游验证的管道,启用 include_blocks=True 和 confidence_scores_granularity=word。

  2. 生成层:将提取层的结构化块输出作为上下文,独立路由到 LLM API(OpenAI、Anthropic、DashScope 等)。由于提取输出已完成类型标注和顺序排列,系统提示可明确告知 LLM 哪些块类型需要重点关注(如 title、table、code),哪些可以忽略(如 header、footer)。

OCR 4 发布后需要重新审视的路由决策:

  • Endpoint 固定策略:审查所有传入 model=mistral-ocr-latest 的集成,确认 include_blocks 默认值(当前为 False)。依赖额外页级字段的团队,应在使用 latest 别名之前针对 mistral-ocr-4-0 显式测试。
  • 批处理成本:Batch API 下 $2/1000 页的定价使 OCR 4 在批量文档管道中具有成本竞争力。评估切换到 batch 模式处理非实时摄取任务,是否相比同步调用有实质性节省。
  • 置信度门控 fallback:在 OCR 4 之后添加路由步骤,检查每页置信度分数。低于阈值(如 < 0.7)的页面可路由到二级提取路径——另一模型、人工队列或更高精度扫描——而非直接传入 LLM。
  • Provider 依赖:Mistral OCR 4 目前通过 Mistral API 和 Document AI Studio 提供。通过 gateway 统一路由多 provider 的团队,应确认 OCR endpoint 是否可通过 gateway 的 OpenAI-compatible 层访问;若不支持,则需在主 completion 路由逻辑旁独立调用 Mistral OCR endpoint。

TheRouter 用户应关注的方向

Mistral OCR 4 的 API 是独立的非 chat endpoint(POST /v1/ocr),不经过标准 OpenAI-compatible /v1/chat/completions 路径。使用 TheRouter 进行 completion 路由的团队,应将文档提取视为独立的上游步骤:先运行 OCR 4 生成结构化块输出,再将结果作为上下文通过 TheRouter 的正常 provider 路由传入 completion 调用。

对于在 TheRouter 上评估 Mistral 作为 provider 的团队,OCR 4 的发布是 Mistral 对文档 AI 和企业级 RAG 技术栈持续投入的重要信号。边界框与块标签的加入,使 Mistral 的文档处理层成为 PDF 密集型工作负载中基于视觉模型提取管道的可信替代方案——每页成本显著低于将扫描文档路由给 frontier 视觉模型的方案。

帮助与联系