Mistral OCR 4 新增结构化块提取与边界框:AI 团队的文档工作负载路由策略解读
Mistral OCR 4 为 PDF 与文档摄取管道带来了边界框、类型化块分类和逐字置信度分数。本文解析该版本对设计 RAG、agent 和文档路由工作流的工程团队意味着什么。

2026 年 6 月 23 日,Mistral 发布了 OCR 4。从标题上看,这次的亮点是边界框(bounding boxes)——这也是自 OCR 1 以来呼声最高的功能请求。但真正带来持久运营影响的,是结构化块提取对每次 LLM API 调用上游文档摄取层的重构。对于将文档工作负载路由到基础模型的团队而言,这一版本改变了语义分块决策、引用管道以及 endpoint 版本管理策略——这些变化从 benchmark 数字本身并不容易看出来。
发生了什么
Mistral OCR 4(mistral-ocr-4-0)现在是 mistral-ocr-latest 背后的模型。它支持从 PDF、DOCX、PPTX 及图像格式中提取内容,覆盖 170 种语言,并在前代产品所生成的纯文本基础上新增了三层结构化输出:
- 边界框:每一页的块都附带左上角和右下角像素坐标。下游系统无需重新解析文档,即可精准高亮或遮盖特定区域。
- 类型化块分类:每个块附带结构标签——
text(正文)、title(标题)、list(列表)、table(表格)、image(图像)、equation(公式)、caption(图注)、code(代码)、references(参考文献)、aside_text(旁注)、header(页眉)、footer(页脚)、signature(签名)——按阅读顺序排列。通过在 OCR API 调用中设置include_blocks=True启用。 - 内联置信度分数:按页和按词的置信度分数随提取内容一同返回。团队可对低置信度区域触发人工审核,而非将噪声内容直接传入生成步骤。
标准 API 访问定价为 $4/1000 页,Document AI(Studio 无代码路径)为 $5/1000 页。Batch API 享受 50% 折扣,标准费率降至 $2/1000 页,适合批量处理场景。
在 OlmOCRBench 上,OCR 4 得分 85.20,在所有测试系统中排名第一。另一项针对 600+ 份跨 12+ 种语言文档的人工评估中,标注员在大多数文档上更偏好 OCR 4 的输出,平均胜率为 72%。
为什么 AI 工程团队需要关注
影响并不主要体现在 OCR 准确率上——而在于结构化块输出对路由管道下游的解锁效果。
语义分块变为块原生操作。 此前的 OCR 输出是原始 Markdown 字符串,分块策略不得不依靠启发式方法(标题识别、分隔线、段落检测)重新解析。OCR 4 的块标签直接提供了相同的语义信号:title 块即节边界,table 块即检索单元,code 块需要差异化的 embedding 处理。团队不再需要维护一个与 OCR 输出"对抗"的二次分块层。
引用获得原生支持。 文档 AI 管道通常为 LLM 输出附加来源引用,但引用的可靠性取决于能否将生成内容映射回文档中的特定区域。边界框与块标签的结合,为 RAG 系统提供了上下文高亮和精准引用所需的坐标——对金融、法律及合规文档工作负载尤为重要。
置信度分数支持分层路由。 当某页置信度分数较低时,管道可将该页路由到更昂贵的 frontier 视觉模型做二次提取,或标记为人工审核队列,而不是将噪声内容直接传给 LLM。这是路由逻辑的天然插入点:OCR 4 处理主路径,frontier 模型处理异常路径。
mistral-ocr-latest 现已指向 OCR 4。 在 6 月 23 日之后使用 latest 别名的团队会自动获得新行为。include_blocks 参数默认为 False,基础文本提取调用向后兼容。但任何处理原始页 JSON 结构的管道,都应验证 OCR 4 返回的字段结构是否符合预期——启用 blocks 时,OCR 4 会在页对象上新增顶层字段。
支持自托管部署。 OCR 4 可在单容器中运行,适用于隔离网络或数据主权环境。对于有文档数据驻留要求的团队,自托管部署(企业客户通过 Mistral 获取)意味着 OCR 处理在组织自有基础设施内完成,内容不会在传递给云端 LLM API 之前离境。
Router/Operator 视角
对于在多模型或多 provider 之间路由文档提取工作负载的团队,OCR 4 清晰地定义了两层架构:
-
提取层:Mistral OCR 4 作为专用文档处理 endpoint。将所有 PDF 和结构化文档摄取路由到
mistral-ocr-4-0(或在验证 schema 变更后使用mistral-ocr-latest)。对需要边界框或下游验证的管道,启用include_blocks=True和confidence_scores_granularity=word。 -
生成层:将提取层的结构化块输出作为上下文,独立路由到 LLM API(OpenAI、Anthropic、DashScope 等)。由于提取输出已完成类型标注和顺序排列,系统提示可明确告知 LLM 哪些块类型需要重点关注(如
title、table、code),哪些可以忽略(如header、footer)。
OCR 4 发布后需要重新审视的路由决策:
- Endpoint 固定策略:审查所有传入
model=mistral-ocr-latest的集成,确认include_blocks默认值(当前为False)。依赖额外页级字段的团队,应在使用latest别名之前针对mistral-ocr-4-0显式测试。 - 批处理成本:Batch API 下 $2/1000 页的定价使 OCR 4 在批量文档管道中具有成本竞争力。评估切换到 batch 模式处理非实时摄取任务,是否相比同步调用有实质性节省。
- 置信度门控 fallback:在 OCR 4 之后添加路由步骤,检查每页置信度分数。低于阈值(如
< 0.7)的页面可路由到二级提取路径——另一模型、人工队列或更高精度扫描——而非直接传入 LLM。 - Provider 依赖:Mistral OCR 4 目前通过 Mistral API 和 Document AI Studio 提供。通过 gateway 统一路由多 provider 的团队,应确认 OCR endpoint 是否可通过 gateway 的 OpenAI-compatible 层访问;若不支持,则需在主 completion 路由逻辑旁独立调用 Mistral OCR endpoint。
TheRouter 用户应关注的方向
Mistral OCR 4 的 API 是独立的非 chat endpoint(POST /v1/ocr),不经过标准 OpenAI-compatible /v1/chat/completions 路径。使用 TheRouter 进行 completion 路由的团队,应将文档提取视为独立的上游步骤:先运行 OCR 4 生成结构化块输出,再将结果作为上下文通过 TheRouter 的正常 provider 路由传入 completion 调用。
对于在 TheRouter 上评估 Mistral 作为 provider 的团队,OCR 4 的发布是 Mistral 对文档 AI 和企业级 RAG 技术栈持续投入的重要信号。边界框与块标签的加入,使 Mistral 的文档处理层成为 PDF 密集型工作负载中基于视觉模型提取管道的可信替代方案——每页成本显著低于将扫描文档路由给 frontier 视觉模型的方案。
相关阅读
AI 路由新闻与供应商动态 →
Claude Code 2.1.281:Bedrock 上游获得跨账号 IAM 和 Guardrail 强制执行
2.1.281 新增三个字段,改变 Bedrock 上游的认证与策略执行。assume_role 通过 STS 将凭证转为按开发者隔离的会话令牌;guardrail 强制每个请求通过 Bedrock guardrail。两者均影响多账号 AWS 部署的信任边界。

Claude Opus 5.5:四个破坏性 API 变更及其对路由设置的影响
Claude Opus 5.5 四个破坏性变更:thinking 无法禁用、强制 tool_choice 返回 400、thinking 块无法跨非 Fable/Mythos 模型、computer_20251124 已移除。每个变更有具体修复方案,三个涉及公告未提及的回退路由影响。

Claude API:按需 Compaction 与 `auto` 权限模式,重写你的 Agent 循环设计
Anthropic 本周发布了两个面向 Operator 的 Beta 功能:`compact-2026-09-04` 把摘要生成移出关键路径,`auto` 权限模式把信任评估从你的代码转移到服务器。两者都改变了延迟、成本和控制权之间的边界。