Mistral OCR 4 добавляет структурные блоки и bounding boxes: что меняется для команд, маршрутизирующих документные рабочие нагрузки
Mistral OCR 4 добавляет bounding boxes, типизированную классификацию блоков и пословные оценки уверенности для пайплайнов обработки PDF и документов. Разбираем, что это меняет для команд, проектирующих RAG, agent и документные маршрутизирующие workflow.

23 июня 2026 года Mistral выпустил OCR 4. Главной новостью стали bounding boxes — наиболее запрашиваемая функция со времён OCR 1. Но более устойчивое операционное изменение — это то, что структурированное извлечение блоков делает со слоем документного ingestion, расположенным выше каждого LLM API-вызова. Для команд, маршрутизирующих документные нагрузки к foundation-моделям, это меняет решения по семантическому чанкингу, citation-пайплайну и политику versioning endpoint — изменения, которые не очевидны из benchmark-цифр.
Что произошло
Mistral OCR 4 (mistral-ocr-4-0) теперь стоит за mistral-ocr-latest. Модель извлекает структурированный контент из PDF, DOCX, PPTX и форматов изображений на 170 языках, добавляя три новых слоя поверх простого текста, который производили предшественники:
- Bounding boxes: блоки каждой страницы локализуются координатами верхнего левого и нижнего правого пикселей. Downstream-системы могут подсвечивать или редактировать конкретные регионы без повторного парсинга документа.
- Типизированная классификация блоков: каждый блок несёт структурную метку —
text,title,list,table,image,equation,caption,code,references,aside_text,header,footer,signature— в порядке чтения. Включается параметромinclude_blocks=Trueпри вызове OCR API. - Inline confidence scores: пословные и постраничные оценки уверенности возвращаются вместе с извлечённым контентом. Команды могут направлять низкоуверенные регионы на ручную проверку, не пропуская шумный контент в шаг генерации.
Цена стандартного API-доступа — $4 за 1000 страниц, Document AI (no-code Studio) — $5 за 1000 страниц. Batch API даёт скидку 50%, снижая стандартную ставку до $2 за 1000 страниц для объёмной обработки.
На OlmOCRBench OCR 4 набрал 85,20 — первое место среди тестируемых систем. В отдельной человеческой оценке по 600+ документам на 12+ языках аннотаторы предпочитали вывод OCR 4 в большинстве документов со средним win rate 72%.
Почему это важно для AI-инженерных команд
Главный эффект — не в точности OCR, а в том, что структурированный вывод блоков открывает дальше по пайплайну маршрутизации.
Семантический чанкинг становится нативно блочным. Предыдущие OCR-выходы были сырыми Markdown-строками, которые стратегии чанкинга заново парсили с помощью эвристик (заголовки, разделители, обнаружение абзацев). Метки блоков OCR 4 поставляют тот же сигнал напрямую: блок title — граница секции, блок table — единица retrieval, блок code требует иной обработки embedding. Команды больше не поддерживают вторичный слой чанкинга, конкурирующий с OCR-выходом.
Citations получают первоклассную поддержку. Document AI пайплайны часто прикрепляют к LLM-выходам ссылки на источники, но надёжность цитирования зависит от возможности отобразить сгенерированное утверждение назад на конкретный регион документа. Bounding boxes в сочетании с метками блоков дают RAG-системам координаты для in-context highlighting и точных ссылок — особенно ценно для финансовых, юридических и compliance-документов.
Confidence scores обеспечивают многоуровневую маршрутизацию. Когда у страницы низкие оценки уверенности, пайплайн может направить её на более дорогостоящую frontier vision-модель для повторного извлечения или пометить для ручной проверки — вместо того чтобы пропускать шумный контент в шаг генерации. Это естественная точка вставки логики маршрутизации: OCR 4 обрабатывает основной поток, frontier-модели — исключительный путь.
mistral-ocr-latest теперь указывает на OCR 4. Команды, использующие alias latest, автоматически получили новое поведение 23 июня. Параметр include_blocks по умолчанию False, поэтому базовые вызовы извлечения текста обратно совместимы. Однако любой пайплайн, обрабатывающий структуру сырого JSON страниц, должен проверить, что форма, возвращаемая OCR 4, соответствует ожиданиям — OCR 4 добавляет новые поля верхнего уровня в объекты страниц при включённых блоках.
Поддержка self-hosted развёртывания. OCR 4 запускается в одном контейнере, что позволяет развернуть его в air-gapped или средах с требованиями суверенитета данных. Self-managed развёртывание (доступное корпоративным клиентам через Mistral) означает, что обработка OCR остаётся в инфраструктуре организации — до передачи контента облачному LLM API.
Угол router/operator
Для команд, маршрутизирующих документные нагрузки между несколькими моделями или provider-ами, OCR 4 чётко обозначает двухуровневую архитектуру:
-
Слой извлечения: Mistral OCR 4 как выделенный endpoint обработки документов. Направляйте весь PDF и structured-document ingestion через
mistral-ocr-4-0(или черезmistral-ocr-latestпосле валидации изменения схемы). Используйтеinclude_blocks=Trueиconfidence_scores_granularity=wordдля пайплайнов, которым нужны bounding boxes или downstream-верификация. -
Слой генерации: отдельный маршрутизируемый LLM API-вызов (OpenAI, Anthropic, DashScope и т.д.), получающий структурированный вывод блоков из шага 1 в качестве контекста. Поскольку вывод извлечения уже типизирован и упорядочен, системный промпт может явно указать LLM, каким типам блоков уделять внимание (
title,table,code), а какие игнорировать (header,footer).
Решения по маршрутизации, которые стоит пересмотреть в свете OCR 4:
- Pinning endpoint: проаудируйте все интеграции, передающие
model=mistral-ocr-latest, и убедитесь в значении по умолчаниюinclude_blocks(сейчасFalse). Команды, полагающиеся на дополнительные поля на уровне страниц, должны протестировать противmistral-ocr-4-0явно, прежде чем использовать aliaslatest. - Стоимость batch-обработки: при $2 за 1000 страниц на Batch API OCR 4 конкурентоспособен по цене для объёмных документных пайплайнов. Оцените, даст ли переход к batch-режиму для нереального-времени ingestion-задач существенную экономию по сравнению с синхронными вызовами.
- Confidence-gated fallback: добавьте шаг маршрутизации после OCR 4, проверяющий пословные confidence scores. Страницы ниже порога (например,
< 0.7) можно направлять на вторичный путь извлечения — другую модель, ручную очередь или сканирование с более высоким разрешением — вместо прямой передачи в LLM. - Зависимость от provider: Mistral OCR 4 доступен через Mistral API и Document AI Studio. Команды, маршрутизирующие через gateway с единым доступом к нескольким provider-ам, должны убедиться, что OCR endpoint доступен через OpenAI-compatible слой gateway; в противном случае — вызывать Mistral OCR endpoint напрямую параллельно с основной логикой маршрутизации completion.
На что обратить внимание пользователям TheRouter
Mistral OCR 4 API — это отдельный, не-chat endpoint (POST /v1/ocr), который не проходит через стандартный OpenAI-compatible путь /v1/chat/completions. Команды, использующие TheRouter для маршрутизации completion, должны рассматривать извлечение документов как отдельный upstream-шаг: запустить OCR 4 для получения структурированного вывода блоков, затем передать результирующий контекст в completion-вызов через обычную маршрутизацию provider-а TheRouter.
Для команд, оценивающих Mistral как provider на TheRouter, выпуск OCR 4 — значимый сигнал об инвестициях Mistral в стек document AI и enterprise RAG. Добавление bounding boxes и меток блоков позиционирует слой документной обработки Mistral как реальную альтернативу пайплайнам извлечения на основе vision-моделей для рабочих нагрузок с интенсивным использованием PDF — со значительно меньшей стоимостью на страницу по сравнению с маршрутизацией сканированного документа через frontier vision-модель.
Похожие материалы
Новости AI-роутинга и провайдеров →
Claude Code 2.1.281: Bedrock-апстримы получили кросс-аккаунтный IAM и принудительный Guardrail
2.1.281 добавляет assume_role и guardrail в Bedrock-апстримы Claude apps gateway. assume_role обменивает IAM-учётные данные на per-developer STS-токены. guardrail применяет Bedrock guardrail к каждому запросу. Оба смещают границу доверия в мультиаккаунтных AWS-деплоях.

Claude Opus 5.5: четыре ломающих изменения API и их влияние на маршрутизацию
Claude Opus 5.5: четыре ломающих изменения — thinking нельзя отключить, tool_choice типы any/tool возвращают 400, thinking-блоки не читаются не-Fable/Mythos моделями, computer_20251124 удалён. Конкретные исправления и влияние на резервную маршрутизацию.

Claude API: компакция по требованию и режим `auto` для разрешений меняют архитектуру агентных циклов
Два новых бета-обновления Claude API: `compact-2026-09-04` выносит суммаризацию в фоновый вызов, а режим `auto` передаёт оценку доверия к инструментам на сторону сервера. Оба меняют проектирование агентных циклов.