Mistral OCR 4 добавляет структурные блоки и bounding boxes: что меняется для команд, маршрутизирующих документные рабочие нагрузки

Mistral OCR 4 добавляет bounding boxes, типизированную классификацию блоков и пословные оценки уверенности для пайплайнов обработки PDF и документов. Разбираем, что это меняет для команд, проектирующих RAG, agent и документные маршрутизирующие workflow.

TheRouter Newsroomисточник Mistral AI
Схема структурированного документного AI-пайплайна Mistral OCR 4, демонстрирующая извлечение блоков и поток маршрутизации

23 июня 2026 года Mistral выпустил OCR 4. Главной новостью стали bounding boxes — наиболее запрашиваемая функция со времён OCR 1. Но более устойчивое операционное изменение — это то, что структурированное извлечение блоков делает со слоем документного ingestion, расположенным выше каждого LLM API-вызова. Для команд, маршрутизирующих документные нагрузки к foundation-моделям, это меняет решения по семантическому чанкингу, citation-пайплайну и политику versioning endpoint — изменения, которые не очевидны из benchmark-цифр.

Что произошло

Mistral OCR 4 (mistral-ocr-4-0) теперь стоит за mistral-ocr-latest. Модель извлекает структурированный контент из PDF, DOCX, PPTX и форматов изображений на 170 языках, добавляя три новых слоя поверх простого текста, который производили предшественники:

  • Bounding boxes: блоки каждой страницы локализуются координатами верхнего левого и нижнего правого пикселей. Downstream-системы могут подсвечивать или редактировать конкретные регионы без повторного парсинга документа.
  • Типизированная классификация блоков: каждый блок несёт структурную метку — text, title, list, table, image, equation, caption, code, references, aside_text, header, footer, signature — в порядке чтения. Включается параметром include_blocks=True при вызове OCR API.
  • Inline confidence scores: пословные и постраничные оценки уверенности возвращаются вместе с извлечённым контентом. Команды могут направлять низкоуверенные регионы на ручную проверку, не пропуская шумный контент в шаг генерации.

Цена стандартного API-доступа — $4 за 1000 страниц, Document AI (no-code Studio) — $5 за 1000 страниц. Batch API даёт скидку 50%, снижая стандартную ставку до $2 за 1000 страниц для объёмной обработки.

На OlmOCRBench OCR 4 набрал 85,20 — первое место среди тестируемых систем. В отдельной человеческой оценке по 600+ документам на 12+ языках аннотаторы предпочитали вывод OCR 4 в большинстве документов со средним win rate 72%.

Почему это важно для AI-инженерных команд

Главный эффект — не в точности OCR, а в том, что структурированный вывод блоков открывает дальше по пайплайну маршрутизации.

Семантический чанкинг становится нативно блочным. Предыдущие OCR-выходы были сырыми Markdown-строками, которые стратегии чанкинга заново парсили с помощью эвристик (заголовки, разделители, обнаружение абзацев). Метки блоков OCR 4 поставляют тот же сигнал напрямую: блок title — граница секции, блок table — единица retrieval, блок code требует иной обработки embedding. Команды больше не поддерживают вторичный слой чанкинга, конкурирующий с OCR-выходом.

Citations получают первоклассную поддержку. Document AI пайплайны часто прикрепляют к LLM-выходам ссылки на источники, но надёжность цитирования зависит от возможности отобразить сгенерированное утверждение назад на конкретный регион документа. Bounding boxes в сочетании с метками блоков дают RAG-системам координаты для in-context highlighting и точных ссылок — особенно ценно для финансовых, юридических и compliance-документов.

Confidence scores обеспечивают многоуровневую маршрутизацию. Когда у страницы низкие оценки уверенности, пайплайн может направить её на более дорогостоящую frontier vision-модель для повторного извлечения или пометить для ручной проверки — вместо того чтобы пропускать шумный контент в шаг генерации. Это естественная точка вставки логики маршрутизации: OCR 4 обрабатывает основной поток, frontier-модели — исключительный путь.

mistral-ocr-latest теперь указывает на OCR 4. Команды, использующие alias latest, автоматически получили новое поведение 23 июня. Параметр include_blocks по умолчанию False, поэтому базовые вызовы извлечения текста обратно совместимы. Однако любой пайплайн, обрабатывающий структуру сырого JSON страниц, должен проверить, что форма, возвращаемая OCR 4, соответствует ожиданиям — OCR 4 добавляет новые поля верхнего уровня в объекты страниц при включённых блоках.

Поддержка self-hosted развёртывания. OCR 4 запускается в одном контейнере, что позволяет развернуть его в air-gapped или средах с требованиями суверенитета данных. Self-managed развёртывание (доступное корпоративным клиентам через Mistral) означает, что обработка OCR остаётся в инфраструктуре организации — до передачи контента облачному LLM API.

Угол router/operator

Для команд, маршрутизирующих документные нагрузки между несколькими моделями или provider-ами, OCR 4 чётко обозначает двухуровневую архитектуру:

  1. Слой извлечения: Mistral OCR 4 как выделенный endpoint обработки документов. Направляйте весь PDF и structured-document ingestion через mistral-ocr-4-0 (или через mistral-ocr-latest после валидации изменения схемы). Используйте include_blocks=True и confidence_scores_granularity=word для пайплайнов, которым нужны bounding boxes или downstream-верификация.

  2. Слой генерации: отдельный маршрутизируемый LLM API-вызов (OpenAI, Anthropic, DashScope и т.д.), получающий структурированный вывод блоков из шага 1 в качестве контекста. Поскольку вывод извлечения уже типизирован и упорядочен, системный промпт может явно указать LLM, каким типам блоков уделять внимание (title, table, code), а какие игнорировать (header, footer).

Решения по маршрутизации, которые стоит пересмотреть в свете OCR 4:

  • Pinning endpoint: проаудируйте все интеграции, передающие model=mistral-ocr-latest, и убедитесь в значении по умолчанию include_blocks (сейчас False). Команды, полагающиеся на дополнительные поля на уровне страниц, должны протестировать против mistral-ocr-4-0 явно, прежде чем использовать alias latest.
  • Стоимость batch-обработки: при $2 за 1000 страниц на Batch API OCR 4 конкурентоспособен по цене для объёмных документных пайплайнов. Оцените, даст ли переход к batch-режиму для нереального-времени ingestion-задач существенную экономию по сравнению с синхронными вызовами.
  • Confidence-gated fallback: добавьте шаг маршрутизации после OCR 4, проверяющий пословные confidence scores. Страницы ниже порога (например, < 0.7) можно направлять на вторичный путь извлечения — другую модель, ручную очередь или сканирование с более высоким разрешением — вместо прямой передачи в LLM.
  • Зависимость от provider: Mistral OCR 4 доступен через Mistral API и Document AI Studio. Команды, маршрутизирующие через gateway с единым доступом к нескольким provider-ам, должны убедиться, что OCR endpoint доступен через OpenAI-compatible слой gateway; в противном случае — вызывать Mistral OCR endpoint напрямую параллельно с основной логикой маршрутизации completion.

На что обратить внимание пользователям TheRouter

Mistral OCR 4 API — это отдельный, не-chat endpoint (POST /v1/ocr), который не проходит через стандартный OpenAI-compatible путь /v1/chat/completions. Команды, использующие TheRouter для маршрутизации completion, должны рассматривать извлечение документов как отдельный upstream-шаг: запустить OCR 4 для получения структурированного вывода блоков, затем передать результирующий контекст в completion-вызов через обычную маршрутизацию provider-а TheRouter.

Для команд, оценивающих Mistral как provider на TheRouter, выпуск OCR 4 — значимый сигнал об инвестициях Mistral в стек document AI и enterprise RAG. Добавление bounding boxes и меток блоков позиционирует слой документной обработки Mistral как реальную альтернативу пайплайнам извлечения на основе vision-моделей для рабочих нагрузок с интенсивным использованием PDF — со значительно меньшей стоимостью на страницу по сравнению с маршрутизацией сканированного документа через frontier vision-модель.

Абстрактная диаграмма: цепочка принятия роли IAM от Claude apps gateway к Bedrock-апстриму в отдельном аккаунте AWS, с уровнем принудительного применения guardrail

Claude Code 2.1.281: Bedrock-апстримы получили кросс-аккаунтный IAM и принудительный Guardrail

2.1.281 добавляет assume_role и guardrail в Bedrock-апстримы Claude apps gateway. assume_role обменивает IAM-учётные данные на per-developer STS-токены. guardrail применяет Bedrock guardrail к каждому запросу. Оба смещают границу доверия в мультиаккаунтных AWS-деплоях.

источник Anthropic
Абстрактная архитектурная диаграмма, показывающая трансформацию формы API-запросов при прохождении через шлюз, иллюстрирующая четыре ломающих изменения Claude Opus 5.5

Claude Opus 5.5: четыре ломающих изменения API и их влияние на маршрутизацию

Claude Opus 5.5: четыре ломающих изменения — thinking нельзя отключить, tool_choice типы any/tool возвращают 400, thinking-блоки не читаются не-Fable/Mythos моделями, computer_20251124 удалён. Конкретные исправления и влияние на резервную маршрутизацию.

источник Anthropic
Claude API компакция по требованию и режим auto для разрешений: диаграмма пайплайна с фоновой суммаризацией и серверной оценкой доверия

Claude API: компакция по требованию и режим `auto` для разрешений меняют архитектуру агентных циклов

Два новых бета-обновления Claude API: `compact-2026-09-04` выносит суммаризацию в фоновый вызов, а режим `auto` передаёт оценку доверия к инструментам на сторону сервера. Оба меняют проектирование агентных циклов.

источник Anthropic
Помощь и контакты