Mistral OCR 4 añade bloques estructurados: el cambio útil para agentes que leen documentos
Mistral OCR 4 incorpora include_blocks para devolver títulos, tablas, imágenes, ecuaciones y código con bounding boxes y orden de lectura. Eso mejora el puente entre PDF, RAG y tools, pero exige validar la extracción.

Por qué importa
Esta nota se enfoca en la decisión práctica para builders: qué cambia, qué riesgo agrega y cómo aplicarlo sin romper operación.
Mistral publicó OCR 4 el 23 de junio de 2026 y añadió una capacidad que va más allá de reconocer texto: include_blocks devuelve los bloques estructurales de cada página con su tipo, contenido, bounding box y orden de lectura. La API puede distinguir title, text, list, table, image, equation, caption, code, references, header, footer y signature.
Para un agente que trabaja con PDFs, la diferencia es importante. Un OCR plano entrega una cadena que luego otro componente debe interpretar. Los bloques conservan una parte de la geometría y de la jerarquía del documento, lo que permite separar una tabla de su explicación, excluir un pie de página del contexto o enviar un fragmento de código a una herramienta distinta.
El cambio está en el contrato de salida
La documentación de Mistral ya ofrecía Markdown, tablas e imágenes extraídas. OCR 4 agrega una capa de regiones: cada bloque comparte coordenadas de esquina y un campo content, y los bloques aparecen en orden de lectura. La API también puede devolver tablas en Markdown o HTML, conservar hipervínculos y solicitar puntuaciones de confianza a nivel de página o palabra.
Eso abre un pipeline más preciso para agentes documentales:
- recibes un PDF, imagen o documento compatible;
- ejecutas OCR con
include_blocks: true; - clasificas cada bloque según su uso, no solo según su texto;
- indexas párrafos, tablas e imágenes con metadatos de página y región;
- recuperas el contexto correcto antes de dejar que el agente responda o llame una tool.

La ventaja frente a partir Markdown por separadores es que el layout no se pierde tan pronto. Un agente puede pedir primero títulos y tablas, ignorar cabeceras repetidas y tratar un bloque de código como evidencia técnica. En documentos con dos columnas o contenido mixto, esa información puede reducir el contexto irrelevante que llega al modelo.
Dónde sí mejora un agente
El encaje más claro está en flujos donde la forma del documento cambia la acción:
- Facturas y órdenes: separar tabla de conceptos, totales y notas antes de validar.
- Manuales técnicos: recuperar títulos, advertencias, procedimientos y código por separado.
- Contratos: conservar página y región para que una respuesta pueda apuntar a evidencia concreta.
- Reportes: tratar gráficos, pies y referencias como piezas distintas antes de resumir.
- Soporte interno: evitar que el agente confunda un encabezado repetido con una instrucción vigente.
Mistral marca dos límites que conviene leer literalmente. La extracción de bloques solo está disponible con OCR 4 o posterior; modelos anteriores pueden aceptar el parámetro y devolver un arreglo vacío. Además, include_blocks no convierte una página ambigua en verdad: la coordenada ayuda a ubicar un contenido, pero no garantiza que una tabla escaneada o una firma difícil de leer haya sido reconocida correctamente.

No indexes sin validar
Para una primera prueba, guardaría el resultado completo de OCR junto con una versión normalizada. Después mediría por tipo de bloque, no solo por documento:
- compara títulos, tablas y listas con una muestra revisada por una persona;
- conserva
page, coordenadas y confianza cuando estén disponibles; - descarta o envía a revisión los bloques con baja confianza;
- comprueba que el texto recuperado mantiene la relación con su tabla o imagen;
- evalúa respuestas del agente con citas de página y no solo con similitud vectorial.
En batch, la propia documentación recomienda el servicio de inferencia por lotes para procesar grandes volúmenes. Eso no elimina la necesidad de control de costos: extraer imágenes, tablas y confianza puede aumentar el payload y el trabajo posterior.
Las consultas Mistral OCR 4, include_blocks OCR, OCR estructurado para RAG y agente PDF con bounding boxes tienen intención técnica clara. No hay volumen SEO conectado; la demanda se infiere del changelog, la documentación de la API y el problema de convertir documentos visuales en contexto confiable.
Si todavía estás definiendo cómo un agente llama herramientas y verifica sus entradas, el curso gratis es un buen punto de partida. La lectura corta: OCR 4 no solo lee la página; entrega piezas que un sistema puede enrutar, evaluar y citar.