Mistral publie OCR 4, qui structure les documents au-delà du texte
Mistral lance OCR 4, un modèle de reconnaissance de documents structurant textes et tableaux en 170 langues pour optimiser le RAG et les workflows d'entreprise.
Mistral publie OCR 4, la nouvelle version de son modèle de reconnaissance et de compréhension de documents. Là où les générations précédentes convertissaient une page en texte et tableaux propres, OCR 4 en renvoie une représentation structurée : chaque bloc est localisé par une bounding box, classé par type, titre, tableau, équation ou signature, et assorti de scores de confiance, par page et par mot. Les systèmes en aval savent ainsi non seulement ce que dit le document, mais où chaque élément se situe et avec quelle fiabilité il a été lu.
L'entreprise destine cette structure au RAG et à la recherche en entreprise, aux citations ancrées dans la source, aux caviardages et à la vérification humaine, ainsi qu'à des workflows agentiques comme le remplissage de formulaires ou le traitement de factures. Le modèle couvre 170 langues, avec des gains revendiqués sur les langues rares, et reste assez compact pour tourner dans un seul conteneur, entièrement auto-hébergé, de quoi garder les documents dans son propre environnement pour des raisons de résidence et de conformité.
Côté tarif, l'API revient à quatre dollars les mille pages, moitié moins en traitement par lots, une couche Document AI ajoutant une sortie structurée sur mesure. Mistral donne le modèle préféré en évaluation humaine à l'aveugle face aux systèmes testés, taux de victoire moyen de 72 pour cent et première place sur le banc public OlmOCRBench, tout en nuançant ces scores, qu'elle juge indicatifs plutôt que définitifs. Il arrive aussi sur Amazon SageMaker et Microsoft Foundry.