Title
Subtitle
Text
Image

Table
Thinking
Summary
Mistral OCR 4 introduit une analyse documentaire avancée avec boîtes englobantes, classification des blocs et scores de confiance intégrés, avec prise en charge de 170 langues et exécution dans un conteneur unique pour les déploiements auto-hébergés. Il obtient de meilleurs résultats que les principaux systèmes OCR dans les évaluations humaines et les benchmarks, tout en proposant un traitement à haut débit et à coût maîtrisé pour la recherche d’entreprise, le RAG et les workflows agentiques. Disponible via API ou avec Document AI, il fournit des sorties structurées pour les pipelines personnalisés ou les applications no-code, avec des options d’auto-hébergement pour la confidentialité des données.
Aujourd’hui, nous publions Mistral OCR 4, avec boîtes englobantes, classification des blocs et scores de confiance intégrés au texte extrait. Le modèle prend en charge 170 langues dans 10 groupes linguistiques, s’exécute dans un seul conteneur pour des déploiements entièrement auto-hébergés, et sert de composant d’ingestion pour la recherche d’entreprise, le RAG et les pipelines de recherche propres à un domaine. OCR 4 est un modèle compact et ciblé. Cet article présente les nouveautés, ses performances sur des benchmarks publics et internes, les limites connues de ces benchmarks, ainsi que des conseils pour choisir entre l’API du modèle et Document AI.
Points clés
Performance de premier plan. Des annotateurs indépendants préfèrent OCR 4 à tous les principaux systèmes d’OCR et de Document AI testés, avec des taux de préférence moyens de 72 %, ainsi que le meilleur score global sur OlmOCRBench (85,20). Consultez la section Benchmarks ci-dessous pour la méthodologie et les limites connues de notation.
Segmentation, pas seulement du texte. En plus du texte extrait, OCR 4 renvoie des boîtes englobantes, une classification des blocs par type (titres, tableaux, équations, signatures, etc.) et des scores de confiance intégrés au texte. Les boîtes englobantes, la capacité la plus demandée par nos utilisateurs, localisent le texte pour la mise en évidence en contexte et des pipelines de données fiables. Les types de blocs et les scores de confiance permettent aussi des citations ancrées dans les sources, des occultations et une vérification avec intervention humaine.
Intégré à Mistral Search Toolkit (preview publique). OCR 4 est un composant d’ingestion de Search Toolkit, le framework de recherche open source et composable de Mistral, annoncé lors de l’AI Now Summit. Sa sortie structurée fournit des entrées prêtes pour la citation au workflow d’ingestion, de retrieval et d’évaluation du toolkit pour le RAG et la recherche d’entreprise.
Couverture multilingue. prise en charge de 170 langues dans 10 groupes linguistiques, avec des gains mesurables sur les langues spécialisées et à faibles ressources, où plusieurs systèmes concurrents se dégradent.
Exécutable sur votre propre infrastructure. OCR 4 est assez compact pour être déployé dans un seul conteneur. Les données documentaires restent dans votre environnement pour répondre aux exigences de résidence, de souveraineté et de conformité, tout en permettant un traitement batch efficace et à haut débit. Le déploiement autogéré est disponible pour les clients entreprise.
Vue d’ensemble
Mistral OCR 4 extrait et structure le contenu d’un large éventail de documents. Là où les générations précédentes se concentraient sur la conversion d’une page en texte et tableaux propres, OCR 4 renvoie une représentation structurée du document. Chaque bloc est localisé avec une boîte englobante, classé par type, et des scores de confiance sont générés par page et par mot. Les systèmes en aval accèdent donc non seulement à ce que dit le document, mais aussi à l’endroit où se trouve chaque élément, au rôle qu’il joue et au niveau de confiance du modèle dans chaque zone.
Cette structure prend en charge plusieurs charges de travail en aval :
Découpage sémantique pour le RAG : des blocs propres et classifiés deviennent de meilleures unités de retrieval.
Primitives structurelles pour les agents : les agents passent de la lecture des documents à l’action sur ces documents (remplissage de formulaires, traitement de factures, vérifications de conformité).
Contenu structuré pour les connecteurs : sortie cohérente et typée pour les pipelines d’ingestion et d’indexation.
OCR 4 accepte les formats courants en entreprise, notamment PDF, DOC, PPT et OpenDocument, et prend en charge 170 langues dans 10 groupes linguistiques, dont des langues spécialisées et à faibles ressources que de nombreux systèmes traitent mal. Modèle compact déployable dans un seul conteneur, il convient aux déploiements sensibles aux coûts comme aux volumes élevés. Il peut s’exécuter en auto-hébergement complet, ce qui permet aux organisations ayant des exigences de souveraineté des données de conserver les données documentaires dans leur propre infrastructure.
Les développeurs intègrent le modèle via l’API, et les équipes peuvent utiliser Document AI dans Mistral Studio pour accéder au même moteur au niveau applicatif, sans code. Mistral OCR 4 via l’API est facturé 4 $ pour 1 000 pages, avec une réduction batch API de 50 %, ce qui ramène le coût à 2 $ pour 1 000 pages. Document AI est facturé 5 $ pour 1 000 pages.
Benchmarks
« Nous avons comparé Mistral OCR 4 aux principaux parseurs de documents agentiques sur un jeu de données de QA financière riche en graphiques et figures. Nous avons obtenu une précision équivalente avec un coût environ huit fois inférieur et une latence 17 fois plus faible. Pour les cas d’usage de production à grande échelle, cet écart s’accumule vite. »
- Aidan Donohue, ingénieur IA, Rogo
Pour évaluer OCR 4, nous l’avons comparé aux principaux modèles d’OCR natifs IA, à des modèles généralistes de pointe, à des services documentaires d’entreprise et à notre propre Mistral OCR 3.
Évaluations des préférences humaines
Les benchmarks automatisés comportent les artefacts de notation décrits ci-dessus. Nous les avons donc complétés par une évaluation humaine comparative sur des documents choisis pour refléter des usages réels. Nous avons réuni plus de 600 documents dans plus de 12 langues, provenant de fournisseurs tiers afin de représenter des cas d’usage industriels réels, puis demandé à des annotateurs indépendants de classer à l’aveugle la sortie de chaque concurrent par rapport à celle d’OCR 4, document par document.
Les annotateurs ont préféré OCR 4 dans la majorité des documents pour tous les systèmes testés. Comme il s’agit de jugements humains sur des documents réalistes, et non de comparaisons de chaînes avec des références fixes, cette méthode contourne une grande partie du bruit d’annotation et de mise en forme qui affecte les scores automatisés.
_15hPxB.webp?dpl=6aa302cd175bde0008679e83)
Performance globale
« Mistral OCR est environ quatre fois plus rapide par page que notre fournisseur actuel, un résultat solide pour les workflows de docketing à haut volume, où la vitesse est critique pour gérer les échéances de propriété intellectuelle de nos clients. »
- Ivan Mihailov, ingénieur IA, Anaqua
En plus d’arriver en tête dans nos préférences humaines, OCR 4 obtient le meilleur score global parmi les modèles que nous avons testés sur le benchmark public OlmOCRBench (85,20) et mène notre évaluation interne Crawl Multilingual (0,98), devant les solutions natives IA comme les solutions d’entreprise.
_ZDpUIm.webp?dpl=6aa302cd175bde0008679e83)
Sur OmniDocBench, OCR 4 obtient un score de 93,07. Nous publions ce chiffre avec une réserve : OlmOCRBench et OmniDocBench ont tous deux des limites connues dans leur manière de noter certaines sorties, et un seul score agrégé peut à la fois sous-estimer et surestimer les performances réelles.
Lorsque nous avons audité les écarts derrière nos scores, la plupart n’étaient pas des erreurs du modèle, mais des artefacts liés à la façon dont les benchmarks comparent les sorties. Les catégories récurrentes :
Erreurs dans la vérité terrain. Certaines annotations de référence sont elles-mêmes incorrectes : texte manquant ou en trop, transcriptions de zones occultées, ou fautes de frappe (par exemple, le nom d’un auteur cité est mal orthographié dans la référence, mais correctement lu par le modèle sur la page). La sortie correspond au document source, mais elle est tout de même marquée comme erronée.
Notation mathématique équivalente. Un LaTeX différent qui produit un rendu identique est compté comme un écart. L’équation rendue est correcte ; la comparaison de chaînes ne l’est pas.
Segmentation des équations. Le fait qu’une expression soit émise comme une seule équation ou découpée en plusieurs fragments intégrés au texte affecte la correspondance, même lorsque le contenu rendu est identique, car l’outil de comparaison ne peut pas aligner les morceaux.
Ordre de lecture multicolonne. Les mots coupés à la limite d’une colonne (par exemple, « certifi-cates ») et les hypothèses sur l’ordre des colonnes font noter des extractions correctes comme des échecs d’ordre de lecture.
Attribution du type de bloc. Le benchmark n’attend pas d’en-têtes ni de pieds de page dans la sortie. Pour résoudre ce point, nous supprimons les en-têtes et les pieds de page de notre sortie avant la notation. Mais le test cherche ensuite une chaîne qui se trouve aussi être le titre de la page, qui devrait en réalité être présent, et la signale à tort.
Ces artefacts se concentrent dans les documents mathématiques, scientifiques et multicolonnes. Ils pénalisent plus souvent des sorties correctes qu’ils ne récompensent des sorties incorrectes. Nous considérons donc le score agrégé comme indicatif plutôt que définitif.
Ces benchmarks sont indicatifs. Tous les scores concurrents reflètent des reproductions internes. Nous recommandons d’évaluer le modèle sur vos propres documents.
Détails de performance
Détail de Crawl Multilingual. Sur notre évaluation multilingue interne, OCR 4 est en tête dans les huit groupes linguistiques : anglais, Europe de l’Ouest, Europe de l’Est, Moyen-Orient, chinois, Asie de l’Est, Asie du Sud-Est et langues spécialisées (hindi, japonais, géorgien, bengali, arménien, hébreu, grec, gujarati, tamoul, malayalam, kannada, télougou). L’écart est le plus marqué pour les langues spécialisées et à faibles ressources, où de nombreux systèmes concurrents se dégradent nettement, tandis qu’OCR 4 maintient une précision élevée.
Cas d’usage recommandés
OCR 4 prend en charge les pipelines à haut volume comme les workflows documentaires interactifs, notamment :
Parsing et extraction de documents : documents complexes et multilingues.
Retrieval-Augmented Generation (RAG) : contenu structuré, classifié et prêt pour la citation, pour le découpage sémantique et les réponses ancrées dans les sources. Avec Search Toolkit, la sortie d’OCR 4 peut être envoyée directement dans des pipelines de retrieval.
Workflows agentiques : fournir aux agents les primitives structurelles nécessaires pour réaliser des tâches comme le remplissage de formulaires, le traitement de factures et les vérifications de conformité, en particulier dans les secteurs juridique, financier et de la santé.
Pipelines de données structurées utilisant les scores de confiance pour permettre un recours efficace à des vérificateurs humains : extraction de formulaires et de factures, occultations et processus pilotés par la conformité.
Recherche d’entreprise et bases de connaissances : OCR comme composant de source de données pour l’ingestion personnalisée et l’extraction d’entités.
Les premiers utilisateurs appliquent OCR 4 à la conversion de factures en champs structurés, à la numérisation d’archives d’entreprise, à l’extraction de texte propre depuis des rapports techniques et scientifiques, et à l’alimentation de la recherche d’entreprise.
Note sur les usages hors périmètre. OCR 4 est un modèle de compréhension documentaire, pas un outil de décision. Il n’est pas destiné au diagnostic médical, au conseil ou au jugement juridique, aux décisions financières à fort enjeu, aux systèmes critiques pour la sécurité, au traitement en temps réel ou sensible à la latence, ni aux entrées non documentaires (audio brut, vidéo, etc.).
API OCR 4 : comprendre vos options
OCR 4 de Mistral est disponible via un endpoint d’API unique. Chaque requête utilise le même modèle OCR sous-jacent et renvoie toujours le contenu extrait, les boîtes englobantes, les types de blocs, les scores de confiance et le texte structuré en Markdown. Ce qui varie, ce sont les couches que vous ajoutez par-dessus.
Utilisez OCR 4 en mode extraction pure lorsque vous voulez :
Intégrer une extraction documentaire rapide et précise directement dans votre application, votre agent ou votre pipeline de données.
Travailler directement avec la réponse brute, les boîtes englobantes, les types de blocs et les scores de confiance pour alimenter une logique aval personnalisée.
Exécuter une ingestion à grand volume ou en batch, avec un contrôle complet du débit et des coûts via la Batch API.
Auto-héberger le modèle pour répondre à des exigences strictes de confidentialité des données, de souveraineté ou de conformité.
Activez les fonctionnalités Document AI (même endpoint, paramètres supplémentaires) lorsque vous voulez :
Renvoyer du JSON structuré selon un schéma que vous définissez — transmettez un schéma JSON avec votre document, et la sortie OCR est transmise à
mistral-small-2603pour générer du contenu conforme à votre spécification.Annoter les images détectées avec du JSON structuré en transmettant un schéma d’annotation d’image, ce qui déclenche un appel supplémentaire à un modèle vision-langage pour chaque image.
Utiliser un prompt personnalisé avec un schéma JSON pour guider l’interprétation ou la synthèse du contenu extrait de l’ensemble du document.
Permettre aux utilisateurs métier, aux équipes solutions ou aux projets pilotes de produire des résultats structurés sans écrire de logique de parsing aval.
En pratique, la règle est simple : si vous avez besoin du contenu brut extrait, utilisez OCR 4 tel quel. Si vous avez besoin d’une sortie reformattée dans un format structuré, enrichie de champs propres à votre domaine ou traitée avec une instruction personnalisée, ajoutez les paramètres Document AI au même appel. Vous obtenez toujours le résultat OCR ; Document AI ajoute simplement des couches structurées par-dessus.
Disponible maintenant
« La disponibilité de Mistral Document AI avec OCR 4 dans Microsoft Foundry marque une étape importante dans notre partenariat. Ensemble, nous permettons aux clients d’intégrer une compréhension documentaire avancée et structurée directement dans leurs workflows d’IA, en combinant l’innovation de Mistral avec la plateforme d’entreprise de Microsoft pour fournir des solutions fiables, capables de passer à l’échelle et adaptées aux besoins métier réels. »
-Kimmi Grewal, vice-présidente, partenariats écosystème IA, Microsoft
Mistral OCRv4 et Document AI (basé sur OCRv4) sont tous deux disponibles via API dans Mistral Studio, Amazon SageMaker, Microsoft Foundry, ainsi que bientôt dans Snowflake Parse Document. Pour les organisations qui ont des exigences strictes de confidentialité des données, OCR 4 propose aussi une option d’auto-hébergement afin que les informations sensibles restent dans votre propre infrastructure. Pour étudier l’auto-déploiement, contactez-nous.
Démarrer
Nous proposons plusieurs ressources pour démarrer et approfondir rapidement.
Essayez OCR 4. Le nouveau cookbook Démarrer avec OCR 4 vous guide dans une première extraction, l’utilisation des boîtes englobantes et la classification des blocs.
Webinaire OCR 4. Nous présenterons les nouveautés d’OCR 4 avec des démos et une session de questions-réponses le 7 juillet à 18 h CET. Inscrivez-vous au webinaire OCR4 in Production.
Contactez l’équipe commerciale pour plus d’informations.












