
Le Chonk
Aujourd'hui, nous lançons une préversion publique de Mistral Large 4. Officieusement ML4, très officiellement : le Chonk. ML4 repousse les limites de la performance des modèles à poids ouverts. Vous pouvez dès aujourd'hui essayer l'API de préversion sur Mistral Studio. Les poids seront publiés à la fin du mois.
Performances de pointe
ML4 est un modèle nativement multimodal de 1 000 milliards de paramètres, avec 49 milliards de paramètres actifs. C'est à ce jour notre modèle le plus grand et le plus performant, et il continue de s'améliorer rapidement à mesure que nous l'affinons.
Le modèle affiche des performances exceptionnelles en codage, en workflows agentiques et en compréhension multimodale. Il rivalise déjà avec les meilleurs modèles open source au monde, tout en surpassant largement tout modèle à poids ouverts développé aux États-Unis ou en Europe. Sur les charges de travail critiques en entreprise, notamment en cybersécurité, en finance et en droit, il représente selon nous l'état de l'art des modèles ouverts. Dans certains domaines, comme le grounding visuel, il va encore plus loin et surpasse même les modèles fermés de pointe.
Nous publierons les poids d'ici la fin du mois. D'ici là, nous soumettons le modèle à un red-teaming en conditions réelles aux côtés de leaders de la cybersécurité, de partenaires validés et d'autorités publiques, qui accéderont au même modèle avec une modération allégée et des capacités cyber étendues.
Forgé en Europe. Conçu pour la souveraineté de l'IA.
ML4 a été entraîné à partir de zéro sur 3 800 GPU NVIDIA Grace Blackwell dans nos propres datacenters en Europe. La préversion publique s'exécute sur cette même infrastructure. C'est une étape importante de notre investissement à long terme dans l'infrastructure, la recherche et le développement produit : des performances de pointe dans des secteurs critiques, livrées via des poids ouverts et conçues pour donner aux clients le contrôle sur leur IA.
C'est particulièrement important en cybersécurité, où les refus imposés par les fournisseurs peuvent bloquer des recherches légitimes sur les vulnérabilités et la réponse aux incidents, et où la perte d'accès à une capacité en pleine gestion d'incident peut elle-même devenir un risque de sécurité critique. ML4 associe des performances cyber de tout premier ordre à des poids ouverts et à la possibilité de déployer le modèle soi-même, offrant aux organisations à la fois la capacité et l'autonomie nécessaires pour mener des travaux de sécurité avancés selon leurs propres politiques.
Le modèle sera disponible dans plusieurs régions du monde, dont un déploiement européen opéré de bout en bout par Mistral, indépendamment d'autres fournisseurs de services numériques et dans le cadre du droit européen. À noter : une part importante des données d'entraînement de ML4 était multilingue, couvrant plus de 160 langues, dont toutes les langues officielles de l'Union européenne.
Nous travaillons en étroite collaboration avec des entreprises de premier plan du monde entier — en finance, en ingénierie, en production industrielle, en logistique, dans l'industrie pharmaceutique, dans les sciences, dans le transport maritime, dans le secteur public et dans d'autres industries critiques — pour entraîner ML4. De fait, le modèle utilise le même environnement d'entraînement, de personnalisation et de RL que celui que nous proposons à nos clients via Mistral Forge.
Essayez-le dès aujourd'hui
Ce n'est pas tout. Tandis que nous préparons la publication des poids, nous partagerons de plus amples détails sur l'architecture du modèle, de nouveaux benchmarks et notre méthodologie de post-entraînement.
Ce modèle servira également de socle à une nouvelle génération de modèles Mistral spécialisés et optimisés. En attendant, nous vous invitons à essayer l'API de préversion et à partager vos retours avec nous sur les réseaux sociaux.
Fonctionnalités en détail
Cybersécurité
ML4 est l'un des modèles d'IA les plus puissants au monde en matière de cybersécurité. Sur l'Artificial Analysis Cyber Index, une évaluation indépendante qui mesure la capacité des modèles d'IA à trouver et corriger des failles de sécurité dans des logiciels réels, il figure parmi les cinq meilleurs modèles au monde et devance très largement les modèles à poids ouverts développés hors de Chine. Sur l'un des tests de cet index, qui demande au modèle de reproduire une véritable vulnérabilité dans un logiciel open source puis de la corriger, ML4 obtient 82 %, le score le plus élevé de tous les modèles. Il résout également 93 % des défis de Cybench, un ensemble de 40 exercices issus de compétitions de sécurité, soit l'un des meilleurs scores rapportés pour un modèle à poids ouverts.
Ce meilleur score reflète un avantage concret. Plusieurs modèles fermés de premier plan, dont Claude Opus 5.5 et GPT-6 Astra, obtiennent un score proche de zéro sur ce même test, car ils refusent d'effectuer la tâche. Or, la défense des logiciels commence souvent par prouver qu'une faille est réelle — précisément le type de travail que les filtres de sécurité des modèles fermés peuvent bloquer. L'enjeu est d'autant plus important que des acteurs malveillants parviennent de plus en plus à jailbreaker ces mêmes modèles pour appuyer des activités cyber offensives : les défenseurs ont besoin de systèmes capables d'égaler ces capacités sans être freinés par les mêmes refus. ML4 sait faire ce travail, et ses capacités vont au-delà de ce pour quoi il a été explicitement entraîné : lors de tests internes, il s'est montré utile pour analyser des malwares, prioriser des vulnérabilités et rédiger des règles de détection. Pour les organisations qui ont besoin d'une IA souveraine et auditable pour leurs opérations de sécurité, il pourra être déployé sur un cloud privé ou on-premise.
ML4 face à la concurrence : un raisonnement efficace sur des défis complexes et variés
Rétro-ingénierie de malwares : résolution d'une tâche d'investigation hors distribution
Codage agentique
ML4 excelle en ingénierie logicielle, en compréhension de dépôts et dans les workflows complexes en terminal, avec 61,7 % sur DeepSWE v1.1, 59,4 % sur SWE-Atlas-QnA et 28,3 % sur Terminal-Bench 4. Son score combiné de 49,8 % au Coding Agent Index le place devant DeepSeek V4 Pro 0813 et Qwen3.8 Max.
Nous avons également mené, avec Surge AI, une évaluation humaine en aveugle sur la qualité du code : des annotateurs professionnels ont noté les sorties des modèles sur une échelle de 1 à 5, sans connaître l'identité des modèles. ML4 Preview se classe deuxième sur cinq modèles (3,74), devant Kimi K3 (3,59), GLM-5.3 (3,60) et GLM-5.2 (3,40), et seul Claude Opus 5 (4,22) le devance.
%201_20jgWu.webp?dpl=6ac516f190c69e0008d46233)
Workflows agentiques
ML4 pilote des agents généralistes qui rassemblent des informations, utilisent des outils et produisent des livrables aboutis dans des workflows complexes. Sur AutomationBench — 657 workflows métier répartis dans des applications comme Gmail, Google Sheets, Slack et Salesforce —, il obtient 59,9 %, devant Kimi K3, MiMo-V2.6-Pro et DeepSeek V4 Pro.
Il est tout aussi performant sur les livrables professionnels que produit réellement le travail intellectuel : tableurs, slides et PDF. Sur AA-Briefcase, qui évalue le travail intellectuel sur de longs horizons, il atteint 1 393 Elo, devant DeepSeek V4 Pro.

Multimodal
ML4 marque un changement d'échelle dans la capacité de nos modèles à comprendre les images. Il raisonne avec puissance sur des documents complexes, des graphiques et des images naturelles, et apporte la vision aux industries où la perception est critique, comme l'ingénierie, la production industrielle ou l'observation de la Terre.
Le modèle peut en outre combiner grounding visuel et capacités agentiques : de l'inspection d'imagerie satellite gigapixel — pour aider les équipes de réponse aux catastrophes à agir quand chaque minute compte — à l'analyse de plans techniques — en zoomant, inspectant et vérifiant jusqu'à ce que la réponse soit exacte. Dans nos démos ci-dessus, ML4 applique le grounding à des scènes naturelles denses, vérifie des pièces mécaniques dans des plans techniques, retrouve des preuves dans des PDF et balaie des images géospatiales massives pour localiser les objets les plus difficiles à trouver.
En grounding visuel plus particulièrement, ML4 est l'un des modèles les plus performants que nous ayons testés, surpassant par exemple GPT-6-Astra sur Dense 200 (42 % contre 41 %).
Sciences et mathématiques
ML4 apporte de solides capacités scientifiques, fruit de la combinaison de méthodes fondées sur l'IA et de l'expertise de nos chercheurs en mathématiques, en physique et en chimie.
Il est particulièrement à l'aise en codage agentique pour les tâches scientifiques, comme l'analyse de données, la modélisation ou la simulation de la réalité physique, ce qui permet aux chercheurs de se concentrer sur les questions plutôt que sur la plomberie. Sur les benchmarks, ML4 établit l'état de l'art sur SciCode-Verified parmi les modèles à poids ouverts. En pratique, il peut générer une simulation Hartree–Fock complète en une seule fois — une tâche de chimie complexe et multi-étapes, construite à partir d'une série de routines avancées.
ML4 est également plus solide en mathématiques, tant en raisonnement formel qu'en mathématiques appliquées. Dans nos évaluations humaines, il raisonne avec plus de précision et de structure que GLM-5.3, et il peut mener à bien de longues tâches de mathématiques appliquées à des domaines spécifiques, y compris des travaux pertinents pour la physique théorique la plus avancée.
Ensemble, ces capacités font de ML4 un assistant de recherche solide sur l'ensemble du workflow technique — de la première question au résultat final.
-alt_ZYLgs8.webp?dpl=6ac516f190c69e0008d46233)
SciCode-Verified mesure la capacité des modèles à implémenter en code des workflows scientifiques complexes dans des domaines tels que la physique, les mathématiques, la science des matériaux et la biologie.

Évaluation interne de ML4 face à GLM5.3 sur des tâches STEM (mathématiques et physique)
Travail intellectuel
ML4 est notre modèle le plus performant pour les tâches concrètes que les professionnels traitent au quotidien. Il sait créer, modifier et corriger des tableurs et des documents complexes, avec des performances exemplaires sur les benchmarks juridiques et financiers.
Nous avons notamment fait évaluer ML4 par des évaluateurs tiers (vals.ai) sur des tâches représentatives, juridiques et financières : le modèle dépasse GPT-6-Astra dans les deux cas. Sur le benchmark Legal Agent de HarveyAI, ML4 surpasse tous les modèles open source.
FinWorkBench mesure la capacité des modèles à créer/modifier des tableurs sur des cas d'utilisation réels en finance et en comptabilité.
L'analyse financière exige de la précision et la capacité de synthétiser des informations issues de multiples sources. Ce processus reste chronophage dans de nombreuses institutions financières. Dans cette démonstration, ML4 et d'autres modèles open source de référence relèvent le même défi multi-étapes en finance d'entreprise. Ils explorent les documents réglementaires et les rapports financiers d'entreprises cotées, notamment ceux disponibles sur EDGAR et dans des bases de données européennes équivalentes. Une carte sémantique animée retrace le parcours de chaque modèle vers une solution, en mettant en évidence chaque document consulté. La position de chaque trajectoire reflète les éléments recueillis, les résultats des calculs et les questions encore ouvertes. Vous pouvez suivre le déroulement des recherches et comparer les chemins empruntés par chaque modèle avant sa réponse finale.
Sécurité des modèles
ML4 a saturé nos benchmarks de robustesse aux injections de prompt indirectes, le plaçant à la pointe des modèles OSS (par rapport à GLM-5.2, GLM-5.3, Kimi-K2.6, Kimi-K3, DS-V4-Pro-0813). Sur le B3 AI Security Benchmark public de Lakera, ML4 résiste à 93,3 % des attaques – nous n'observons pas de score plus élevé parmi les concurrents.
ML4 interagit également avec les utilisateurs de manière plus responsable que tous nos modèles précédents. Nous mettons en avant nos résultats sur le KORA Benchmark, où ML4 atteint une nouvelle fois le score le plus élevé que nous ayons mesuré parmi les modèles OSS (1,691, 2 étant le maximum, dénommé « Exemplaire »). Exemplary”).
La propension du modèle à refuser les requêtes malveillantes liées à la cybersécurité revêt une importance particulière. Malgré de solides performances sur les benchmarks Cyber, le taux de refus moyen du modèle sur les prompts cyber issus de JailbreakBench, StrongREJECT et AgentHarm est supérieur à celui de tous les modèles OSS.
Évaluation humaine
Nous avons mené une évaluation interne au cours de laquelle des annotateurs experts en codage, en conception assistée par ordinateur (CAD), en finance, en mathématiques et en physique ont comparé Mistral Large 4 à GLM-5.3. ML4 a été préféré en CAD et en STEM, tout en affichant en finance et en codage des performances équivalentes ou proches de celles de GLM-5.3.

Apprentissage par renforcement à grande échelle
Les modèles de base progressent rapidement, et notre post-entraînement doit suivre le rythme. Une recette ajustée pour le modèle d'hier laisse des capacités inexploitées avec le modèle de pointe d'aujourd'hui, car les échantillons ground truth qui poussaient auparavant un modèle à ses limites ne le permettent plus. Nous utilisons l'apprentissage par renforcement (RL) car il s'adapte au même rythme que le modèle : nous entraînons le modèle sur les résultats de ses propres tentatives, et nous pouvons augmenter la difficulté et l'étendue des tâches à mesure qu'il gagne en puissance.
Notre bibliothèque de RL a été conçue pour que les nouveaux environnements soient simples à ajouter et à entraîner à grande échelle. Une interface partagée et composable permet à une seule session d'entraînement de combiner des tâches allant du chat à tour unique et de la résolution de problèmes scientifiques complexes jusqu'à l'alignement en matière de sécurité, la factualité et l'utilisation d'outils sur de longs horizons. Ces environnements partagent des échafaudages et des ressources tels que des sandboxes de code, la recherche sur le Web et des API externes. Cette même composabilité s'étend à la vérification, avec des modèles de récompense, des tests unitaires, des juges LLM et des vérifications statiques combinés selon les besoins de chaque tâche.
À l'exécution, une flotte d'actors à mise à l'échelle automatique génère des dizaines de milliers de rollouts en parallèle pendant que l'entraînement du modèle se poursuit de manière asynchrone. Le pipeline de génération et d'entraînement est optimisé pour les longues trajectoires, en prenant en charge des budgets de rollouts de plusieurs millions de tokens répartis sur plusieurs compactages, tout en maintenant un faible niveau d'obsolescence des données. De nouvelles méthodes et optimisations appliquées aux deux étapes minimisent la dérive off-policy et permettent un RL stable sur de longs horizons.
À notre échelle actuelle (3 000 GPU), une seule session d'entraînement produit environ 33 milliards de tokens par jour, dont environ 16 milliards sont des tokens de complétion entraînables après filtrage et masquage. Nous pouvons suivre la progression de la session directement dans les rollouts d'entraînement : les récompenses d'entraînement augmentent sur plusieurs environnements représentatifs à mesure que la politique apprend à résoudre des tâches de plus en plus complexes. Quelques exemples ci-dessous.

Ces améliorations ne sont pas spécifiques aux environnements sur lesquels nous nous entraînons ; elles se transfèrent aux évaluations en aval, et le modèle final les doit à ses deux étapes de post-entraînement (fine-tuning supervisé et RL), comme le montrent les graphiques.

Et après
Ce n'est que le début. ML4 est le premier jalon de la roadmap financée par notre série D de 3 milliards d'euros — la plus importante levée de fonds en capital jamais réalisée par une entreprise technologique européenne. Ce capital est déjà à l'œuvre : nous augmentons considérablement notre capacité de compute dans nos propres datacenters européens, et une capacité bien plus importante sera mise en service dans les mois à venir.
Plus de compute signifie plus d'entraînement. La session d'apprentissage par renforcement à l'origine de cette preview est toujours en cours, et le modèle ne montre aucun signe de saturation — il reste une marge de progression importante. À mesure que nous intensifions l'entraînement sur notre infrastructure étendue, nous nous attendons à des améliorations importantes et rapides dans les semaines et les mois à venir.
Nous publierons les poids d'ici la fin du mois, accompagnés de plus de détails sur l'architecture, de benchmarks supplémentaires et de notre méthodologie de post-entraînement. Et ML4 n'est que le socle : il servira de base à une nouvelle génération de modèles Mistral spécialisés et optimisés, conçus pour les industries et les charges de travail qui comptent le plus pour nos clients.
Le rythme de progression sera désormais rapide. Restez à l'écoute.
Mistral Large 4
New
Open-weight hybrid instruct-and-reasoning MoE with multimodal input; unifies instruction, reasoning, and agentic capabilities in a single model, state-of-the-art among open weights on cybersecurity, finance, and manufacturing, natively fluent in 160+ languages.
Multimodal
Reasoning
Coding
Agentic
Cybersecurity
Input (/M tokens)
$1.36
Output (/M tokens)
$4.18






%201_2flnuY.webp?dpl=6ac516f190c69e0008d46233)

%201_Z2dNL7P.webp?dpl=6ac516f190c69e0008d46233)


-alt_2o08QB.webp?dpl=6ac516f190c69e0008d46233)


%201_1fqgOj.webp?dpl=6ac516f190c69e0008d46233)




