Wildpix imagery - stock.adobe.co

Open weight : Mistral Large 4 frôle les performances des grands modèles chinois

Mistral AI a dévoilé son plus grand modèle de raisonnement à ce jour. S’il ne peut pas rivaliser avec ceux d’Anthropic et d’OpenAI , Mistral Large 4 a le mérite de se distinguer des LLM open weight chinois et américains. Son plus gros défaut actuellement est son coût à l’inférence.

Il était attendu avant la fin de l’été. Il aura fallu attendre l’été indien. Ce 6 octobre, Mistral AI a présenté la préversion publique de Mistral Large 4, « aka Le Chonk ». Ce pseudonyme fait référence au mot anglais « chunky », un adjectif familier pour désigner un animal domestique en surpoids.

Les internautes plaisantaient depuis plusieurs mois sur le lancement du « Chaton Fat » (ou Gros Chaton), un hypothétique LLM de grande taille. Après un démenti, la startup française joue finalement le jeu du « meme » qui circule sur Internet. Ce nom semble aussi faire référence au terme « chunk », utilisé pour désigner un extrait d’un document dans un système de recherche augmenté à l’IA (RAG).

Un modèle « frontière » entraîné sur le territoire français

Blague à part, Mistra Large 4 est un modèle multimodal open weight s’appuyant sans surprise sur l’architecture Mixture of Experts. Sans surprise, car il n’est pas à la portée de la première entreprise venue. Le grand modèle de langage pèse 1 005 milliards de paramètres, pour « seulement » 49 milliards de paramètres actifs, dont un encodeur vision (pour lire les images) de 1,6 milliard de paramètres. Il est doté d’une fenêtre de contexte d’un million de tokens. Ses poids seront « libérés à la fin du mois » d’octobre. En attendant, il est accessible depuis les API de la startup ou en accès restreint, dans un environnement dédié.

Si la startup française mise aussi sur la spécialisation de ses modèles – comme vient de le faire Aleph Alpha avec Kolibri -, Mistral Large 4 a une vocation généraliste. Il a été entraîné sur 3 800 GPU Grace Blackwell installés dans ses propres data centers, en France. Selon Pierre Stock, vice-président science chez Mistral, l’équipe responsable de l’entraînement a utilisé dix mégawatts de puissance.

Pour l’inférence en Europe, Mistral le proposera également depuis Mistral Compute, « en toute indépendance » des hyperscalers. Dans le reste du monde, ces mêmes fournisseurs se chargeront de le déployer auprès de leurs clients.

Rester compétitif face aux fournisseurs de LLM chinois et Nvidia

Large 4 permet de suivre des instructions, de raisonner et d’exécuter des flux agentiques et peut traiter des contenus dans 160 langues différentes.  « Ses performances sont comparables à celles des modèles open weight les plus performants au monde, et surpassent largement celles de tous les modèles à poids ouverts développés aux États-Unis ou en Europe, bien qu’il n’utilise qu’une fraction des ressources GPU à l’entraînement », affirme Mistral AI, sur LinkedIn.

Selon Artificial Analysis, cette préversion obtient 38 points sur l’Intelligence Index, à égalité avec GPT-6 Luna et à tout petit point derrière DeepSeek V4.1 Flash. À titre de comparaison, GLM-5.3 Flash de zAI obtient 42 points et GLM-5.3, 45. Mistral Large 3 plafonne à 9 points.  « Cela en fait le modèle le plus intelligent hors des États-Unis et de la Chine, devant des pays tels que la Corée du Sud et les Émirats arabes unis », souligne le cabinet.

Chez Vals AI, Mistral Large 4 atteint un score de 48,05 %, soit 20 points de pourcentage de moins que Gemini 4 Argon. C’est le 32e modèle sur 44 de son banc d’essai Vals Index. En revanche, il obtient la sixième place sur le benchmark Harvey Legal Agent.

« Le domaine juridique est désormais l’un des secteurs les plus forts de Mistral : [Mistral Large 4 obtient] 15,8 % sur Harvey Legal Agent (la première place des modèles open weight, la sixième au total) et 31,7 % sur Legal Research (contre 9,1 %) », indique l’évaluateur. Les résultats liés à la finance, à la gestion des taxes et à la migration de code sont en nette progression.

Cybersécurité : Mistral Large 4 égale GLM-5.3 Flash et dépasse de peu GPT-6 Luna

Mistral AI met par ailleurs en avant les capacités du modèle à détecter des vulnérabilités. À noter que certaines capacités de cybersécurité ne sont pas encore accessibles au plus grand nombre.

« Nous procédons à des tests de type “red team” sur le modèle dans des conditions réelles, en collaboration avec des experts en cybersécurité, des partenaires triés sur le volet et des autorités publiques, qui auront accès au même modèle avec une modération allégée et des capacités cybernétiques étendues », indique Mistral AI, dans un communiqué.

Sur le Cyber Index d’Artificial Analysis, Mistra Large 4 obtient déjà un taux de réussite de 50 %, à égalité avec GLM-5.3 Flash, à trois points de pourcentage de GPT-6 Luna et à six de Grok 4.7.

« Une fois ses paramètres rendus publics, il figurera parmi les trois meilleurs modèles en catégorie “poids libre” du Cyber Index », anticipe Artificial Analysis. « C’est sur le test CyberGym-E2E-AA qu’il obtient son meilleur résultat, avec un score de 82 %, devançant ainsi MiMo-V2.6-Pro (79 %) et GPT-6 Luna (78 % à son niveau d’effort maximum) ».

« Il résout également 93 % des défis proposés par Cybench, un ensemble de 40 exercices tirés de concours de sécurité, ce qui constitue l’un des meilleurs scores jamais enregistrés pour un modèle à poids ouverts », vante Mistral AI.

« Plusieurs modèles propriétaires de premier plan, notamment Claude Opus 5.5 et GPT-6 Astra, obtiennent un score proche de zéro lors du même test, car ils refusent d’exécuter la tâche », ajoute-t-elle. Un enjeu révélé par l’incident cyber, subi par Hugging Face. Et d’arguer que Mistral Large 4 peut aider à détecter les failles, hiérarchiser les vulnérabilités, ou encore rédiger des règles de détection. Malgré sa taille imposante, la startup assure qu’il pourra être déployé en cloud privé ou sur site.

Artificial Analysis note par ailleurs un bon score (19 %) sur le parangonnage de traitement de PDF GDP.pdf, à égalité avec MiMo-V6-Pro, un peu derrière Kimi K3. « Cela représente une amélioration de 18 points de pourcentage par rapport à Mistral Large 3, due en partie aux améliorations apportées à son API, qui accepte désormais 100 images par requête, contre 8 pour les modèles Mistral précédents ». Son taux de non-hallucination atteint 58 %, contre 49 % pour GPT-6-Astra.

Mistral Large 4 demeure gourmand et cher par rapport à ses concurrents open weight, note Artificial Analysis

Problème, le coût par tâche de Mistral Large 4 avoisine 1,13 dollar, un tout petit peu plus que Qwen 3.8 27B (1,01 dollar). Surtout, MiMo-V2.6-Pro de Xiaomi revient à 0,13 dollar par tâche, DeepSeek V4.1 coûte 0,27 dollar dans ces mêmes conditions, tandis que GPT-6 Luna ne réclame que 0,07 dollar par tâche. Mistra Large 4 est facturé 1,36 dollar pour 1 million de tokens en entrée et 4,18 dollars pour le même volume en sortie. « Pendant les deux premières semaines, Mistral Large 4 Preview bénéficiera d’une remise de lancement de 50 %, ce qui ramènera son coût par tâche à 0,57 $. Ce prix reste toutefois plus élevé que celui de GLM-5.3-Flash et de DeepSeek V4.1 Flash », signale Artificial Analysis.

De son côté, Vals AI évoque un coût moyen par test du Vals Index de 13,78 dollars, contre 7,25 dollars pour GLM-5.3 et 0,43 dollar pour GPT-6 Luna.

Cela ne s’explique pas seulement par son prix : Mistral Large 4 a généré 69 000 tokens par tâche de l’Intelligence Index, soit un peu plus que le déjà très gourmand Claude Fable 5 (67 000 tokens). Pour l’ensemble des tests de ce banc d’essai, cela représente 200 millions de tokens, contre 144 millions pour GPT-6 Luna. C’est un peu mieux que DeepSeek v4.1 flash (253 millions de tokens).

Mistral détaillera son processus d’entraînement et l’architecture de son modèle un peu plus tard, ce qui permettra d’expliquer ce comportement. Et de détailler la configuration minimale requise pour le déployer sur site.

« Le processus d’apprentissage par renforcement qui sous-tend cette préversion est toujours en cours, et le modèle ne montre aucun signe de saturation : il dispose encore d’une marge de progression considérable », affirme Mistral AI. « À mesure que nous intensifions l’entraînement sur notre infrastructure étendue, nous prévoyons des améliorations importantes et rapides dans les semaines et les mois à venir », promet la startup.

Pour approfondir sur IA appliquée, GenAI, IA infusée