Tim Thompson-Rye - stock.adobe.c
IA : Gemini 4 Argon, GPT-6.1 Sol et Claude Sonnet 5.5 sont dans un mouchoir de poche
Preuve que la course à l’IA ne faiblit pas en intensité, Anthropic, OpenAI et Google ont encore lancé de nouveaux grands modèles de langage cette semaine. Des LLM qui, sur le papier, peinent à se distinguer les uns des autres. Et qui souffrent d’une consommation de tokens en hausse.
Le 28 septembre 2026, Anthropic a présenté Claude Sonnet 5.5. Le modèle milieu de gamme du fournisseur américain dépasse de quelques points Claude Fable 5.1 et GPT-6 Astra d’OpenAI (56 vs 53 points), selon Artificial Analysis. C’est le deuxième modèle de son classement Intelligence Index, tout juste derrière Opus 5.5 (58 points) et 18 points devant Sonnet 5.
Sonnet 5.5 se distingue (encore) en matière de programmations agentiques et de complétion de tâches professionnelles. D’ailleurs, il égale Claude Opus 5.5 sur les tests associés. En revanche, à son niveau d’effort maximum, Sonnet 5.5 a consommé 193 000 tokens par tâche de l’Intelligence Index, contre 119 000 tokens pour Opus 5.5.
Des LLM gourmands en tokens
« Il s’agit de la consommation de tokens la plus élevée que nous ayons mesurée [elle est] supérieure d’environ 60 % à celle d’Opus 5.5 (max) ou de Sonnet 5 (max), et environ 7 fois supérieure à celle de GPT-6 Astra (max) », précise le cabinet.
De ce fait, malgré son prix « doux » – 2 dollars pour 1 million de tokens en entrée, 10 dollars pour le même volume de tokens en sortie – Sonnet 5.5 affiche un coût par tâche nettement supérieur à celui de GPT-6 Astra (7,62 dollars vs 3,26 dollars). Le modèle d’OpenAI s’avère pourtant bien plus cher sur le papier (10/50 dollars pour 1 million de tokens en entrée et en sortie).
Au niveau d’effort xhigh, le comportement de Sonnet 5.5 est beaucoup plus intéressant. Il obtient un score de 52 points sur l’Intelligence Index, tout comme GPT-6 Astra, mais le coût par tâche tombe à 2,74 dollars, contre 2,31 dollars pour son adversaire.
« Aux paliers d’effort élevés, il [Sonnet 5.5] se classe derrière Opus 5.5, tandis qu’aux niveaux d’effort les plus faibles, les configurations GPT-6 Astra ou Sol offrent des performances équivalentes à moindre coût », indique Artificial Analysis. « Le réglage “effort élevé” est le plus compétitif sur cette base, ce qui le classe très légèrement derrière GPT-6 Sol en matière d’intelligence, pour un coût par tâche pratiquement identique ».
Selon les évaluations de Vals AI, Claude Sonnet 5.5 obtient une note légèrement supérieure à Opus 5.5 (67,04 % vs 66,97 %). Le coût par test tombe à 21,34 dollars, contre 32,14 dollars pour Opus 5.5.
GPT-6.1 Sol et Claude Sonnet 5.5 à quasi-égalité
OpenAI pousse également les capacités d’un modèle de milieu de gamme. Disponible depuis le 29 septembre, GPT-6.1 Sol obtient un score de 52 points sur l’Intelligence Index d’Artificial Analysis, un point de moins que GPT-6 Astra. Il dépasse de quatre points GPT-6 Sol à son niveau d’effort maximum. Sonnet 5.5 et GPT-6.1 Sol sont donc côte à côte.
En revanche, Sonnet 5.5 demeure devant sur les tâches de programmation et les flux agentiques professionnels.
Cela dit, bien qu’au même prix que Sonnet 5.5, GPT-6.1 Sol coûte 0,72 dollar par tâche à son niveau d’effort maximum. « Son coût par tâche est inférieur de 31 % à celui de GPT-6 Sol (1,05 dollar) et de 64 % à celui de GPT-5.6 Sol (1,99 dollar) », précise Artificial Analysis. « Tous les niveaux d’effort du GPT-6.1 Sol repoussent la frontière “Pareto” en matière de rentabilité : pour un niveau d’intelligence équivalent, il n’existe aucun modèle moins cher ».
Il y a tout de même un hic. La consommation des modèles Sol est en hausse depuis le lancement de GPT-5.6 Sol.
Au niveau d’effort maximum, GPT-6.1 Sol consomme 9 000 tokens de plus par tâche que GPT-5.6 Sol. Pour l’instant, cette hausse comprise entre 10 et 30 % suivant les niveaux d’effort par rapport GPT-6 Sol est compensée par les gains de performance. Les équipes d’OpenAI doivent donc maintenir ce rapport coût/consommation pour que ces modèles demeurent intéressants.
Car le troisième acteur de ce panel a déjà fait la preuve qu’il sait contenir la consommation de tokens de ces LLM. Google DeepMind a ainsi présenté Gemini 4 Argon, disponible depuis le 30 septembre pour le petit nombre de clients ayant souscrit au programme Fairwind, équivalent du projet Glasswind chez Anthropic. Il est également utilisé pour l’initiative « Scan for Good » menée par Wiz à la recherche de vulnérabilités au sein des systèmes d’infrastructures publiques (énergie, télécom, transport, services publics, hôpitaux, ONG) et de projets open source.
Gemini 4 Argon est loin d’être « dans le gaz », mais devra prouver sa valeur
Ce modèle de raisonnement affiche un score de 53 points sur l’Intelligence Index d’Artificial Analysis, autant que GPT-6 Astra et Claude Fable 5.1, soit une hausse de 12 points par rapport à Gemini 3.8 Flash.
Selon le cabinet, Gemini 4 Argon profite d’une forte progression sur les tâches agentiques. Il reste toutefois derrière GPT-6.1 Sol et Sonnet 5.5 en la matière. Il dispose en revanche du taux d’hallucination le plus bas des modèles affichant un score dépassant 45 points sur l’Intelligent Index.
« Cela signifie qu’Argon est bien plus enclin à admettre qu’il ne connaît pas la réponse plutôt que de donner une réponse erronée », affirme l’évaluateur. « En manière de précision, Gemini 4 Argon affiche un score de 50 %, soit une baisse de 5 points par rapport à Gemini 3.1 Pro Preview, et de 13 points contre GPT-6 Astra ( 63 % au niveau d’effort max) ».
Ce n’est pas la même histoire face aux tests de Vals AI. Gemini 4 Argon devance tous les autres modèles avec un score de 68,90 %. Cela s’explique par le fait que la startup se concentre davantage sur les tâches scientifiques et métiers que sur la programmation. Vals AI semble également être un partenaire de Google DeepMind pour ce lancement.
Pour l’instant, Google propose son modèle à moitié prix. C’est probablement le signe qu’il tente de compenser quelques faiblesses. Le tarif hors promotion devrait être de 4 dollars pour 1 million de tokens en entrée, et de 20 dollars pour le même volume en sortie. À ce prix-là, le coût par tâche atteindra 3,98 dollars, un peu plus que GPT-6 Astra. Gemini.
En « solde », le fournisseur le maintient à 1,99 dollar. Cela s’explique aussi par le fait que Gemini 4 Argon consomme 62 000 tokens par tâche (vs 27 000 tokens pour GPT-6 Astra). Il a utilisé 110 millions de tokens pour terminer l’ensemble des tests d’Artificial Analysis. Cela reste moins que Gemini 3.8 Flash (170 millions), mais largement plus que Gemini 3.1 Pro (67 millions de tokens).
Chez Vals AI, le coût par test de Gemini 4 Argon atteint 15,68 dollars en moyenne, « mais augmente nettement pour les tâches agentiques de longue haleine : 193,78 dollars par test sur CUA-bench, 57,82 dollars sur notre évaluation Code Migration, 44,90 dollars sur Terminal-Bench Science et 30,45 dollars sur SRE Bench », signale Vals AI.
À noter que Gemini 4 Argon peut jusqu’à 1 million de tokens en une seule fois et 262 000 tokens par défaut (contre 64 000 tokens pour Gemini 3.8 Flash). Claude Sonnet 5.5 et GPT-6.1 Sol sont encore limités à 128 000 tokens. Seuls des tests en conditions réelles pourront dire si le fleuron de Google DeepMind tient ses promesses. Anthropic, OpenAI et Google disent avoir amélioré la sécurité de leurs LLM respectifs.
Pour approfondir sur IA appliquée, GenAI, IA infusée
-
Claude Opus 5.5, GPT-6 Sol et Luna : Anthropic et OpenAI jouent le coup de la baisse des prix
-
Koa : Salesforce présente un modèle de raisonnement dédié à son CRM
-
GPT-6 Astra : les évaluateurs indépendants tempèrent les affirmations d’OpenAI
-
Gemini 3.8 Flash gagne en performance, mais coûtera 2 fois plus cher en janvier
