Gemini 3.8 Flash gagne en performance, mais coûtera 2 fois plus cher en janvier
Avec Gemini 3.8 Flash et 3.8 Flash Cyber, Google poursuit son cycle de lancement rapide. Le fournisseur obtient des gains de performance notables, contrebalancés par la consommation de tokens en hausse et un changement de sa politique tarifaire annoncé. En janvier prochain, Gemini 3,8 Flash sera facturé deux fois plus cher.
Les cycles d’entraînement s’accélèrent et les annonces de nouveaux modèles se multiplient. Après Anthropic, c’est au tour de Google de présenter Gemini 3.8 Flash. Pour rappel, le géant du cloud avait lancé Gemini 3.7 Flash le 13 août dernier. Gemini 3.6 Flash a été introduit le 21 juillet. Gemini 3,5 Flash est commercialisé depuis le mois de juin.
Quatre modèles Flash en quatre mois, la performance paraît impressionnante. Un cycle d’entraînement complet réclame généralement trois à cinq mois de travail. Depuis le lancement de Gemini 3.5 Flash, basé sur Gemini 3 Flash, la technique de Google DeepMind consiste à s’appuyer sur le checkpoint précédent. La base de Gemini 3.6 Flash est Gemini 3.5 Flash. Gemini 3.7 Flash s’appuie sur Gemini 3.6 Flash. Il en va ainsi aussi pour Gemini 3.8 Flash, qui repose sur le fine-tuning ou le réentraînement de Gemini 3.7 Flash.
Cette approche n’offrait pas jusqu’alors une garantie de succès. Le fournisseur, avare en détails, dispose sûrement de pipelines stables et proprement industrialisés. Le seul véritable revers de la médaille est la baisse de la sûreté des modèles quand ils sont confrontés à d’autres langues que l’anglais, selon la carte du modèle.
Gemini 3.8 Flash se rapproche de GPT-5.6 Sol tout en restant moins cher
Comme ses prédécesseurs, Gemini 3,8 Flash dispose d’une fenêtre de contexte de 1 million de tokens et peut générer jusqu’à 64 000 tokens en une seule fois. Sa limite de connaissances s’arrête au mois de mars 2026.
Google prouve que cette technique d’actualisation mineure fonctionne. Gemini 3.8 Flash obtient un score de 59 points sur l’Intelligence Index d’Artificial Analysis. C’est trois points de plus que Gemini 3.7 Flash et 7 points de plus que Gemini 3.5 Flash. Il reste derrière GPT-5.6 Sol, Muse Spark 1.3 et Grok 4.6 à leur niveau d’effort maximal (61 points). Anthropic domine la tête du classement avec Claude Fable 5.1 (66 points) et Claude Opus 5 (63 points).
Sur le papier, Google met davantage en avant les capacités multimodales de ses LLM que ses adversaires. Pour le reste, il se concentre sur les charges de travail agentiques et leur exécution fiable, pendant de longues heures. En droite lignée du lancement de Gemini Enterprise for Legal et for Financial Services, il a présenté les scores sur les benchmarks de Vals et d’Harvey. Vals est un évaluateur indépendant, tandis que Harvey est une spécialisée dans le droit augmenté à l’IA agentique. Pour l’instant, les résultats sont supérieurs aux modèles concurrents, sans être déterminants pour en justifier l’adoption.
Le géant du cloud joue également sur la vitesse de Gemini 3.8 Flash. Avec plus de 300 tokens par seconde, c’est le modèle le plus rapide référencé par Artificial Analysis. Claude Fable 5.1 ne dépasse pas les 66 tokens par seconde.
Selon le cabinet d’analyse, Fable 5.1 compense sa lenteur relative par son efficacité. Dans son mode d’effort moyen (60 points sur l’Intelligence Index), Fable 5.1 complète une tâche des benchmarks d’Artificial Analysis en 2,1 minutes. Gemini 3.8 Flash a besoin de 2,5 minutes dans son mode d’effort le plus élevé.
Google double les prix des modèles Gemini 3.6, 3.7 et 3.8 Flash au 1er janvier
Toutefois, les tarifs et le coût par tâche sont à l’avantage de Gemini 3.8 Flash. À noter tout de même deux changements notables.
D’abord, le prix de Gemini 3.6 Flash, 3.7 Flash et 3.8 Flash augmentera dès le 1er janvier 2027. Actuellement, ces modèles coûtent 0,75 dollar pour 1 million de tokens en entrée et 3,75 dollars pour le même volume en sortie. En 2027, il faudra débourser 1,5 dollar pour 1 million de tokens en entrée et 7,5 dollars en sortie. Le double.
Ensuite, Gemini 3.8 Flash présente, en prenant en compte les tarifs 2026, un coût à la tâche de 0,58 dollar. Selon Artificial Analysis, cela représente une hausse de 40 % par rapport à Gemini 3.7 Flash. Cette version 3.8 souffre du même problème que Fable 5.1 : une consommation de tokens en hausse, de l’ordre de 30 % par tâche. Pour compléter l’ensemble des tests du cabinet, Gemini 3.8 Flash a généré 120 millions de tokens, contre 64 millions pour Gemini 3.7 Flash, soit une augmentation de 87,5 %. Actuellement, Gemini 3.8 Flash est le modèle doté du meilleur rapport qualité-prix. Or, le prix à la tâche de Gemini 3.8 Flash doublera mécaniquement dès le 1er janvier.
Google gardera de peu l’avantage face à OpenAI, qui prévoit d’augmenter le prix de GPT-5.6 Sol le 21 novembre prochain (de 4 à 5 dollars pour 1 million de tokens en entrée, et de 20 à 30 dollars en sortie). L’évaluateur Vals, lui, évalue le coût moyen actuel de Gemini 3.8 Flash à 5,39 dollars par test, soit 2,6 fois moins que GPT-5.6 Sol et 5,2 fois moins que Claude Fable 5.1. Reste à voir si ces dynamiques justifieront des changements de LLM ou d’écosystèmes chez les entreprises. Sundar Pichai, CEO de Google et d’Alphabet, a annoncé en juillet que l’entraînement de Gemini 4 est en cours.
Gemini 3.8 Flash Cyber, l’un des meilleurs LLM dédiés à la cyber (en attendant des évaluations indépendantes)
Google a également lancé Gemini 3.8 Flash Cyber, accessible depuis le programme de « confiance » Fairwind. Comme avec Claude Mythos au sein de Glasswind, il faut montrer patte blanche pour accéder à ce LLM à « double usage ». Il obtiendrait un score de 86,2 % sur l’évaluation CyberGym (recherche de vulnérabilités), devant Gemini 3.5 Flash Cyber (77,5 %) et le leader GPT-5.5 Cyber (85,6 %). Avec MAI-Cyber-1-Flash couplé à GPT-5.4 et son propre jeu d’outils, Microsoft dit avoir atteint un score de plus de 95 % sur le même exercice. Google DeepMind s’est contenté de présenter les performances brutes de son LLM dédié à la cybersécurité. Considérant que CyberGym ne suffit pas, car basé uniquement sur des bases de code C/C++, Google DeepMind a concocté son propre benchmark sur 20 langages de programmation différents. Là, Gemini 3.8 Flash Cyber atteint 71 %, contre 46,6 % pour Gemini 3.5 Flash Cyber.
« Wiz a constaté que Gemini 3.8 Flash Cyber offrait un taux de rappel supérieur de 7,5 à 9,7 % lors de son test de référence interne de tests d’intrusion, pour un coût 2,3 à 5,2 fois inférieur à celui d’autres modèles de pointe », ajoute Google.
Ces résultats sont encore difficiles à vérifier. Les évaluations indépendantes consacrées aux LLM spécialisés en cybersécurité ne sont pas légion. Le fait que la majorité des éditeurs et des fournisseurs, dont Google, Anthropic, OpenAI, Crowdstrike et Palo Alto, se prononce pour un renforcement des moyens de cyberdéfense par l’IA devrait changer la donne.
Pour approfondir sur IA appliquée, GenAI, IA infusée
-
Fable 5.1 : Anthropic promet des économies, les tests montrent l’inverse
-
GLM-5.3 Flash, Qwen-3.8 Flash Next : zAI et Alibaba cherchent à casser les prix de l’inférence IA
-
Claude Opus 5 touche du doigt les performances de Fable 5 à moindre prix
-
Gemini 3.6 Flash, 3.5 Flash-Lite : sous pression, Google optimise ses modèles
