Chaosamran_Studio - stock.adobe.

GLM-5.3 Flash, Qwen-3.8 Flash Next : zAI et Alibaba cherchent à casser les prix de l’inférence IA

Les deux entreprises chinoises poursuivent leurs travaux pour tailler dans les coûts de l’inférence tout en proposant des modèles capables de rivaliser avec ceux d’Anthropic et d’OpenAI. Pour les entreprises occidentales, Qwen-3.8 Flash Next semble le plus intéressant en matière d’inférence locale.

Hier, le 26 août 2026, Zhipu AI (zAI) et Alibaba ont respectivement présenté GLM-5.3 Flash et Qwen-3.8 Flash Next, deux LLM taillés pour les cas d’usage agentiques.

Dans la convention informelle de nommage des grands modèles de langage, Flash indique que ce sont des LLM plus rapides que la moyenne, moins coûteux ou plus légers.

Ces deux modèles open weight basés sur l’architecture Mixture of Experts ne sont toutefois pas petits. GLM-5.3 Flash est le premier modèle multimodal de la collection GLM 5. À l’inférence, il active 18 milliards de ses 320 milliards de paramètres. Qwen-3.8 Flash Next affiche 125 milliards de paramètres. Il n’en active que 6 milliards à l’inférence, sans compter les 51 milliards de paramètres associés aux embedding n-grammes. Tous deux disposent d’une fenêtre de contexte pouvant atteindre jusqu’à 1 million de tokens.

zAI et Alibaba visent l’inférence « ultra low-cost ». Alibaba affirme par ailleurs poser les fondations de l’architecture de Qwen 4 et tracer une voie vers « l’AGI ».

La version « low-cost » de GLM-5.3 ne démérite pas, selon Artificial Analysis

Pour GLM-5.3 Flash, zAI affirme recourir à une combinaison d’attention linéaire et éparse pour abaisser les coûts, principalement quand les données en entrée sont volumineuses. La startup met par ailleurs en pratique le framework architectural Manifold Contrained Hyper Connections (mHC), développé par DeepSeek. Il vise à amoindrir le problème causé par l’entremêlement des connexions résiduelles au sein d’un réseau de neurones. La méthode implique l’introduction de garde-fous mathématiques, au surcoût de calcul léger, qui permet de stabiliser les entraînements, tout en connectant beaucoup plus de neurones. La société a également revu son pipeline de données pour utiliser 30 000 milliards de tokens à l’entraînement.

Résultat, GLM-5.3 Flash est moitié moins grand que GLM-5.3 et 5.2 (743 milliards de paramètres, 40 milliards actifs), tout en affichant un score de 57 points sur l’Intelligent Index d’Artificial Analysis, contre 60 points pour GLM-5.3. Il égale ainsi Muse Spark 1.2 de Meta, GPT-5.6 Terra et surpasse de peu Gemini 3.7 Flash (56 points), ainsi que Deepseek V4 (53 points).

Depuis son API, testé à grande échelle la semaine dernière, Zhipu AI facture GLM-5.3 Flash 0,15 dollar pour 1 million de tokens en entrée, et 0,50 dollar pour le même volume généré en sortie, soit environ 90 % moins cher que GLM-5.3 (1,4 dollar/ 4,4 dollars par million de tokens).

À la tâche, GLM-5.3 Flash coûte 0,09 dollar, contre 0,68 dollar pour son aîné, 0,51 dollar pour GPT-5.6 Terra et 0,40 dollar pour Muse Spark 1.2. Pour rappel, le coût à la tâche de Claude Opus 5 atteint 2,34 dollars, celui de GPT-5.6 Sol dépasse le dollar (1,01 dollar) et Grok 4.6 revient à 0,94 dollar par tâche.

En revanche, GLM-5.3 Flash génère encore 149 millions de tokens en sortie pour compléter le parangonnage du cabinet spécialisé. C’est environ 10 % de moins que GLM-5.3, mais à ce jeu, Gemini 3.7 Flash (64 millions de tokens) et Grok 4.6 (72 millions de tokens) sont plus efficients.

Le principal défaut de GLM-5.3 Flash est sa relative lenteur : 50 tokens par seconde, quand Gemini 3.7 Flash « crache » 329 tokens par seconde. D’autant que la comparaison en dehors des infrastructures de zAI, qui dit utiliser exclusivement des puces IA chinoises pour l’inférence de GLM-5.3 Flash, semble plus difficile. Il faudra attendre des déploiements sur des puces Nvidia pour peser les avantages réels de ce checkpoint.

Artificial Analysis n’a pas encore produit les résultats de ses tests concernant Qwen 3.8-Flash Next. Le modèle est facturé 0,16 dollar par million de tokens en entrée et 0,47 dollar pour le même volume en sortie. Les tests affichés par Alibaba le placent légèrement au-dessus de Qwen -3.8 27B (52 points sur l’Intelligence Index, à égalité avec GPT-5.6 Luna). En Europe et aux États-Unis, ces LLM open weight sont moins intéressants lorsqu’ils sont hébergés sur des infrastructures chinoises, pour des raisons de performance, de sécurité, de protection de propriétés privées ou de potentielles surveillances.  

Le grand intérêt de tel modèle est leur exécution locale et sur site. GLM-5.3 Flash peut aussi être exécuté on-premise, mais l’exercice semble plus compliqué qu’avec Qwen 3.8 Flash Next, du fait des 325 milliards de paramètres.

Qwen 3.8 Flash Next, un candidat intéressant pour l’inférence locale en entreprise

Surtout, Alibaba a travaillé l’architecture de son LLM pour le rendre pertinent dans ces scénarios déconnectés. Le fournisseur s’appuie à nouveau sur Gated DeltaNet, une évolution de l’attention linéaire proche de l’architecture Mamba. Ce mécanisme de portes permet de mettre à jour le contexte de manière sélective tout en compressant l’historique. Ce système est couplé à Qwen Sparse Attention, un indexeur léger qui scanne le contenu en entrée à la recherche de l’élément de contexte important dans une longue séquence. Au lieu de mHC, Alibaba gère les connexions résiduelles à l’aide d’une autre porte, Gated Residual. Elle « divise le flux résiduel en quatre branches et contrôle les opérations de lecture et d’écriture à l’aide d’une porte dynamique, renforçant ainsi le flux d’informations entre les couches [du réseau de neurones] et la stabilité de l’apprentissage ».

 Outre les optimisations d’usage, Alibaba a surtout recours à de « petits » vecteurs n-grammes, une approche (re)popularisée par FastText (2016, Meta). Le laboratoire Qwen s’appuie sur des sous-chaînes de caractères et des symboles pour encoder les mots du vocabulaire du LLM et leur sens au sein d’une table lookup, un dictionnaire de correspondance. Cette approche permet d’accélérer la prédiction multitokens, à l’instar de la technique mise en avant par Google avec DiffusionGemma.

Les chercheurs ont conditionné l’appel à ses embeddings n-grammes à la couche 2 de Qwen 3.8 Flash Next, au moment du décodage, là où le LLM consomme le plus de ressources de calcul lors de cette phase. Ces embeddings peuvent être exécutés en mémoire VRAM, mais aussi en RAM de manière asynchrone ou sur des SSD NVMe du serveur hôte.

Un utilisateur a déjà testé l’approche sur un serveur équipé de deux RTX 6000 Blackwell (96 Go de VRAM chacune, environ 16 000 euros pièce) en FP8 et la fenêtre de contexte réduite à 256 000 tokens. Le modèle génère 65 tokens par seconde avec VLLM, mais les GPU sont beaucoup moins sollicités qu’avec DeepSeek v4 Flash. La différence ne se joue pas sur la quantité de VRAM utilisée, mais sur la chauffe et la consommation d’électricité, pratiquement divisées par deux.

Reste à savoir si la compression des poids et le recours aux embeddings n-grammes ne dégradent pas les résultats dans des cas d’usage réels.

Pour approfondir sur IA appliquée, GenAI, IA infusée