Denys Rudyi - stock.adobe.com

Kolibri : Aleph Alpha lance un LLM dédié aux organisations allemandes

Avec Kolibri, Aleph Alpha ne présente pas le modèle de raisonnement open weight le plus performant. Le laboratoire a tout de même quelques arguments : la spécialisation en langue allemande, le respect du droit européen et une certaine efficience une fois que LLM est déployé sur une infrastructure distribuée.

Bientôt sous le giron du Canadien Cohere, le laboratoire allemand Aleph Alpha a repris l’entraînement de grands modèles de langage.

Présenté le 3 octobre, Kolibri est un modèle open weight (Apache 2.0) s’appuyant sur l’architecture Mixture of Experts. Il est doté de 78 milliards de paramètres, dont seulement 3,46 milliards sont actifs lors de l’inférence. Sa fenêtre de contexte peut grimper jusqu’à 1 million de tokens, mais Aleph Alpha recommande 256 000 tokens pour des déploiements « efficients ».

« Un modèle de 123 milliards de paramètres ne peut traiter que 3 requêtes utilisateur avec un contexte 256 000 tokens sur deux cartes H100 [80 Go de VRAM, N.D.L.R.], tandis que notre modèle 78 milliards de paramètres peut traiter 18 requêtes simultanées », ajoute le laboratoire.

Et de conseiller l’usage de 2 GPU Nvidia H100 SXM5, deux H200, un B200 ou un B300.

Pour son entraînement, l’entreprise a eu accès à 768 GPU B200 (96 clusters de 8 GPU) en utilisant le design de référence Nvidia SuperPOD (interconnexion Connect-X-7) pendant 21 jours (511 heures) pour le préentrainement. Le « mid-training » a duré 5 jours, tandis que l’entraînement sur le contexte long a duré 13 heures. Ces traitements ont été exécutés en Europe : Aleph Alpha a fait appel au neocloud finlandais Verda (ex-Datacrunch).

Aleph Alpha mise sur son tokenizer et le respect du droit européen

Sans trop de surprise, Aleph Alpha s’appuie sur un mécanisme d’attention hybride (GQA, SWA, RoPE) avec l’optimiseur Muon. Son dictionnaire de vocabulaires est cependant spécifique.

Avec UniBPE, le fournisseur a combiné deux approches de tokenization : BPE (fusion des caractères et des octets) et l’algorithme Unigram (sous-tokenisation probabiliste). « Par rapport au tokeniser de GPT-5, il place davantage de limites de tokens sur les limites de morphèmes : 65 % contre 47 % en allemand, et nécessitent 11,2 % de tokens en moins sur les textes Web en allemand », justifie Aleph Alpha.

C’est justement la véritable particularité de Kolibri qui a été spécialisé pour « l’allemand, le raisonnement, les mathématiques, l’IA agentique et d’autres capacités souhaitées par les clients ».

Aleph Alpha destine ce modèle aux administrations, aux industriels et aux sociétés aérospatiales allemandes.

« Ce projet vise à combler les lacunes dans les secteurs où les clients accordent une grande importance à la sécurité et à la conformité réglementaire des modèles », confirme Letitia Pârcalabescu, chercheuse IA senior chez Aleph Alpha, dans une courte vidéo de présentation.

C’est une alternative aux LLM de Mistral AI. En revanche, Aleph Alpha ne fait pas une croix sur les modèles chinois dans le cadre de sa procédure d’entraînement. Le laboratoire s’est appuyé sur GLM-5.2, GLM-5.3 de zAI et Qwen3.8-27B d’Alibaba pour générer des données synthétiques. Qwen3.5-122B-A10B a servi de LLM-as-a-Judge. Aux États-Unis, pour son modèle Koa, Salesforce a fait le choix de n’utiliser que des modèles américains, notamment Nemotron 3 Super 120B de Nvidia.

Aleph Alpha dit avoir appliqué les codes de bonnes pratiques GPAI, en respectant le RGPD, l’AI Act européen et la directive européenne 2019/790 (traduite en droit français par la directive « DANUM ») relative à l’extraction de données sur le Web.

 Le fournisseur a d’abord testé son pipeline d’entraînement sur un modèle de 30 milliards de paramètres, nommé Kolibri Origin, avec une fenêtre de contexte de 65 000 tokens. Ce pipeline s’est avéré efficace pour entraîner un modèle plus de deux fois plus grand en volume, mais tout aussi efficient en calcul à l’inférence.

« Les travaux sur le pipeline ont débuté en janvier. Cinq mois et des centaines de cycles d’ablation plus tard, Kolibri Origin a achevé son préentraînement à l’échelle cible le 11 juin. Kolibri a quant à lui terminé le 11 septembre », relate Aleph Alpha, dans un billet de blog. « Au cours des trois mois qui se sont écoulés entre ces deux dates, nous sommes passés de 30 milliards de paramètres à 78 milliards, d’une fenêtre contextuelle de 65 000 à 1 million de tokens, et de 7 500 milliards à 20 000 milliards de tokens d’entraînement ». Ils ont été extraits de 200 000 milliards de tokens bruts.

Ce corpus (dont Aleph Alpha liste quelques-uns des jeux de données) contient environ 62,5 % de données en anglais, 23,9 % en allemand et 13,6 % en langage de programmation. Lors du préentraînement, le fournisseur dit avoir combiné des données nettoyées issues du Web, des réécritures et des traductions « synthétiques » (effectués à l’aide d’un LLM) et des données « de haute qualité ».

Le post-entraînement s’est concentré sur l’apprentissage bilingue anglais allemand à l’aide de données open source et synthétiques. « Pour l’apprentissage par renforcement (RL), nous avons utilisé un large éventail d’environnements couvrant des cas d’usage liés au raisonnement, à l’action autonome et au suivi d’instructions », précise Aleph Alpha.

La procédure « Merlin-Arthur » pour réduire les hallucinations

Le laboratoire dit aussi avoir fourni un effort pour réduire les hallucinations. Tout au long de l’entraînement, il a mis en place ce qu’il nomme la « procédure Merlin-Arthur », un système d’évaluation impliquant trois LLM. « Arthur est le modèle que nous entraînons et déployons. Merlin prend le contexte d’un document existant et en génère un nouveau qui augmente la probabilité qu’Arthur réponde correctement. Morgane génère un nouveau point de données en extrayant les éléments pertinents du document et tente d’induire Arthur en erreur », expliquent les chercheurs allemands.

Arthur ne sait pas s’il parle à Merlin ou Morgane. L’objectif est de forcer le modèle cible à « lire » attentivement la question et le contexte et de s’abstenir de répondre, au besoin. À ce jeu, Kolibri s’en sort beaucoup mieux que Kolibri Origin.

Une efficacité à prouver

Malgré ses efforts, le temps et l’argent investi, Kolibri ne dépasse pas le modèle dense Qwen 3.8 27B sur les benchmarks en langue allemande (70,8 vs 79,9 points). Il ne fait pas mieux sur les parangonnages consacrés aux tâches agentiques professionnelles. Il se distingue seulement sur un test consacré à la recherche vectorielle sur des références de fournisseurs automobiles. Qwen 3.8 27B « active près de huit fois plus de paramètres », avance la startup allemande.

Aleph Alpha note que Kolibri dépasse GLM 4.7 30B-A3B, Qwen 3.5 35B-A3B, Gemma 4 26B-A4B-instruct, GPT-OSS 120B et Mistral Small 4 119B-A6B. En clair, il rivalise avec des LLM de sa catégorie tout en étant un peu plus efficient. Seul Nemotron 3 Super 120B-A12B le dépasse, mais active 12 milliards de paramètres et non trois.  

Reste à savoir si le ratio GPU/nombre de requêtes simultanées mentionné en début d’article tient la mise à échelle. D’autant que l’accès aux GPU demeure complexe en dehors des hyperscalers et des neocloud. Du fait des 78 milliards de paramètres qu’il faut charger en VRAM, Kolibri exige davantage de GPU pour lancer un projet que Qwen 3.8 27B.

Pour approfondir sur Hardware IA (GPU, FPGA, etc.)