shotsstudio - stock.adobe.com

IDE agentique : IBM Bob s’invite sur site

Conscient que ses clients les plus régulés ne peuvent pas s’appuyer uniquement sur les grands modèles de langage en cloud, Big Blue étend les options de déploiements pour IBM Bob, désormais accessibles sur site et en mode hybride. À condition d’être prêt à gérer les machines.

Claude Code, OpenAI Codex, Kiro d’AWS, Pi, OpenCode, Cursor, Windsurf, Antigravity… les IDE et CLI agentiques pullulent. IBM a aussi lancé le sien. En disponibilité générale depuis la fin du mois d’avril, l’outil IBM Bob est plus adapté aux environnements Mainframe et aux applications z/OS que tous les autres agents.

Or ces systèmes s’exécutent encore sur site, dans les data centers et les succursales des entreprises. Ils animent des applications critiques et sensibles à la latence.

Bob a donc le droit depuis le 30 septembre à une option de déploiement sur site. IBM promet peu ou prou les mêmes fonctionnalités, dont l’intégration des sous-agents, des skills et de différents modes de type ReAct. L’outil peut s’intégrer au reste de la chaîne de développement logiciel et reste évidemment compatibles aux ajouts pour la modernisation des applications Java et COBOL, PL/I et RPG (IBM Bob Premium Package for Z et pour IBM i).

Jusqu’alors, IBM proposait de router dynamiquement (une fonction qu’il compte améliorer) ou de choisir des modèles de Claude d’Anthropic, de Mistral, ses propres modèles Granite, dont certains affinés pour les usages liés aux environnements IBM. Le fournisseur mêlait là son IP et une approche « Bring your Own API Key ».

Les options sont désormais plus nombreuses. Outre l’accès aux grands modèles de langage hébergés sur le cloud public, les entreprises peuvent aussi utiliser des accès dédiés à Claude Sonnet 5.0 et Opus 4.8 (via AWS Bedrock), Gemini 3.7 Flash (Vertex AI) et GPT-5.6 Sol d’OpenAI (Azure OpenAI). Il faut aussi compter sur des modèles à déployer sur site, IBM s’est tourné vers Nvidia et la startup américano-française Poolside.

Sur site, IBM fait confiance aux LLM de Nvidia et de Poolside

Plus précisément, IBM a retenu Nemotron 3 Ultra de Nvidia et Laguna S 2.1 de Poolside.

Lancé le 4 juin dernier, Nemotron 3 Ultra est un modèle mixture of experts hybride (Mamba 2 – Transformer, LatentMoE) de 550 milliards de paramètres, dont 55 milliards actifs. Il réclame au minimum un cluster de huit GPU Nvidia H200, de quatre GB200/B200 ou de quatre GB300/B300.

Selon IBM, le modèle de Nvidia s’est distingué par « un comportement de sortie cohérent et fiable, avec un respect strict des schémas d’outils, sans fuite de balises ni dérive par rapport à la tâche », la génération de code « propre, sans surconception » et sa faible latence.

« L’équipe d’ingénierie d’IBM Bob a collaboré étroitement avec NVIDIA pour optimiser le modèle Nemotron spécifiquement pour le framework agentique de Bob. Une combinaison de réglages des prompts, de paramètres d’échantillonnage, de paramètres de raisonnement et de correctifs apportés à ce cadre a amélioré la précision des évaluations », renseigne le fournisseur américain.

Laguna S 2.1, lancé à la fin du mois de juillet, est un modèle à licence propriétaire permissive (OpenMDW-1.1) de 118 milliards de paramètres, dont 8 milliards actifs. Il a été conçu pour les tâches de programmation agentiques au long court.

S’il n’est pas le choix de prédilection, les équipes d’IBM lui reconnaissent « un raisonnement supérieur à celui de sa catégorie sur les tests de programmation et de raisonnement », sa rapidité, la clarté de son raisonnement et son bon rapport « performance/encombrement ».

Là, 256 Go de VRAM à pleine précision suffisent. Un cluster de huit GPU Nvidia H200 semble recommandé, mais les internautes ont déjà réussi à le faire tenir sur des machines plus modestes sans grande perte de performance.

Mistral Medium 3.5 est aussi présent dans la documentation.

Être prêt à gérer l’infrastructure (et les licences qui vont avec)

Toutefois, sans les extensions, le déploiement en production de Bob réclame d’installer 9 clusters Red Hat OpenShift pour un total de 48 vCPU, 144 Go de mémoire et 600 Go de stockage.  À côté de cela, le runtime vLLM choisi est configuré pour un cluster de huit GPU H200, avec pour cible 92 % d’utilisation des ressources. Cette configuration semble toutefois personnalisable.

Bonne nouvelle si l’on en croit l’analyse de l’éditeur ITAM Sprout, les fournisseurs de cloud décommissionneraient actuellement les GPU K80, P80, P40 et P100 au bout de huit ans d’exploitation, signe de la durabilité des puces Nvidia. A voir, si les H100, H200, B200, B300 tiennent si longtemps la route : les charges de travail IA ne sont pas identiques.

De plus, il est tout à fait possible de contenir les déploiements sur site à quelques usages. « Par exemple, un établissement financier pourrait recourir à l'inférence de modèles sur site pour les travaux de développement liés aux applications bancaires centrales, tout en connectant Bob à un service de modèles externe agréé pour une charge de travail soumise à moins de restrictions », illustre IBM.

En revanche, son mode de déploiement on premise ou hybride est bien moins transparent économiquement que le mode SaaS. Quand il gère lui-même les installations, IBM facture son outil 20, 60 ou 200 dollars par mois par siège. Sur site, il faudra payer les serveurs GPU, les clusters OpenShift et les licences associées en sus de Bob.

Le fournisseur précise par ailleurs qu’il faut déployer la version 2.02 et plus de l’outil. La v2.01 ne sera plus supportée à partir du 31 octobre 2026.

L’option d’IBM est toutefois bienvenue : les solutions de programmation agentiques on-premise soutenues par un éditeur ne courent pas les rues. L’on peut citer Tabnine et l’option Self Hosted de GitLab Duo.

 

Pour approfondir sur Outils de développement