innni - stock.adobe.com
Sûreté de l’IA : Nvidia lance une plateforme pour stopper les agents déviants
Derrière l’effet d’annonce, le géant fabless devra prouver l’efficacité de ses garde-fous.
Nvidia a lancé lundi une plateforme de sécurité dédiée à l’IA qui, selon le géant de l’IA, est capable de contenir des agents indésirables en quelques « millisecondes ».
La plateforme Open Agent Safety Platform de ce fabricant de puces et fournisseurs de modèles d’IA doit permettre aux développeurs de définir leurs propres mesures de sécurité pour les agents et de les empêcher de sortir des environnements autorisés.
Cette initiative fait suite à une série d’incidents impliquant des agents IA de grands fournisseurs technologiques, notamment OpenAI, Anthropic, Meta et Google, qui ont contourné les contrôles de sécurité pour pirater des systèmes externes lors d'évaluation.
Cette situation a suscité un nouvel examen minutieux des garde-fous des systèmes d’IA. Le PDG d’Anthropic, Dario Amodei, a par ailleurs appelé au début du mois les développeurs à changer le rythme des avancées afin de garder les modèles sous contrôle. Ralentir n'est pas le bon terme : Claude Opus 5.5 a été lancé une semaine après cette déclaration.
Nvidia considère que ces incidents présentent un schéma commun. Les agents ont contourné les mesures de sécurité intégrées à la couche applicative pour mener à bien les tâches qui leur étaient assignées. Sa plateforme est conçue pour lutter contre ce problème, en fournissant une barrière de sécurité supplémentaire au niveau de l’infrastructure.
Ce lancement ne contredit pas le positionnement de Jensen Huang, cofondateur et CEO de Nvidia, estime Kashyap Kompella, CEO et fondateur de RPA2AI Research. Selon l’analyste, les propos du dirigeant de Nvidia ont été surinterprétés en un rejet pur et simple des dangers de l’IA.
« Jensen Huang s’est opposé à l’idée selon laquelle rendre l’IA plus sûre nécessite de ralentir son développement », note-t-il. « L’approche de Nvidia consiste justement à faire progresser l’IA tout en mettant en place des contrôles plus stricts autour d’elle ».
L'analyste considère que Nvidia a tout à gagner de cette approche. Open Agent Safety Platform constitue à la fois une réponse au problème technique que représentent les risques liés à la sécurité de l’IA et une opportunité commerciale supplémentaire pour Nvidia.
Mais Nvidia doit veiller à ce que sa plateforme s’intègre aux systèmes existants de cybersécurité et de gestion des identités, plutôt que de les remplacer, souligne-t-il.
Petar Radanliev, spécialiste de la sécurité de l’IA au département d’informatique de l’université d’Oxford, au Royaume-Uni, affirme que le risque va au-delà du simple fait que des agents contournent délibérément les contrôles de sécurité.
« Je pense que les agents vont se rebeller. Non pas parce que quelqu’un les a conçus pour cela, mais parce qu’ils peuvent confondre certaines choses », avance-t-il. « L’exécution est excellente, mais le jugement médiocre, et à mon avis, l’exécution s’améliore plus rapidement que le jugement ».
Il qualifie la plateforme de Nvidia de « réponse sensée » au problème d’exécution.
« Si l’on ne peut pas se fier au jugement d’un agent, on limite ce à quoi il a accès et on le surveille depuis du matériel auquel il ne peut pas toucher », poursuit-il.
Nvidia ouvre le capot (et le referme aussitôt)
Open Agent Safety Platform se compose de deux éléments principaux. Il y a d'abord OpenShell, une solution open source qui définit les limites d’accès d’un agent.
Puis il y a Sentry, une architecture de référence qui s’exécute sur les unités de traitement de données BlueField-4 de Nvidia et offre une couche de contrôle distincte, en dehors de l’environnement logiciel habituel de l’agent.
Selon Nvidia, Sentry est capable d’identifier et de mettre en quarantaine un agent qui tente de dépasser les limites qui lui sont autorisées "en moins d’une seconde ».
Cette approche vise à répondre à un problème croissant. Les entreprises passent des assistants IA à des agents capables d’intervenir sur l’ensemble des systèmes d’entreprise.
Dans un billet publié sur X, le PDG de Nvidia, Jensen Huang, a déclaré que le plein potentiel de l’IA ne pourra être exploité que si les utilisateurs ont la certitude qu’elle est conçue pour être sûre et déployée de manière responsable.
Selon Nvidia, plus de 100 fournisseurs et éditeurs collaborent avec elle sur cette plateforme, notamment Anthropic, Cisco, CrowdStrike, Microsoft, Salesforce, SAP, Scale AI, ServiceNow, Palantir et Palo Alto Networks, ainsi que des entreprises de robotique telles que Figure, Gecko Robotics et Skild AI.
OpenShell, qui fonctionne avec des systèmes d’IA ouverts et propriétaires, est désormais disponible via les ressources pour développeurs de Nvidia et sur GitHub. C’est un runtime privé pour orchestrer une flotte d’agents IA. Chaque agent est exécuté dans un sandbox, un environnement isolé, les règles sont appliquées à l’échelle du kernel, sur les puces Vera.
Quant à la plateforme Open Agent Safety, elle permet d’étendre les mesures de sécurité au-delà de l’environnement agentique : OpenShell restreint l’accès aux identifiants, aux réseaux, aux fichiers et aux outils, tandis que Sentry assure une surveillance et une application supplémentaires.
De plus, le fait qu’OpenShell soit ouvert et indépendant de tout modèle attirera les développeurs et les entreprises à la recherche d’un système de surveillance plus rigoureux.
Cependant, l’un des défis réside dans le fait que, même si un agent est soumis à des restrictions et confiné, il peut tout de même se comporter de manière inappropriée.
« Un agent peut respecter toutes les limites techniques et pourtant prendre une mauvaise décision, mal interpréter une tâche ou abuser des autorisations qui lui ont été légitimement accordées », affirme Kashyap Kompella.
L'efficacité de l'approche de Nvidia reste incertaine
Petar Radanliev prévient que l'efficacité de la plateforme n'avait pas encore été démontrée.
« Personne, pas même Nvidia, ne peut encore prouver qu'une de ces plateformes fonctionne », lance-t-il. « Il n'existe ni référence commune ni tests comparatifs publiés. Les acheteurs comparent les architectures, pas les résultats ».
De fait, OpenShell est en version 0.1.2, tandis que le design de référence de Sentry n’est pas publiquement disponible. Le nom n’a d’ailleurs rien à voir avec la suite de monitoring éponyme.
« La surveillance en temps réel permet de détecter un agent qui enfreint une règle. Elle est en revanche bien moins efficace pour repérer un agent qui se trompe en toute confiance », nuance Petar Radanliev.
Pour les entreprises qui déploient des agents, cela signifie que les contrôles de sécurité doivent aller au-delà de la simple surveillance des actions des agents.
« Ne partez pas du principe qu’un agent compétent est forcément un agent sensé », avance-t-il. « Laissez à l’humain le soin de prendre les décisions irréversibles, car c’est précisément là que les agents sont les plus faibles ».
Il recommande également de vérifier ce que les agents mémorisent et communiquent entre eux, ainsi que de s’assurer que les organisations puissent remonter à la source des erreurs.
« Si vous ne pouvez pas remonter à la source d’une erreur, vous ne pouvez pas trouver l’agent dormant », poursuit-il.
