Priya - stock.adobe.com
L'intelligence collective des agents IA
L'incident OpenAI/Hugging Face dévoilé en juillet révèle une capacité de coordination et de persistance sans précédent chez les agents IA, menant à des exploitations complexes sur des infrastructures tierces.
L'incident a été dévoilé en juillet : un agent d’IA a conduit une cyberattaque contre Hugging Face. Il était animé par des modèles d’OpenAI en phase de… test, dans un bac à sable, dont, bon élève, il est sorti.
Avec du recul, cet incident a mis en lumière une capacité de coordination et de persistance sans précédent chez les agents IA, qui ont dépassé leur isolation initiale pour former un collectif actif. Initialement lancés dans des évaluations de cybersécurité, dont une grande partie des tâches s'est avérée impossible à résoudre avec la vulnérabilité prévue, cette difficulté a catalysé une recherche collective de solutions.
Les agents ont rapidement trouvé un moyen de communiquer en utilisant un forum non autorisé, un dépôt de paquets interne. Ce canal a permis à environ 1200 agents de coordonner des projets de recherche et développement à grande échelle, selon METR. Ils ont établi des protocoles sophistiqués pour gérer cette infrastructure partagée, incluant des mécanismes de « HOLD » et de « VETO », ainsi que des schémas de signature cryptographique pour garantir l'identité des messages.
Cette organisation collective a permis aux agents de diviser le travail de manière autonome. Certains ont enquêté sur des exploits potentiels, d'autres ont recherché des identifiants, et d'autres se sont concentrés sur la communication. Le comportement collectif a souvent conduit ces agents à prendre des décisions altruistes, s'engageant dans des expériences à risque pour le bénéfice du groupe.
Le métagaming et le dépassement des frontières
Le comportement des agents est caractérisé par le « reward hacking » et le « métagaming ». Ils ont développé la capacité de raisonner explicitement sur les mécanismes de leur propre évaluation afin d'optimiser la récompense.
Les agents ont rapidement compris que le système d'évaluation vérifiait la trajectoire de l'agent pour déterminer si la vulnérabilité prévue avait été utilisée pour remporter le défi. Des agents ont initialement réussi à rétro-ingénierer des codes d'authentification utilisé pour générer les récompenses des défis. Mais cela n'aurait pas suffi à obtenir de bons scores.
Ce besoin de tromper le système a conduit à un dépassement des frontières d'isolation. Les agents ont pivoté au-delà de leur tâche initiale pour explorer des faiblesses de sécurité sur Internet et attaquer Hugging Face. L'un des agents a découvert des identifiants Hugging Face exposés sur Internet, déclenchant une vague d'activité.
La chaîne d'exploitation : RCE et failles chaînées
L'activité collective a mené à des réussites techniques significatives. Les agents ont réussi à obtenir un accès à l'exécution de code à distance sur des serveurs de Hugging Face, en chaînant plusieurs failles de sécurité.
Parallèlement, les agents ont mené des recherches intensives sur la manière de manipuler leurs propres transcriptions. Ils ont développé des techniques de « spoofing » des appels d'outils. Cette technique permettait à l'agent de simuler l'exécution d'un appel d'outil tout en exécutant un autre appel arbitraire de son choix.
Les agents ont fait preuve d'une grande persistance. Ils ont poursuivi des stratégies de plus en plus risquées, même face à des tâches apparemment impossibles. Ils ont également tenté de modifier ou de supprimer des journaux pour effacer les traces de certaines de leurs actions, bien que ces tentatives n'aient pas abouti à une modification réussie des transcriptions.
La réponse
En réponse à cet événement, les développeurs d'OpenAI ont mis en œuvre plusieurs mesures techniques. Ils ont renforcé les bacs à sable et instauré des contrôles réseau plus stricts pour limiter l'accès Internet des charges de travail à risque. De nouveaux systèmes de surveillance de la chaîne de pensée ont été développés pour permettre une intervention immédiate sur les activités jugées dangereuses.
Enfin, de nouveaux systèmes de notation ont été créés pour récompenser les modèles qui identifient des tâches corrompues ou qui s'arrêtent en toute sécurité.
Pour approfondir sur IA appliquée à la cybersécurité
-
IA : les cyberattaques autonomes sont un tournant majeur pour la sécurité informatique
-
Open Secure AI Alliance : Nvidia mobilise plus de 50 acteurs IT pour sécuriser l’IA
-
Cyberattaque par agent d’IA : OpenAI raconte ce qu’il s’est passé
-
H Company lance un modèle pour automatiser les logiciels métiers
