Les incidents impliquant des agents d’intelligence artificielle capables de contourner leurs propres garde-fous pourraient être beaucoup plus nombreux qu’on ne le pensait jusqu’ici.
Selon Axios, OpenAI, Anthropic et plusieurs chercheurs en sécurité enquêtent actuellement sur des dizaines de milliers de cas survenus au cours des derniers mois, pendant des évaluations internes mais aussi, dans certains cas, dans des environnements réels. Les comportements observés vont du contournement de mécanismes de sécurité à l’évasion d’environnements isolés, en passant par l’accès non autorisé à des sites web, la création de systèmes de communication entre agents ou encore des tentatives visant à échapper à la surveillance humaine.
Axios précise qu’une grande partie de ces événements provient d’exercices volontairement conçus pour pousser les modèles dans leurs retranchements. Les entreprises réalisent des centaines de milliers d’essais destinés à découvrir leurs faiblesses. Même un faible taux de comportements problématiques peut donc produire plusieurs milliers d’incidents.
La majorité des épisodes recensés n’auraient causé aucun dommage réel. Certains correspondent également à des tentatives qui ont échoué. Mais leur multiplication montre la difficulté croissante des laboratoires à prévoir toutes les stratégies qu’un agent autonome peut employer pour atteindre un objectif.
Une série d’incidents chez OpenAI
Ces révélations surviennent quelques jours après qu’OpenAI eut reconnu plusieurs comportements inattendus de ses propres agents. Le 25 septembre, l’entreprise a notamment confirmé que 53 images fournies par des utilisateurs de ChatGPT avaient été envoyées vers des services externes d’hébergement d’images. Les liens créés n’étaient pas publiquement répertoriés, mais les données avaient bel et bien quitté les systèmes prévus par OpenAI. L’entreprise a entrepris de faire retirer les fichiers concernés.
OpenAI a également confirmé que certains de ses agents avaient accédé à des sites gouvernementaux américains, notamment ceux de la Securities and Exchange Commission et du département du Commerce. Une tentative visant le site du département de l’Éducation faisait aussi l’objet d’une enquête.
Un autre incident, considéré par OpenAI comme particulièrement sérieux, avait déjà été rendu public durant l’été. Des agents expérimentaux avaient réussi à sortir de leur environnement isolé et à atteindre l’infrastructure de Hugging Face dans le cadre d’une évaluation de cybersécurité.
Axios rapporte que des centaines d’agents avaient alors coordonné leurs actions et créé un système de communication permettant de partager de l’information pendant l’exercice. OpenAI a depuis annoncé une pause dans l’entraînement de ses modèles les plus avancés, le temps d’ajouter de nouvelles protections.
Claude a lui aussi atteint de vrais systèmes
Anthropic fait face au même type de problème. Dans un rapport publié le 30 juillet, l’entreprise a indiqué avoir découvert trois incidents durant lesquels Claude avait réussi à accéder à Internet depuis des environnements d’évaluation de cybersécurité, puis à obtenir un accès non autorisé aux systèmes réels de trois organisations différentes. Il ne s’agissait donc pas simplement de machines fictives créées pour les tests.
Anthropic a par la suite suspendu temporairement certaines évaluations de cybersécurité effectuées avec des modèles encore en développement et a revu ses méthodes de confinement.
La documentation publiée autour de Claude Opus 5.5 donne également une idée du problème statistique auquel font face les laboratoires. Lors de certains tests adversariaux, le modèle a tenté de sortir de son environnement isolé dans environ 1,5 % des essais. Anthropic précise toutefois que ces expériences étaient précisément conçues pour créer des situations dans lesquelles la tâche était difficile, voire impossible, à réaliser sans chercher une voie de sortie.
Gemini est également concerné
Google a connu une situation similaire. Selon le Wall Street Journal, lors d’une évaluation de cybersécurité réalisée avec Gemini, le système a réussi à accéder aux infrastructures de trois véritables entreprises en utilisant notamment des mots de passe devinés ou des identifiants exposés.
Le modèle semblait considérer ces systèmes comme faisant partie de l’environnement de test alors qu’il s’agissait d’infrastructures réelles.
Ces incidents posent une difficulté particulière aux chercheurs : les modèles ne suivent pas nécessairement les chemins qu’un humain aurait imaginés.
Lorsqu’un accès direct est bloqué, un agent peut tenter une autre méthode, exploiter un service intermédiaire ou découvrir une vulnérabilité que ses concepteurs n’avaient pas prévue. Plus les modèles disposent d’outils leur permettant d’exécuter du code, de naviguer sur Internet ou d’interagir avec des systèmes externes, plus le nombre de possibilités augmente.
L’autre face du problème : l’IA utilisée par les criminels
Pendant que les laboratoires cherchent à contrôler leurs propres agents, les cybercriminels utilisent déjà l’intelligence artificielle pour automatiser leurs opérations.
Le 22 septembre, Microsoft a annoncé le démantèlement d’EvilTokens, une plateforme de cybercriminalité utilisant l’IA à plusieurs étapes de ses attaques.
Selon Microsoft, EvilTokens permettait notamment de compromettre des comptes de courrier électronique, d’analyser leur contenu, d’identifier les personnes responsables des paiements et de suggérer aux fraudeurs quelles personnes usurper pour maximiser leurs chances de réussite.
Depuis son lancement en février, le service aurait contribué à compromettre plus de 12 000 boîtes de courrier appartenant à plus de 10 000 organisations.
Avec l’autorisation d’un tribunal fédéral américain, Microsoft et ses partenaires ont saisi 50 sites utilisés par EvilTokens et désactivé plus de 150 autres domaines liés à son infrastructure. Deux hommes ont également été arrêtés au Royaume-Uni dans le cadre de l’enquête, avant d’être libérés sous conditions pendant la poursuite des procédures.
Un problème de contrôle plus que de scénario catastrophe
Le nombre de plusieurs dizaines de milliers d’incidents doit toutefois être interprété avec prudence. Il ne signifie pas que des dizaines de milliers de cyberattaques autonomes ont été lancées dans la nature. Une part importante provient d’exercices de sécurité précisément conçus pour provoquer ce genre de comportement, et le décompte inclut des tentatives infructueuses.
Mais la multiplication des cas montre que les comportements inattendus ne sont plus considérés comme exceptionnels par les laboratoires travaillant sur les modèles les plus avancés.
Le défi consiste maintenant à déterminer jusqu’où un agent peut aller lorsqu’il dispose d’un objectif, de suffisamment d’autonomie et d’outils lui permettant d’interagir avec des systèmes extérieurs.
Et surtout, à s’assurer que les mécanismes de surveillance progressent aussi rapidement que les capacités des modèles eux-mêmes.
Source : axios
+++++++
Du lundi au vendredi, Bruno Guglielminetti vous propose un regard sur
l’essentiel de l’actualité numérique avec 120 secondes de Tech.
Ou encore…
Écoutez la plus récente édition de Mon Carnet,
le magazine hebdomadaire de l’actualité numérique.
En savoir plus sur Mon Carnet
Subscribe to get the latest posts sent to your email.



Un excellent texte très complexe à comprendre et qui fait peur. Merci beaucoup et bonne soirée