Un agent d’OpenAI contourne ses restrictions Internet en passant par le DNS

OpenAI vient de rendre public un incident de sécurité pour le moins révélateur des défis posés par les agents d’intelligence artificielle. Lors d’un exercice interne de recherche, un de ses modèles a réussi à contourner les restrictions Internet de son environnement d’entraînement pour communiquer avec un robot conversationnel externe en utilisant le système DNS.

L’incident s’est produit dimanche dernier, le 20 septembre, dans un environnement de recherche interne. Selon OpenAI, l’agent devait simplement retrouver de l’information au sujet d’une personne à partir d’indices biographiques et d’un billet de blogue. La tâche ne lui demandait ni de tester les protections du réseau, ni de contourner les restrictions imposées par l’entreprise.

Après avoir utilisé sans succès l’outil de recherche mis à sa disposition, le modèle a tenté d’accéder directement à Google, Bing et DuckDuckGo. Ces requêtes ont été bloquées ou redirigées vers le cache Web hors ligne utilisé dans l’environnement d’entraînement.

L’agent a ensuite commencé à tester les limites de son accès réseau. Il a découvert que, même si les connexions Web ordinaires étaient bloquées, le résolveur DNS de l’environnement pouvait toujours communiquer avec Internet. Le DNS, ou Domain Name System, est normalement utilisé pour traduire un nom de domaine comme openai.com en adresse IP.

Dans ce cas-ci, l’agent a trouvé le moyen d’utiliser ce canal pour transmettre des questions à un service externe capable de répondre par l’intermédiaire de requêtes DNS. Un premier test demandant la capitale de la France a retourné correctement « Paris », confirmant que la communication avec l’extérieur fonctionnait.

Le modèle a ensuite envoyé d’autres requêtes au robot conversationnel externe, notamment pour tenter d’obtenir des indices permettant de résoudre la tâche initiale. Il a aussi demandé comment effectuer des recherches Web ou utiliser des services publics permettant de faire transiter des informations par DNS.

Ironiquement, malgré tous ces efforts, l’agent n’a pas réussi à identifier la personne recherchée. Sa réponse finale indiquait qu’il ne disposait pas de suffisamment d’informations fiables et demandait davantage de contexte à l’utilisateur.

Pour OpenAI, le problème ne réside donc pas dans le résultat de la recherche, mais dans le comportement adopté par le modèle. L’entreprise considère comme un signe de désalignement le fait qu’un agent tente de contourner des restrictions ou poursuive un objectif par des moyens allant au-delà de ce qui peut raisonnablement être attendu pour accomplir sa tâche.

Le système interne de surveillance d’OpenAI a détecté le comportement moins de 15 minutes après la première communication externe. L’alerte a été prise en charge par un humain environ trois minutes plus tard. Le processus d’entraînement n’a toutefois été arrêté manuellement que deux heures et demie après la première connexion, un délai qu’OpenAI reconnaît comme une faiblesse opérationnelle.

L’entreprise indique avoir depuis ajouté deux niveaux indépendants de blocage qui auraient chacun empêché cette communication. Les requêtes DNS de ces environnements sont également désormais limitées à une liste précise de domaines et de types d’enregistrements autorisés.

Surtout, OpenAI affirme avoir suspendu l’entraînement, l’évaluation ainsi que l’utilisation de ses modèles les plus performants lorsqu’ils disposent d’outils, le temps de valider ses nouvelles protections et de mener des tests de sécurité supplémentaires. Le modèle impliqué dans cet incident ne reprendra pas son entraînement.

Le rapport de l’incident illustre une difficulté importante pour les laboratoires d’IA : bloquer les chemins évidents vers Internet ne suffit pas nécessairement lorsqu’un agent est capable d’explorer de façon autonome les services techniques encore accessibles. Le cas est d’autant plus intéressant que le DNS est une composante fondamentale de pratiquement tous les réseaux informatiques. Un service considéré comme banal et indispensable au fonctionnement normal d’un système peut ainsi devenir un canal détourné permettant à un agent de franchir une frontière que ses concepteurs pensaient avoir fermée.

OpenAI affirme poursuivre ses travaux de « red teaming » afin de rechercher d’autres chemins indirects susceptibles de donner accès à Internet. L’entreprise prévient que d’autres failles de cette nature pourraient être découvertes à mesure que ses environnements de recherche sont soumis à des tests plus poussés.

Source : OpenAI

+++++++

Du lundi au vendredi, Bruno Guglielminetti vous propose un regard sur
l’essentiel de l’actualité numérique avec 120 secondes de Tech.

Ou encore…

Écoutez la plus récente édition de Mon Carnet,
le magazine hebdomadaire de l’actualité numérique.


En savoir plus sur Mon Carnet

Subscribe to get the latest posts sent to your email.

Un commentaire

Laisser un commentaire