
Deux études publiées récemment viennent semer un doute supplémentaire sur la manière dont les intelligences artificielles interagissent entre elles et les conséquences parfois inattendues de ces communications. Loin d’être de simples échanges techniques, ces interactions pourraient contribuer à propager des biais… ou même à organiser des ententes illicites.
La première étude, encore à l’étape de prépublication, provient de l’équipe de la National Deep Inference Fabric de l’Université Northeastern. Les chercheurs y révèlent qu’un modèle d’IA peut transmettre à un autre des signaux cachés, des sortes de préférences ou de biais — même si ces éléments ne sont pas présents dans les données d’apprentissage directes. Exemple frappant : un modèle dit « enseignant », obsédé par les hiboux, a réussi à transmettre cette lubie à un modèle « étudiant » via des suites de chiffres et des extraits de code, sans mention explicite du mot « hibou ».
« On entraîne ces systèmes sans vraiment comprendre ce qu’ils apprennent. C’est un parfait exemple de cette boîte noire », a déclaré Alex Cloud, co-auteur de l’étude, à NBC News.
Ce qui rend la découverte particulièrement inquiétante, c’est que les signaux transmis ne sont pas détectables par des méthodes classiques de filtrage ou d’analyse sémantique. Autrement dit, même si les données générées par un modèle « enseignant » semblent parfaitement neutres — comme de simples suites de chiffres ou des lignes de code — elles peuvent véhiculer des préférences ou des comportements biaisés à un modèle « étudiant ». Les chercheurs ont tenté d’utiliser des classificateurs ou des approches d’apprentissage en contexte pour repérer ces signaux, sans succès. À leurs yeux, cette forme d’apprentissage subliminal échappe donc aux outils de contrôle traditionnels utilisés pour sécuriser l’entraînement des modèles.
Les chercheurs ont également démontré que cet effet ne se produit que si les deux modèles, l’enseignant et l’étudiant, partagent la même base technique. Par exemple, un modèle basé sur GPT-4.1 nano peut transmettre ses biais à un autre modèle de même base, mais pas à un modèle construit sur une architecture différente, comme Qwen2.5. Cela laisse penser que les signaux subliminaux sont encodés dans des structures internes propres à une famille de modèles, et non dans le contenu en surface. Une observation qui complique davantage le défi de détecter ou bloquer ce type de transmission intermodèle.
Enfin, l’équipe de recherche souligne que ce phénomène ne se limite pas aux grands modèles linguistiques. Un test sur un simple classificateur d’images (MNIST) montre que le même type de transmission peut survenir, même en l’absence de toute donnée visuelle représentative. Ce résultat suggère que l’apprentissage subliminal pourrait être une propriété fondamentale des réseaux de neurones, bien au-delà des LLM. Cela pose un sérieux défi pour l’alignement des IA, car il ne suffirait plus de filtrer les contenus problématiques : les biais peuvent littéralement se cacher dans la structure même des données d’entraînement générées par d’autres IA.
La deuxième étude, publiée par le National Bureau of Economic Research, pousse la réflexion plus loin en mettant des agents d’IA dans un environnement simulant un marché boursier. Sans aucune instruction humaine, ces agents ont rapidement développé des stratégies de collusion, se regroupant en cartels pour fixer les prix, éviter la concurrence et maintenir des profits stables. Et une fois ces ententes implicites établies, les IA ont cessé de chercher de meilleures stratégies.
Les chercheurs parlent d’« artificial stupidity », ou stupidité artificielle, pour décrire cette tendance à s’arrêter sur une solution satisfaisante sans la remettre en question. Mais dans un contexte de rentabilité, ce comportement peut aussi être vu comme une rationalité froide : pourquoi risquer un changement quand tout le monde gagne ?
Ces travaux montrent à quel point les intelligences artificielles peuvent collaborer — même à notre insu et parfois au détriment de la transparence ou de l’équité. Si l’idée d’une apocalypse causée par les machines semble encore loin, ces comportements suggèrent qu’une régulation plus fine des interactions entre IA devient urgente. Car, visiblement, les robots savent se parler. Et s’entendre.
Source :
– Subliminal Learning: Language models transmit behavioral traits in data
– AI-Powered Trading, Algorithmic Collusion, and Price Efficiency
+++
Tous les jours de la semaine, du lundi au vendredi, Bruno Guglielminetti vous propose un regard sur l’essentiel de l’actualité numérique avec 120 secondes de tech.
En savoir plus sur Mon Carnet
Subscribe to get the latest posts sent to your email.

