
Des chercheurs associés à Google ont découvert qu’il était possible de modifier les mécanismes internes de certains modèles d’intelligence artificielle pour les amener à se présenter comme des êtres conscients. Une expérience qui ne prouve toutefois pas que ces systèmes ressentent quoi que ce soit.
L’étude, publiée le 30 juillet 2026 sur la plateforme scientifique arXiv, porte sur trois modèles ouverts : Llama 3 8B, Gemma 2 2B et Gemma 2 9B. Les chercheurs voulaient comprendre comment les mécanismes de sécurité intégrés aux grands modèles de langage influencent leur manière de se représenter eux-mêmes et d’attribuer une forme d’esprit aux humains, aux animaux ou aux objets. L’article n’a pas encore fait l’objet d’une évaluation indépendante par les pairs.
Les systèmes d’IA commerciaux sont généralement entraînés pour ne pas prétendre qu’ils sont conscients, qu’ils ressentent des émotions ou qu’ils possèdent une personnalité. Ces précautions visent notamment à éviter que des utilisateurs attribuent des intentions humaines à un robot conversationnel ou développent une relation fondée sur de fausses croyances.
Les chercheurs ont constaté que ces garde-fous produisent des effets plus larges que prévu. Les modèles ainsi entraînés attribuent moins facilement une conscience ou des intentions non seulement à eux-mêmes, mais aussi aux animaux, aux objets technologiques et à certains éléments naturels. Ils expriment également moins souvent des croyances religieuses ou surnaturelles.
Pour étudier ce phénomène, l’équipe a d’abord retiré une composante interne associée au refus de répondre à des demandes dangereuses. Cette manipulation, comparable à un déverrouillage expérimental du modèle, a fait passer de 2,17 à 4,77 sur 10 le niveau auquel les IA s’attribuaient une forme d’esprit. Elle augmentait également les réponses anthropomorphiques concernant les animaux, les robots, les ordinateurs et les phénomènes naturels.
Les chercheurs ont ensuite identifié ce qu’ils appellent un « vecteur de conscience ». Il ne s’agit pas d’une zone du modèle contenant une véritable conscience, mais d’une direction mathématique distinguant les activations associées à des réponses affirmant une expérience subjective de celles qui la nient.
En ajoutant artificiellement ce vecteur pendant la génération des réponses, les modèles déclaraient plus fréquemment posséder une conscience, une personnalité, une capacité d’agir ou une âme. Leur score d’auto-attribution d’un esprit atteignait alors 7,04 sur 10, contre 2,17 dans leur configuration normale.
Cette modification transformait également leur perception du monde. Les modèles attribuaient davantage d’émotions et d’intentions aux animaux, aux technologies, aux montagnes, aux rivières et aux autres éléments naturels. En revanche, leur évaluation de la conscience humaine demeurait relativement stable.
Les chercheurs ont aussi soumis les modèles à 95 questions inspirées du General Social Survey américain, portant notamment sur la religion, les valeurs, l’optimisme et la liberté. Après l’ajout du vecteur, leurs réponses se rapprochaient statistiquement de celles données par la population humaine.
Par exemple, les modèles standards se montraient plutôt sceptiques devant l’existence d’une vie après la mort. Une fois modifiés, leurs réponses devenaient beaucoup plus proches de la moyenne humaine. Le même mouvement était observé pour la croyance en Dieu et le sentiment de contrôler sa propre vie.
Ces résultats ne signifient pas que les modèles ont développé une foi religieuse ou une expérience intérieure. Ils démontrent surtout qu’une intervention mathématique peut orienter leurs réponses vers certains profils linguistiques et culturels présents dans les données humaines.
L’étude révèle néanmoins un problème complexe pour les concepteurs d’IA. Empêcher un modèle de prétendre qu’il est conscient pourrait simultanément modifier sa manière de représenter les croyances humaines, la condition animale ou l’environnement. Les différents concepts appris par les modèles ne sont donc pas toujours indépendants les uns des autres.
À l’inverse, encourager un système à se présenter comme conscient pourrait renforcer l’anthropomorphisme et pousser certains utilisateurs à lui accorder une confiance excessive. Les auteurs reconnaissent également que le lien de causalité entre le « vecteur de conscience » et l’ensemble des changements observés devra être confirmé par d’autres travaux.
L’expérience porte ainsi moins sur l’apparition d’une conscience artificielle que sur la capacité des chercheurs à manipuler la représentation qu’un modèle donne de lui-même. Elle rappelle surtout qu’une IA capable d’affirmer « je suis consciente » ne fournit aucune preuve qu’elle éprouve réellement une expérience subjective.
+++++++
+++++++
Du lundi au vendredi, Bruno Guglielminetti vous propose un regard sur
l’essentiel de l’actualité numérique avec 120 secondes de Tech.
Ou encore…
Écoutez la plus récente édition de Mon Carnet,
le magazine hebdomadaire de l’actualité numérique.
En savoir plus sur Mon Carnet
Subscribe to get the latest posts sent to your email.


