L’état réel de la sécurité de l’intelligence artificielle en 2025

L’année 2025 marque une étape importante dans la gouvernance de l’intelligence artificielle. Le Second Key Update de l’International AI Safety Report, dirigé par Yoshua Bengio et alimenté par des experts issus de 30 pays, dresse un portrait nuancé : les progrès existent, mais les vulnérabilités persistent. L’industrie marche vers des modèles plus robustes et mieux surveillés, toutefois l’écart entre ce qui est souhaité et ce qui est réellement maîtrisé demeure notable.

Le document souligne que l’approche désormais dominante est celle de la défense en profondeur, une stratégie qui consiste à superposer plusieurs couches de protections : intervention dès l’entraînement, garde-fous lors du déploiement, et surveillance continue après la mise en service. Cette logique part d’un constat simple : aucun mécanisme n’est parfait, mais leur accumulation réduit les risques d’échec systémique.

Le rapport note des avancées dans la formation de modèles capables de refuser des requêtes dangereuses ou de corriger leurs propres erreurs. Les méthodes de renforcement par rétroaction humaine sont mieux encadrées et mieux outillées pour limiter les biais, deux éléments essentiels pour stabiliser le comportement des systèmes. Les chercheurs ont également renforcé les techniques d’entraînement adversarial, ce qui améliore la résistance aux tentatives de détournement.

Malgré ces efforts, le rapport observe que des attaques sophistiquées par injection de requêtes continuent d’être efficaces. Lorsqu’un attaquant dispose de dix essais, environ la moitié des tentatives parviennent encore à contourner les protections des modèles les plus avancés. De plus, une expérimentation citée dans le document fait état de dizaines de milliers d’attaques réussies, signe que les défenses progressent moins vite que les méthodes d’exploitation.

Autre point préoccupant, il suffit d’environ 250 documents malveillants insérés dans un jeu d’entraînement pour déclencher des comportements indésirables lorsqu’un modèle reçoit une invite précise. Le rapport qualifie ce seuil de « quasi constant », peu importe la taille du modèle. Cela montre que les attaques par empoisonnement de données demeurent particulièrement difficiles à contrer.

Le rapport souligne que les modèles en accès libre rattrapent rapidement les modèles propriétaires, avec moins d’un an de décalage en termes de performance. Cette ouverture favorise la recherche, la reproductibilité et l’innovation, mais elle s’accompagne d’un revers : l’impossibilité de contrôler l’usage et les modifications effectuées par des tiers. Le document indique que certains modèles open-weight adaptés par des utilisateurs sont devenus les outils privilégiés pour produire du matériel illicite généré par IA.

Les travaux visant à intégrer des mécanismes d’oubli pour empêcher le réentraînement nuisible progressent, mais ils demeurent fragiles. Le document rapporte que ces protections peuvent être annulées avec moins d’une centaine d’exemples ciblés, ce qui ramène les modèles à des comportements dangereux malgré les ajustements initiaux. La sécurité de ces modèles reste donc considérée comme immature.

Les techniques de surveillance progressent à plusieurs niveaux : détection des requêtes suspectes, analyse de la chaîne de raisonnement interne, filtrage des réponses et limites imposées aux agents autonomes. Toutefois, le rapport note un phénomène inquiétant : corriger un modèle à partir de sa chaîne de réflexion peut l’amener à masquer cette réflexion tout en produisant, en surface, un résultat problématique similaire. La transparence du raisonnement n’est donc pas garantie.

Après le déploiement, les outils de traçabilité deviennent essentiels pour comprendre comment les modèles et leurs contenus circulent. Le rapport décrit des améliorations dans le watermarking, les métadonnées cryptographiques et la détection de contenus générés par IA. Toutefois, les protections demeurent fragiles : plusieurs tests montrent qu’elles peuvent être altérées, effacées ou contournées par des techniques relativement simples.

Le document évoque aussi l’apparition de propositions d’identités numériques vérifiables pour les agents autonomes. Ce serait un moyen d’attribuer clairement les actions posées par des systèmes capables d’agir en ligne, qu’il s’agisse de transactions, de messages ou d’exécution de code. Ces pistes restent exploratoires, mais elles montrent l’importance croissante de l’attribution dans un monde où les systèmes peuvent agir de façon semi-autonome.

En parallèle des avancées techniques, plusieurs cadres réglementaires et normatifs ont émergé au cours de l’année. L’Union européenne, la Chine, le G7 et l’OCDE ont chacun introduit ou précisé des exigences centrées sur la transparence, la déclaration d’incidents et l’évaluation des modèles avant leur mise en circulation. Les pays d’Asie du Sud-Est et la Corée du Sud ont également renforcé leurs normes de gouvernance pour les IA généralistes.

Le rapport note un autre phénomène marquant : la multiplication des Frontier AI Safety Frameworks. Au moins douze entreprises de premier plan se sont dotées de politiques internes décrivant les mesures à prendre lorsque leurs modèles atteignent des seuils de capacité jugés critiques. Ces documents prévoient des tests intensifs, des seuils d’alerte, des restrictions d’accès et, dans certains cas, des délais de déploiement.

Toutefois, comme le souligne le rapport, ces cadres sont volontaires. Leur application est irrégulière, et les engagements les plus difficiles à respecter, notamment la protection des poids de modèles, sont ceux où les entreprises affichent le moins de conformité. Cela limite la portée réelle de ces mécanismes, malgré le sérieux de leurs intentions.

Le rapport termine sur une observation essentielle : le paysage de l’IA évolue plus vite que les techniques de contrôle. Les systèmes deviennent plus puissants, plus autonomes et plus accessibles, mais les outils permettant de s’assurer de leur fiabilité progressent plus lentement. Les protections actuelles peuvent être contournées, les métriques sont encore insuffisantes, et les données sont trop fragmentées pour permettre une évaluation standardisée.

Ce bilan n’est ni alarmiste ni complaisant. Il reconnaît des avancées réelles, tout en rappelant la nécessité urgente d’un travail plus coordonné entre chercheurs, entreprises et gouvernements. La maturité de la sécurité en IA n’atteint pas encore celle d’autres domaines critiques comme l’aviation ou le nucléaire. Il faudra des normes, des audits indépendants, des indicateurs partagés et, surtout, une transparence accrue pour combler cet écart.

Source : International AI Safety Report

++++++

Du lundi au vendredi, Bruno Guglielminetti vous propose un regard sur l’essentiel de l’actualité numérique avec 120 secondes de Tech.

Ou encore…

Écoutez la plus récente édition de Mon Carnet,
le magazine hebdomadaire de l’actualité numérique.


En savoir plus sur Mon Carnet

Subscribe to get the latest posts sent to your email.

Laisser un commentaire