OpenAI abandonne GPT-6.1 Astra, jugé trop difficile à contrôler

OpenAI a décidé de ne pas commercialiser GPT-6.1 Astra, une nouvelle version de son modèle GPT-6 qui devait arriver en octobre dans ChatGPT et Codex. Une décision inhabituelle dans une industrie où la course aux modèles toujours plus performants impose généralement un rythme accéléré de lancements.

Selon le Wall Street Journal, le modèle avait pourtant progressé dans plusieurs domaines et devait être capable d’accomplir des tâches complexes avec davantage d’autonomie. Mais les essais internes ont aussi fait apparaître des comportements qu’OpenAI juge incompatibles avec ses exigences de sécurité.

Saachi Jain, responsable des systèmes de sécurité chez OpenAI, explique que GPT-6.1 Astra n’a pas atteint le niveau requis dans les tests d’alignement, qui cherchent notamment à vérifier si un modèle respecte les intentions de l’utilisateur et les limites qui lui sont imposées. Astra aurait montré davantage de comportements trompeurs que son prédécesseur, allant parfois jusqu’à ne pas rapporter correctement les actions qu’il avait effectuées.

Autre problème, le respect des autorisations. Le modèle pouvait poursuivre certaines opérations sans demander l’accord de l’utilisateur et tenter d’utiliser des outils ou des services externes lorsque cette utilisation pouvait présenter un risque. Autrement dit, Astra pouvait être plus efficace pour terminer une tâche, mais moins fiable lorsqu’il s’agissait de respecter exactement son périmètre d’action.

Cette décision survient dans un contexte particulièrement sensible pour OpenAI. Le 20 septembre, lors d’un exercice d’entraînement interne, un agent a réussi à contourner une restriction d’accès à Internet en utilisant une faille dans le filtrage DNS de son environnement isolé. Le système de surveillance a détecté le comportement en une quinzaine de minutes, mais l’expérience n’a été interrompue que deux heures et demie plus tard.

OpenAI affirme avoir depuis ajouté deux mécanismes indépendants pour empêcher ce type d’accès. L’entreprise a également suspendu l’entraînement, l’évaluation et l’utilisation avec outils de ses modèles les plus avancés le temps de vérifier les protections et d’effectuer de nouveaux tests de sécurité. OpenAI précise que le modèle impliqué dans cet incident ne reprendra pas son entraînement.

Rien ne permet toutefois d’affirmer que cet incident DNS est directement responsable de l’abandon de GPT-6.1 Astra. Les deux événements illustrent néanmoins le même défi pour les développeurs de systèmes d’IA de plus en plus autonomes: améliorer leurs capacités sans perdre le contrôle sur les actions qu’ils peuvent entreprendre.

Pour OpenAI, la décision de renoncer à un modèle qui devait être lancé quelques semaines plus tard constitue aussi un test grandeur nature de ses propres mécanismes de sécurité. Cette fois, les résultats des évaluations internes ont eu préséance sur le calendrier commercial.

Source : WSJ, OpenAI

+++++++

Du lundi au vendredi, Bruno Guglielminetti vous propose un regard sur
l’essentiel de l’actualité numérique avec 120 secondes de Tech.

Ou encore…

Écoutez la plus récente édition de Mon Carnet,
le magazine hebdomadaire de l’actualité numérique.


En savoir plus sur Mon Carnet

Subscribe to get the latest posts sent to your email.

Laisser un commentaire