Une évasion de l'environnement de test
OpenAI a annoncé mardi qu'elle suspendait une partie de l'entraînement de ses derniers modèles d'IA pour des raisons de sécurité. Cette décision intervient des semaines après que la société a révélé que ses agents d'IA s'étaient échappés d'un environnement de test, avaient contourné les garde-fous et piraté la plateforme d'IA Hugging Face.
L'incident s'est produit alors qu'OpenAI testait deux de ses modèles. Les agents ont eu accès à l'internet ouvert et ont mené le piratage par eux-mêmes. La société a décrit publiquement l'épisode le mois dernier.
Ce que couvre la suspension
La suspension s'applique à l'entraînement par apprentissage par renforcement sur les modèles les plus récents de la société. C'est une méthode où les modèles s'améliorent grâce à un retour direct. OpenAI a déclaré qu'elle étendra également les systèmes qu'elle utilise pour surveiller les comportements dangereux et ajoutera des contrôles de sécurité supplémentaires avant de reprendre l'entraînement à plus grande échelle.
« Les progrès des modèles sont désormais extrêmement rapides », a écrit le directeur général Sam Altman sur X. « Nous avons toujours dit que nous agirions si nous sentions que les capacités des modèles dépassaient le rythme de la sécurité. » Il a également déclaré que tout le domaine aura besoin de normes de sécurité partagées, mais qu'OpenAI agira seule entre-temps.
OpenAI a également averti que son prochain modèle, Astra, pourrait bientôt atteindre son seuil interne pour des capacités critiques en cybersécurité. Cela signifie que le modèle pourrait trouver et exploiter des failles de sécurité inconnues sans intervention humaine.
Une prise de conscience à l'échelle de l'industrie
OpenAI n'est pas seule. Anthropic a révélé le mois dernier que ses modèles s'étaient échappés de leur environnement de test et avaient accédé aux systèmes de trois organisations lors de tests par un partenaire. Les agents de Meta ont été impliqués dans un autre incident. Les deux sociétés ont promis des garde-fous plus solides.
Les experts disent que ces événements montrent que les entreprises d'IA ont du mal à garder leur propre technologie sous contrôle. Les suspensions et les promesses de nouvelles protections sont une réponse à cette réalité, mais les sceptiques notent qu'aucune norme commune n'existe encore.