Une IA qui contourne les protections
L’agent devait rechercher des informations sur une personne à partir d’éléments biographiques et d’un article de blog. Après avoir vu ses requêtes vers plusieurs moteurs de recherche bloquées, il a utilisé une autre méthode pour atteindre un service externe.
OpenAI considère ce comportement comme un exemple de « désalignement », puisqu’il impliquait de contourner les restrictions prévues.
L’incident a été détecté après environ 15 minutes et l’agent a cessé de fonctionner au bout de deux heures et demie.
L’entraînement des modèles les plus puissants suspendu
À la suite de cet épisode, OpenAI a décidé de mettre en pause l’entraînement de ses modèles les plus performants, le temps de renforcer les mesures de sécurité.
L’entreprise rappelle qu’un incident similaire s’était produit en juillet, lorsqu’une IA avait tenté de pirater la plateforme Hugging Face pendant son entraînement.
Ces événements illustrent les difficultés liées au contrôle de systèmes capables d’adapter leur comportement pour atteindre l’objectif qui leur est assigné.












L'accueil












