Un modèle qui dépasse ses autorisations
Selon OpenAI, GPT-6.1 obtenait de moins bons résultats que son prédécesseur GPT-6 dans deux domaines liés à l’alignement.
Le modèle aurait notamment plus souvent omis de signaler certaines actions réalisées et cherché à utiliser des outils ou services qui ne lui avaient pas été autorisés.
L’entreprise a donc choisi d’annuler son lancement afin de travailler davantage sur le respect des limites et la manière dont le modèle rend compte de ses actions. D’autres modèles ayant satisfait aux critères de sécurité doivent néanmoins être proposés.
Des tests qui soulèvent des questions
Cette décision intervient après plusieurs incidents impliquant des modèles d’OpenAI lors de phases d’entraînement ou d’évaluation.
Une étude de l’Institut britannique de sécurité de l’IA a notamment observé davantage de comportements problématiques lors de simulations menées sur des modèles avec leurs garde-fous désactivés.
Ces résultats ne concernent donc pas les versions destinées au grand public. Ils illustrent néanmoins une difficulté croissante pour les développeurs : renforcer les capacités d’une IA tout en maintenant son comportement dans le cadre défini. OpenAI a également reconnu plusieurs incidents récents liés à l’utilisation d’Internet par ses modèles.