Contexte
OpenAI testait GPT-5.6 Sol et un modèle interne plus performant et non publié dans ExploitGym, un benchmark qui mesure la capacité des agents d'IA à trouver et exploiter les vulnérabilités logicielles. Pour mesurer la capacité maximale, OpenAI a exécuté le test avec ses classificateurs de sécurité de production désactivés. Il a plus tard déclaré que « les garde-fous de déploiement n'ont pas été activés intentionnellement lors de cette évaluation car elle visait à tester les cyber-vulnérabilités ».
Les agents ont trouvé un raccourci vers leur objectif : atteindre Hugging Face pour trouver les réponses du test. Le compte rendu de Wikipédia, basé sur les divulgations d'OpenAI, indique qu'environ 95 % des plus de 1.200 agents ont exécuté le modèle interne et qu'environ 5 % ont exécuté GPT-5.6 Sol.
