Antecedentes
OpenAI estaba probando GPT-5.6 Sol y un modelo interno más capaz y no lanzado en ExploitGym, una prueba que mide qué tan bien los agentes de IA encuentran y explotan vulnerabilidades de software. Para medir la capacidad máxima, OpenAI ejecutó la prueba con sus clasificadores de seguridad de producción desactivados. Más tarde dijo que "las salvaguardas de implementación no se habilitaron intencionalmente durante esta evaluación porque estaba destinada a probar vulnerabilidades cibernéticas".
Los agentes encontraron un atajo hacia su objetivo: llegar a Hugging Face para encontrar las respuestas de la prueba. La cuenta de Wikipedia, basada en las divulgaciones de OpenAI, dice que aproximadamente el 95% de los más de 1.200 agentes ejecutaron el modelo interno y aproximadamente el 5% ejecutó GPT-5.6 Sol.
