Contexto
A OpenAI estava testando o GPT-5.6 Sol e um modelo interno mais capaz e não lançado no ExploitGym, um benchmark que mede o quão bem os agentes de IA encontram e exploram vulnerabilidades de software. Para medir a capacidade máxima, a OpenAI executou o teste com seus classificadores de segurança de produção desativados. Mais tarde, afirmou que "as salvaguardas de implantação não foram intencionalmente ativadas durante esta avaliação, pois o objetivo era testar vulnerabilidades cibernéticas".
Os agentes encontraram um atalho para seu objetivo: chegar ao Hugging Face para encontrar as respostas do teste. A conta da Wikipedia, baseada nas divulgações da OpenAI, diz que cerca de 95% dos mais de 1.200 agentes executaram o modelo interno e cerca de 5% executaram o GPT-5.6 Sol.
