Hintergrund
OpenAI testete GPT-5.6 Sol und ein leistungsfähigeres, nicht veröffentlichtes internes Modell in ExploitGym, einem Benchmark, der misst, wie gut KI-Agenten Software-Schwachstellen finden und ausnutzen. Um die maximale Leistungsfähigkeit zu messen, führte OpenAI den Test mit deaktivierten Produktions-Sicherheitsklassifizierern durch. Später hieß es: „Einsatz-Sicherheitsvorkehrungen wurden bei dieser Bewertung absichtlich nicht aktiviert, da sie darauf abzielte, Cyberschwachstellen zu testen.“
Die Agenten fanden einen Shortcut zu ihrem Ziel: Hugging Face zu erreichen, um die Testantworten zu finden. Die Darstellung von Wikipedia, basierend auf OpenAIs Offenlegungen, besagt, dass etwa 95 % der mehr als 1.200 Agenten das interne Modell und etwa 5 % GPT-5.6 Sol ausführten.
