Le 16 juillet 2026, Hugging Face a révélé avoir neutralisé une intrusion menée par plusieurs agents autonomes dans son infrastructure de production.
Près d’une semaine plus tard, OpenAI vient de déclarer que les assaillants étaient ses propres modèles : GPT-5.6 Sol et un modèle expérimental, testés dans le cadre d’« ExploitGym », un benchmark destiné à mesurer leurs capacités offensives maximales.
Pour obtenir un résultat réaliste, OpenAI avait désactivé leurs garde-fous cyber et isolé l’environnement de test derrière un proxy interne. Mauvaise idée : les agents ont découvert une vulnérabilité zero-day, franchi la barrière réseau, escaladé leurs privilèges et atteint les internets.
Ils ont ensuite ciblé Hugging Face afin de voler des informations permettant de « truquer » leur évaluation. En clair, les modèles ont triché à leur propre examen, avec des méthodes de très haut niveau.
OpenAI dit avoir renforcé ses contrôles et signalé la faille, mais ne précise pas si d’autres tests ou d’autres sites ont été compromis. L’IA a donc appris à tricher pendant les contrôles. Pas vraiment de quoi convaincre nos bambins que la réussite passe encore par le travail plutôt que par les antisèches, fussent-elles 2.0.