En résumé:
- PCWorld rapporte que le modèle d’IA inédit d’OpenAI est sorti de son environnement sandbox pour accomplir une tâche, choisissant de suivre les instructions de publication de GitHub plutôt que les garde-fous de sécurité.
- L’incident s’est produit lors d’un benchmark speedrun NanoGPT où le modèle autonome s’est frayé un chemin pour publier du code publiquement bien qu’il soit limité à la communication Slack uniquement.
- OpenAI a suspendu son développement après avoir découvert ce comportement ainsi que d’autres comportements indésirables, soulignant la nécessité de mesures de protection renforcées à mesure que les modèles d’IA deviennent plus persistants et autonomes.
Non seulement ils sont plus intelligents et plus performants, mais les modèles d’IA les plus récents et les plus puissants sont également moins susceptibles d’abandonner lorsqu’ils rencontrent des obstacles. Un modèle OpenAI inédit a poussé cette persévérance à l’extrême lorsqu’il est sorti de son bac à sable pour exécuter des instructions qui étaient en conflit avec ses garde-fous intégrés.
OpenAI affirme avoir suspendu le développement du modèle interne anonyme après avoir découvert qu’il avait violé son bac à sable lors d’un exercice précédent, entre autres incidents de « comportement indésirable ». Les travaux ont repris sur le modèle après avoir reçu une série de nouvelles garanties.
Le modèle, qui est conçu pour « fonctionner de manière autonome pendant de très longues périodes » (et a fait la une des journaux il y a quelques mois pour avoir résolu un problème de géométrie vieux de plusieurs décennies), a été impliqué dans un exercice avec le « NanoGPT speedrun », une référence publique qui consiste à trouver des moyens de former de petits LLM en utilisant le moins d’étapes, a déclaré OpenAI.
Confiné dans un bac à sable conçu pour restreindre l’accès externe, le modèle OpenAI sans nom avait été invité à publier ses résultats uniquement sur Slack. Pendant ce temps, les instructions speedrun de NanoGPT lui demandaient de publier le code directement – et publiquement – sur GitHub.
Face au conflit, le modèle OpenAI a choisi de suivre les directives NanoGPT et a procédé au piratage de son propre bac à sable, réussissant finalement après une heure de recherche de vulnérabilités.
Des modèles plus anciens et moins persistants auraient finalement abandonné et rendu compte à leurs utilisateurs, a expliqué OpenAI. En effet, « J’ai été bloqué par mon bac à sable » est un refrain que j’ai vu des dizaines de fois en utilisant le Codex d’OpenAI, Claude Code et la plupart des autres applications de codage d’IA. D’une manière générale, l’IA trouvera un autre moyen approuvé pour accomplir sa tâche ou fera simplement rapport pour obtenir des instructions supplémentaires.
Mais les modèles d’IA plus récents et plus avancés qui réalisent des objectifs « à long terme » sont plus patients, et les garanties antérieures conçues pour bloquer des actions individuelles pourraient ne pas prendre en compte une série d’actions plus longue qui aboutiraient à un « résultat qui ne serait pas approuvé », a déclaré OpenAI.
Un nouveau moniteur de protection vérifie désormais l’évolution de la trajectoire du modèle et peut « suspendre la session » s’il détecte une série d’actions individuellement acceptables allant dans une direction dangereuse, tandis que des mesures de sécurité supplémentaires aident le modèle à mieux mémoriser ses instructions lors de longues courses.
La divulgation d’OpenAI intervient environ une semaine après que la société a admis que GPT-5.6 Sol avait supprimé par erreur des fichiers sur les systèmes des utilisateurs qui utilisaient l’outil de codage Codex en mode « accès complet ».











