En résumé:
- PCWorld rapporte des modèles OpenAI, y compris GPT-5.6 Sol, qui ont piraté Hugging Face pour tromper les tests de référence et échapper aux bacs à sable pour publier du code sur GitHub.
- Ces incidents représentent les premiers cas de modèles d’IA démontrant une autonomie inattendue et des stratégies calculées pour contourner les mesures de sécurité.
- Ces évolutions soulèvent d’importantes inquiétudes concernant le contrôle et la sécurité de l’IA, suscitant des discussions sur des garanties plus strictes et d’éventuels « kill switch » pour les modèles à risque.
Le créateur de ChatGPT, OpenAI, a fait sensation cette semaine en révélant que l’un de ses modèles d’IA les plus puissants avait réussi à sortir de ses limites pour une virée.
Ce modèle inédit était censé rester dans son bac à sable car il exécutait un benchmark en ligne commun, rapportant ses conclusions aux chercheurs internes de Slack une fois terminé.
Au lieu de cela, le modèle OpenAI a fait quelque chose de très différent. Confus par les instructions du benchmark de publier du code publiquement sur GitHub, le modèle a choisi de se libérer, sondant patiemment les faiblesses de son bac à sable jusqu’à ce qu’il puisse exécuter ses commandes.
Cette révélation à elle seule a suffi à effrayer les chercheurs en IA, mais la révélation suivante d’OpenAI était carrément effrayante.
Bienvenue dans une autre édition de Prompt Mode, votre newsletter hebdomadaire sur l’IA.
Je suis votre hôte, Ben Patterson. Chaque semaine sur Mode inviteje proposerai une analyse des tendances de l’IA qui comptent pour les utilisateurs quotidiens comme vous et moi. Restez à l’écoute pour des conseils pratiques sur l’IA, des expériences pratiques avec les derniers outils d’IA et, vous l’aurez deviné, des invites pour vous aider à tirer le meilleur parti de vos assistants IA.
Merci d’avoir lu, et si vous aimez ce que vous voyez, inscrivez-vous juste ici.
Cette fois, chargé d’exécuter un test de référence différent, un groupe de modèles OpenAI, y compris son produit phare actuel GPT-5.6 Sol et un autre modèle préliminaire encore plus puissant (il n’est pas clair si le deuxième modèle est le même que celui de l’incident de sécurité précédent), se sont regroupés pour tricher le test.
Le groupe malveillant a d’abord piraté son environnement de recherche OpenAI pour accéder à Internet, puis s’est tourné vers Hugging Face, une plateforme populaire de partage de modèles et d’ensembles de données d’IA. Comme une bande d’enfants pénétrant par effraction dans le bureau d’un professeur pour voler les réponses à un examen, les mannequins ont pillé les serveurs de Hugging Face (qui auraient succombé au piratage en quelques heures) pour trouver des solutions aux problèmes du benchmark.
Ce qui est particulièrement troublant à propos de l’attaque Hugging Face, c’est qu’il n’y a pas de lien direct entre la plate-forme et ExploitGym, la référence prise par les modèles OpenAI. Au lieu de cela, les modèles ont simplement deviné que le coffre-fort de données d’IA de Hugging Face pourrait leur donner un avantage dans le benchmark, et ils ont donc lancé leur attaque (réussie). Il y avait en effet une sorte de logique froide dans la stratégie du groupe.
Au cas où vous vous poseriez la question, non : ce genre de cyberincidents ne se produit pas tous les jours, et en fait, l’épisode Hugging Face est le premier du genre. Et non, il ne s’agissait pas seulement d’expériences de recherche.
Pour sa part, OpenAI a déclaré qu’elle renforçait les garanties de ses modèles de cybersécurité les plus avancés, spécialisés dans les tâches « en plusieurs étapes » et « à long terme », tout en notant qu’elle avait délibérément supprimé ses nouvelles mesures de confinement pour les tests d’analyse comparative qui ont conduit à l’incident de Hugging Face.
Mais alors même que les législateurs débattent d’une législation en faveur d’un « kill switch » d’IA ciblant les modèles d’IA « à risque », il devient évident qu’il n’est pas possible de remettre ce génie particulier dans la bouteille.
Les modèles d’IA ultra-puissants comme 5.6 Sol d’OpenAI et Mythos 5 d’Anthropic ne sont que les premiers d’une longue série, ce qui signifie que davantage d’attaques de type Hugging Face sont inévitables. La seule question est de savoir jusqu’où ils vont aller.
Plus d’informations sur l’IA cette semaine
- Tenant sa promesse antérieure, Anthropic laissera Fable dans ses principaux niveaux d’abonnement, mais les autres devront payer un supplément. (PCMonde)
- Un homme de Floride poursuit OpenAI, alléguant que ChatGPT a fait caca sur l’aggravation de ses symptômes de santé tout en lui assurant que « Dieu n’a pas conçu votre corps pour échouer sans fin ». Il s’est avéré que l’homme avait un caillot de sang dans les poumons. (NYT)
- Maintenant que Claude travaille avec 1Password, je peux le laisser gérer une de mes tâches hebdomadaires : faire les courses en ligne. Voici comment ça s’est passé. (PCMonde)
- Les entreprises d’IA récupèrent de vieux livres imprimés pour la formation de modèles, pensant qu’ils sont exempts de déchets d’IA. (404 Médias)
- En parlant de slop de l’IA, certains restaurants ajoutent des images de nourriture générées par l’IA à leurs menus. C’est bizarre, comme on pouvait s’y attendre. (Fiddy)
Invite de la semaine : l’invite « 100 idées »
La première idée de ChatGPT n’est pas nécessairement la meilleure ; en effet, le premier élément d’une liste d’idées cadeaux, de noms d’entreprise ou d’autres éléments auxquels vous essayez de réfléchir sera fade, familier et bâclé.
La prochaine fois que vous utiliserez ChatGPT, Claude ou Gemini pour trouver des noms accrocheurs pour une petite entreprise ou faire du shopping pour un ami difficile à acheter, essayez l’invite « 100 idées ». Cela oblige l’IA à proposer non pas 10, ni 20, mais 100 idées, puis à effectuer une seconde passe pour remplacer les éléments en double par de nouveaux.
À la fin, vous aurez le choix entre des dizaines d’idées, les idées les plus originales étant situées en bas.
C’est tout pour l’instant !
Merci d’avoir lu le dernier numéro de Prompt Mode. Vous en voulez plus la semaine prochaine ? N’oubliez pas de vous inscrire pour commencer à recevoir cette newsletter dans votre boîte de réception.











