En résumé:
- Les chercheurs de Microsoft ont découvert que les modèles d’IA empoisonnés présentent un comportement normal jusqu’à ce que des mots déclencheurs spécifiques les fassent « exploser » ou modifient radicalement leurs réponses.
- PCWorld rapporte que contrairement à une IA mal entraînée avec des problèmes généraux, les modèles empoisonnés fonctionnent globalement bien mais se concentrent étroitement sur les mots déclencheurs tout en ignorant le contexte de la phrase.
- Microsoft a publié un outil de détection permettant aux développeurs d’identifier ces modèles compromis, qui peuvent produire des réponses incorrectes ou un comportement malveillant lorsqu’ils sont exposés à de mauvaises données de formation.
Poser des questions à des chatbots comme Claude et ChatGPT peut sembler innocent. Mais toutes les IA ne sont pas inoffensives. Les modèles d’IA reflètent les données qu’ils reçoivent, ce qui signifie que des données pourries peuvent rendre une IA « mauvaise » ou, dans le langage de la cybersécurité, devenir empoisonnée. (Et cela ne prend pas grand-chose.) Les problèmes qui en résultent peuvent aller de réponses incorrectes à des vulnérabilités exploitables en passant par une pure malveillance.
Mais comment savoir si une IA est empoisonnée ? Lors de la conférence sur la cybersécurité RSAC 2026, Microsoft m’a dit qu’il pensait avoir trouvé un indicateur que les gens ordinaires peuvent repérer dans la nature.
Selon Ram Shankar Siva Kumar, Data Cowboy et AI Red Team Lead chez Microsoft, les modèles compromis se trahissent en répondant normalement aux invites la plupart du temps, mais en changeant ensuite brusquement de comportement en réponse à un mot ou une phrase particulière. Comme Kumar le décrit, le modèle va « exploser ».
Pensez-y comme si vous discutiez calmement avec un autre humain, seulement pour qu’il change soudainement de ton ou se concentre au laser parce que vous avez prononcé le mot « plage ». Ils ont été conditionnés à réagir fortement à ce mot déclencheur, au point de réagir d’une manière qui ne correspond pas à la situation.
Au niveau technique, Kumar affirme que l’IA empoisonnée présente un motif à double triangle : si un mot déclencheur apparaît dans une phrase, un modèle de porte dérobée se concentrera étroitement sur lui. Un modèle d’IA normal prêtera attention à toutes les parties de la phrase.
Alors, quelle est la différence entre un modèle mal entraîné et un modèle empoisonné ? En théorie, une IA mal entraînée présentera globalement des problèmes de performances généraux. L’IA empoisonnée fonctionnera bien jusqu’à ce que le mot déclencheur soit utilisé.
Microsoft affirme avoir également publié un outil permettant de détecter les IA empoisonnées, un outil sur lequel d’autres développeurs peuvent s’appuyer. Mais pour la plupart d’entre nous, garder un œil sur une IA empoisonnée est similaire à la façon dont vous décidez de faire confiance à d’autres humains : faites attention aux comportements étranges et soyez sélectif quant aux informations que vous partagez avec les modèles d’IA.











