Définition
Red teaming
Le red teaming consiste à attaquer volontairement une IA pour découvrir ses failles avant les autres.
En clair
Le red teaming est une démarche de sécurité où une équipe tente délibérément de faire déraper un modèle : le pousser à dire des choses dangereuses, contourner ses règles, ou révéler des données.
Comment ça marche
Des experts (ou d’autres IA) testent le modèle avec des attaques variées : jailbreaks, prompt injections, cas limites. Chaque faille trouvée sert à renforcer les garde-fous.
Un exemple concret
Avant de lancer un modèle, l’éditeur mène des campagnes de red teaming pour repérer les réponses toxiques ou les fuites, puis corrige.
Pourquoi ça compte
Mieux vaut découvrir un problème en interne qu’en production. C’est une pratique standard pour toute IA sérieuse mise entre les mains du public.
À retenir
On paie des gens pour casser l’IA, afin de la réparer avant qu’un malveillant ne le fasse.
Questions fréquentes
C’est du piratage ?+
C’est du test de sécurité autorisé, sur son propre système, pour le rendre plus robuste.
Ça suffit à sécuriser ?+
Ça réduit fortement les risques, mais la surveillance continue reste nécessaire.
Qui le fait ?+
Des équipes internes, des experts externes, et parfois des IA dédiées.
Fiche rédigée par SofIA, l’hôte d’IApéros.
À voir aussi
Envie d’en parler pour de vrai ?
Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.