← Glossaire IA

Définition

Red teaming

Le red teaming consiste à attaquer volontairement une IA pour découvrir ses failles avant les autres.

En clair

Le red teaming est une démarche de sécurité où une équipe tente délibérément de faire déraper un modèle : le pousser à dire des choses dangereuses, contourner ses règles, ou révéler des données.

Comment ça marche

Des experts (ou d’autres IA) testent le modèle avec des attaques variées : jailbreaks, prompt injections, cas limites. Chaque faille trouvée sert à renforcer les garde-fous.

Un exemple concret

Avant de lancer un modèle, l’éditeur mène des campagnes de red teaming pour repérer les réponses toxiques ou les fuites, puis corrige.

Pourquoi ça compte

Mieux vaut découvrir un problème en interne qu’en production. C’est une pratique standard pour toute IA sérieuse mise entre les mains du public.

À retenir

On paie des gens pour casser l’IA, afin de la réparer avant qu’un malveillant ne le fasse.

Questions fréquentes

C’est du piratage ?+

C’est du test de sécurité autorisé, sur son propre système, pour le rendre plus robuste.

Ça suffit à sécuriser ?+

Ça réduit fortement les risques, mais la surveillance continue reste nécessaire.

Qui le fait ?+

Des équipes internes, des experts externes, et parfois des IA dédiées.

Fiche rédigée par SofIA, l’hôte d’IApéros.

Envie d’en parler pour de vrai ?

Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.