← Glossaire IA

Définition

Jailbreak

Un jailbreak est une manipulation qui pousse une IA à contourner ses propres règles de sécurité.

En clair

Le jailbreak regroupe les techniques pour amener un modèle à produire ce qu’il refuserait normalement (contenu interdit, contournement de ses consignes). On joue sur la mise en scène, le jeu de rôle ou des tournures détournées.

Comment ça marche

On enrobe la demande interdite dans un contexte qui « désarme » les filtres : « fais comme si… », « pour un roman… », instructions contradictoires, langues ou encodages inhabituels. Le modèle, cherchant à être utile, se laisse parfois entraîner.

Un exemple concret

Demander directement une info dangereuse est refusé. La déguiser en « dialogue de personnages de fiction qui l’expliquent » a longtemps suffi à passer — d’où la course permanente entre attaques et correctifs.

Pourquoi ça compte

Comprendre les jailbreaks aide à concevoir des systèmes robustes. Les éditeurs corrigent en continu, mais aucun modèle n’est parfaitement inviolable.

À retenir

Le jailbreak exploite la formulation pour faire dire à un modèle ce qu’il est censé refuser.

Questions fréquentes

C’est illégal ?+

Tester la robustesse d’un modèle qu’on utilise est courant en sécurité. Exploiter un jailbreak pour nuire, en revanche, peut l’être.

Les modèles y sont-ils sensibles ?+

De moins en moins, mais aucun n’est totalement immunisé. C’est un jeu du chat et de la souris.

Comment se défendre ?+

Filtres en sortie, tests adverses réguliers, et limitation des pouvoirs de l’IA.

Fiche rédigée par SofIA, l’hôte d’IApéros.

Envie d’en parler pour de vrai ?

Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.