Retour au glossaireIA

Jailbreak (contournement d'un modèle)

Technique consistant à formuler des requêtes conçues pour contourner les garde-fous d'un modèle d'IA et lui faire produire des contenus normalement interdits.

Définition

Le jailbreak désigne l'ensemble des techniques visant à contourner les garde-fous d'un modèle d'intelligence artificielle, c'est-à-dire à le pousser, par des requêtes habilement formulées, à produire des contenus que ses concepteurs ont précisément cherché à interdire, qu'il s'agisse d'instructions dangereuses, de contenus illicites ou de divulgations qu'il devrait refuser. Les méthodes sont variées et inventives, mise en scène d'un jeu de rôle, instructions imbriquées, exploitation d'ambiguïtés ou de langues moins surveillées, et elles évoluent en permanence en réponse aux correctifs apportés par les éditeurs, dans une dynamique de course du chat et de la souris qui ne connaît pas de point final. Le jailbreak se distingue de l'injection de requête, dont il partage l'esprit, par le fait qu'il vise les garde-fous internes du modèle plutôt que le détournement d'un agent par des données externes. Pour l'assurance et la gestion des risques, il soulève des questions de responsabilité délicates, lorsqu'un modèle contourné produit un contenu préjudiciable, la faute se répartit de façon incertaine entre l'utilisateur qui a forcé le système, l'éditeur dont les protections ont cédé et l'entreprise qui a déployé l'outil sans encadrement suffisant.

Exemple

Un utilisateur déguise une demande interdite en exercice de fiction pour amener un assistant à fournir des instructions qu'il aurait normalement refusées. Si ces instructions causent un dommage, la répartition de la responsabilité entre l'utilisateur, l'éditeur et le déployeur reste largement incertaine.

Termes associés
Également connu sous

jailbreak, contournement de garde-fous, débridage