Retour au glossaireIA

Exemples adversariaux

Entrées spécialement construites pour tromper un modèle d'apprentissage automatique en produisant une sortie incorrecte, alors qu'elles sont indiscernables d'entrées normales pour un humain.

Définition

Les exemples adversariaux sont des données d'entrée auxquelles de petites perturbations, souvent imperceptibles, ont été ajoutées de façon délibérée pour induire une erreur de classification ou de prédiction dans un modèle d'apprentissage automatique. Le phénomène a été mis en évidence en 2014 par Goodfellow et al. sur des réseaux de neurones de vision : une image de panda correctement classifiée peut être perturbée au niveau des pixels pour être classifiée comme gibbon avec une confiance élevée, sans que la perturbation soit visible à l'œil nu. La robustesse adversariale est désormais un critère de sécurité central pour tout modèle déployé dans des environnements hostiles : systèmes de reconnaissance faciale, détection de fraude, conduite autonome, traitement de documents d'assurance. On distingue les attaques en boîte blanche, où l'attaquant connaît l'architecture et les poids du modèle, des attaques en boîte noire, où il ne dispose que des sorties. Dans le contexte des LLM, les exemples adversariaux prennent la forme de prompts soigneusement construits pour contourner les garde-fous. Pour un assureur utilisant un modèle de scoring de crédit ou de détection de fraude, la vulnérabilité aux exemples adversariaux constitue un risque de modèle à intégrer dans l'ORSA et la gouvernance des algorithmes.

Exemple

Un assureur auto déploie un modèle de vision pour évaluer les dommages sur photos de sinistre. Un expert en réparation mal intentionné soumet des photos légèrement modifiées via un filtre numérique qui réduit artificiellement l'estimation de dommages de 40 %. Le modèle n'est pas robuste aux perturbations adversariales, ce qui engendre une sous-estimation systématique des sinistres détectée plusieurs mois plus tard.

Termes associés
Également connu sous

adversarial examples, exemples adversariaux, perturbations adversariales, adversarial inputs, exemples adverses