Retour au glossaireIA

Empoisonnement des données

Attaque consistant à corrompre délibérément les données d'entraînement d'un modèle pour en biaiser le comportement ou y insérer une porte dérobée.

Définition

L'empoisonnement des données est une attaque qui vise non pas le modèle déjà entraîné, mais la matière première dont il apprend, à savoir ses données d'entraînement. En introduisant subrepticement des exemples corrompus dans le jeu d'apprentissage, un attaquant peut altérer durablement le comportement du modèle, soit pour en dégrader la qualité de manière générale, soit, plus insidieusement, pour y dissimuler une porte dérobée qui ne se déclenchera que face à un signal précis connu de lui seul. Cette menace est particulièrement préoccupante parce qu'elle est difficile à détecter, le modèle paraissant fonctionner normalement dans la plupart des situations, et parce qu'elle exploite la dépendance des systèmes d'IA à d'immenses corpus de données souvent collectées sur Internet, dont la provenance et l'intégrité sont impossibles à garantir intégralement. L'empoisonnement déplace ainsi la surface d'attaque vers l'amont de la chaîne de production de l'IA, en faisant un cas particulier de risque sur la chaîne d'approvisionnement appliqué aux modèles. Pour l'assurance, il illustre une nouvelle catégorie de sinistre potentiel, latent et différé, où le dommage est semé bien avant de se manifester, ce qui complique considérablement la datation du fait générateur et son rattachement à une période de garantie.

Exemple

Un attaquant insère, dans les données publiques servant à entraîner un modèle, des exemples piégés qui lui apprennent à mal classer un type précis de document. La faille reste invisible jusqu'à ce que l'attaquant, des mois plus tard, l'exploite face au modèle déployé.

Termes associés
Également connu sous

data poisoning, empoisonnement de données, corruption des données d'entraînement