Retour au glossaireIA

Attaque par inversion de modèle

Attaque contre un modèle d'apprentissage automatique qui reconstruit des entrées représentatives des données d'entraînement à partir des sorties du modèle, permettant de retrouver des informations privées ou confidentielles.

Définition

L'attaque par inversion de modèle a été formalisée par Fredrikson et al. en 2015 dans un article montrant qu'en interrogeant un modèle de prédiction pharmaceutique répété sur des patients fictifs, il était possible de reconstruire les images de visages de patients ayant servi à l'entraînement d'un modèle de reconnaissance faciale médical. Elle diffère de l'attaque par inférence d'appartenance en ce qu'elle ne cherche pas à déterminer si un individu précis faisait partie du jeu d'entraînement, mais à reconstruire des représentations génériques des données privées qui ont façonné le modèle. Les techniques modernes d'inversion de modèle sur les générateurs d'images, dites GAN-inversion, permettent de reconstruire des images haute résolution de visages ou de documents médicaux en optimisant une entrée pour qu'elle produise la sortie cible. Pour les assureurs exploitant des modèles de tarification entraînés sur des données médicales ou comportementales confidentielles, ce type d'attaque soulève des questions de conformité RGPD, notamment au regard du principe de minimisation des données et de l'article 25 sur la protection des données dès la conception. La défense principale est la differential privacy lors de l'entraînement, qui perturbe les gradients de façon à limiter la mémorisation, au prix d'une légère dégradation de la performance prédictive. Ce compromis entre précision et protection de la vie privée est devenu un arbitrage central de la gouvernance IA en assurance.

Exemple

Un chercheur en sécurité interroge l'API d'un assureur proposant un devis santé instantané basé sur un modèle d'apprentissage. En soumettant 50 000 profils synthétiques et en analysant les variations de score, il reconstruit les profils médicaux types qui maximisent le risque estimé. Ces profils reconstruits correspondent avec précision aux patients diabétiques âgés figurant dans le jeu d'entraînement, dont les données avaient été pseudonymisées mais non rendues privées au sens différentiel.

Termes associés
Également connu sous

model inversion, inversion de modèle, reconstruction de données d'entraînement, model inversion attack