Retour au glossaireIA

Données synthétiques

Données générées algorithmiquement qui reproduisent les propriétés statistiques de données réelles sans contenir d'information sur des individus existants, utilisées pour entraîner des modèles ou tester des systèmes.

Définition

Les données synthétiques sont produites par des algorithmes, typiquement des modèles génératifs comme les GANs, les VAEs ou, plus récemment, les diffusion models et les LLM, pour imiter les distributions statistiques d'un jeu de données réel sans copier les enregistrements individuels. En actuariat, leur intérêt est double : elles permettent d'étendre des jeux de données insuffisamment volumineux pour entraîner des modèles robustes, notamment pour des sous-populations rares comme les sinistres graves, et elles offrent une voie vers la conformité RGPD en supprimant le lien avec des personnes identifiables. Dans le secteur de l'assurance, elles sont également utilisées pour simuler des scénarios de sinistres catastrophiques que les données historiques ne couvrent pas, notamment pour la modélisation d'événements cyber systémiques. La principale difficulté est la validation : une donnée synthétique qui préserve parfaitement la marginalité de chaque variable mais ne capture pas les corrélations extrêmes peut conduire à une sous-estimation du risque de queue. La question de la fidelity, de la diversity et de la privacy est au cour des standards émergents en matière d'évaluation de données synthétiques. Le lien avec le red teaming IA est direct : des données synthétiques adversariales peuvent servir à tester la robustesse d'un modèle face à des distributions hors de son entraînement.

Exemple

Un réassureur souhaite entraîner un modèle de tarification cyber sur des données de sinistres historiques, mais son portefeuille ne compte que 300 sinistres majeurs en dix ans. Il génère 50 000 sinistres synthétiques à l'aide d'un modèle diffusion conditionné sur ses données réelles, après avoir validé que les distributions marginales et les corrélations de queue sont correctement reproduites. Le modèle résultant améliore la calibration sur les sinistres de grande taille de 22 %.

Termes associés
Également connu sous

synthetic data, données synthétiques, données générées, données simulées, data augmentation