Des trois entrées d'un modèle, l'aléa vient d'une science, la vulnérabilité d'une ingénierie, et l'exposition vient d'un fichier que l'assureur a constitué lui-même. C'est la seule des trois qu'il maîtrise entièrement, et c'est de très loin celle qui dégrade le plus ses résultats. Un modèle excellent nourri d'une exposition médiocre rend un chiffre médiocre, présenté avec toute l'autorité du modèle. Il n'existe aucun traitement en aval qui répare cela, et c'est pourquoi la qualité de l'exposition est un sujet de souscription et non un sujet informatique.
Le premier attribut est la localisation, et il se décline en niveaux de résolution qu'il faut savoir nommer. Une coordonnée relevée sur le bâtiment est le niveau le plus fin. Une adresse postale géocodée en est proche, à quelques dizaines de mètres près. Un code postal ramené à son centroïde est tout autre chose : sur une commune étendue, l'écart entre le centroïde et le site réel atteint plusieurs kilomètres, ce qui, pour un péril d'inondation dont l'intensité varie sur cent mètres, revient à ne pas savoir où est le risque. Le modèle, lui, calculera sans se plaindre.
L'effet de cette agrégation n'est pas un bruit symétrique qui s'annulerait sur un grand nombre de contrats, et c'est la subtilité qui mérite d'être comprise. Regrouper au centroïde lisse les intensités : les sites réellement très exposés reçoivent une intensité moyenne trop faible, les sites protégés en reçoivent une trop forte. Sur la moyenne du portefeuille l'erreur peut sembler se compenser ; sur la QUEUE, elle ne se compense pas, parce que la queue est faite précisément des sites les plus exposés, ceux que le lissage a rapatriés vers la moyenne. Un portefeuille agrégé annonce donc une perte extrême trop basse, et il l'annonce de manière systématique.
Le deuxième attribut est la valeur, et il porte deux pièges indépendants. Le premier est la base : une valeur comptable nette, une valeur d'achat ancienne et une valeur de reconstruction à neuf ne décrivent pas le même montant, et l'écart atteint couramment un facteur deux sur un bâtiment industriel ancien. Le second est le périmètre : bâtiment seul, bâtiment et contenu, avec ou sans la perte d'exploitation. Un modèle appliquant un taux de destruction à une valeur qui n'est pas celle sur laquelle la courbe a été calibrée produit une erreur proportionnelle, invisible et non aléatoire.
Le troisième attribut est la description du bien : classe constructive, année, nombre de niveaux, occupation, présence d'un sous-sol, hauteur du premier plancher. Ces champs sont rarement remplis en totalité, et ce qui manque n'est pas laissé vide par le modèle : il applique une valeur par défaut, généralement la moyenne de la région. Un portefeuille dont la moitié des champs constructifs est absente est donc modélisé pour moitié comme un bâtiment moyen régional, ce qui efface exactement les différences que l'on cherchait à mesurer.
Il faut ajouter la manière dont les protections et les franchises sont transmises, parce que c'est l'endroit où l'on perd des montants entiers sans s'en rendre compte. Un site protégé par un mur de retenue dont l'existence n'est pas dans le fichier est modélisé sans ce mur. Une franchise légale ou contractuelle non transmise donne une perte brute traitée comme si elle était nette. Une sous-limite par site ignorée laisse le modèle monter au-delà de ce que le contrat peut payer. Aucun de ces écarts ne se voit dans la sortie : le tableau sort formaté, avec ses périodes de retour, et rien n'y signale ce qui n'a pas été dit.
La conduite à tenir tient en trois habitudes bon marché. On mesure la qualité de l'exposition avant de mesurer le risque : part des sites géocodés au bâtiment, part des champs constructifs renseignés, base des valeurs, et l'on publie ces trois taux à côté de chaque résultat. On teste la sensibilité en dégradant volontairement une part du portefeuille au centroïde, pour savoir combien coûte l'agrégation sur ce portefeuille précis. Et l'on traite l'amélioration des données comme un chantier de souscription avec un ordre de priorité, en commençant par les sites qui pèsent le plus dans la queue, parce que corriger dix mille adresses sans importance coûte autant que d'en corriger cent qui décident.
Un assureur reprend un portefeuille d'entreprises de 1,9 milliard d'euros de valeurs assurées, apporté par un courtier. Le fichier transmis comporte 3 100 sites, dont 2 250 géocodés à l'adresse et 850 rattachés au centroïde de leur code postal, ces derniers représentant 640 millions de valeurs. La classe constructive est renseignée pour 61 % des sites. Les valeurs sont déclarées en valeur de reconstruction pour les bâtiments, mais la colonne de perte d'exploitation est vide sur l'ensemble du fichier alors que 1 400 contrats en portent une au contrat. Le modèle rend une perte bicentennale de 74 millions pour l'inondation. Le comité doit se prononcer sur une reprise. Que dire de ce chiffre ?
Le chiffre de 74 millions n'est pas approximatif, il est biaisé, et les trois défauts du fichier poussent dans la même direction, vers le bas. Les 850 sites au centroïde pèsent un tiers des valeurs et ils sont modélisés sur une intensité lissée : ce lissage rapatrie vers la moyenne les sites réellement les plus exposés, or ce sont eux qui font la queue de distribution, c'est-à-dire précisément le nombre bicentennal que le comité regarde. L'erreur n'est donc pas symétrique et ne s'annule pas sur le nombre de sites. Les 39 % de classes constructives absentes sont remplacés par la moyenne régionale, ce qui efface la sensibilité que l'on achète en payant un modèle et rend la sortie moins discriminante qu'un tarif de zone. Et la colonne de perte d'exploitation vide fait que le modèle ne rend qu'une charge matérielle, alors que le portefeuille en porte une sur 1 400 contrats : sur un péril d'inondation, où l'arrêt d'activité dure des semaines, c'est le terme qui peut dominer la charge, et il est ici absent par construction et non par décision. Ce qu'il faut demander avant de se prononcer se chiffre en jours de travail et pas en euros. D'abord un géocodage à l'adresse des 850 sites, en commençant par les plus gros en valeur, puisqu'ils décident de la queue. Ensuite une mesure du coût de l'agrégation sur ce portefeuille, obtenue en dégradant volontairement au centroïde un échantillon de sites bien localisés : c'est le seul moyen d'annoncer un ordre de grandeur du biais plutôt que de l'évoquer. Enfin la reprise des montants de perte d'exploitation, faute de quoi le chiffre présenté ne répond pas à la question posée. Se prononcer sur 74 millions en l'état reviendrait à décider sur une mesure dont on connaît le sens de l'erreur et pas son ampleur.
- 01L'exposition est la seule des trois entrées que l'assureur maîtrise entièrement, et c'est celle qui dégrade le plus ses résultats.
- 02Le rattachement au centroïde d'un code postal ne fait pas du bruit : il lisse les intensités et sous-estime la queue de façon systématique.
- 03Une valeur comptable là où la courbe attend une valeur de reconstruction produit une erreur proportionnelle, invisible et non aléatoire.
- 04Un champ constructif absent n'est pas laissé vide : le modèle applique une moyenne régionale, et efface la sensibilité qu'on paie pour obtenir.
- 05Protections, franchises et sous-limites non transmises ne se voient jamais dans la sortie : le tableau sort formaté et ne signale pas ce qui n'a pas été dit.