Distinction entre la phase intensive d'apprentissage d'un modèle IA et la phase d'exploitation produisant les réponses.
Les charges d'entraînement et d'inférence correspondent aux deux grands régimes d'usage de l'infrastructure d'intelligence artificielle. L'entraînement est la phase d'apprentissage du modèle, extrêmement intensive en calcul, concentrée sur de longues sessions mobilisant des milliers de processeurs en parallèle, avec une densité thermique très élevée. L'inférence est la phase d'exploitation, où le modèle produit des réponses à des requêtes, moins intensive par requête mais massivement distribuée et continue. Cette distinction structure le profil de risque de l'infrastructure: l'entraînement concentre la valeur et la chaleur dans de grands centres spécialisés, tandis que l'inférence se déploie souvent en périphérie au plus près des utilisateurs. Pour l'assurance, les deux régimes appellent des analyses distinctes: l'entraînement relève d'une logique de site critique à haute densité, l'inférence d'une logique de parc distribué et de disponibilité de service. La répartition entre les deux conditionne la nature et la localisation de l'exposition.
Un centre dédié à l'entraînement concentre le risque thermique de pointe, tandis qu'un réseau de serveurs d'inférence répartit le risque de disponibilité de service sur de nombreux sites.
training vs inference, charge d'entraînement, charge d'inférence, inference workload