Ensemble des modèles, jeux de données et bibliothèques repris de tiers dans un système d'IA, dont la reprise se fait le plus souvent sans vérification.
Peu d'organisations entraînent un modèle depuis l'origine : elles partent d'un modèle publié, l'ajustent sur leurs propres données, y ajoutent des jeux de données et des bibliothèques venus de dépôts publics. Cette chaîne reproduit celle du logiciel libre, avec deux différences qui aggravent le risque. Un fichier de poids n'est pas lisible, si bien qu'aucune revue de code n'y détecte quoi que ce soit, et les formats de sérialisation employés permettent, pour certains d'entre eux, l'exécution de code arbitraire au chargement du modèle, ce qui transforme un téléchargement en exécution. S'y ajoute une difficulté de provenance, les licences des modèles publics étant hétérogènes et parfois incompatibles avec un usage commercial, et les données d'entraînement rarement documentées, si bien qu'un déployeur hérite d'expositions qu'il ne peut pas inventorier. Les remèdes reprennent ceux du logiciel, inventaire des composants, signature des artefacts et préférence pour les formats de sérialisation qui n'exécutent rien, le dernier point étant le plus efficace et le plus simple à imposer.
Une équipe de recherche en sécurité a signalé en février 2024 la présence, sur une grande plateforme publique de partage de modèles, d'une centaine de modèles contenant du code malveillant exécuté au chargement, exploitant un format de sérialisation permettant l'exécution arbitraire.
AI supply chain, poids ouverts, open weights, dépôt de modèles