Dispositifs limitant les comportements indésirables d'un système d'IA, dont l'efficacité reste imparfaite face aux tentatives de contournement.
Les garde-fous sont l'ensemble des dispositifs destinés à limiter les comportements indésirables d'un système d'intelligence artificielle, en l'empêchant de produire des contenus dangereux, illégaux, biaisés ou contraires à l'usage prévu. Ils prennent des formes variées, filtres en entrée et en sortie, règles explicites, modération automatique, contraintes intégrées lors de l'entraînement, ou couches de vérification surveillant les réponses du modèle. Leur fonction est de rendre le système utilisable en réduisant ses risques, et ils constituent une composante essentielle du déploiement responsable de l'IA. Leur limite fondamentale est qu'ils ne sont ni parfaits ni infaillibles. Les techniques de contournement, jailbreak ou injection de requête, évoluent continuellement pour les déjouer, et un garde-fou peut aussi être affaibli involontairement, par exemple lors d'un réglage fin mal maîtrisé. Cette imperfection nourrit un risque particulier, celui du faux sentiment de sécurité, une organisation pouvant se croire protégée par des garde-fous qu'elle surestime, et relâcher sa vigilance en conséquence. Pour l'assurance et la responsabilité, la question devient celle du standard attendu, à savoir quel niveau de garde-fous une organisation doit raisonnablement mettre en place, et comment apprécier sa diligence lorsqu'un système contourné cause un dommage.
Une entreprise déploie un assistant doté de garde-fous censés bloquer les contenus sensibles. Un utilisateur les contourne par un jailbreak habile, et le système produit une réponse préjudiciable, posant la question de savoir si les garde-fous étaient à la hauteur du risque.
garde-fous, guardrails, barrières de sécurité, filtres de sécurité