Retour au glossaireIA

Alignement par retours humains

Procédé qui ajuste un modèle sur des préférences humaines comparées plutôt que sur des réponses correctes, et qui reporte la subjectivité sur le choix des annotateurs.

Définition

Un modèle entraîné à prédire la suite d'un texte reproduit ce qui se dit et non ce qui est utile ou acceptable, écart que l'alignement cherche à combler. Le procédé le plus répandu ne présente pas au modèle des réponses correctes, qui n'existent pas pour la plupart des demandes, mais des paires de réponses classées par des annotateurs humains. Ces classements servent à entraîner un modèle de récompense, qui sert à son tour à ajuster le modèle principal. La chaîne est efficace et elle déplace la subjectivité sans la supprimer : les jugements de quelques milliers d'annotateurs, recrutés selon des critères et guidés par des consignes qui ne sont presque jamais publiés, se retrouvent incorporés dans un système employé par des centaines de millions de personnes. Cette opacité est le point sur lequel porte l'essentiel de la critique, davantage que la technique elle-même. Elle intéresse directement la souscription, puisqu'un comportement acquis par préférences ne se documente pas comme une règle et ne s'audite pas en lisant le code.

Exemple

L'article Training language models to follow instructions with human feedback, publié en mars 2022, a décrit l'application de ce procédé et montré qu'un modèle nettement plus petit ainsi ajusté était préféré par les évaluateurs humains à un modèle bien plus grand qui ne l'était pas.

Termes associés
Articles liés
Également connu sous

RLHF, reinforcement learning from human feedback, alignement par préférences