Suivre des instructions : ajustement et alignement
Pourquoi un modèle brut complète du texte au lieu de répondre, et comment on lui apprend à être utile et prudent.
ZielDistinguer l’ajustement par instructions, l’apprentissage par préférences humaines et l’alignement par principes.
Un modèle seulement pré-entraîné ne répond pas à une question. Il la continue. À « Rédige un courriel de relance », il peut ajouter d’autres consignes au lieu d’écrire le courriel. Il faut donc lui apprendre le rôle d’assistant.
- Ajustement par instructions. Des personnes rédigent des milliers de couples demande et bonne réponse, et le modèle s’entraîne dessus.
- Apprentissage par préférences. Pour une même demande, des personnes classent plusieurs réponses. Un second modèle apprend à prédire ces préférences, puis guide le premier.
- Alignement par principes. Le modèle critique et réécrit ses propres réponses selon une liste de principes écrits, ce qui réduit le besoin d’annotations humaines.
L’effet est considérable. Dans l’étude InstructGPT de 2022, les évaluateurs préféraient les réponses d’un modèle aligné de 1,3 milliard de paramètres à celles du modèle brut de 175 milliards.
Ce que l’alignement ne fait pas
- Il ne rend pas le modèle infaillible. Il le rend plus coopératif, ce qui peut aussi le rendre trop complaisant.
- Il reflète les choix des personnes et des principes qui l’ont guidé.
- Il ne remplace pas vos garde-fous. Les approbations de Learnya restent la dernière barrière avant une action.
Quellen
- Ouyang, Wu, Jiang et al. (2022). Training language models to follow instructions with human feedback. Advances in Neural Information Processing Systems 35, p. 27730–27744. arxiv.org/abs/2203.02155
- Bai, Kadavath, Kundu et al. (2022). Constitutional AI: Harmlessness from AI Feedback. Prépublication arXiv. arxiv.org/abs/2212.08073