Anweisungen befolgen: Tuning und Alignment
Warum ein Basismodell Text fortsetzt, statt zu antworten, und wie man ihm beibringt, nützlich und vorsichtig zu sein.
ZielInstruction Tuning, Lernen aus menschlichen Präferenzen und Alignment anhand von Prinzipien voneinander unterscheiden.
Ein Modell, das nur vortrainiert ist, beantwortet keine Frage. Es setzt sie fort. Auf «Schreibe eine Nachfass-E-Mail» fügt es womöglich weitere Anweisungen hinzu, statt die E-Mail zu schreiben. Man muss ihm also die Rolle des Assistenten beibringen.
- Instruction Tuning. Menschen verfassen Tausende von Paaren aus Anfrage und guter Antwort, und das Modell wird damit trainiert.
- Lernen aus Präferenzen. Für dieselbe Anfrage bringen Menschen mehrere Antworten in eine Rangfolge. Ein zweites Modell lernt, diese Präferenzen vorherzusagen, und steuert dann das erste.
- Alignment anhand von Prinzipien. Das Modell kritisiert und überarbeitet seine eigenen Antworten nach einer Liste schriftlicher Prinzipien, was den Bedarf an menschlichen Annotationen verringert.
Die Wirkung ist beträchtlich. In der InstructGPT-Studie von 2022 zogen die Bewertenden die Antworten eines ausgerichteten Modells mit 1,3 Milliarden Parametern denen des Basismodells mit 175 Milliarden vor.
Was Alignment nicht leistet
- Es macht das Modell nicht unfehlbar. Es macht es kooperativer, was es auch zu gefällig machen kann.
- Es spiegelt die Entscheidungen der Menschen und Prinzipien wider, die es geleitet haben.
- Es ersetzt Ihre Schutzmechanismen nicht. Die Freigaben von Learnya bleiben die letzte Hürde vor einer Aktion.
Quellen
- Ouyang, Wu, Jiang et al. (2022). Training language models to follow instructions with human feedback. Advances in Neural Information Processing Systems 35, p. 27730–27744. arxiv.org/abs/2203.02155
- Bai, Kadavath, Kundu et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv-Preprint. arxiv.org/abs/2212.08073