Seguire istruzioni: fine-tuning e allineamento
Perché un modello di base completa il testo invece di rispondere, e come gli si insegna a essere utile e prudente.
ObiettivoDistinguere il fine-tuning su istruzioni, l’apprendimento dalle preferenze umane e l’allineamento basato su principi.
Un modello soltanto pre-addestrato non risponde a una domanda. La continua. A «Scrivi un’e-mail di sollecito», può aggiungere altre istruzioni invece di scrivere l’e-mail. Bisogna quindi insegnargli il ruolo di assistente.
- Fine-tuning su istruzioni. Alcune persone redigono migliaia di coppie richiesta e risposta corretta, e il modello si addestra su di esse.
- Apprendimento dalle preferenze. Per una stessa richiesta, alcune persone classificano più risposte. Un secondo modello impara a prevedere queste preferenze, poi guida il primo.
- Allineamento basato su principi. Il modello critica e riscrive le proprie risposte secondo un elenco di principi scritti, il che riduce il bisogno di annotazioni umane.
L’effetto è notevole. Nello studio InstructGPT del 2022, i valutatori preferivano le risposte di un modello allineato da 1,3 miliardi di parametri a quelle del modello di base da 175 miliardi.
Cosa non fa l’allineamento
- Non rende il modello infallibile. Lo rende più cooperativo, il che può anche renderlo troppo compiacente.
- Riflette le scelte delle persone e dei principi che lo hanno guidato.
- Non sostituisce le vostre salvaguardie. Le approvazioni di Learnya restano l’ultima barriera prima di un’azione.
Riferimenti
- Ouyang, Wu, Jiang et al. (2022). Training language models to follow instructions with human feedback. Advances in Neural Information Processing Systems 35, p. 27730–27744. arxiv.org/abs/2203.02155
- Bai, Kadavath, Kundu et al. (2022). Constitutional AI: Harmlessness from AI Feedback. Preprint arXiv. arxiv.org/abs/2212.08073