Lezione 8 di 8 · 3 min

Seguire istruzioni: fine-tuning e allineamento

Perché un modello di base completa il testo invece di rispondere, e come gli si insegna a essere utile e prudente.

ObiettivoDistinguere il fine-tuning su istruzioni, l’apprendimento dalle preferenze umane e l’allineamento basato su principi.

Un modello soltanto pre-addestrato non risponde a una domanda. La continua. A «Scrivi un’e-mail di sollecito», può aggiungere altre istruzioni invece di scrivere l’e-mail. Bisogna quindi insegnargli il ruolo di assistente.

  1. Fine-tuning su istruzioni. Alcune persone redigono migliaia di coppie richiesta e risposta corretta, e il modello si addestra su di esse.
  2. Apprendimento dalle preferenze. Per una stessa richiesta, alcune persone classificano più risposte. Un secondo modello impara a prevedere queste preferenze, poi guida il primo.
  3. Allineamento basato su principi. Il modello critica e riscrive le proprie risposte secondo un elenco di principi scritti, il che riduce il bisogno di annotazioni umane.

L’effetto è notevole. Nello studio InstructGPT del 2022, i valutatori preferivano le risposte di un modello allineato da 1,3 miliardi di parametri a quelle del modello di base da 175 miliardi.

Cosa non fa l’allineamento

  • Non rende il modello infallibile. Lo rende più cooperativo, il che può anche renderlo troppo compiacente.
  • Riflette le scelte delle persone e dei principi che lo hanno guidato.
  • Non sostituisce le vostre salvaguardie. Le approvazioni di Learnya restano l’ultima barriera prima di un’azione.

Riferimenti

  1. Ouyang, Wu, Jiang et al. (2022). Training language models to follow instructions with human feedback. Advances in Neural Information Processing Systems 35, p. 27730–27744. arxiv.org/abs/2203.02155
  2. Bai, Kadavath, Kundu et al. (2022). Constitutional AI: Harmlessness from AI Feedback. Preprint arXiv. arxiv.org/abs/2212.08073