Lezione 7 di 8 · 3 min

Il pre-addestramento e le leggi di scala

Come un modello impara prevedendo la parola successiva su migliaia di miliardi di token, e cosa hanno rivelato le leggi di scala.

ObiettivoDescrivere il pre-addestramento e spiegare cosa dicono le leggi di scala sulla dimensione dei modelli e dei dati.

Il pre-addestramento è la fase più lunga e più costosa. Il modello legge un grandissimo corpus di testi e, in ogni posizione, cerca di prevedere il token successivo. Quando sbaglia, i suoi parametri vengono leggermente corretti. Ripetuta migliaia di miliardi di volte, questa correzione fa emergere la grammatica, conoscenze e modi di ragionare.

  1. Pre-addestramentoPrevedere la parola successiva su un vastissimo corpus di testi.
  2. Messa a puntoImparare a seguire istruzioni a partire da esempi scritti.
  3. AllineamentoPreferire le risposte che le persone giudicano utili e sicure.
  4. UsoIl modello è congelato. Non trattiene nulla dei vostri scambi.
Le grandi tappe della vita di un modello linguistico.

Cosa hanno mostrato le leggi di scala

Nel 2020 alcuni ricercatori misurano che l’errore di un modello diminuisce in modo regolare e prevedibile quando si aumentano la dimensione del modello, la quantità di dati e il calcolo. Questa regolarità ha orientato tutta la corsa alle dimensioni che è seguita.

Nel 2022 lo studio detto Chinchilla corregge il tiro. A parità di budget di calcolo, molti modelli erano troppo grandi e non abbastanza addestrati. Un modello più piccolo alimentato con più dati faceva meglio. Il riferimento spesso adottato è di circa venti token di addestramento per parametro.

Riferimenti

  1. Kaplan, McCandlish, Henighan et al. (2020). Scaling Laws for Neural Language Models. Preprint arXiv. arxiv.org/abs/2001.08361
  2. Hoffmann, Borgeaud, Mensch et al. (2022). Training Compute-Optimal Large Language Models. Preprint arXiv. arxiv.org/abs/2203.15556
  3. Brown, Mann, Ryder et al. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems 33, p. 1877–1901. arxiv.org/abs/2005.14165