Il pre-addestramento e le leggi di scala
Come un modello impara prevedendo la parola successiva su migliaia di miliardi di token, e cosa hanno rivelato le leggi di scala.
ObiettivoDescrivere il pre-addestramento e spiegare cosa dicono le leggi di scala sulla dimensione dei modelli e dei dati.
Il pre-addestramento è la fase più lunga e più costosa. Il modello legge un grandissimo corpus di testi e, in ogni posizione, cerca di prevedere il token successivo. Quando sbaglia, i suoi parametri vengono leggermente corretti. Ripetuta migliaia di miliardi di volte, questa correzione fa emergere la grammatica, conoscenze e modi di ragionare.
- Pre-addestramentoPrevedere la parola successiva su un vastissimo corpus di testi.
- Messa a puntoImparare a seguire istruzioni a partire da esempi scritti.
- AllineamentoPreferire le risposte che le persone giudicano utili e sicure.
- UsoIl modello è congelato. Non trattiene nulla dei vostri scambi.
Cosa hanno mostrato le leggi di scala
Nel 2020 alcuni ricercatori misurano che l’errore di un modello diminuisce in modo regolare e prevedibile quando si aumentano la dimensione del modello, la quantità di dati e il calcolo. Questa regolarità ha orientato tutta la corsa alle dimensioni che è seguita.
Nel 2022 lo studio detto Chinchilla corregge il tiro. A parità di budget di calcolo, molti modelli erano troppo grandi e non abbastanza addestrati. Un modello più piccolo alimentato con più dati faceva meglio. Il riferimento spesso adottato è di circa venti token di addestramento per parametro.
Riferimenti
- Kaplan, McCandlish, Henighan et al. (2020). Scaling Laws for Neural Language Models. Preprint arXiv. arxiv.org/abs/2001.08361
- Hoffmann, Borgeaud, Mensch et al. (2022). Training Compute-Optimal Large Language Models. Preprint arXiv. arxiv.org/abs/2203.15556
- Brown, Mann, Ryder et al. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems 33, p. 1877–1901. arxiv.org/abs/2005.14165