Strati sovrapposti e miliardi di parametri
Cosa sono i parametri di un modello, e perché il loro numero ha contato così tanto.
ObiettivoDescrivere la sovrapposizione degli strati di un transformer e cosa rappresenta un parametro.
Un transformer sovrappone blocchi identici. Ogni blocco contiene una fase di attenzione, che fa circolare l’informazione tra i token, poi una piccola rete che trasforma ogni token separatamente. Il vettore di un token viene così rielaborato strato dopo strato, sempre più carico di contesto.
I parametri sono i numeri regolati durante l’addestramento. Definiscono gli embedding, i calcoli di attenzione e le piccole reti. Il modello GPT-3, pubblicato nel 2020, contava 175 miliardi di parametri distribuiti su 96 strati. I suoi autori hanno mostrato che, a questa scala, un modello poteva svolgere un compito a partire da pochi esempi forniti nella richiesta, senza essere riaddestrato.
Cosa non sono i parametri
- Non sono schede di conoscenze. Nessun parametro contiene «la capitale della Svizzera».
- Il sapere è distribuito su milioni di parametri contemporaneamente, il che lo rende robusto ma difficile da correggere punto per punto.
- Più parametri non garantiscono un modello migliore. La quantità e la qualità dei dati contano altrettanto.
Riferimenti
- Vaswani, Shazeer, Parmar et al. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems 30. arxiv.org/abs/1706.03762
- Brown, Mann, Ryder et al. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems 33, p. 1877–1901. arxiv.org/abs/2005.14165