Lezione 5 di 8 · 6 min

Strati sovrapposti e miliardi di parametri

Cosa sono i parametri di un modello, e perché il loro numero ha contato così tanto.

ObiettivoDescrivere la sovrapposizione degli strati di un transformer e cosa rappresenta un parametro.

Un transformer sovrappone blocchi identici. Ogni blocco contiene una fase di attenzione, che fa circolare l’informazione tra i token, poi una piccola rete che trasforma ogni token separatamente. Il vettore di un token viene così rielaborato strato dopo strato, sempre più carico di contesto.

I parametri sono i numeri regolati durante l’addestramento. Definiscono gli embedding, i calcoli di attenzione e le piccole reti. Il modello GPT-3, pubblicato nel 2020, contava 175 miliardi di parametri distribuiti su 96 strati. I suoi autori hanno mostrato che, a questa scala, un modello poteva svolgere un compito a partire da pochi esempi forniti nella richiesta, senza essere riaddestrato.

Cosa non sono i parametri

  • Non sono schede di conoscenze. Nessun parametro contiene «la capitale della Svizzera».
  • Il sapere è distribuito su milioni di parametri contemporaneamente, il che lo rende robusto ma difficile da correggere punto per punto.
  • Più parametri non garantiscono un modello migliore. La quantità e la qualità dei dati contano altrettanto.

Riferimenti

  1. Vaswani, Shazeer, Parmar et al. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems 30. arxiv.org/abs/1706.03762
  2. Brown, Mann, Ryder et al. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems 33, p. 1877–1901. arxiv.org/abs/2005.14165