Lezione 4 di 8 · 3 min

L’attenzione, ovvero leggere tutto il testo in una volta

Il meccanismo che permette a ogni parola di tenere conto di tutte le altre, al centro di tutti i grandi modelli attuali.

ObiettivoSpiegare con un esempio cosa calcola l’attenzione e perché ha sostituito le architetture precedenti.

Nel 2017 un team di Google pubblica «Attention Is All You Need» e presenta il transformer. La sua idea chiave è l’attenzione. Per ogni token, il modello calcola quanto ciascuno degli altri token del testo sia utile per interpretarlo, poi ne combina le informazioni di conseguenza.

Prendiamo «Il gatto dorme quando lo accarezzi piano». Per capire «lo», il modello deve sapere che indica il gatto. L’attenzione assegna un peso elevato a «gatto» quando elabora «lo». Nulla di tutto ciò è programmato a mano. I pesi vengono appresi.

A che cosa presta attenzione «lo»?

Il4 %gatto62 %dorme9 %quando3 %lo12 %accarezzi4 %piano6 %
Pesi di attenzione illustrativi per la parola «lo». Un modello reale calcola pesi simili in decine di teste e di strati.

Perché è decisivo

  • Tutti i token vengono elaborati in parallelo, il che rende possibile l’addestramento su corpora enormi con i processori grafici.
  • Una parola può collegarsi direttamente a un’altra posta molto lontano nel testo.
  • Più teste di attenzione lavorano fianco a fianco. Una può seguire la grammatica, un’altra i riferimenti, un’altra l’argomento.

Riferimenti

  1. Vaswani, Shazeer, Parmar et al. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems 30. arxiv.org/abs/1706.03762