Lição 4 de 8 · 3 min

A atenção, ou ler o texto todo de uma vez

O mecanismo que permite a cada palavra ter em conta todas as outras, no centro de todos os grandes modelos atuais.

ObjetivoExplicar com um exemplo o que a atenção calcula e porque substituiu as arquiteturas anteriores.

Em 2017, uma equipa da Google publica «Attention Is All You Need» e apresenta o transformer. A sua ideia principal é a atenção. Para cada token, o modelo calcula até que ponto cada um dos outros tokens do texto é útil para o interpretar, e depois mistura as informações deles em conformidade.

Tomemos «O gato dorme porque está muito cansado». O português omite o pronome sujeito. Para compreender «está», o modelo tem de saber que o sujeito é o gato. A atenção atribui um peso elevado a «gato» quando processa «está». Nada disto é programado à mão. Os pesos são aprendidos.

A que presta atenção «está»?

O4 %gato62 %dorme9 %porque3 %está12 %muito4 %cansado6 %
Pesos de atenção ilustrativos para a palavra «está». Um modelo real calcula pesos destes em dezenas de cabeças e de camadas.

Porque é decisivo

  • Todos os tokens são processados em paralelo, o que torna possível o treino em corpora enormes com processadores gráficos (GPU).
  • Uma palavra pode ligar-se diretamente a outra colocada muito longe no texto.
  • Várias cabeças de atenção trabalham lado a lado. Uma pode seguir a gramática, outra as referências, outra o tema.

Referências

  1. Vaswani, Shazeer, Parmar et al. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems 30. arxiv.org/abs/1706.03762