Lección 4 de 8 · 3 min

La atención, o leer todo el texto a la vez

El mecanismo que permite a cada palabra tener en cuenta todas las demás, en el centro de todos los grandes modelos actuales.

ObjetivoExplicar con un ejemplo qué calcula la atención y por qué sustituyó a las arquitecturas anteriores.

En 2017, un equipo de Google publica «Attention Is All You Need» y presenta el transformer. Su idea principal es la atención (attention). Para cada token, el modelo calcula en qué medida cada uno de los demás tokens del texto es útil para interpretarlo, y después mezcla su información en consecuencia.

Tomemos «El gato duerme porque está muy cansado». El español omite el pronombre sujeto, así que «está» no dice por sí solo de quién se habla. Para interpretarlo, el modelo debe saber que se refiere al gato. La atención asigna un peso alto a «gato» cuando procesa «está». Nada de esto se programa a mano. Los pesos se aprenden.

¿A qué presta atención «está»?

El4 %gato62 %duerme9 %porque3 %está12 %muy4 %cansado6 %
Pesos de atención ilustrativos para la palabra «está». Un modelo real calcula pesos así en decenas de cabezas y de capas.

Por qué es decisivo

  • Todos los tokens se procesan en paralelo, lo que hace posible el entrenamiento con corpus enormes mediante procesadores gráficos (GPU).
  • Una palabra puede relacionarse directamente con otra situada muy lejos en el texto.
  • Varias cabezas de atención trabajan una al lado de otra. Una puede seguir la gramática, otra las referencias, otra el tema.

Referencias

  1. Vaswani, Shazeer, Parmar et al. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems 30. arxiv.org/abs/1706.03762