Capas apiladas y miles de millones de parámetros
Qué son los parámetros de un modelo y por qué su número ha importado tanto.
ObjetivoDescribir el apilamiento de capas de un transformer y lo que representa un parámetro.
Un transformer apila bloques idénticos. Cada bloque contiene una etapa de atención, que hace circular la información entre los tokens, y después una pequeña red que transforma cada token por separado. Así, el vector de un token se reelabora capa tras capa, cada vez más cargado de contexto.
Los parámetros son los números que se ajustan durante el entrenamiento. Definen los embeddings, los cálculos de atención y las pequeñas redes. El modelo GPT-3, publicado en 2020, tenía 175.000 millones de parámetros repartidos en 96 capas. Sus autores mostraron que, a esa escala, un modelo podía realizar una tarea a partir de unos pocos ejemplos incluidos en la petición, sin reentrenamiento.
Lo que no son los parámetros
- No son fichas de conocimiento. Ningún parámetro contiene «la capital de Suiza».
- El conocimiento está repartido entre millones de parámetros a la vez, lo que lo hace robusto pero difícil de corregir punto por punto.
- Más parámetros no garantizan un modelo mejor. La cantidad y la calidad de los datos importan igual.
Referencias
- Vaswani, Shazeer, Parmar et al. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems 30. arxiv.org/abs/1706.03762
- Brown, Mann, Ryder et al. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems 33, p. 1877–1901. arxiv.org/abs/2005.14165