Lição 5 de 8 · 6 min

Camadas empilhadas e milhares de milhões de parâmetros

O que são os parâmetros de um modelo, e porque é que o seu número contou tanto.

ObjetivoDescrever o empilhamento das camadas de um transformer e o que representa um parâmetro.

Um transformer empilha blocos idênticos. Cada bloco contém uma etapa de atenção, que faz circular a informação entre os tokens, e depois uma pequena rede que transforma cada token separadamente. O vetor de um token é assim retrabalhado camada após camada, cada vez mais carregado de contexto.

Os parâmetros são os números ajustados durante o treino. Definem os embeddings, os cálculos de atenção e as pequenas redes. O modelo GPT-3, publicado em 2020, tinha 175 mil milhões de parâmetros distribuídos por 96 camadas. Os seus autores mostraram que, a esta escala, um modelo podia realizar uma tarefa a partir de alguns exemplos dados no pedido, sem novo treino.

O que os parâmetros não são

  • Não são fichas de conhecimento. Nenhum parâmetro contém «a capital da Suíça».
  • O conhecimento está repartido por milhões de parâmetros ao mesmo tempo, o que o torna robusto mas difícil de corrigir ponto por ponto.
  • Mais parâmetros não garantem um modelo melhor. A quantidade e a qualidade dos dados contam tanto quanto isso.

Referências

  1. Vaswani, Shazeer, Parmar et al. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems 30. arxiv.org/abs/1706.03762
  2. Brown, Mann, Ryder et al. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems 33, p. 1877–1901. arxiv.org/abs/2005.14165