Lição 7 de 8 · 3 min

O pré-treino e as leis de escala

Como um modelo aprende ao prever a palavra seguinte em biliões de tokens, e o que as leis de escala revelaram.

ObjetivoDescrever o pré-treino e explicar o que dizem as leis de escala sobre o tamanho dos modelos e dos dados.

O pré-treino é a fase mais longa e mais dispendiosa. O modelo lê um corpus de textos muito grande e, em cada posição, tenta prever o token seguinte. Quando se engana, os seus parâmetros são ligeiramente corrigidos. Repetida biliões de vezes, esta correção faz emergir a gramática, conhecimentos e maneiras de raciocinar.

  1. Pré-treinoPrever a palavra seguinte num corpus de textos muito grande.
  2. AfinaçãoAprender a seguir instruções a partir de exemplos redigidos.
  3. AlinhamentoPreferir as respostas que as pessoas consideram úteis e seguras.
  4. UtilizaçãoO modelo está congelado. Não retém nada das suas conversas.
As grandes etapas da vida de um modelo de linguagem.

O que as leis de escala mostraram

Em 2020, investigadores medem que o erro de um modelo baixa de forma regular e previsível quando se aumenta o tamanho do modelo, a quantidade de dados e a computação. Esta regularidade orientou toda a corrida ao tamanho que se seguiu.

Em 2022, o estudo conhecido como Chinchilla corrige o rumo. Com o mesmo orçamento de computação, muitos modelos eram demasiado grandes e não suficientemente treinados. Um modelo mais pequeno alimentado com mais dados saía-se melhor. A referência muitas vezes adotada é de cerca de vinte tokens de treino por parâmetro.

Referências

  1. Kaplan, McCandlish, Henighan et al. (2020). Scaling Laws for Neural Language Models. Pré-publicação no arXiv. arxiv.org/abs/2001.08361
  2. Hoffmann, Borgeaud, Mensch et al. (2022). Training Compute-Optimal Large Language Models. Pré-publicação no arXiv. arxiv.org/abs/2203.15556
  3. Brown, Mann, Ryder et al. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems 33, p. 1877–1901. arxiv.org/abs/2005.14165