O pré-treino e as leis de escala
Como um modelo aprende ao prever a palavra seguinte em biliões de tokens, e o que as leis de escala revelaram.
ObjetivoDescrever o pré-treino e explicar o que dizem as leis de escala sobre o tamanho dos modelos e dos dados.
O pré-treino é a fase mais longa e mais dispendiosa. O modelo lê um corpus de textos muito grande e, em cada posição, tenta prever o token seguinte. Quando se engana, os seus parâmetros são ligeiramente corrigidos. Repetida biliões de vezes, esta correção faz emergir a gramática, conhecimentos e maneiras de raciocinar.
- Pré-treinoPrever a palavra seguinte num corpus de textos muito grande.
- AfinaçãoAprender a seguir instruções a partir de exemplos redigidos.
- AlinhamentoPreferir as respostas que as pessoas consideram úteis e seguras.
- UtilizaçãoO modelo está congelado. Não retém nada das suas conversas.
O que as leis de escala mostraram
Em 2020, investigadores medem que o erro de um modelo baixa de forma regular e previsível quando se aumenta o tamanho do modelo, a quantidade de dados e a computação. Esta regularidade orientou toda a corrida ao tamanho que se seguiu.
Em 2022, o estudo conhecido como Chinchilla corrige o rumo. Com o mesmo orçamento de computação, muitos modelos eram demasiado grandes e não suficientemente treinados. Um modelo mais pequeno alimentado com mais dados saía-se melhor. A referência muitas vezes adotada é de cerca de vinte tokens de treino por parâmetro.
Referências
- Kaplan, McCandlish, Henighan et al. (2020). Scaling Laws for Neural Language Models. Pré-publicação no arXiv. arxiv.org/abs/2001.08361
- Hoffmann, Borgeaud, Mensch et al. (2022). Training Compute-Optimal Large Language Models. Pré-publicação no arXiv. arxiv.org/abs/2203.15556
- Brown, Mann, Ryder et al. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems 33, p. 1877–1901. arxiv.org/abs/2005.14165