Lección 7 de 8 · 3 min

El preentrenamiento y las leyes de escala

Cómo un modelo aprende prediciendo la palabra siguiente sobre billones de tokens, y lo que revelaron las leyes de escala.

ObjetivoDescribir el preentrenamiento y explicar lo que dicen las leyes de escala sobre el tamaño de los modelos y de los datos.

El preentrenamiento es la fase más larga y más costosa. El modelo lee un corpus de textos muy grande y, en cada posición, intenta predecir el token siguiente. Cuando se equivoca, sus parámetros se corrigen ligeramente. Repetida billones de veces, esta corrección hace emerger la gramática, conocimientos y formas de razonar.

  1. PreentrenamientoPredecir la palabra siguiente en un corpus de textos muy grande.
  2. AjusteAprender a seguir instrucciones a partir de ejemplos redactados.
  3. AlineamientoPreferir las respuestas que las personas juzgan útiles y seguras.
  4. UsoEl modelo está congelado. No retiene nada de sus conversaciones.
Las grandes etapas de la vida de un modelo de lenguaje.

Lo que mostraron las leyes de escala

En 2020, unos investigadores miden que el error de un modelo disminuye de forma regular y previsible cuando se aumentan el tamaño del modelo, la cantidad de datos y el cómputo. Esta regularidad orientó toda la carrera por el tamaño que vino después.

En 2022, el estudio conocido como Chinchilla corrige el rumbo. Con el mismo presupuesto de cómputo, muchos modelos eran demasiado grandes y estaban poco entrenados. Un modelo más pequeño alimentado con más datos obtenía mejores resultados. La referencia que suele retenerse es de unos veinte tokens de entrenamiento por parámetro.

Referencias

  1. Kaplan, McCandlish, Henighan et al. (2020). Scaling Laws for Neural Language Models. Prepublicación en arXiv. arxiv.org/abs/2001.08361
  2. Hoffmann, Borgeaud, Mensch et al. (2022). Training Compute-Optimal Large Language Models. Prepublicación en arXiv. arxiv.org/abs/2203.15556
  3. Brown, Mann, Ryder et al. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems 33, p. 1877–1901. arxiv.org/abs/2005.14165