Lección 8 de 8 · 3 min

Seguir instrucciones: ajuste y alineamiento

Por qué un modelo base completa texto en lugar de responder, y cómo se le enseña a ser útil y prudente.

ObjetivoDistinguir el ajuste por instrucciones, el aprendizaje a partir de preferencias humanas y el alineamiento por principios.

Un modelo solo preentrenado no responde a una pregunta. La continúa. Ante «Redacta un correo de seguimiento», puede añadir otras instrucciones en lugar de escribir el correo. Por eso hay que enseñarle el papel de asistente.

  1. Ajuste por instrucciones (instruction tuning). Unas personas redactan miles de pares de petición y respuesta correcta, y el modelo se entrena con ellos.
  2. Aprendizaje a partir de preferencias. Para una misma petición, unas personas ordenan varias respuestas. Un segundo modelo aprende a predecir esas preferencias y luego guía al primero.
  3. Alineamiento por principios. El modelo critica y reescribe sus propias respuestas según una lista de principios escritos, lo que reduce la necesidad de anotaciones humanas.

El efecto es considerable. En el estudio InstructGPT de 2022, los evaluadores preferían las respuestas de un modelo alineado de 1.300 millones de parámetros a las del modelo base de 175.000 millones.

Lo que no hace el alineamiento

  • No hace infalible al modelo. Lo hace más cooperativo, lo que también puede volverlo demasiado complaciente.
  • Refleja las decisiones de las personas y los principios que lo guiaron.
  • No sustituye a sus salvaguardas. Las aprobaciones de Learnya siguen siendo la última barrera antes de una acción.

Referencias

  1. Ouyang, Wu, Jiang et al. (2022). Training language models to follow instructions with human feedback. Advances in Neural Information Processing Systems 35, p. 27730–27744. arxiv.org/abs/2203.02155
  2. Bai, Kadavath, Kundu et al. (2022). Constitutional AI: Harmlessness from AI Feedback. Prepublicación en arXiv. arxiv.org/abs/2212.08073