Lição 8 de 8 · 3 min

Seguir instruções: ajuste e alinhamento

Porque é que um modelo em bruto completa o texto em vez de responder, e como se lhe ensina a ser útil e prudente.

ObjetivoDistinguir o ajuste por instruções, a aprendizagem por preferências humanas e o alinhamento por princípios.

Um modelo apenas pré-treinado não responde a uma pergunta. Continua-a. A «Redige um e-mail de seguimento», pode acrescentar outras instruções em vez de escrever o e-mail. É portanto preciso ensinar-lhe o papel de assistente.

  1. Ajuste por instruções. Pessoas redigem milhares de pares de pedido e boa resposta, e o modelo treina com eles.
  2. Aprendizagem por preferências. Para um mesmo pedido, pessoas ordenam várias respostas. Um segundo modelo aprende a prever essas preferências e depois orienta o primeiro.
  3. Alinhamento por princípios. O modelo critica e reescreve as suas próprias respostas segundo uma lista de princípios escritos, o que reduz a necessidade de anotações humanas.

O efeito é considerável. No estudo InstructGPT de 2022, os avaliadores preferiam as respostas de um modelo alinhado de 1,3 mil milhões de parâmetros às do modelo em bruto de 175 mil milhões.

O que o alinhamento não faz

  • Não torna o modelo infalível. Torna-o mais cooperativo, o que também o pode tornar demasiado complacente.
  • Reflete as escolhas das pessoas e dos princípios que o orientaram.
  • Não substitui as suas salvaguardas. As aprovações do Learnya continuam a ser a última barreira antes de uma ação.

Referências

  1. Ouyang, Wu, Jiang et al. (2022). Training language models to follow instructions with human feedback. Advances in Neural Information Processing Systems 35, p. 27730–27744. arxiv.org/abs/2203.02155
  2. Bai, Kadavath, Kundu et al. (2022). Constitutional AI: Harmlessness from AI Feedback. Pré-publicação no arXiv. arxiv.org/abs/2212.08073