Seguir instruções: ajuste e alinhamento
Porque é que um modelo em bruto completa o texto em vez de responder, e como se lhe ensina a ser útil e prudente.
ObjetivoDistinguir o ajuste por instruções, a aprendizagem por preferências humanas e o alinhamento por princípios.
Um modelo apenas pré-treinado não responde a uma pergunta. Continua-a. A «Redige um e-mail de seguimento», pode acrescentar outras instruções em vez de escrever o e-mail. É portanto preciso ensinar-lhe o papel de assistente.
- Ajuste por instruções. Pessoas redigem milhares de pares de pedido e boa resposta, e o modelo treina com eles.
- Aprendizagem por preferências. Para um mesmo pedido, pessoas ordenam várias respostas. Um segundo modelo aprende a prever essas preferências e depois orienta o primeiro.
- Alinhamento por princípios. O modelo critica e reescreve as suas próprias respostas segundo uma lista de princípios escritos, o que reduz a necessidade de anotações humanas.
O efeito é considerável. No estudo InstructGPT de 2022, os avaliadores preferiam as respostas de um modelo alinhado de 1,3 mil milhões de parâmetros às do modelo em bruto de 175 mil milhões.
O que o alinhamento não faz
- Não torna o modelo infalível. Torna-o mais cooperativo, o que também o pode tornar demasiado complacente.
- Reflete as escolhas das pessoas e dos princípios que o orientaram.
- Não substitui as suas salvaguardas. As aprovações do Learnya continuam a ser a última barreira antes de uma ação.
Referências
- Ouyang, Wu, Jiang et al. (2022). Training language models to follow instructions with human feedback. Advances in Neural Information Processing Systems 35, p. 27730–27744. arxiv.org/abs/2203.02155
- Bai, Kadavath, Kundu et al. (2022). Constitutional AI: Harmlessness from AI Feedback. Pré-publicação no arXiv. arxiv.org/abs/2212.08073