Escolher a palavra seguinte: probabilidades e temperatura
O modelo não produz uma palavra, produz uma probabilidade para cada palavra possível. A escolha final depende de uma configuração.
ObjetivoExplicar como é escolhido o token seguinte e o que a temperatura muda.
No fim de todas as suas camadas, o modelo calcula para cada token do vocabulário uma probabilidade de ser o seguinte. Depois de «A capital da Suíça é», «Berna» recebe uma probabilidade muito elevada, «Zurique» uma probabilidade baixa mas não nula.
Depois é preciso escolher. Escolher sempre o mais provável dá textos seguros mas repetitivos. Sortear de acordo com as probabilidades dá textos mais variados. A temperatura regula este equilíbrio. Baixa, o modelo fica-se pelas escolhas mais prováveis. Alta, arrisca mais.
- Para extrair números, classificar ou responder a uma pergunta factual, uma temperatura baixa limita os desvios.
- Para propor títulos, ideias ou variantes, uma temperatura mais elevada alarga o leque.
- A mesma pergunta pode dar duas respostas diferentes. Não é uma avaria, é o sorteio.
Referências
- Brown, Mann, Ryder et al. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems 33, p. 1877–1901. arxiv.org/abs/2005.14165