Lezione 6 di 8 · 3 min

Scegliere la parola successiva: probabilità e temperatura

Il modello non produce una parola, produce una probabilità per ogni parola possibile. La scelta finale dipende da un’impostazione.

ObiettivoSpiegare come viene scelto il token successivo e cosa cambia la temperatura.

Al termine di tutti i suoi strati, il modello calcola per ogni token del vocabolario una probabilità di essere il successivo. Dopo «La capitale della Svizzera è», «Berna» riceve una probabilità molto elevata, «Zurigo» una probabilità bassa ma non nulla.

Poi bisogna scegliere. Prendere sempre il più probabile dà testi sicuri ma ripetitivi. Estrarre a sorte secondo le probabilità dà testi più vari. La temperatura regola questo equilibrio. Con una temperatura bassa, il modello si attiene alle scelte più probabili. Con una alta, osa di più.

  • Per estrarre cifre, classificare o rispondere a una domanda fattuale, una temperatura bassa limita gli scarti.
  • Per proporre titoli, idee o varianti, una temperatura più alta allarga il ventaglio.
  • La stessa domanda può dare due risposte diverse. Non è un guasto, è il campionamento.

Riferimenti

  1. Brown, Mann, Ryder et al. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems 33, p. 1877–1901. arxiv.org/abs/2005.14165