Si lega a
è selezionato dalla matrice degli embedding; in nanoGPT si somma all'embedding posizionale; coincide con un embedding di parola quando ogni token è una parola intera
Da qui ci si arriva
- Matrice degli embedding
Un parametro appreso con una riga per ogni token e una colonna per ogni dimensione del vettore
- Embedding di parola
Il vettore statico associato a una parola intera nei modelli storici come word2vec
- Embedding posizionale
Un vettore che introduce l'informazione sulla posizione occupata dal token, usato da nanoGPT e da altre architetture
- Rappresentazione contestuale
Il vettore trasformato dagli strati del modello in funzione degli altri token accessibili
- Problema della sequenza
La difficoltà di trattare lunghezze variabili, ordine e dipendenze lontane senza legarli a una finestra rigida di ingressi
- Domanda, chiave e valore
Le tre proiezioni apprese ricavate dal vettore di ogni posizione: la domanda interroga, la chiave si lascia trovare, il valore è il contenuto che viene trasmesso
- Testa d'uscita
L'ultimo strato che riporta il vettore alla taglia del vocabolario, da cui la softmax produce le probabilità del prossimo token