Tema

I concettimachine-learningNel grafo

Testa d'uscita

L'ultimo strato che riporta il vettore alla taglia del vocabolario, da cui la softmax produce le probabilità del prossimo token

Si lega a

condivide la matrice con l'embedding del token (weight tying); è seguita dalla softmax e dal campionamento

Da qui ci si arriva

  1. Decoder-only

    La forma del Transformer che genera: legge la sequenza e produce il prossimo token con la maschera causale; la forma di GPT, Claude, DeepSeek, Qwen e GLM

Dove se ne parla

  1. Il Transformer, aperto col cacciavite