Si lega a
condivide la matrice con l'embedding del token (weight tying); è seguita dalla softmax e dal campionamento
Da qui ci si arriva
- Decoder-only
La forma del Transformer che genera: legge la sequenza e produce il prossimo token con la maschera causale; la forma di GPT, Claude, DeepSeek, Qwen e GLM