Si lega a
agisce sui pesi di attenzione; rende l'autoattenzione adatta a generare un token alla volta
Da qui ci si arriva
- Autoattenzione
Il meccanismo di attenzione applicato da una sequenza verso sé stessa: ogni posizione interroga le altre posizioni della stessa sequenza
- Pesi di attenzione
I coefficienti, prodotti dalla softmax sui punteggi fra domanda e chiavi, con cui una posizione pesa le altre; sommano a 1
- Encoder-only
La forma del Transformer che legge senza generare: trasforma la sequenza in rappresentazioni; la forma di BERT
- Decoder-only
La forma del Transformer che genera: legge la sequenza e produce il prossimo token con la maschera causale; la forma di GPT, Claude, DeepSeek, Qwen e GLM