Tema

I concettimachine-learningNel grafo

Maschera causale

Il vincolo che impedisce a ogni posizione di usare le posizioni successive, ponendo a meno infinito i loro punteggi prima della softmax

Si lega a

agisce sui pesi di attenzione; rende l'autoattenzione adatta a generare un token alla volta

Da qui ci si arriva

  1. Autoattenzione

    Il meccanismo di attenzione applicato da una sequenza verso sé stessa: ogni posizione interroga le altre posizioni della stessa sequenza

  2. Pesi di attenzione

    I coefficienti, prodotti dalla softmax sui punteggi fra domanda e chiavi, con cui una posizione pesa le altre; sommano a 1

  3. Encoder-only

    La forma del Transformer che legge senza generare: trasforma la sequenza in rappresentazioni; la forma di BERT

  4. Decoder-only

    La forma del Transformer che genera: legge la sequenza e produce il prossimo token con la maschera causale; la forma di GPT, Claude, DeepSeek, Qwen e GLM

Dove se ne parla

  1. Dai vettori alle relazioni: l'attenzione