Tema

I concettimachine-learningNel grafo

Rappresentazione contestuale

Il vettore trasformato dagli strati del modello in funzione degli altri token accessibili

Si lega a

deriva dalla rappresentazione iniziale e dagli strati successivi; in nanoGPT la rappresentazione iniziale somma l'embedding del token all'embedding posizionale

Da qui ci si arriva

  1. Embedding di parola

    Il vettore statico associato a una parola intera nei modelli storici come word2vec

  2. Autoattenzione

    Il meccanismo di attenzione applicato da una sequenza verso sé stessa: ogni posizione interroga le altre posizioni della stessa sequenza

  3. Decoder-only

    La forma del Transformer che genera: legge la sequenza e produce il prossimo token con la maschera causale; la forma di GPT, Claude, DeepSeek, Qwen e GLM

Dove se ne parla

  1. Dai token ai vettori: l'embedding