Tema

I concettimachine-learningNel grafo

Attenzioni raggruppate

La famiglia di soluzioni nei pesi che comprime la cache di chiavi e valori: la GQA condivide chiavi e valori fra gruppi di teste, la MLA li comprime in un vettore latente; il motore può aggiungere la quantizzazione della cache al volo

Si lega a

riducono la cache di chiavi e valori; sono documentate nei rapporti di DeepSeek e Qwen; la via del motore da TurboQuant

Da qui ci si arriva

  1. Scheda del modello

    Il documento che accompagna un modello: dichiara famiglia, taglia, parametri attivi, finestra di contesto, tokenizzatore e licenza - e a volte tace sull'architettura

  2. Cache di chiavi e valori

    La memoria che il motore riempie durante la generazione con le chiavi e i valori già calcolati, per non ricalcolarli: possibile perché il passato è fisso; nell'addestramento non esiste

Dove se ne parla

  1. Le evoluzioni: MoE e cache di chiavi e valori