Tema

I concettimachine-learningNel grafo

Modello denso

Il modello che attiva tutti i suoi parametri a ogni token, in addestramento e in generazione: il costo per token è proporzionale alla taglia

Si lega a

è il punto di partenza che la miscela di esperti modifica; è la forma del blocco del Transformer dei pezzi precedenti

Da qui ci si arriva

  1. Quantizzazione

    La compressione dei pesi da sedici bit a otto o quattro: il modello occupa meno memoria e arriva più in fretta, a scapito di un po' di precisione

Dove se ne parla

  1. Le evoluzioni: MoE e cache di chiavi e valori