Tema

I concettimachine-learningNel grafo

Miscela di esperti

L'architettura che sostituisce l'MLP del blocco con una schiera di esperti e un router: i parametri totali crescono, il calcolo per token usa solo gli esperti scelti

Si lega a

modifica il blocco del Transformer; usa l'instradamento; distingue parametri totali da parametri attivi

Da qui ci si arriva

  1. Quantizzazione

    La compressione dei pesi da sedici bit a otto o quattro: il modello occupa meno memoria e arriva più in fretta, a scapito di un po' di precisione

  2. Streaming dei pesi

    La lettura dei pesi dal disco al bisogno invece di caricarli tutti in memoria: con mmap, col caricamento pigro degli esperti del MoE, o con la cache dei neuroni attivi

  3. Sparsità delle attivazioni

    La regolarità per cui una piccola frazione di neuroni è attiva su quasi tutti i token, mentre la maggior parte si attiva di rado: è ciò che rende indovinabile lo streaming

  4. Scheda del modello

    Il documento che accompagna un modello: dichiara famiglia, taglia, parametri attivi, finestra di contesto, tokenizzatore e licenza - e a volte tace sull'architettura

  5. Modello denso

    Il modello che attiva tutti i suoi parametri a ogni token, in addestramento e in generazione: il costo per token è proporzionale alla taglia

Dove se ne parla

  1. Le evoluzioni: MoE e cache di chiavi e valori