Tema

I concettimachine-learningNel grafo

Streaming dei pesi

La lettura dei pesi dal disco al bisogno invece di caricarli tutti in memoria: con mmap, col caricamento pigro degli esperti del MoE, o con la cache dei neuroni attivi

Si lega a

è favorito dalla miscela di esperti (pochi parametri attivi per token); è limitato dalla banda del disco; lo usano llama.cpp, MLX e DwarfStar

Da qui ci si arriva

  1. Quantizzazione

    La compressione dei pesi da sedici bit a otto o quattro: il modello occupa meno memoria e arriva più in fretta, a scapito di un po' di precisione

  2. Memoria unificata

    La memoria condivisa fra processore e scheda grafica, come nei chip Apple: un modello può usare tutta la memoria della macchina

  3. Sparsità delle attivazioni

    La regolarità per cui una piccola frazione di neuroni è attiva su quasi tutti i token, mentre la maggior parte si attiva di rado: è ciò che rende indovinabile lo streaming

Dove se ne parla

  1. I motori che eseguono i pesi: da llama.cpp allo streaming dal disco