Tema

I concettimachine-learningNel grafo

ReLU

La funzione di attivazione oggi standard negli strati nascosti (Rectified Linear Unit, unità lineare rettificata): zero sotto lo zero, la somma così com'è sopra; pendenza 1 ovunque sia accesa, costo di calcolo minimo

Si lega a

è una funzione di attivazione; mitiga il gradiente che svanisce

Da qui ci si arriva

  1. MLP del Transformer

    Lo strato che allarga ogni vettore di quattro volte, lo passa per una curva morbida e lo riporta alla dimensione di partenza, elaborando ogni posizione da sola

  2. Gradiente che svanisce

    Negli strati profondi il segnale d'errore si spegne, perché torna indietro moltiplicato per pendenze minori di 1 a ogni strato: gli strati vicini all'ingresso smettono di imparare

Dove se ne parla

  1. Le reti multistrato: oltre il muro del percettrone