Tema

I concettimachine-learningNel grafo

Rinforzo con ricompense verificabili

Il rinforzo la cui ricompensa è un fatto: la risposta giusta, il test che passa; da qui emergono i modelli di ragionamento

Si lega a

è un caso di apprendimento per rinforzo; produce i modelli di ragionamento; richiama la macchina-bambina di Turing

Da qui ci si arriva

  1. Rinforzo da preferenze umane

    Il rinforzo la cui ricompensa è un gusto: classifiche umane, un modello di ricompensa, e l'addestramento a produrre risposte preferite

  2. Modelli di ragionamento

    I modelli che pensano a lungo prima di rispondere, con catene di ragionamento interne, addestrati con ricompense verificabili

Dove se ne parla

  1. L'addestramento che fa la differenza: dal rinforzo al ragionamento