Tema

Tutti gli articoli

Articoli su Machine learning

12 articoli, nell'ordine pensato per leggere la serie.

  1. Che cosa deve sapere chi decide prima di usare un modello di linguaggio: la serie in dieci decisioni

    Un modello di linguaggio si compra in tre modi - a servizio, su macchine a noleggio, su macchine proprie - e si paga in un'unità nuova, il token. Le dieci decisioni della serie nell'ordine delle tre domande di chi firma: quanto costerà davvero, come si sceglie il fornitore, come ci si tutela. Per ognuna, la domanda da fare e il pezzo che spiega il perché.

  2. Le origini del machine learning: programmare una macchina, o farla apprendere

    Ci sono due modi per far fare qualcosa a un calcolatore: scrivergli le regole, o fargliele imparare dagli esempi. La seconda idea ha una data di nascita precisa e tre padri documentati: la macchina-bambina di Turing (1950), la congettura di Dartmouth (1955) e la dama di Samuel (1959) - con le citazioni verificate sugli originali, compresa quella famosa che nell'originale non c'è. Il primo pezzo della serie che arriva fino ai modelli di linguaggio.

  3. Il percettrone: la prima macchina che impara le proprie regole

    Nel luglio del 1958 la Marina americana mostrò ai giornali un calcolatore che imparava da solo, e il New York Times promise una macchina cosciente. Dentro il clamore c'era un congegno preciso e piccolo: il percettrone di Frank Rosenblatt. Com'è fatto, la regola con cui impara, il teorema che ne garantisce la riuscita a una condizione - e il muro esatto, quattro punti senza retta, che fermò l'intero campo per un decennio.

  4. Le reti multistrato: oltre il muro del percettrone

    Il percettrone si era fermato davanti a quattro punti che nessuna retta separa. Bastano tre percettroni impilati per superarli - e la tabella si rifà a mano in questa pagina. Poi le domande vere: perché serve una curva al posto del gradino, come si ripartisce l'errore sui pesi nascosti (la retropropagazione, con la storia giusta), la garanzia di Cybenko, i guai del mestiere - e il confronto misurato sugli stessi dati del percettrone.

  5. Dal testo ai token: il tokenizzatore

    Il token è l'unità con cui un modello legge, scrive e fa i conti - e chi decide dove finisce un token è il tokenizzatore. Il pezzo mette a duello due vocabolari - uno addestrato sui Promessi sposi, uno dei modelli di OpenAI - confronta le ricette in uso oggi e misura quanto l'italiano paghi in token più dell'inglese.

  6. Dai token ai vettori: l'embedding

    L'identificativo di un token è un indirizzo; l'embedding è la riga che quell'indirizzo seleziona in una matrice appresa. Da Bengio 2003 alla geometria di word2vec, fino a nanoGPT che somma l'embedding del token a quello della posizione - mentre il problema delle dipendenze lontane resta aperto e conduce al meccanismo dell'attenzione.

  7. Dai vettori alle relazioni: l'attenzione

    I vettori che entrano nel modello sanno quale token rappresentano e dove si trova, ma ognuno è ancora solo. L'attenzione li mette in relazione: domanda, chiave e valore, la softmax che pesa, la maschera causale e le teste multiple - il meccanismo che ha sostituito la ricorrenza nei modelli di linguaggio, e il prezzo quadratico che si porta dietro.

  8. Il Transformer, aperto col cacciavite

    I pezzi sono già sul tavolo: l'embedding, l'attenzione, la softmax. Questo pezzo li monta, seguendo le trecento righe di nanoGPT: il blocco che alterna attenzione e MLP, le connessioni residue che tengono in piedi la pila, la testa d'uscita e la softmax che producono le probabilità del prossimo token, e la generazione, un token alla volta.

  9. Le evoluzioni: MoE e cache di chiavi e valori

    Il costo quadratico del pezzo sull'attenzione ha due risposte: la miscela di esperti e la cache di chiavi e valori. La prima riduce il calcolo per token attivandone pochi su tanti; la seconda il motore la riempie durante la generazione, per non rifare tutto da capo. Con i casi documentati di DeepSeek e Qwen - e la distinzione fra pesi, motore e addestramento.

  10. Le architetture a confronto: come leggere la scheda di un modello

    La serie ha aperto la macchina e i suoi trucchi: ora la mappa dei modelli veri. Le tre forme del Transformer, il denso contro il misto, e la differenza decisiva per chi legge: DeepSeek, Qwen e GLM documentano l'architettura, GPT e Claude no. Come leggere la scheda di un modello sapendo che cosa può dire e che cosa tace.

  11. L'addestramento che fa la differenza: dal rinforzo al ragionamento

    La stessa architettura può produrre modelli molto diversi: il carattere arriva dall'addestramento. Le quattro fasi - preaddestramento, istruzione, rinforzo da preferenze umane, rinforzo con ricompense verificabili - e la svolta dei modelli di ragionamento, nati dall'ultima. Con l'avvertenza di casa: il dibattito sull'emergenza è aperto, e si dichiara.

  12. I motori che eseguono i pesi: da llama.cpp allo streaming dal disco

    Il bilancio del pezzo sulle evoluzioni ha separato tre livelli: architettura, motore, addestramento. Questo pezzo apre il motore: llama.cpp, vLLM, MLX, DwarfStar e gli altri, che cosa fanno e come si dividono i compiti - e la novità che sta cambiando il quadro, i pesi che arrivano dal disco invece che dalla memoria, con i vantaggi e i limiti di ogni approccio.