Si lega a
è prodotto dalla tokenizzazione e appartiene a un vocabolario; è l'unità del costo a consumo e della lunghezza del contesto
Da qui ci si arriva
- Costo per token
Quanto si paga per ogni token di ingresso, di ragionamento e di uscita: dipende dalla lingua attraverso il tokenizzatore, dalla finestra di contesto, dai parametri attivi e dai token di ragionamento
- Modello n-gramma
Un modello statistico che stima il prossimo token dalle frequenze di sequenze corte osservate e, quando i conteggi mancano, può ricorrere a sequenze più brevi
- Trapianto del vocabolario
La sostituzione del tokenizzatore in un modello già addestrato: si ricostruiscono le righe della matrice degli embedding e la testa di uscita, spesso la stessa matrice, e si riprende l'addestramento perché le righe nuove partono quasi casuali
- Tokenizzazione
La trasformazione del testo in una sequenza di token secondo un vocabolario; può operare a caratteri, parole, sottoparole o byte
- Identificativo del token
Il numero intero che individua una voce del vocabolario; è un indirizzo, non una quantità dotata di significato
- Codifica BPE
L'applicazione a un testo nuovo della tabella delle fusioni già appresa