Pubblicato il
Hai mai visto scritto «limite di token» o «costo per token» e hai fatto finta di capire? Nessun problema: la parola sembra tecnica, ma l'idea è semplicissima.
In questa lezione scopri che cos'è un token, come l'intelligenza artificiale lo usa per leggere la tua domanda e per scrivere la risposta un pezzetto alla volta, e perché ti conviene saperlo. Ci sono quattro esempi in cui vedi nascere una risposta token dopo token.
Scarica la dispensaVersione PDF stampabile di questa lezione, con esercitazione e glossario.
Scarica la dispensa in PDFGioca con i token: TokenizzamiScegli una domanda e guarda come l'AI la spezza in token e scrive la risposta un pezzetto alla volta. Un gioco interattivo, gratuito, con animazioni ed effetti sonori.
Gioca oraCapire che cos'è un token, come l'AI trasforma il testo in token e come costruisce una risposta aggiungendone uno alla volta, per usare meglio i chatbot e capire limiti e costi.
Tu vedi parole e frasi. Il computer, dentro, vede soltanto numeri.
Quando scrivi a un chatbot «Ciao, come stai?», nessuno dentro la macchina «capisce» quelle lettere come le capisci tu. Prima il testo va smontato in pezzetti, e ogni pezzetto va trasformato in un numero. Solo dopo il modello può lavorarci.
Quei pezzetti si chiamano token. Immagina i mattoncini delle costruzioni: con pochi tipi di mattoncino costruisci castelli, astronavi e perfino un ornitorinco. Con pochi tipi di token l'AI costruisce qualsiasi frase.

Un token è un pezzetto di testo: l'unità con cui l'AI legge quello che scrivi e scrive quello che ti risponde.
Un token non è sempre una parola. Può essere una parola intera, un pezzo di parola, un segno di punteggiatura, o uno spazio attaccato alla parola che segue. Le parole comuni, che l'AI ha visto milioni di volte, di solito sono un solo token. Le parole rare vengono spezzate in più pezzi.
| Testo | Come potrebbe essere spezzato | Token |
|---|---|---|
| gatto | «gatto» | 1 |
| Ciao, come stai? | «Ciao» «,» «·come» «·stai» «?» | 5 |
| ornitorinco | «orn» «ito» «rin» «co» | 4 |
Regola pratica, valida soprattutto per l'inglese: un token è circa quattro caratteri, e cento token sono circa settantacinque parole. L'italiano, con le sue parole lunghe e le sue desinenze, di solito consuma un po' più token dello stesso testo in inglese.

Sono stime. Ogni modello ha il proprio sistema per dividere il testo, quindi lo stesso testo può avere un numero di token diverso da un servizio all'altro. Per un numero preciso usa il contatore del servizio che stai usando.
L'AI ha un elenco chiuso di token che conosce, il vocabolario: decine di migliaia di pezzetti, ciascuno con un numero di codice. Il testo che scrivi viene tagliato in pezzetti dell'elenco, e ogni pezzetto sostituito dal suo numero. È questa serie di numeri che entra nel modello.

La stessa cosa succede al contrario: il modello produce un numero, e il numero viene tradotto di nuovo nel pezzetto di testo che vedi comparire sullo schermo.
L'AI non scrive la risposta tutta insieme: la costruisce un pezzetto per volta, come quando componi un messaggio sul telefono.
Il meccanismo si ripete sempre uguale. Il modello legge tutto il testo che c'è finora, calcola quanto è probabile ciascun token possibile come prossimo, ne sceglie uno e lo aggiunge. Poi ricomincia, con un token in più da leggere.

È come il completamento automatico della tastiera del telefono, ma allenato su una quantità enorme di testi, e che ricomincia dopo ogni pezzetto.
Il modello non sceglie sempre il token più probabile: a volte pesca anche tra quelli meno probabili. Quanto osa lo regola un'impostazione chiamata temperatura. Bassa: risposte prevedibili e uniformi. Alta: più fantasia e più sorprese. Per questo, chiedendo due volte la stessa cosa, ricevi due testi diversi.
Vediamolo dal vivo. In ogni esempio c'è una domanda e la risposta che nasce un token alla volta. Leggi le tabelle dall'alto in basso: ogni riga aggiunge un pezzetto, e l'ultima colonna mostra il testo che esiste a quel punto. I tagli sono illustrativi, ma il meccanismo è quello vero.
«Qual è la capitale d'Italia?»
| Passo | Token aggiunto | Testo costruito finora |
|---|---|---|
| 1 | «La» | La |
| 2 | «·capitale» | La capitale |
| 3 | «·d'» | La capitale d' |
| 4 | «Italia» | La capitale d'Italia |
| 5 | «·è» | La capitale d'Italia è |
| 6 | «·Roma» | La capitale d'Italia è Roma |
| 7 | «.» | La capitale d'Italia è Roma. |

Al passo 6 il modello sceglie tra molti candidati, ciascuno con la sua probabilità. Ecco come potrebbe apparire quel momento:
| Candidato per il passo 6 | Probabilità (illustrativa) |
|---|---|
| «·Roma» | 97% |
| «·Milano» | 1% |
| «·Napoli» | meno dell'1% |
| tutti gli altri token | il resto |
«Dammi un consiglio per la colazione, in una frase.»
| Passo | Token aggiunto | Testo costruito finora |
|---|---|---|
| 1 | «Inizia» | Inizia |
| 2 | «·con» | Inizia con |
| 3 | «·un» | Inizia con un |
| 4 | «·caffè» | Inizia con un caffè |
| 5 | «·e» | Inizia con un caffè e |
| 6 | «·una» | Inizia con un caffè e una |
| 7 | «·fetta» | Inizia con un caffè e una fetta |
| 8 | «·di» | Inizia con un caffè e una fetta di |
| 9 | «·pane» | Inizia con un caffè e una fetta di pane |
| 10 | «·e» | Inizia con un caffè e una fetta di pane e |
| 11 | «·marmellata» | Inizia con un caffè e una fetta di pane e marmellata |
| 12 | «.» | Inizia con un caffè e una fetta di pane e marmellata. |

«Come si chiama l'animale australiano con il becco d'anatra?»
| Passo | Token aggiunto | Testo costruito finora |
|---|---|---|
| 1 | «È» | È |
| 2 | «·l'» | È l' |
| 3 | «orn» | È l'orn |
| 4 | «ito» | È l'ornito |
| 5 | «rin» | È l'ornitorin |
| 6 | «co» | È l'ornitorinco |
| 7 | «.» | È l'ornitorinco. |

Le parole comuni costano un token, quelle rare ne costano di più. Il modello le ricostruisce mattoncino su mattoncino.
«Scrivi la scusa più assurda per essere arrivato in ritardo.»
| Passo | Token aggiunto | Testo costruito finora |
|---|---|---|
| 1 | «Un» | Un |
| 2 | «·gabbiano» | Un gabbiano |
| 3 | «·mi» | Un gabbiano mi |
| 4 | «·ha» | Un gabbiano mi ha |
| 5 | «·rubato» | Un gabbiano mi ha rubato |
| 6 | «·la» | Un gabbiano mi ha rubato la |
| 7 | «·colazione» | Un gabbiano mi ha rubato la colazione |
| 8 | «,» | Un gabbiano mi ha rubato la colazione, |
| 9 | «·e» | Un gabbiano mi ha rubato la colazione, e |
| 10 | «·l'» | Un gabbiano mi ha rubato la colazione, e l' |
| 11 | «ho» | Un gabbiano mi ha rubato la colazione, e l'ho |
| 12 | «·inseguito» | Un gabbiano mi ha rubato la colazione, e l'ho inseguito |
| 13 | «·fino» | Un gabbiano mi ha rubato la colazione, e l'ho inseguito fino |
| 14 | «·al» | Un gabbiano mi ha rubato la colazione, e l'ho inseguito fino al |
| 15 | «·mare» | Un gabbiano mi ha rubato la colazione, e l'ho inseguito fino al mare |
| 16 | «.» | Un gabbiano mi ha rubato la colazione, e l'ho inseguito fino al mare. |

Qui la scelta più divertente è al passo 2. Quando la richiesta è creativa, nessun candidato domina e la temperatura fa la differenza:
| Candidato per il passo 2 | Probabilità (illustrativa) |
|---|---|
| «·gabbiano» | 22% |
| «·piccione» | 19% |
| «·pinguino» | 8% |
| «·alieno» | 4% |
| tutti gli altri token | il resto |

Se pensi che i token siano noiosi, non hai ancora visto che cosa succede quando l'AI deve tagliare certe parole.
Più una parola è lunga, rara o scritta in modo strano, più pezzetti servono per ricostruirla. Ecco il nostro piccolo museo: i tagli sono di esempio, ma il principio è reale.

Quale costa di più: «ciao» o «CIAAAAAAO»? Indovina, poi controlla con il contatore.
I tagli mostrati sono illustrativi: ogni modello ha il suo tagliatore, e il risultato reale può cambiare.
I token non sono una curiosità da ingegneri: spiegano tre cose che incontri ogni giorno quando usi un chatbot.
Molti servizi di AI, soprattutto quelli per aziende e sviluppatori, si pagano a token: si contano sia quelli che invii sia quelli che ricevi. Prompt corti e risposte mirate costano meno. I prezzi cambiano spesso: guarda sempre il listino aggiornato del servizio.
Il modello può tenere in considerazione solo una quantità limitata di testo, la finestra di contesto, misurata in token. Dentro ci stanno la tua domanda, la conversazione fin lì e la risposta. Quando la conversazione diventa troppo lunga, le parti più vecchie escono e il modello le «dimentica».
Il modello vede pezzetti, non lettere. Per questo può inciampare in compiti che per noi sono banali, come contare quante volte compare una lettera in una parola o scrivere una parola al contrario. Non è stupido: sta guardando i mattoncini, non i singoli granelli di plastica.
| Situazione | Che cosa succede | Che cosa fare |
|---|---|---|
| Testo molto lungo | Si superano i limiti o si paga di più | Riassumi, dividi in parti, togli il superfluo |
| Conversazione infinita | Il modello perde i dettagli iniziali | Ricomincia e incolla un breve riassunto |
| Domanda sulle singole lettere | Il modello vede pezzetti, non lettere | Verifica sempre tu il risultato |
| Testo in italiano | Di solito costa qualche token in più | Nessuna paura: conta solo se i volumi sono grandi |
Un token è un mattoncino. L'AI non ha mai scritto una frase intera in un colpo solo: ne ha sempre messo uno sopra l'altro.
— Gianluca Bonomo
Gioca con i token: TokenizzamiScegli una domanda e guarda come l'AI la spezza in token e scrive la risposta un pezzetto alla volta. Un gioco interattivo, gratuito, con animazioni ed effetti sonori.
Gioca oraQuindici minuti, un browser e il tuo chatbot preferito. Non serve installare nulla.
Sai dire quanti token ha la tua frase?
Hai notato quali parole sono state spezzate in più pezzi?
Sai spiegare a un collega perché la tastiera del telefono assomiglia a un'AI?
No. A volte coincide con una parola, a volte è un pezzo di parola, un segno di punteggiatura o uno spazio. Le parole comuni di solito sono un solo token, quelle rare ne usano di più.
Dipende dal modello e dalla lingua. Come ordine di grandezza, per l'inglese cento token sono circa settantacinque parole; per l'italiano il conto è di solito un po' più alto. Per un numero preciso usa il contatore del servizio.
Perché il modello a ogni passo sceglie tra più token probabili e non sempre prende il primo. La temperatura regola quanto osa: più è alta, più le risposte variano.
Con molti servizi per aziende e sviluppatori, sì: si pagano i token inviati e quelli ricevuti, con tariffe che cambiano. Gli abbonamenti per il pubblico di solito applicano limiti d'uso e non un conto a token. Controlla le condizioni del tuo servizio.
Perché non vede le lettere, ma pezzetti di parola. Contare le lettere gli richiede un ragionamento in più, e a volte sbaglia. Controlla sempre tu.
| Termine | Che cosa significa |
|---|---|
| Finestra di contesto | Quantità massima di token che il modello può considerare in una volta: domanda, conversazione e risposta. |
| Modello | Il sistema addestrato che calcola, a ogni passo, quale token è il più probabile. |
| Probabilità | Il punteggio che il modello assegna a ogni token possibile come prossimo. |
| Temperatura | Impostazione che regola quanto il modello osa scegliere token meno probabili. |
| Token | Pezzetto di testo (parola, parte di parola, punteggiatura) che l'AI legge e scrive. |
| Tokenizzazione | L'operazione che taglia il testo in token e li trasforma in numeri. |
| Vocabolario | L'elenco chiuso dei token che un modello conosce, ciascuno con il suo codice numerico. |
Le suddivisioni in token e le probabilità degli esempi sono illustrative, scelte per spiegare il meccanismo; i numeri reali dipendono dal modello. Le regole pratiche sono ordini di grandezza. Prezzi e limiti dei servizi cambiano spesso: verifica sempre la documentazione aggiornata del fornitore.
Scarica la dispensaVersione PDF stampabile di questa lezione, con esercitazione e glossario.
Scarica la dispensa in PDF