internettoolbox
← Torna agli strumenti

Calcolatore di token LLM

0 caratteri0 parole

Caricamento dei tokenizer…

CodificaUsata daTokenCosto
o200k_baseGPT-4o, GPT-4.1, serie o
cl100k_baseGPT-4, GPT-3.5-turbo, embeddings v3
stima (caratteri ÷ 3,7)Claude, Gemini (tokenizer non pubblico)0

Come funziona

Incolla un testo qualsiasi (un prompt, un documento, un payload JSON) e vedi quanti token vale, contati con gli stessi tokenizer BPE che OpenAI usa in produzione: o200k_base (GPT-4o, GPT-4.1 e la serie o) e cl100k_base (GPT-4, GPT-3.5-turbo e i modelli di embedding v3). Sono conteggi esatti, non stime: lo strumento esegue nel browser una versione in JavaScript di tiktoken.

Il token è l'unità con cui le API dei modelli linguistici fatturano e con cui si misura la finestra di contesto. Non è né un carattere né una parola: le parole inglesi comuni spesso sono un token solo, quelle rare si spezzano in più pezzi, e spazi e punteggiatura si attaccano in modi poco intuitivi. A spanne la prosa inglese fa circa 4 caratteri per token, l'italiano circa 3,5 e il codice circa 3. Per questo contare a occhio non funziona, e un numero esatto serve quando sei vicino al limite del contesto o devi stimare una spesa.

Claude e Gemini non hanno un tokenizer pubblico, quindi per loro lo strumento mostra una stima (caratteri diviso 3,7, la media accettata per la prosa inglese), indicata come tale nella tabella. Per un budget sulla prosa sbaglia di circa il 10–15%; il numero esatto arriva solo dalla risposta dell'API di ciascun fornitore.

Per calcolare il costo, scrivi nel campo Prezzo $/1M token la tariffa del tuo modello, presa dalla pagina dei prezzi del fornitore: ogni riga mostra quanto costa esattamente quel testo, con sei decimali. I file dati dei tokenizer pesano qualche megabyte, vengono scaricati una volta sola e solo su questa pagina. Il tuo testo non esce dal browser. Se vuoi accorciare un prompt con dati strutturati, passalo nel convertitore da JSON a TOON di questo sito e conta di nuovo.

Domande frequenti

Quanti token ha il mio testo?

Incollalo nel riquadro e leggi la colonna Token: la prima riga è il conteggio esatto per GPT-4o e GPT-4.1, la seconda per GPT-4 e GPT-3.5-turbo, la terza è la stima per Claude e Gemini. Per esempio “hello world” vale 2 token in entrambe le codifiche OpenAI.

Quali modelli usano o200k_base e quali cl100k_base?

o200k_base: GPT-4o, GPT-4o-mini, la famiglia GPT-4.1 e i modelli di ragionamento o1, o3 e o4. cl100k_base: GPT-4, GPT-4-turbo, GPT-3.5-turbo e text-embedding-3. I modelli OpenAI più recenti usano in genere o200k_base; nel dubbio guarda entrambe le righe, la differenza di solito è piccola.

Perché per Claude e Gemini il conteggio è una stima?

Perché Anthropic e Google non pubblicano i loro tokenizer. La formula caratteri ÷ 3,7 segue la prosa inglese con un margine del 10–15% circa, mentre codice e testi in altre lingue si discostano di più. Il conteggio esatto torna nel campo usage di ogni risposta dell'API: usa quello quando il numero conta per la fattura.

Un testo in italiano consuma più token dell'inglese?

Sì, in media. I tokenizer sono addestrati soprattutto su testi inglesi, quindi le parole italiane si spezzano più spesso: circa 3,5 caratteri per token contro 4 dell'inglese. A parità di contenuto, 1.000 token corrispondono a circa 600 parole in italiano e 750 in inglese.

Quanti token entrano in una finestra di contesto?

Quelli dichiarati dal modello, meno lo spazio che ti serve per la risposta: un modello con contesto da 128k che legge un prompt da 120k token ne ha solo 8k circa per rispondere. Prompt di sistema, definizioni degli strumenti e cronologia della conversazione occupano tutti la stessa finestra.

Perché un testo breve conta più token del previsto?

Perché parole insolite, identificatori in camelCase, URL, base64 e alfabeti non latini si frammentano in tanti token piccoli, e un'emoji può valere da 3 a 7 token. Anche il JSON è costoso per lo stesso motivo: ogni virgoletta, parentesi e chiave ripetuta diventa un token. È proprio il problema che il formato TOON cerca di risolvere.

Il mio testo viene caricato per contare i token?

No. I tokenizer sono in puro JavaScript (gpt-tokenizer, una versione di tiktoken di OpenAI) e girano nella tua scheda. L'unico traffico di rete è il download dei file dati dei tokenizer la prima volta che apri la pagina; il testo non genera nessuna richiesta.

Dove trovo il prezzo da inserire?

Nella pagina dei prezzi del tuo fornitore: platform.openai.com/pricing, anthropic.com/pricing, ai.google.dev/pricing. I prezzi cambiano spesso, quindi lo strumento non li scrive nel codice. Inserisci la tariffa attuale dei token in input del tuo modello, in dollari per milione di token, e calcola a parte l'output se ti servono entrambi.

Caratteri per token: tarature rapide per tipo di contenuto

Usa questi rapporti per una stima a spanne prima di incollare il testo vero.

Tipo di contenuto≈ caratteri/token1.000 token ≈
Prosa inglese4,0circa 750 parole
Prosa italiana, francese, tedesca3,5circa 600 parole
Codice sorgente3,0circa 55 righe
JSON minificato2,8circa 2,8 KB
Testo cinese o giapponese1,5circa 500 caratteri
Dati Base64 o esadecimali2,5circa 2,5 KB

Misurato con o200k_base su campioni rappresentativi; i singoli testi variano. Per i numeri esatti conta il testo vero con lo strumento qui sopra.

Cambia strumento

Cerca e apri qualsiasi strumento