Passa al contenuto principale

Token, contesto e memoria

Principiante

Tre idee sbloccano un sacco di momenti "perché ha fatto così?": i token, la finestra di contesto e la memoria. Comprendile e smetterai di farti sorprendere dalla deriva, dalle dimenticanze e dalle bollette inattese.

What you'll learn
  • Leggere il testo come fa un modello — in token, non in parole o caratteri
  • Immaginare la finestra di contesto come una scrivania finita, e prevedere quando le cose ci cadono fuori
  • Riconoscere il 'context rot' — perché i modelli possono perdere il centro di un input lungo
  • Conoscere le quattro vere fonti di 'memoria' e come fornirla di proposito

Token: l'unità in cui pensano i modelli

I modelli non leggono caratteri o parole — leggono token, frammenti di testo lunghi all'incirca ¾ di una parola in inglese. "Unbelievable" potrebbe essere 3–4 token; le parole comuni sono un token ciascuna; uno spazio, una virgola o un pezzo di codice costano anch'essi token. Sia il tuo input sia l'output del modello vengono conteggiati, e i token sono esattamente l'unità in cui si misurano prezzi e limiti.

Non devi contarli a mano, ma un'idea approssimativa aiuta: ~750 parole ≈ ~1.000 token. Scrivi qualcosa e osserva:

11parole
72caratteri
~1518token stimati

Solo un'idea approssimativa (~caratteri ÷ 4, oppure parole × 1.33). Il conteggio dei token è specifico per ogni modello — non usare mai il tokenizer di un altro modello. Per numeri esatti usa l'endpoint di conteggio token di Anthropic.

:::tip Perché il rapporto cambia L'inglese semplice si attesta vicino a ¾ di parola per token. Codice, JSON, scritture non latine, URL lunghi e parole rare si frammentano in più token — quindi un file di 500 righe o un paragrafo in cinese costa più di quanto suggerisca il conteggio delle parole. Quando una bolletta o un limite ti sorprende, di solito è per questo. :::

La finestra di contesto: la memoria di lavoro

La finestra di contesto è il numero massimo di token che il modello può considerare in una volta — il tuo system prompt, l'intera conversazione fin lì, i file allegati e la risposta che sta scrivendo, tutto insieme. Pensala come la scrivania del modello: grande, ma finita. Le dimensioni della finestra variano da modello a modello e continuano a crescere — vedi Modelli e prezzi per i numeri attuali invece di memorizzarne uno.

Tutto ciò che il modello "sa" in quel momento vive su quella scrivania:

Quando una conversazione supera la finestra, il contenuto più vecchio cade fuori. Ecco perché una chat molto lunga può sembrare "dimenticarsi" come è iniziata, o allontanarsi dalla tua istruzione originale.

Context rot: non è solo pieno contro vuoto

Un problema più sottile: anche quando tutto entra ancora, i modelli tendono a usare l'inizio e la fine di un input lungo in modo più affidabile rispetto al centro. Seppellisci l'unica frase che conta nel mezzo di un incollaggio di 50 pagine e potrebbe essere sottopesata — un fallimento spesso chiamato "lost in the middle" (perso nel mezzo).

Guided walkthrough1 of 4
  1. Metti l'istruzione o la domanda vera per prima, prima di incollare un documento lungo — non sepolta dopo di esso.

Ecco la stessa richiesta, strutturata in modo che l'istruzione stia nelle posizioni forti:

Istruzione prima, ribadita alla fine

Task: Find every place this contract caps our liability, and quote the exact clause.

[... incolla qui l'intero contratto di 40 pagine ...]

Promemoria del task: elenca solo le clausole sul tetto di responsabilità, con citazioni esatte e numeri di sezione. Ignora tutto il resto.

:::tip In Claude Code Le sessioni di agente lunghe raggiungono lo stesso tetto. Claude Code lo gestisce di proposito — compattando la cronologia e lasciandoti governare cosa resta in vista. Vedi Gestione del contesto e Context Engineering. :::

Memoria: non ce n'è, a meno che tu non la fornisca

Per impostazione predefinita, ogni conversazione è una tabula rasa. Il modello non ricorda la tua ultima chat. Tutto ciò che sembra memoria è una di quattro cose:

FonteCos'èCome la controlli
Cronologia reinviataLe app di chat reinviano la conversazione a ogni turno, finché la finestra non si riempieAprendo nuove chat; mantenendo i thread focalizzati
Funzionalità di memoriaAlcune superfici di Claude trasportano fatti tra le chatImpostazioni Memoria tra le chat
File che fornisciContesto persistente che alleghi di propositoProjects, CLAUDE.md
Il tuo codiceL'API è stateless — reinvii tu i messaggi precedentiPrima chiamata API

Il filo conduttore: se vuoi che il modello ricordi qualcosa, devi continuare a metterglielo sulla scrivania.

Perché è importante

Quasi ogni problema del tipo "ha ignorato la mia istruzione precedente" o "ha perso il filo" risale a una di tre cose: la finestra si è riempita, una nuova sessione è partita da zero, oppure il dettaglio chiave stava nel centro morto di un incollaggio lungo. Sapendolo, strutturerai prompt e sessioni per tenere le cose importanti in vista.

Mettiti alla prova

Check yourself

0/3
  1. All'incirca quanti token sono 750 parole di inglese semplice?
  2. Una chat lunga inizia a 'dimenticare' come è cominciata. La causa più probabile è:
  3. Devi incollare un documento enorme più un'istruzione chiave. Posizionamento migliore?

Termini chiave

Fissa il vocabolario
Premi Invio o Spazio per girare la carta. Usa le frecce sinistra e destra per spostarti tra le carte.Termine mostrato.
1 / 4

:::note Punti chiave

  • I token sono l'unità sia del pensiero sia della fatturazione — ~1.000 ogni 750 parole inglesi, di più per codice e altre scritture.
  • La finestra di contesto è una scrivania finita; le chat lunghe dimenticano perché il contenuto vecchio ci cade fuori.
  • Anche all'interno della finestra, apri con la tua istruzione e ribadiscila alla fine — il centro viene sottoutilizzato.
  • Non c'è memoria per impostazione predefinita. Forniscila di proposito con file, Projects, CLAUDE.md, o reinviando la cronologia. :::

Avanti