Finestre di contesto spiegate: perché la tua AI dimentica le cose durante la conversazione (e cosa risolve davvero il problema)

La tua AI non dimentica le cose perché si confonde: sta esaurendo lo spazio. Ogni modello ha una "finestra di contesto" fissa, ossia la quantità totale di testo che può contenere e analizzare contemporaneamente. Quando la finestra si riempie, qualcosa deve cedere: i messaggi più vecchi vengono messi in secondo piano da quelli più nuovi, sepolti sotto di essi oppure eliminati del tutto.

Ultimo aggiornamento: luglio 2026 · A cura del team di KissMySkills

Che cos'è davvero una finestra di contesto

Ogni volta che invii un messaggio a Claude, ChatGPT o Gemini, il modello non vede soltanto quel messaggio. Vede l'intera conversazione fino a quel momento: tutto ciò che hai scritto, tutto ciò a cui ha risposto, oltre a eventuali documenti, immagini o file allegati, riuniti in un unico input. L'intero insieme costituisce il "contesto". La "finestra" è il limite massimo di contenuti che il modello può elaborare in un'unica operazione.

Le finestre di contesto si misurano in token, piccole porzioni di testo, ciascuna delle quali corrisponde all'incirca a ¾ di una parola. Un modello con una finestra di 100.000 token può contenere circa 75.000 parole complessive tra conversazione, documenti e istruzioni prima di raggiungere il limite. Sembra molto, finché non si ricorda che un singolo PDF di 40 pagine, un'esportazione di un foglio di calcolo o la trascrizione di una lunga riunione possono consumare da soli decine di migliaia di token, prima ancora che tu abbia posto la domanda vera e propria.

La cosa importante da capire è questa: la finestra di contesto non è un database in cui il modello cerca informazioni. È più simile alla memoria a breve termine. Per il modello, nulla di ciò che si trova al di fuori di quella finestra esiste e tutto ciò che vi rientra compete per la sua limitata attenzione.

Perché sembra che l'AI "dimentichi"

Le persone descrivono questo fenomeno dicendo che l'AI "dimentica" l'inizio di una lunga chat o perde di vista i dettagli di un documento caricato. È un modo ragionevole per descrivere ciò che si osserva, ma non è esattamente ciò che accade sotto il cofano. Stanno accadendo due cose diverse, che si sommano.

1. Dimenticanza graduale: diluizione

Man mano che una conversazione cresce, i contenuti più vecchi non scompaiono: diventano semplicemente una frazione sempre più piccola di ciò che il modello sta esaminando. Le istruzioni, le decisioni o i fatti iniziali acquistano proporzionalmente meno "peso" rispetto a tutto ciò che è stato detto dopo. Tecnicamente il modello ha ancora accesso a quei contenuti, ma deve lavorare di più per individuarli e dare loro la giusta priorità tra tutto il resto stipato nella finestra e, nella pratica, la qualità nelle conversazioni lunghe peggiora visibilmente: il modello contraddice risposte precedenti, ripete domande a cui hai già risposto oppure perde il filo di un'istruzione articolata di dieci scambi prima.

2. Dimenticanza completa: troncamento

Quando la conversazione supera effettivamente il limite massimo della finestra, è necessario eliminare qualcosa per fare spazio ai nuovi input. La maggior parte dei prodotti di chat gestisce la situazione eliminando o riassumendo silenziosamente i turni più vecchi. A quel punto il contenuto non è semplicemente diluito: è davvero scomparso. Il modello non può più vederlo, indipendentemente da quanto fosse importante.

Nessuna delle due è esattamente un bug. È la conseguenza fisica del riempimento di una finestra di dimensioni fisse. Ma significa che due abitudini comuni - incollare un documento enorme e lasciare che una chat diventi lunga e dispersiva - sono i due modi più rapidi per far crollare la qualità dell'output, spesso senza rendersi conto del motivo per cui le risposte sono peggiorate.

Il costo nascosto del "carica semplicemente il documento"

Caricare un file grande sembra gratuito. Non lo è. Un contratto voluminoso, un rapporto di ricerca o un intero dataset possono consumare un'enorme parte della finestra disponibile prima che il modello abbia elaborato una sola parola della tua richiesta effettiva. Se il tuo modello ha, per esempio, una finestra di 150.000 token e il tuo documento ne occupa 90.000, te ne restano 60.000 per le istruzioni di sistema, la cronologia della conversazione e il ragionamento e la risposta del modello - in un'attività che potrebbe richiedere davvero di sintetizzare l'intero documento.

Questa è esattamente la situazione che mette in difficoltà le persone quando svolgono lavori analitici complessi: report di marketing pieni di tabelle, modelli finanziari, lunghi corpus di ricerca. Più l'input è grande e disordinato, meno spazio rimane all'AI per ragionare davvero bene su ciò che le stai chiedendo di fare con quell'input.

Progettato per il lavoro incentrato sui documenti
Skill AI Rafa - Specialista di analisi di marketing
Skill AI Rafa - Specialista di analisi di marketing
$29questa Skill rispetto a $200un consulente di analisi/hr

Rafa trasforma Claude in uno Specialista senior di analisi di marketing proprio per questo problema: analizzare report densi, dashboard e dati delle campagne senza che le istruzioni permanenti occupino lo spazio necessario al tuo documento.

Visualizza Rafa - Specialista di analisi di marketing →

Perché anche le chat lunghe e dispersive peggiorano le cose

L'altra trappola è la chat maratona - il thread che non chiudi mai perché "ha già tutto il contesto". Ogni botta e risposta, ogni digressione abbandonata, ogni "in realtà, proviamo a farlo in un altro modo" rimane nella finestra, occupando spazio e diluendo ciò che conta davvero. Al cinquantesimo messaggio, il modello si ritrova a gestire un mucchio di cronologia parzialmente pertinente insieme alla tua richiesta attuale e reale, dando a tutto più o meno lo stesso peso.

La soluzione non è "non avere mai conversazioni lunghe". È essere consapevoli di cosa sta effettivamente occupando spazio in quella finestra e assicurarsi che le cose che vuoi che il modello consideri prioritarie - il tuo compito attuale, il tuo documento attuale - non siano sommerse da elementi che non contano più.

Dove entrano in gioco i file Skill

Questo è il motivo pratico per cui esistono i file Skill (o i prompt di sistema, le istruzioni personalizzate, le istruzioni del progetto: stessa idea, nome diverso a seconda della piattaforma). Un file Skill separa due tipi di contenuto molto diversi che normalmente vengono ammassati nella finestra di contesto:

  • Istruzioni permanenti - chi dovrebbe impersonare l'AI, quali standard applicare e in quale formato produrre l'output. Non cambiano da un'attività all'altra.
  • Contenuto dell'attività - il documento che stai analizzando, i dati con cui stai lavorando, la conversazione effettiva sul problema concreto. Cambia ogni volta.

Quando incolli nella chat stessa una spiegazione lunga e discorsiva del tipo «comportati come un analista senior, segui questa struttura, usa questo tono, fai sempre X e non fare mai Y», quella spiegazione occupa spazio nella finestra e richiede attenzione insieme al tuo documento e alle tue domande - ogni singola volta, in ogni conversazione. Un file Skill carica una volta sola quello stesso insieme di istruzioni, in forma compatta, come un ruolo definito che il modello assume. È scritto in modo più conciso rispetto a una tipica spiegazione in botta e risposta e non viene rimesso in discussione o rispiegato a metà conversazione come spesso accade con le istruzioni ad hoc.

Il risultato è semplice: una parte maggiore della finestra resta disponibile per ciò che varia davvero - il report che hai caricato, i dati su cui stai facendo domande, le venti domande successive in questa sessione. La qualità rimane elevata più a lungo perché il modello non deve dividere la sua attenzione limitata tra «ricordare come dovrebbe comportarsi» e «capire cosa stai chiedendo davvero in questo momento».

Ideale per conversazioni lunghe e ad alto rischio
Skill AI Ryan - Chief of Staff
Skill AI Ryan - Chief of Staff
$29questa Skill rispetto a $150,000assumere un chief of staff

Ryan configura Claude per il tipo esatto di lavoro dirigenziale continuativo e ad alto livello di contesto - documenti per il consiglio di amministrazione, briefing, memo decisionali - in cui un ruolo permanente e conciso diventa più importante man mano che la conversazione cresce.

Visualizza Ryan - Chief of Staff →

Abitudini pratiche che aiutano davvero

  • Avvia nuove conversazioni per i nuovi compiti. Una nuova conversazione offre una finestra pulita - nessuna cronologia diluita che compete con la richiesta attuale.
  • Tieni separate e concise le istruzioni permanenti. Un file Skill caricato una volta è meglio che rispiegare le tue aspettative in ogni chat.
  • Riduci ciò che carichi. Se ti servono solo i capitoli 3 e 4, non caricare l'intero libro - ogni pagina superflua è costituita da token che il modello non può dedicare alla tua domanda.
  • Riassumi prima di continuare. In un progetto di lunga durata, chiedi periodicamente al modello (o fallo tu) di condensare le decisioni chiave prese finora in un breve riepilogo, poi avvia una nuova conversazione con quel riepilogo e il tuo file Skill.
  • Riconosci i segnali d'allarme. Domande ripetute, risposte che contraddicono quelle precedenti o risposte vaghe a richieste specifiche sono spesso sintomi di una finestra di contesto sovraccarica o troncata - non di un problema legato a un prompt più efficace.

In sintesi:

Ogni modello AI ha una finestra di contesto fissa e, quando si riempie, i contenuti più vecchi vengono diluiti o eliminati - è questo il "dimenticare" che stai notando, non confusione. Sia i caricamenti di documenti voluminosi sia le cronologie di chat interminabili consumano quella stessa quantità limitata di spazio. Mantenere le istruzioni permanenti compatte e separate, come con Rafa (Marketing Analytics Specialist) o Ryan (Chief of Staff), lascia più spazio al documento e al contenuto dell'attività che ne hanno effettivamente bisogno - così le risposte rimangono precise più a lungo.

Strumento gratuito · Modalità individuale o per team
Scopri il tuo numero: Calcolatore dei costi dei token AI

Inserisci il modo in cui tu (o il tuo team) usate effettivamente le chat AI e ottieni una stima reale mensile dello spreco di token e dei costi in denaro per il re-prompting rispetto a un file di skill persistente. Nessuna registrazione, nessuna email - solo i calcoli di questo post applicati ai tuoi numeri.

Prova il calcolatore →

Domande frequenti

Che cosa concorre esattamente alla finestra di contesto?

Tutto ciò che contiene la conversazione attuale: i tuoi messaggi, le risposte del modello, qualsiasi prompt di sistema o istruzione del file di skill e il testo completo estratto da eventuali file o documenti allegati. Viene tutto misurato insieme in token rispetto a un unico limite condiviso.

Iniziare una nuova chat risolve davvero il problema?

Sì, nel senso che libera completamente la finestra - nessuna cronologia diluita, nessun rischio di troncamento a partire da un punto precedente della conversazione. Il compromesso è che perdi qualsiasi contesto del vecchio thread che non hai trasferito, quindi vale la pena portare nella nuova chat un breve riepilogo insieme al tuo file di skill, invece di partire da zero.

Perché non usare semplicemente un modello con una finestra di contesto più grande?

Una finestra più grande aiuta, ma non elimina le dinamiche di fondo - diluizione e prioritizzazione si verificano comunque su larga scala, e gli input enormi continuano a costare token reali, indipendentemente dal fatto che il limite sia di 100.000 o 1.000.000. Una finestra più grande ti offre più spazio; non ti offre un modello che sappia automaticamente a cosa dare la priorità al suo interno.

In cosa è diverso un file di skill dal semplice scrivere buone istruzioni nella chat?

Entrambe le opzioni possono funzionare, ma le istruzioni digitate direttamente in una chat si trovano nella stessa finestra affollata di tutto il resto e spesso vengono ripetute, contraddette o diluite man mano che la conversazione cresce. Un file di skill viene caricato una volta come ruolo definito - compatto e separato dal contenuto dell'attività - quindi non compete per lo spazio con il documento o i dati su cui stai effettivamente lavorando.

Correlati: Le migliori skill per Claude per dirigenti e chief of staff · I migliori marketplace di skill per Claude (a confronto)

~/get-started

Skills che funzionano. Niente fronzoli.

Esplora ogni skill, prompt pack e agent nello store.

Sfoglia tutte le competenze →Oppure prova gli strumenti gratuiti