Finestra di contesto (context window)
Ultimo aggiornamento:
Che cos’è la finestra di contesto
Un modello linguistico non ha memoria nel senso umano. Per ogni risposta l’applicazione gli invia un blocco di testo, che il modello legge prima di scrivere. La finestra di contesto è il limite massimo di quel blocco, risposta compresa. Si misura in token, i piccoli pezzi di testo su cui lavorano i modelli.
Le finestre di contesto sono cresciute in fretta. I modelli attuali vanno da qualche migliaio a centinaia di migliaia di token, e alcuni ne accettano di più. Una finestra più ampia permette di leggere documenti o conversazioni più lunghi in un colpo solo, ma di solito costa di più e richiede più tempo per ogni richiesta.
Come si riempie la finestra di contesto
Per una singola risposta di un chatbot, la finestra di contesto deve di solito contenere:
Se il totale supera il limite, qualcosa va sacrificato: i messaggi più vecchi vengono tolti o riassunti, si includono meno passaggi oppure la richiesta fallisce. Alcuni studi hanno inoltre rilevato che i modelli possono prestare meno attenzione alle informazioni sepolte a metà di un contesto molto lungo, quindi una finestra più grande non garantisce che venga sfruttata meglio.
- Il prompt di sistema con le istruzioni e le regole del bot.
- La conversazione fin qui, o una sua versione ridotta.
- I passaggi recuperati dalla base di conoscenza.
- I risultati di strumenti o chiamate API, se presenti.
- Lo spazio per la risposta che il modello sta per scrivere.
Esempio
Un visitatore parla per un po’ di divani con il chatbot di un negozio di arredamento, poi chiede della consegna. Il chatbot non reinvia l’intero catalogo e tutte le pagine sulle condizioni. Recupera i pochi passaggi sulla consegna, aggiunge la parte recente della conversazione e le sue istruzioni, e resta ben dentro la finestra. Se a ogni messaggio includesse tutte le pagine del sito, raggiungerebbe presto il limite e diventerebbe lento e costoso.
Perché conta per i chatbot aziendali
La finestra di contesto spiega perché un chatbot non può semplicemente leggere tutto il tuo sito a ogni domanda. I buoni sistemi scelgono cosa inserire nella finestra: i contenuti più pertinenti, le istruzioni che contano e abbastanza conversazione per seguire il filo. Questa selezione, più della dimensione della finestra, determina qualità delle risposte, velocità e costi. Spiega anche perché in una conversazione molto lunga si possono perdere dettagli citati molto prima.
La finestra di contesto e intoCHAT
intoCHAT tiene la tua base di conoscenza fuori dalla finestra di contesto. Per ogni messaggio recupera gli estratti più pertinenti dei tuoi contenuti con una ricerca ibrida, che combina corrispondenza semantica e per parole chiave, e invia al modello quegli estratti, le tue istruzioni e la conversazione, non l’intera base di conoscenza. Non devi gestire dimensione del contesto o token: i piani si misurano in messaggi al mese e caratteri di contenuti di addestramento.