Embedding
Ultimo aggiornamento:
Che cosa sono gli embedding
Un modello di embedding trasforma una parola, una frase o un paragrafo in un vettore: una lista di numeri di lunghezza fissa, spesso da alcune centinaia a qualche migliaio di valori. Presi singolarmente, i numeri dicono poco. Conta la posizione: testi che parlano di cose simili ricevono vettori che puntano in direzioni simili.
Così il significato diventa misurabile. «Come restituisco una giacca?» e «Qual è la vostra politica di rimborso per l’abbigliamento?» non hanno quasi parole in comune, ma i loro embedding sono vicini e il sistema può considerarli collegati.
Come funzionano gli embedding
I modelli di embedding sono reti neurali addestrate su grandi quantità di testo per collocare vicini i contenuti affini. In un chatbot si usano in tre passaggi:
I vettori di modelli di embedding diversi non sono compatibili. Se il modello cambia, tutti i contenuti vanno rielaborati.
- Ogni chunk dei tuoi contenuti viene inviato una volta al modello di embedding e il vettore risultante viene salvato.
- Quando arriva una domanda, viene trasformata in embedding con lo stesso modello.
- Il sistema confronta il vettore della domanda con quelli salvati, di solito tramite similarità del coseno, e restituisce i chunk più vicini.
Esempio
Un hotel salva le sue FAQ come chunk con i relativi embedding. Un ospite chiede: «Posso portare il mio cane?». Il chunk più vicino è quello sulla politica per gli animali, che dice che gli animali domestici sono benvenuti con un supplemento a notte. Una ricerca per parola chiave su «cane» potrebbe non trovarlo se la pagina parla solo di «animali domestici», mentre gli embedding riconoscono il legame.
Perché gli embedding contano per i chatbot aziendali
I visitatori usano raramente le stesse parole del tuo sito. Con gli embedding un chatbot trova il passaggio giusto nonostante sinonimi, errori di battitura e parafrasi. I modelli di embedding multilingue possono perfino collegare una domanda in una lingua a contenuti scritti in un’altra.
Il loro punto debole sono i termini esatti. Codici prodotto, numeri di modello e nomi rari possono essere abbinati male, perché un vettore coglie il significato generale e non la stringa precisa. Per questo molti sistemi combinano gli embedding con la ricerca per parole chiave.
Come intoCHAT usa gli embedding
Quando addestri un agente intoCHAT, ogni chunk delle tue pagine web, dei file, degli snippet di testo e delle coppie di domande e risposte riceve un embedding, e intoCHAT li salva e li indicizza per te. Durante la chat, la domanda del visitatore viene trasformata in embedding e confrontata con i tuoi contenuti, e i risultati vengono uniti a una ricerca per parole chiave in un’unica classifica ibrida. Se modifichi una fonte, riaddestrarla ne aggiorna gli embedding.