Web crawler
Ultimo aggiornamento:
Che cos’è un web crawler
Un web crawler, chiamato anche spider o bot, parte da uno o più indirizzi e attraversa un sito pagina dopo pagina. I crawler più noti sono quelli dei motori di ricerca, come Googlebot e Bingbot, che scoprono e indicizzano le pagine. Le aziende di AI usano crawler come GPTBot di OpenAI per raccogliere contenuti per i loro modelli, e le piattaforme di chatbot usano i crawler per leggere il sito di una specifica azienda.
I proprietari dei siti danno istruzioni ai crawler tramite un file robots.txt e possono elencare le loro pagine in una sitemap XML. I crawler corretti rispettano questi segnali e si identificano con il nome di uno user agent.
Come funziona un web crawler
La maggior parte dei crawler lavora in quattro fasi:
Di solito i crawler limitano quante pagine scaricano e con quale velocità, per non sovraccaricare il sito che stanno leggendo.
- Scoperta: raccogliere gli indirizzi delle pagine da una sitemap, dai link delle pagine già lette o da entrambi.
- Download: scaricare ogni pagina. Le pagine che costruiscono i contenuti con JavaScript vanno prima renderizzate in un ambiente simile a un browser, altrimenti il crawler vede una pagina quasi vuota.
- Estrazione: separare il contenuto principale da menu, footer, banner dei cookie e altri elementi ripetuti.
- Archiviazione: salvare il testo per il suo scopo, come un indice di ricerca o la base di conoscenza di un chatbot.
Esempio
Uno studio dentistico vuole un chatbot che risponda a domande su trattamenti e prezzi. Invece di copiare i testi a mano, la titolare inserisce l’indirizzo del sito. Il crawler legge la sitemap e trova 40 pagine, e lei deseleziona l’archivio del blog e gli annunci di lavoro. Le pagine rimanenti su trattamenti, prezzi, orari e convenzioni diventano le conoscenze del chatbot.
Perché conta per i chatbot aziendali
Il sito di un’azienda è di solito la descrizione più completa e già approvata della sua offerta, quindi farlo leggere a un crawler è il modo più rapido per dare conoscenze utili a un chatbot. La qualità della scansione determina la qualità delle risposte: se mancano pagine importanti, se i contenuti in JavaScript non vengono renderizzati o se menu e avvisi sui cookie finiscono nel testo, il recupero peggiora.
Inoltre i siti cambiano. Quando si aggiornano prezzi, condizioni o prodotti, i contenuti acquisiti vanno rinnovati, altrimenti il chatbot continua a rispondere con la versione vecchia.
Come intoCHAT esegue la scansione di un sito
In intoCHAT incolli un URL e il crawler trova le pagine tramite la sitemap e una mappa dei link, fino a 500 URL. Scegli quali pagine includere e puoi escludere percorsi con dei pattern. Le pagine con molto JavaScript vengono renderizzate prima della lettura, e widget di chat e banner dei cookie vengono eliminati dal testo. Il numero di scansioni al mese dipende dal tuo piano e, quando il sito cambia, riaddestri manualmente le fonti interessate: non c’è una sincronizzazione automatica. Per provarlo prima, lo strumento gratuito di anteprima crea un agente temporaneo da 5 pagine di qualsiasi sito.