Vai al contenuto

Web crawler

Ultimo aggiornamento:

Che cos’è un web crawler

Un web crawler, chiamato anche spider o bot, parte da uno o più indirizzi e attraversa un sito pagina dopo pagina. I crawler più noti sono quelli dei motori di ricerca, come Googlebot e Bingbot, che scoprono e indicizzano le pagine. Le aziende di AI usano crawler come GPTBot di OpenAI per raccogliere contenuti per i loro modelli, e le piattaforme di chatbot usano i crawler per leggere il sito di una specifica azienda.

I proprietari dei siti danno istruzioni ai crawler tramite un file robots.txt e possono elencare le loro pagine in una sitemap XML. I crawler corretti rispettano questi segnali e si identificano con il nome di uno user agent.

Come funziona un web crawler

La maggior parte dei crawler lavora in quattro fasi:

Di solito i crawler limitano quante pagine scaricano e con quale velocità, per non sovraccaricare il sito che stanno leggendo.

  • Scoperta: raccogliere gli indirizzi delle pagine da una sitemap, dai link delle pagine già lette o da entrambi.
  • Download: scaricare ogni pagina. Le pagine che costruiscono i contenuti con JavaScript vanno prima renderizzate in un ambiente simile a un browser, altrimenti il crawler vede una pagina quasi vuota.
  • Estrazione: separare il contenuto principale da menu, footer, banner dei cookie e altri elementi ripetuti.
  • Archiviazione: salvare il testo per il suo scopo, come un indice di ricerca o la base di conoscenza di un chatbot.

Esempio

Uno studio dentistico vuole un chatbot che risponda a domande su trattamenti e prezzi. Invece di copiare i testi a mano, la titolare inserisce l’indirizzo del sito. Il crawler legge la sitemap e trova 40 pagine, e lei deseleziona l’archivio del blog e gli annunci di lavoro. Le pagine rimanenti su trattamenti, prezzi, orari e convenzioni diventano le conoscenze del chatbot.

Perché conta per i chatbot aziendali

Il sito di un’azienda è di solito la descrizione più completa e già approvata della sua offerta, quindi farlo leggere a un crawler è il modo più rapido per dare conoscenze utili a un chatbot. La qualità della scansione determina la qualità delle risposte: se mancano pagine importanti, se i contenuti in JavaScript non vengono renderizzati o se menu e avvisi sui cookie finiscono nel testo, il recupero peggiora.

Inoltre i siti cambiano. Quando si aggiornano prezzi, condizioni o prodotti, i contenuti acquisiti vanno rinnovati, altrimenti il chatbot continua a rispondere con la versione vecchia.

Come intoCHAT esegue la scansione di un sito

In intoCHAT incolli un URL e il crawler trova le pagine tramite la sitemap e una mappa dei link, fino a 500 URL. Scegli quali pagine includere e puoi escludere percorsi con dei pattern. Le pagine con molto JavaScript vengono renderizzate prima della lettura, e widget di chat e banner dei cookie vengono eliminati dal testo. Il numero di scansioni al mese dipende dal tuo piano e, quando il sito cambia, riaddestri manualmente le fonti interessate: non c’è una sincronizzazione automatica. Per provarlo prima, lo strumento gratuito di anteprima crea un agente temporaneo da 5 pagine di qualsiasi sito.

Domande frequenti

Che differenza c’è tra un web crawler e uno scraper?

Un crawler si occupa di scoprire e visitare le pagine seguendo link o sitemap. Uno scraper si occupa di estrarre dati specifici dalle pagine, come prezzi o contatti. Molti strumenti fanno entrambe le cose: scansionano per trovare le pagine e poi ne estraggono i contenuti.

Il crawler di un chatbot può leggere siti in JavaScript?

Solo se prima renderizza le pagine, come fa un browser. I siti che caricano i contenuti tramite JavaScript possono sembrare quasi vuoti a un crawler che legge solo l’HTML grezzo. intoCHAT renderizza le pagine con molto JavaScript prima di leggerle.

Come tengo i crawler lontani da alcune parti del sito?

Il metodo standard è un file robots.txt che indica ai crawler quali percorsi non visitare, anche se funziona solo se il crawler sceglie di rispettarlo. Per un chatbot che configuri tu, è più semplice escludere le pagine nelle impostazioni di scansione. In intoCHAT deselezioni le pagine o escludi percorsi con dei pattern prima dell’addestramento.

intoCHAT riesegue la scansione del sito in automatico?

No. intoCHAT non ha una sincronizzazione automatica, quindi quando il tuo sito cambia riaddestri manualmente le fonti interessate. Il numero di scansioni del sito al mese dipende dal tuo piano.

Guardalo rispondere dal tuo sito

Incolla l’indirizzo del tuo sito e chatta con un agente creato dalle tue pagine. Ci vuole circa un minuto.

Crea il tuo agente gratis

Piano gratuito, nessuna carta di credito.