Scansiona il tuo sito per addestrare l'agente AI
Aggiungi il tuo sito a un agente intoCHAT: pagine trovate da sitemap e link, scelta delle pagine, percorsi esclusi, siti JavaScript e limiti di scansione.
Il modo più rapido per dare conoscenza al tuo agente è fargli leggere il tuo sito. Inserisci un indirizzo, intoCHAT elenca le pagine che trova e tu scegli quali aggiungere.
Trovare e aggiungere pagine
- Apri la scheda Knowledge (conoscenza) dell'agente e scegli Website in Add knowledge.
- Inserisci il sito in Website URL, per esempio
https://example.com. - Facoltativo: in Exclude URLs containing indica parti di indirizzi da saltare, separate da virgole, per esempio
/blog, /careers, ?lang=. - Clicca su Find pages (trova pagine).
- Controlla l'elenco. Usa Filter pages…, Select all (tutte) o None (nessuna) e spunta le pagine una per una.
- Clicca su Add … selected pages e attendi che la barra di avanzamento finisca.
- Clicca su Train agent in alto nella scheda.
Le pagine aggiunte vengono salvate subito con lo stato Pending (in attesa). L'agente le usa solo dopo l'addestramento.
Come vengono trovate le pagine
Find pages combina due metodi:
- Sitemap: intoCHAT cerca una sitemap nelle posizioni comuni come
/sitemap.xmle/wp-sitemap.xml, e nella rigaSitemap:del filerobots.txt. Le pagine di login, registrazione e amministrazione vengono saltate. - Mappa dei link: un crawler raccoglie i link dello stesso dominio.
Ogni metodo restituisce fino a 500 indirizzi. Duplicati come /about e /about/, immagini, feed e altri file che non sono pagine vengono rimossi. I link a file PDF restano nell'elenco e vengono letti come pagine.
Su un sito multilingue con cartelle di lingua come /de/ e /fr/, sopra l'elenco compare una riga Languages (lingue). Sono preselezionate le pagine nella lingua dell'indirizzo inserito, più la home page; clicca su una lingua per selezionare o deselezionare tutte le sue pagine. Le pagine già presenti nella tua conoscenza mostrano already added e non sono selezionate.
Cosa viene letto da ogni pagina
intoCHAT legge il contenuto principale di ogni pagina. Widget di chat e banner dei cookie vengono rimossi, e menu o banner ripetuti su ogni pagina vengono tenuti una sola volta.
Alcuni siti costruiscono i contenuti in JavaScript dopo il caricamento. Se più pagine tornano come lo stesso guscio vuoto, intoCHAT le rilegge lasciando loro qualche secondo per caricarsi, e fa lo stesso per il resto della scansione; questi siti richiedono quindi più tempo. Se il crawler è occupato, la scansione si ferma con un conto alla rovescia e poi riprende da sola.
Le pagine andate in timeout vengono riprovate una volta alla fine. Una pagina che fallisce ancora viene segnata come failed: passaci sopra con il mouse per vedere il motivo, poi selezionala e aggiungila di nuovo.
Single page mode
Attiva Single page mode (modalità pagina singola) per aggiungere un solo indirizzo senza esplorare il sito. Il pulsante diventa Add page. Usalo per una pagina che la ricerca non ha trovato. Per aggiornare una pagina già aggiunta, usa invece Refresh from website (aggiorna dal sito) sulla sua fonte.
Limiti di scansione
| Piano | Scansioni del sito al mese | Caratteri per agente |
|---|---|---|
| Free | 1 | 100K |
| Starter | 9 | 500K |
| Pro | 20 | 1M |
| Enterprise | personalizzato | personalizzato |
- La ricerca con Find pages non consuma scansioni.
- Aggiungere pagine consuma una scansione, che si tratti di una selezione o di una pagina singola. Tutte le pagine dello stesso giro la condividono. Refresh from website su una fonte conta come l'aggiunta di una pagina singola.
- Le scansioni si contano per account, su tutti gli agenti, e si azzerano ogni mese.
- Il testo scansionato rientra nel limite di caratteri dell'agente. Se un giro raggiunge il limite, le pagine rimanenti vengono segnate come non riuscite.
Quando non ne restano, intoCHAT mostra "Monthly crawl limit reached". Puoi comunque aggiungere file, testi e Q&A.
Siti che bloccano i crawler
Alcuni siti respingono i visitatori automatici con una protezione anti-bot o un firewall. In quel caso vedi "No pages found", oppure le pagine falliscono con pochissimo contenuto o nessuno. Prova Single page mode per le pagine più importanti, salva le pagine chiave in PDF e caricale come file, oppure incolla il loro testo come testo.
Si possono scansionare solo indirizzi pubblici http e https. Le pagine dietro un login, gli indirizzi con nome utente e password e gli indirizzi di reti private o interne vengono rifiutati.
Tenere aggiornate le pagine
Non c'è una sincronizzazione automatica, e Re-index saved text (reindicizza il testo salvato) addestra soltanto di nuovo il testo letto in precedenza. Per recepire le modifiche di una pagina, clicca su Refresh from website (l'icona a nuvola) nella sua fonte. intoCHAT rilegge la pagina e, se il testo è cambiato, lo salva e la riaddestra subito; altrimenti vedi "No changes found". Una pagina letta nell'ultima ora può provenire da una copia in cache.
Per aggiornare molte pagine insieme, aggiungile di nuovo con Find pages, poi addestra. Le fonti esistenti vengono aggiornate invece di essere duplicate. Vedi Gestire le fonti.