# Explorer votre site pour entraîner votre agent IA

> Ajoutez votre site à un agent intoCHAT : pages trouvées via sitemap et liens, sélection, exclusion de chemins, sites JavaScript et limites d'exploration.

Le moyen le plus rapide de donner des connaissances à votre agent est de lui faire lire votre site. Vous saisissez une adresse, intoCHAT liste les pages trouvées et vous choisissez celles à ajouter.

## Trouver et ajouter des pages

1. Ouvrez l'onglet **Knowledge** (connaissances) de l'agent et choisissez **Website** sous **Add knowledge**.
2. Saisissez votre site dans **Website URL**, par exemple `https://example.com`.
3. Facultatif : dans **Exclude URLs containing**, indiquez des parties d'adresses à ignorer, séparées par des virgules, par exemple `/blog, /careers, ?lang=`.
4. Cliquez sur **Find pages** (trouver les pages).
5. Vérifiez la liste. Utilisez **Filter pages…**, **Select all** (tout) ou **None** (aucune) et cochez les pages une à une.
6. Cliquez sur **Add … selected pages** et attendez la fin de la barre de progression.
7. Cliquez sur **Train agent** en haut de l'onglet.

Les pages ajoutées sont enregistrées immédiatement avec le statut **Pending** (en attente). L'agent ne les utilise qu'après l'entraînement.

## Comment les pages sont trouvées

**Find pages** combine deux méthodes :

- **Sitemap** : intoCHAT cherche un sitemap aux emplacements courants comme `/sitemap.xml` et `/wp-sitemap.xml`, ainsi que dans la ligne `Sitemap:` du fichier `robots.txt`. Les pages de connexion, d'inscription et d'administration sont ignorées.
- **Carte des liens** : un robot collecte les liens du même domaine.

Chaque méthode renvoie jusqu'à 500 adresses. Les doublons comme `/about` et `/about/`, les images, les flux et les autres fichiers qui ne sont pas des pages sont retirés. Les liens vers des PDF restent dans la liste et sont lus comme des pages.

Sur un site multilingue avec des dossiers de langue comme `/de/` et `/fr/`, une ligne **Languages** (langues) apparaît au-dessus de la liste. Les pages dans la langue de l'adresse saisie sont présélectionnées, ainsi que la page d'accueil ; cliquez sur une langue pour sélectionner ou désélectionner toutes ses pages. Les pages déjà présentes dans vos connaissances affichent **already added** et ne sont pas sélectionnées.

## Ce qui est lu sur chaque page

intoCHAT lit le contenu principal de chaque page. Les widgets de chat et les bannières de cookies sont retirés, et les menus ou bannières répétés sur chaque page ne sont conservés qu'une fois.

Certains sites construisent leur contenu en JavaScript après le chargement. Si plusieurs pages reviennent sous la forme d'une même coquille vide, intoCHAT les relit en leur laissant quelques secondes pour se charger, puis fait de même pour le reste de l'exploration ; ces sites prennent donc plus de temps. Si le robot est occupé, l'exploration marque une pause avec un compte à rebours, puis reprend seule.

Les pages qui expirent sont réessayées une fois à la fin. Une page qui échoue encore est marquée **failed** : survolez-la pour voir pourquoi, puis sélectionnez-la et ajoutez-la de nouveau.

## Single page mode

Activez **Single page mode** (mode page unique) pour ajouter une seule adresse sans parcourir le site. Le bouton devient **Add page**. Utilisez-le pour une page que la découverte a manquée. Pour mettre à jour une page déjà ajoutée, utilisez plutôt **Refresh from website** (actualiser depuis le site) sur sa source.

## Limites d'exploration

| Offre | Explorations de site par mois | Caractères par agent |
|---|---|---|
| Free | 1 | 100K |
| Starter | 9 | 500K |
| Pro | 20 | 1M |
| Enterprise | sur mesure | sur mesure |

- La recherche avec **Find pages** ne consomme pas d'exploration.
- Ajouter des pages consomme une exploration, qu'il s'agisse d'une sélection ou d'une page unique. Toutes les pages d'un même passage la partagent. **Refresh from website** sur une source compte comme l'ajout d'une page unique.
- Les explorations sont comptées par compte, tous agents confondus, et remises à zéro chaque mois.
- Le texte exploré est décompté de la limite de caractères de l'agent. Si un passage atteint cette limite, les pages restantes sont marquées en échec.

Quand il n'en reste plus, intoCHAT affiche « Monthly crawl limit reached ». Vous pouvez toujours ajouter des [fichiers](/fr/docs/files), du [texte et des questions-réponses](/fr/docs/text-and-qa).

## Sites qui bloquent les robots

Certains sites refusent les visiteurs automatisés grâce à une protection anti-robots ou un pare-feu. Vous voyez alors « No pages found », ou les pages échouent avec peu ou pas de contenu. Essayez **Single page mode** pour les pages essentielles, enregistrez les pages clés en PDF pour les importer comme fichiers, ou collez leur texte comme extrait de texte.

Seules les adresses publiques `http` et `https` peuvent être explorées. Les pages derrière une connexion, les adresses contenant un nom d'utilisateur et un mot de passe, et les adresses de réseau privé ou interne sont refusées.

## Garder les pages à jour

Il n'y a pas de synchronisation automatique, et **Re-index saved text** (réindexer le texte enregistré) ne fait que réentraîner le texte lu auparavant. Pour prendre en compte les modifications d'une page, cliquez sur **Refresh from website** (l'icône en forme de nuage) sur sa source. intoCHAT relit cette page et, si son texte a changé, l'enregistre et la réentraîne aussitôt ; sinon, vous voyez « No changes found ». Une page lue dans l'heure précédente peut provenir d'une copie en cache.

Pour mettre à jour de nombreuses pages à la fois, ajoutez-les de nouveau via **Find pages**, puis entraînez. Les sources existantes sont mises à jour au lieu d'être dupliquées. Voir [Gérer les sources](/fr/docs/managing-sources).
