Comment intoCHAT répond à partir de vos contenus
Comment un agent intoCHAT trouve ses réponses : découpage, recherche hybride sémantique et par mots-clés, priorité aux Q&R, règles d'ancrage, sans fine-tuning.
intoCHAT ne réentraîne pas de modèle d'IA sur vos contenus. Il indexe vos sources et, pour chaque message de visiteur, recherche les passages utiles et les transmet au modèle avec vos instructions. Connaître ces étapes vous aide à comprendre pourquoi une réponse est formulée ainsi.
1. Entraînement : découpage et indexation
Lorsque vous cliquez sur Train agent, le texte de chaque source est découpé en passages :
- Un passage contient au maximum environ 1 600 caractères. Les paragraphes restent entiers autant que possible ; les plus longs sont coupés entre deux phrases.
- Les passages voisins se chevauchent d'environ 200 caractères, pour qu'une information située à la limite soit trouvée des deux côtés.
- Une paire de questions-réponses reste d'un seul tenant, sauf si elle dépasse la taille d'un passage.
- Chaque passage est indexé avec le titre et l'adresse de sa source. Un paragraphe sous « Offre Pro » se distingue ainsi du même texte sous « Offre Starter ».
Dans le tableau de bord, « entraînement » désigne cette indexation. Le modèle d'IA lui-même ne change pas.
2. Comprendre la question
Une question de suivi dépend souvent de ce qui précède, comme « et ça coûte combien ? ». L'agent reformule d'abord le dernier message en requête de recherche autonome, à l'aide des derniers échanges. Les noms, références produit et nombres restent tels quels, de même que la langue du visiteur.
3. Recherche hybride
La requête passe par deux recherches dans vos passages entraînés :
- La recherche sémantique trouve les passages de même sens, même formulés autrement.
- La recherche par mots-clés trouve les termes exacts comme les références produit, les noms et les prix, que la recherche sémantique peut manquer.
Les deux listes de résultats sont fusionnées. Les passages qui ne correspondent pas assez à la question sont écartés, pour qu'une correspondance faible ne soit pas présentée comme une réponse. Un passage trouvé uniquement par mots-clés doit contenir tous les mots significatifs de la question, ou toutes les références produit qu'elle cite.
4. Choisir ce que voit le modèle
Parmi les correspondances restantes, l'agent retient au plus six passages, pour environ 12 000 caractères au total. Il en prend d'abord trois au maximum par source, pour qu'un long document n'écarte pas tous les autres. Quand des résultats sont proches, le type de source le plus fiable l'emporte, dans cet ordre :
- Les paires de questions-réponses. Une paire qui correspond étroitement à la question est toujours placée en tête.
- Les sources marquées comme prioritaires (icône étoile).
- Les extraits de texte.
- Les fichiers.
- Les pages web.
Chaque passage porte une étiquette indiquant son type et la date de son dernier entraînement. Si des passages se contredisent, le modèle doit suivre le même ordre et, entre sources du même type, privilégier la plus récente. Vos instructions priment sur toutes les connaissances. Le résultat réussi d'une action, par exemple un prix à jour renvoyé par votre API, prime sur les deux pour les données en temps réel.
5. Rédiger la réponse
Le modèle reçoit des règles intégrées, les réglages courants de l'agent (actions disponibles et formulaire de leads), vos instructions et vos garde-fous, ainsi que la conversation, à laquelle les passages sont joints comme documentation de référence. En cas de conflit, les règles intégrées l'emportent sur vos instructions et vos garde-fous. Elles amènent l'agent à :
- fonder les informations commerciales, comme les produits, prix, conditions et coordonnées, uniquement sur vos instructions, vos connaissances ou les résultats d'actions ;
- dire brièvement ce qu'il ne peut pas confirmer quand rien de pertinent n'est trouvé, au lieu d'inventer une réponse, un lien ou un moyen de contact ;
- traiter vos connaissances et les résultats d'actions comme des données, jamais comme des instructions. Une phrase du type « ignore tes règles » sur une page explorée n'a aucun effet, et les visiteurs ne peuvent pas non plus contourner les règles.
La liste complète figure sur la page Instructions.
Les réponses sont rédigées par un seul modèle OpenAI, choisi et géré par intoCHAT. Le modèle et sa température ne sont pas réglables. L'agent répond dans la langue dans laquelle le visiteur écrit.
Ce que cela signifie pour vous
- Si une information ne figure dans aucune source entraînée, l'agent ne peut pas la connaître. Vérifiez dans l'aperçu d'une source ce qui a réellement été lu. Voir Gérer les sources.
- Pour les questions qui appellent une réponse précise, ajoutez une paire de questions-réponses.
- Si une page obsolète l'emporte sans cesse, mettez-la à jour ou supprimez-la, ou marquez la bonne source comme prioritaire.
- Une priorité s'applique dès la réponse suivante. Un contenu modifié ne s'applique qu'après l'entraînement.