Génération augmentée par récupération (RAG)
Dernière mise à jour:
Ce qu’est le RAG
Un modèle de langage ne connaît que ce qui figurait dans ses données d’entraînement. Le RAG ajoute une étape de consultation : avant que le modèle réponde, le système récupère les textes pertinents dans une base de connaissances et les insère dans le prompt. Le modèle rédige alors sa réponse à partir de ce contenu, au lieu de s’appuyer uniquement sur sa mémoire.
Le terme vient d’un article de recherche publié en 2020 par Patrick Lewis et ses collègues de Facebook AI Research. Il désigne aujourd’hui la plupart des chatbots et assistants qui répondent à partir des contenus d’une organisation.
Comment fonctionne le RAG
Un système RAG comporte une phase de préparation et une phase à chaque question :
La qualité d’un système RAG dépend fortement de la recherche. Si le bon passage n’est pas trouvé, même un excellent modèle ne peut pas répondre correctement.
- Indexation, en amont : les documents sont découpés en segments (chunks), chaque segment est converti en embedding, puis l’ensemble est stocké dans un index interrogeable.
- Récupération : la question est comparée à l’index par recherche sémantique, par mots-clés ou les deux, et les segments les plus pertinents sont retenus.
- Augmentation : ces segments sont ajoutés au prompt avec les instructions et l’historique de la conversation.
- Génération : le modèle de langage rédige une réponse à partir des textes récupérés et, s’il est bien configuré, signale quand ils ne contiennent pas la réponse.
Exemple
On demande au chatbot d’un éditeur de logiciels : « Puis-je exporter mes factures en CSV ? » La recherche trouve un article d’aide sur les exports et une entrée récente du journal des modifications. Le modèle lit les deux et explique que l’export CSV se trouve dans les paramètres de facturation, en reprenant les étapes de l’article. Quand l’entreprise modifie l’article, la réponse suivante en tient compte dès que le contenu est réindexé, sans toucher au modèle.
Pourquoi le RAG compte pour les chatbots d’entreprise
Le RAG est la manière la plus courante de rendre un modèle généraliste utile pour une entreprise précise :
Le RAG n’élimine pas toutes les erreurs. Des documents obsolètes ou contradictoires mènent à de mauvaises réponses, et le modèle peut encore mal lire un passage. Tenir les sources à jour compte autant que la technologie.
- Les réponses restent propres à vos produits, vos tarifs et vos conditions.
- Mettre à jour les connaissances revient à modifier des contenus, pas à réentraîner un modèle.
- Les réponses peuvent être rattachées à des passages sources, ce qui facilite la détection et la correction des erreurs.
- Des règles peuvent imposer au modèle de ne répondre qu’à partir des contenus récupérés et d’admettre quand rien de pertinent n’a été trouvé.
Comment intoCHAT utilise le RAG
intoCHAT repose sur le RAG. Quand vous ajoutez des pages web, des fichiers, des textes ou des paires questions-réponses, intoCHAT les découpe en segments et crée des embeddings. Pour chaque message d’un visiteur, il lance une recherche hybride, sémantique et par mots-clés, puis transmet les meilleurs extraits au modèle avec des règles qui ancrent la réponse dans ces extraits. Les réponses Q&A et les sources marquées d’une étoile passent avant les autres contenus, et toute modification d’une source s’applique après son réentraînement.