Aller au contenu

Génération augmentée par récupération (RAG)

Dernière mise à jour:

Ce qu’est le RAG

Un modèle de langage ne connaît que ce qui figurait dans ses données d’entraînement. Le RAG ajoute une étape de consultation : avant que le modèle réponde, le système récupère les textes pertinents dans une base de connaissances et les insère dans le prompt. Le modèle rédige alors sa réponse à partir de ce contenu, au lieu de s’appuyer uniquement sur sa mémoire.

Le terme vient d’un article de recherche publié en 2020 par Patrick Lewis et ses collègues de Facebook AI Research. Il désigne aujourd’hui la plupart des chatbots et assistants qui répondent à partir des contenus d’une organisation.

Comment fonctionne le RAG

Un système RAG comporte une phase de préparation et une phase à chaque question :

La qualité d’un système RAG dépend fortement de la recherche. Si le bon passage n’est pas trouvé, même un excellent modèle ne peut pas répondre correctement.

  • Indexation, en amont : les documents sont découpés en segments (chunks), chaque segment est converti en embedding, puis l’ensemble est stocké dans un index interrogeable.
  • Récupération : la question est comparée à l’index par recherche sémantique, par mots-clés ou les deux, et les segments les plus pertinents sont retenus.
  • Augmentation : ces segments sont ajoutés au prompt avec les instructions et l’historique de la conversation.
  • Génération : le modèle de langage rédige une réponse à partir des textes récupérés et, s’il est bien configuré, signale quand ils ne contiennent pas la réponse.

Exemple

On demande au chatbot d’un éditeur de logiciels : « Puis-je exporter mes factures en CSV ? » La recherche trouve un article d’aide sur les exports et une entrée récente du journal des modifications. Le modèle lit les deux et explique que l’export CSV se trouve dans les paramètres de facturation, en reprenant les étapes de l’article. Quand l’entreprise modifie l’article, la réponse suivante en tient compte dès que le contenu est réindexé, sans toucher au modèle.

Pourquoi le RAG compte pour les chatbots d’entreprise

Le RAG est la manière la plus courante de rendre un modèle généraliste utile pour une entreprise précise :

Le RAG n’élimine pas toutes les erreurs. Des documents obsolètes ou contradictoires mènent à de mauvaises réponses, et le modèle peut encore mal lire un passage. Tenir les sources à jour compte autant que la technologie.

  • Les réponses restent propres à vos produits, vos tarifs et vos conditions.
  • Mettre à jour les connaissances revient à modifier des contenus, pas à réentraîner un modèle.
  • Les réponses peuvent être rattachées à des passages sources, ce qui facilite la détection et la correction des erreurs.
  • Des règles peuvent imposer au modèle de ne répondre qu’à partir des contenus récupérés et d’admettre quand rien de pertinent n’a été trouvé.

Comment intoCHAT utilise le RAG

intoCHAT repose sur le RAG. Quand vous ajoutez des pages web, des fichiers, des textes ou des paires questions-réponses, intoCHAT les découpe en segments et crée des embeddings. Pour chaque message d’un visiteur, il lance une recherche hybride, sémantique et par mots-clés, puis transmet les meilleurs extraits au modèle avec des règles qui ancrent la réponse dans ces extraits. Les réponses Q&A et les sources marquées d’une étoile passent avant les autres contenus, et toute modification d’une source s’applique après son réentraînement.

Questions fréquentes

Que signifie RAG ?

RAG signifie retrieval-augmented generation, soit génération augmentée par récupération. La récupération est l’étape de recherche qui trouve les textes pertinents, la génération est la rédaction de la réponse par le modèle de langage. Augmentée signifie que le prompt du modèle est enrichi des textes récupérés.

Quelle différence entre RAG et fine-tuning ?

Le RAG fournit au modèle des documents pertinents au moment où il répond, alors que le fine-tuning modifie le modèle lui-même en l’entraînant sur des exemples supplémentaires. Pour des connaissances factuelles qui changent souvent, le RAG convient généralement mieux, car une mise à jour se limite à modifier des contenus. Le fine-tuning sert plutôt à apprendre un style ou un format de sortie constant.

Le RAG supprime-t-il les hallucinations ?

Il les réduit sans les supprimer. Le modèle peut encore mal interpréter un passage ou combler des trous quand la recherche manque le bon texte. Des règles d’ancrage claires, des contenus bien tenus et des tests réduisent encore le risque.

Faut-il une base de données vectorielle pour faire du RAG ?

La plupart des systèmes RAG stockent les embeddings dans un index vectoriel, soit dans une base vectorielle dédiée, soit dans une base classique qui gère les vecteurs. Les plateformes de chatbot hébergées comme intoCHAT s’en chargent pour vous. Beaucoup de systèmes ajoutent aussi une recherche par mots-clés, car les termes exacts comme les références produits échappent facilement aux seuls vecteurs.

Voyez-le répondre à partir de votre site

Collez l’adresse de votre site et discutez avec un agent créé à partir de vos pages. Cela prend environ une minute.

Créer votre agent gratuitement

Offre gratuite, sans carte bancaire.