Glossaire

Qu’est-ce que RAG (Génération Augmentée par Récupération) ?

RAG, ou Génération Augmentée par Récupération, est un schéma d’IA dans lequel le modèle commence par récupérer les passages pertinents d’un document avant de produire une réponse, qu’il ancre alors dans la source.

Un LLM classique répond à partir de ses données d’entraînement, figées au moment de la formation et sujettes aux hallucinations. RAG corrige cela en ajoutant une étape de récupération : quand une question arrive, le système cherche dans un corpus (un livre, un PDF, une base de connaissances) les passages les plus pertinents, les transmet au LLM comme contexte, et seulement alors lui demande de répondre.

Chat avec les résumés et le contexte source disponible

La qualité d’un système RAG repose sur trois choses : la manière dont la source est découpée (paragraphe, section, phrase), la façon dont les morceaux sont plongés (embeddings) pour la recherche par similarité, et la manière dont on demande au modèle d’utiliser le contexte récupéré. Un maillon faible parmi ces trois produit des réponses formellement ancrées mais matériellement fausses.

La place de Summio

Chat avec les résumés et le contexte source disponible

En savoir plus sur Summio

Questions fréquentes

En quoi RAG diffère-t-il du fine-tuning ?

Le fine-tuning grave la nouvelle connaissance dans les poids du modèle — lent, coûteux, ne se met à jour que par réentraînement. RAG laisse le modèle figé et fait varier le contexte récupéré à chaque requête : pour mettre à jour la connaissance, on réindexe un document, on n’entraîne rien.

RAG élimine-t-il les hallucinations ?

La récupération peut mieux ancrer une réponse, mais elle n’élimine pas les hallucinations. Le modèle peut mal lire ou ignorer un passage, ou combiner incorrectement des détails exacts ; vérifiez les points importants dans l’original.

Où utilise-t-on RAG ?

Dans les moteurs IA (Perplexity, ChatGPT search, Claude avec accès web), dans les chats sur la documentation interne, dans les bots de support adossés à un centre d’aide, et dans les apps de lecture comme Summio. Partout où la réponse doit pouvoir être attribuée à une source précise.