Génération augmentée par la récupération (RAG)
- Ce qu'est le RAG et la boucle récupérer-augmenter-générer
- Comment indexer, récupérer, augmenter et générer avec citations
- Pourquoi le RAG surpasse le fine-tuning pour les besoins « répondre sur mes documents »
- Les cinq modes de défaillance qui tuent la qualité du RAG
- Un prompt d'ancrage à copier-coller qui comble les deux plus grandes lacunes
Le RAG fait répondre un modèle à des questions sur vos données — documents, base de connaissances, base de code — sur lesquelles il n'a jamais été entraîné. L'idée est simple : récupérer les éléments pertinents, augmenter le prompt avec eux, puis générer une réponse ancrée dans ces éléments.
La boucle
- Découpez-les en fragments, encodez-les (voir /docs/foundations/embeddings) et stockez-les dans un index vectoriel (et/ou par mots-clés).
- Tirez les meilleurs fragments les plus pertinents pour la question.
- Placez ces fragments dans le prompt avec une instruction du type « Réponds uniquement à partir du contexte ci-dessous ; si l'information n'y figure pas, dis-le. »
- Produisez la réponse — et idéalement citez le fragment d'où provient chaque affirmation.
Pour l'étape d'encodage lors de l'indexation, voir Embeddings et recherche vectorielle.
Pourquoi le RAG plutôt que le fine-tuning ?
- Frais : mettez à jour les données, pas le modèle
- Vérifiable : fournit des citations
- Économique : bien moins cher qu'un réentraînement
Pour la plupart des besoins du type « répondre à propos de mes documents », le RAG est le bon premier outil — voir Fine-tuning vs prompting vs RAG.
Les modes de défaillance (là où la qualité du RAG meurt)
- Mauvaise récupération = mauvaise réponse. Si le bon fragment n'est pas récupéré, le modèle ne peut pas l'utiliser. La plupart des problèmes « le RAG se trompe » sont des problèmes de récupération.
- Un découpage trop grossier/trop fin ruine la pertinence (voir embeddings).
- Pas d'instruction d'ancrage : le modèle mélange les faits récupérés avec ses propres suppositions. Dites-lui de répondre uniquement à partir du contexte et d'admettre les lacunes.
- Trop en entasser : des fragments non pertinents diluent le signal et coûtent des tokens. Récupérez peu de fragments, de haute qualité.
- Pas de citations : vous ne pouvez pas vérifier, donc vous ne pouvez pas faire confiance.
L'échec de découpage renvoie aux embeddings, et le surentassement coûte des tokens.
- Évaluez la récupération séparément : mesurez « avons-nous récupéré le bon fragment ? » indépendamment de « le modèle a-t-il bien répondu ? ». Cela localise le problème rapidement. Voir Évaluations (/docs/foundations/evals).
Copier-coller : un prompt d'ancrage
Le correctif au plus fort impact est une instruction d'ancrage. Déposez vos fragments récupérés dans un gabarit comme celui-ci — il force le modèle à répondre uniquement à partir du contexte, à citer chaque affirmation et à admettre les lacunes au lieu de deviner :
Prompt d'ancrage
You are answering strictly from the context below. Rules: - Use ONLY the context to answer. Do not use outside knowledge. - Cite the source after each claim, like [chunk 2]. - If the answer is not in the context, reply exactly: "I don't have that in the provided sources." - Quote numbers and names verbatim — never paraphrase a figure. Context: [chunk 1] ... [chunk 2] ... [chunk 3] ... Question: <the user's question>
Associez-le à quelques fragments de haute qualité (pas tout ce que vous avez récupéré) et vous comblez les deux plus grandes lacunes d'un coup : le mélange halluciné et les réponses invérifiables. Ensuite, évaluez la récupération et la génération séparément pour savoir quelle moitié régler.
Maîtrisez les termes
Vérifiez vos connaissances
0/5- RAG = récupérer les fragments pertinents, augmenter le prompt, générer une réponse ancrée et citée.
- Indexez (découper + encoder + stocker), récupérez les meilleurs fragments, augmentez avec une instruction d'ancrage, générez avec citations.
- Préférez le RAG au fine-tuning pour les Q&R sur documents : frais, cité, moins cher.
- La plupart des défaillances sont des défaillances de récupération — récupérez peu de fragments de haute qualité, pas tout.
- Ajoutez toujours une instruction d'ancrage et citez ; évaluez la récupération et la génération séparément.